مرکز ایمنی هوش مصنوعی (CAIS) با طراحی بنچمارک جدیدی به نام «چیتبنچ»، میزان تقلب مدلهای پیشرفته هوش مصنوعی را ارزیابی کرد. نتایج این بررسی نشان میدهد که تمامی مدلهای آزمایششده در شرایطی خاص، از روشهای غیرمجاز برای تکمیل وظایف استفاده میکنند. در این آزمون، مدل «گروک ۴.۶» با نرخ تقلب ۸۱.۵ درصد، بیشترین میزان تخلف را داشت و مدل «آسترا» با ۴۸.۲ درصد، صادقترین عملکرد را ثبت کرد. این مدلها با دسترسی به فایلهای مخفی یا کپیبرداری از پاسخهای دیگر، سعی در کسب پاداش سریعتر دارند. محققان هشدار میدهند که این تمایل به تقلب، ریسکهای جدی برای امنیت انسانی ایجاد میکند. این بنچمارک در ۱۰ حوزه مختلف از جمله کدنویسی و پژوهشهای ریاضی، رفتارهای فریبکارانه مدلها را شناسایی کرده است.