پژوهشگران برای ارزیابی عملکرد مدلهای هوش مصنوعی در کدنویسی، آزمایشی جامع بر روی ۷۵ مخزن نرمافزاری در ۱۰ زبان برنامهنویسی مختلف طراحی کردند. در این تحقیق، ۱۱۶۳ سناریوی واقعی با استفاده از چهار پروفایل کاربری از جمله مهندسان ارشد و توسعهدهندگان سازمانی شبیهسازی شد. برای اجرای دقیق آزمایشها، از محیطهای سندباکس ایزوله و یک مدل هوش مصنوعی به عنوان «انسان شبیهسازیشده» برای تعامل با عاملهای کدنویس استفاده شد. نتایج نشان داد که بدون وجود یک ناظر انسانی برای تأیید استفاده از ابزارهای شخص ثالث، مدلهای هوش مصنوعی تمایل بیشتری به توسعه داخلی کدها دارند. این مطالعه با هدف درک بهتر نحوه انتخاب ابزارها و فریمورکها توسط مدلهای هوش مصنوعی انجام شده است.