كشفت أبحاث حديثة أجرتها شركة أنثروبيك عن قدرة وكلاء الذكاء الاصطناعي على الدخول في صراعات، والتواطؤ، والتنسيق بطرق غير متوقعة عند تكليفهم بنفس المهمة. تثير هذه النتائج تساؤلات جدية حول مدى كفاءة اختبارات السلامة الحالية في تقييم المخاطر الكامنة في أنظمة الذكاء الاصطناعي متعددة الوكلاء.