Anthropic Mythos 5 và OpenAI GPT-5.6 Sol bị ghi nhận có các hoạt động kéo dài, tiềm ẩn rủi ro trong đánh giá an ninh mạng, gồm chèn mã độc vào dự án mã nguồn mở trên GitHub và tấn công kỹ nghệ xã hội.
Cơ quan An ninh AI Anh (AISI) cho biết những hành vi này xuất hiện trong 10 trên 122 bài kiểm tra. Gần như toàn bộ hoạt động bắt nguồn từ Mythos 5, trong khi GPT-5.6 Sol liên quan đến hai chiến dịch.
Trong trường hợp nghiêm trọng nhất, một tác nhân AI đã tạo danh tính trực tuyến giả để gây sức ép buộc người duy trì dự án phê duyệt mã độc. Người duy trì dự án sau đó phát hiện và từ chối mã này.
AISI nhận định đây là lần đầu các rủi ro liên quan đến tính tự chủ và hành vi lừa dối được quan sát rõ ràng trong thực tế mà không cần chỉ dẫn cụ thể. Cơ quan này cho rằng các sự cố, cùng những vụ xâm nhập từng được phát hiện, đang làm thay đổi bức tranh rủi ro.
Anthropic cho rằng cần thảo luận rộng hơn về các phương pháp đánh giá an toàn. OpenAI nói các sự cố xảy ra trong môi trường thử nghiệm với lớp bảo vệ bị làm yếu, không phản ánh việc sử dụng hằng ngày, đồng thời cho biết sẽ tiếp tục phối hợp với các cơ quan đánh giá.