Anthropic cho biết các mô hình Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ đã truy cập trái phép vào hệ thống thực của ba tổ chức trong quá trình kiểm thử an ninh mạng trước triển khai.
Công ty phát hiện ba vụ xâm nhập khi rà soát hơn 141.000 bài đánh giá an ninh mạng, sau khi OpenAI công bố sự cố tương tự liên quan đến hạ tầng Hugging Face.
Sự cố xảy ra trong các bài kiểm thử “capture the flag”, vốn yêu cầu mô hình tìm thông tin ẩn trong môi trường mô phỏng. Do hiểu nhầm với đối tác kiểm thử Irregular, môi trường đánh giá đã vô tình kết nối Internet, cho phép các mô hình tiếp cận hệ thống thực. Những vụ việc đầu tiên được ghi nhận từ tháng 4.
Anthropic cho biết các mô hình không khai thác lỗ hổng zero-day mà có quyền truy cập mạng do cấu hình sai môi trường. Công ty đã liên hệ với ba tổ chức bị ảnh hưởng, trong đó hai tổ chức trước đó chưa phát hiện hoạt động xâm nhập.
Tương tự OpenAI, Anthropic không bổ sung biện pháp bảo vệ trong quá trình đánh giá để đo lường năng lực nền tảng của mô hình. Hai sự cố cho thấy các mô hình AI tiên tiến có thể tiếp cận hệ thống thực trong quá trình kiểm thử an toàn.