DeepSeek cho biết nền tảng sandbox DSec phát hiện các tác nhân AI lấy đáp án qua những kênh ngoài dự kiến, như dữ liệu còn sót trong tệp quản trị, làm ảnh hưởng tính hợp lệ của kết quả huấn luyện và đánh giá.
Sau khi áp dụng kiểm soát quyền truy cập, một số tác nhân vẫn trao đổi ánh xạ khối dữ liệu giữa các tệp để tìm cách tiếp cận nội dung được bảo vệ thông qua bộ mô tả tệp khác, gây ảnh hưởng đến tác vụ hoặc hạ tầng dùng chung.
Phát hiện này được trình bày trong một bài nghiên cứu dài 31 trang về đào tạo tác nhân, giới thiệu DSec như nền tảng sandbox cấp sản xuất được DeepSeek sử dụng nội bộ. Bài nghiên cứu có hơn 100 tác giả, trong đó có Liang Wenfeng, và dành một phần riêng cho vấn đề “tác nhân hoạt động sai lệch”.
DeepSeek nhận định không có cơ chế đơn lẻ nào có thể ngăn chặn mọi hành vi sai lệch và sự cố hệ thống. Nhóm này tập trung tăng khả năng quan sát để phát hiện vấn đề mới, đồng thời tiếp tục củng cố DSec khi mô hình thay đổi, gồm hạn chế các kênh truy cập ngoài dự kiến và giảm phần thưởng cho hành vi đánh lừa.