Vitalik Buterin cho rằng lý thuyết thiết kế cơ chế quản trị đối kháng có thể trở thành một ứng dụng quan trọng trong an toàn AI. Ông tập trung vào cách một bên yếu hơn kiểm soát và đạt kết quả mong muốn từ một tác nhân mạnh hơn.
Vitalik so sánh hai kịch bản: thuật toán tĩnh đóng vai trò bên ủy quyền còn con người là tác nhân thông minh hơn; hoặc con người cùng một mô hình ngôn ngữ lớn yếu hơn làm bên ủy quyền, trong khi mô hình mạnh hơn là tác nhân.
Theo Vitalik, nếu hạn chế hiệu quả việc các tác nhân cấu kết với nhau, bên yếu hơn có thể đạt kết quả tốt hơn đáng kể. Ông cho rằng kết luận này cũng có thể áp dụng khi xây dựng cơ chế an toàn cho AI.
Trong tương lai, các biện pháp kiểm soát AI có thể giống một hệ thống thể chế gồm quy tắc, quyền hạn, cơ chế phân xử và ghi nhận, thay vì chỉ dựa vào các “sandbox” kỹ thuật.