Kimi đã công bố mã nguồn mở PerceptionBench, bộ benchmark đánh giá khả năng nhận thức thị giác của mô hình ngôn ngữ lớn đa phương thức. Kết quả cho thấy cả 16 mô hình hàng đầu đều đạt độ chính xác dưới 60%.
PerceptionBench chia năng lực nhận thức thị giác thành 10 khả năng riêng biệt, gồm quan hệ không gian, đếm, thuộc tính, độ sâu và 3D, định vị, so sánh, nhận diện chi tiết, hiểu ngữ cảnh, OCR và nhận diện ảo giác.
Bộ benchmark được xây dựng từ các trường hợp mô hình thất bại trong 42 bộ đánh giá hiện có, với 3.000 câu hỏi đã được kiểm chứng thủ công. Mỗi câu hỏi chỉ kiểm tra một khả năng thị giác và không yêu cầu suy luận hoặc kiến thức bên ngoài.
GPT-5.6-Sol đứng đầu với độ chính xác 59,7%, tiếp theo là Kimi K3 đạt 58,5%, Claude-Fable-5 đạt 57,2%, Gemini-3.1-Pro đạt 56,2% và GPT-5.5 đạt 55,8%.
Báo cáo xác định nhận diện ảo giác là năng lực yếu nhất ở các mô hình được đánh giá. Dữ liệu hiện có cho thấy khả năng nhận thức thị giác tổng thể vẫn còn nhiều dư địa cải thiện.