OpenAI đã phát hành GPT-6 Astra, nhưng nhiều điểm benchmark của Astra và các mô hình cạnh tranh đã thay đổi sau khi dữ liệu đánh giá được điều chỉnh.
Tỷ lệ “hallucination” của Astra từng được hiển thị ở mức 4,2%, giảm xuống 2% rồi trở lại 4,2%. Điểm ARC-AGI-3 của mô hình cũng tăng từ 98,6% trước khi ra mắt lên 99,99% trên trang hiện tại.
Điểm FrontierMath Tier 4 của Fable 5.1 từ Anthropic từng giảm từ 87,8% xuống 78% trước khi phục hồi lên 83%. Các thay đổi này khiến kết quả so sánh giữa các mô hình biến động theo từng thời điểm.
OpenAI cho biết độ chính xác của đánh giá là ưu tiên, đồng thời giải thích rằng checkpoint, cấu hình công cụ, mức độ suy luận và từng lần chạy thử có thể khiến điểm số dao động vài phần trăm.
Giới phân tích gọi việc liên tục điều chỉnh điều kiện kiểm thử và phương pháp chạy để tối đa hóa điểm benchmark là “Benchmaxxing”, một hiện tượng đã xuất hiện trong ngành AI từ lâu.