Новая версия модели от Anthropic показала результаты в 68,8% на тесте ARC-AGI-2, который оценивает абстрактное мышление. Для сравнения, год назад все ИИ-модели показывали нулевые значения, а средний результат 400 человек составил 60%. Стоимость решения одной задачи составляет $3,64. Результаты были подтверждены командой ARC Prize на заранее подобранных задачах.
Бенчмарк ARC-AGI-2, разработанный Франсуа Шолле, запускает задачи, основанные на визуальных головоломках, где модели должны выработать правило, которое можно применить к новым примерам. ARC Prize провел испытания модели Opus 4.6 в четырех категориях усилий с фиксированным лимитом в 120 тысяч токенов. Результаты варьировались от 63% до 68,8%. Предшественник Opus 4.5 набрал 37,6%. Для сравнения, GPT-5.2 Pro показал 54,2% за ~$10 за задачу.
Тем не менее, ARC Prize не спешит объявлять победителей, поскольку приз в $700 тысяч остается неполученным. В январе команда назвала 2025 год «годом циклов уточнения». В начале 2026 года ожидается запуск ARC-AGI-3 с новыми интерактивными задачами.
