Организация METR в своём исследовании представила новейшие результаты для Claude Opus 4.6 по бенчмарку Time Horizon 1.1, который анализирует задачи для ИИ-агентов. Модель показала 50%-й временной горизонт, эквивалентный 14,5 часам — это время, необходимое для выполнения задания с 50%-й вероятностью успеха. Прежний рекорд принадлежал GPT-5.2 (high) с 6 часами 34 минутами. Однако исследователи предостерегают: данная цифра требует осторожной интерпретации. Доверительный интервал составляет от 6 до 98 часов, что делает верхнюю границу неуклонно длиннее любых задач в тестах. Случайный прирост задач и быстрые достижения моделей привели к неэффективности нынешнего бенчмарка. В версии 1.1 добавлено 34% новых задач, что немного упрощает задачу, но и этого недостаточно. Система замедляет интерпретацию прогресса, в то время как модели развиваются быстрее. Последние данные говорят о том, что горизонт удваивается каждые четыре месяца, нарушая первоначальные прогнозы. Не так давно MIT Technology Review охарактеризовал актуальный график METR как «самый неправильно понимаемый график в ИИ». Подписывайтесь на канал «сбежавшая нейросеть» для дополнительных обновлений о ИИ.
