Организация METR, занимающаяся оценкой ИИ, обнародовала данные тестирования модели Claude Opus 4.5 от Anthropic. Эта модель продемонстрировала рекордный 50%-горизонт в 4 часа 49 минут, что делает её лидером среди всех протестированных систем. Данный показатель указывает, что Opus 4.5 может успешно решать задачи такой длительности с вероятностью 50%. Ранее лучшим результатом был 2 часа 53 минуты, установленный GPT-5.1-Codex-Max от OpenAI.
METR оценивает не точность ответов, а продолжительность задач, которые ИИ способен выполнять без человеческой помощи. За последние годы этот показатель значительно вырос, увеличиваясь вдвое примерно каждые 7 месяцев. Однако исследователи предостерегают от поспешных выводов, так как доверительный интервал результата варьируется от 1 часа 49 минут до 20 часов 25 минут.
При более строгом пороге в 80% успеха горизонт Opus 4.5 сокращается до 27 минут, что сопоставимо с другими современными моделями. Если тренд сохранится, есть вероятность, что к концу десятилетия ИИ смогут выполнять проекты длительностью до месяца. Тем не менее, критики указывают на ограниченность тестового набора METR, в котором недостаточно длинных задач. Организация планирует обновить набор для более точной оценки прогресса в будущем.
