Компания Cursor опубликовала результаты своего эксперимента, посвященного масштабированию автономных кодинг-агентов. В рамках проекта на протяжении нескольких недель работали сотни агентов, которые совместно написали свыше миллиона строк кода. Основной целью эксперимента было выяснить, смогут ли такие агенты решать задачи, которые традиционно занимают у команд разработчиков месяцы. Однако, основная проблема заключалась в координации действий. Когда агенты получили равные полномочия и возможность самостоятельно делить задачи, лишь двадцать из них показывали продуктивность двух-трех, в то время как остальные ждали освобождения блокировок. Без иерархии агенты избегали сложных задач, выполняя только простые правки. В результате было решено разделить роли: одни агенты стали планировщиками, а другие — исполнителями. Для проверки разработанной системы агентам было поручено создать браузер с нуля. За неделю они сгенерировали более трех миллионов строк кода, включая движок рендеринга на Rust. Несмотря на достижения, CEO Cursor, Майкл Труэлл, отметил, что до уровня WebKit и Chromium еще далеко. Интересно, что GPT-5.2 оказалась значительно эффективнее других моделей при выполнении долгосрочных задач. В итоге команда пришла к выводу, что важнее всего правильно составленные промпты, а не выбор модели или архитектуры системы. Хотя система еще далека от совершенства, эксперименты подтвердили, что масштабирование действительно работает.
