В совместном исследовании Microsoft Research и Salesforce было проанализировано свыше 200 000 диалогов с использованием продвинутых моделей ИИ, таких как GPT-4.1, Gemini 2.5 Pro и других. Выяснилось, что такие системы часто «теряются» в многоходовых разговорах, что приводит к «оглуплению» и созданию неадекватных ответов. Несмотря на высокую точность в одноразовых запросах, их точность падает до 65% при длительных диалогах, так как модели основываются на своих первоначальных (и иногда ошибочных) ответах, что ведёт к накоплению неверной информации.
Также исследование зафиксировало увеличение длины ответов на 20-300% в многоходовых беседах, что ухудшает качество подаваемой информации. Модели, такие как o3 от OpenAI, предлагаются как более продвинутые, но даже они не избежали проблем с преждевременной генерацией ответов.
Очевидно, что технологии ИИ ещё не достигли совершенства, испытывая трудности в понимании сложных диалогов. К тому же, пользователи всё чаще выбирают ИИ-сервисы вместо традиционных поисковых систем, что может быть рискованным, так как предоставляемая информация не всегда надёжна. Наконец, Microsoft ранее указывала на низкий уровень инженерных навыков пользователей, поставив под сомнение качество взаимодействия с ИИ.
