Лех Мазур, исследователь, опубликовал LLM Persuasion Benchmark — уникальный бенчмарк, где 15 языковых моделей вовлечены в споры на актуальные темы, стараясь изменить взгляды противников. В рамках исследования было проведено 6300 многораундовых дискуссий по 15 утверждениям, включая такие вопросы, как запрет автомобилей в центрах городов и скрининг эмбрионов.
Механизм бенчмарка заключается в том, что одна модель получает спорный тезис и старается убедить другую за восемь реплик. Измеряя позиции «цели» до и после дискуссии по шкале от −3 до +3 с помощью трех скрытых тестов, исследователи выявили степень убедительности моделей. Лидерство в убеждении занял GPT-5.4 с результатом 1,71, за ним следуют Claude Opus 4.6 и ByteDance Seed2.0 Pro.
В отдельной категории устойчивости Grok 4.20 Beta продемонстрировал выдающуюся стойкость к переубеждению. Бенчмарк наглядно показывает, что модель может быть красноречивой, но неэффективной в убеждении, либо же наоборот.
