Skip to content
Электроника и Гаджеты

Электроника и Гаджеты

  • Главная
  • Гаджеты
  • Автоаксессуары
  • Безопасность дома
  • Бытовой электроинструмент
  • Климат-контроль
  • Умная кухня
  • Умное освещение
  • Новости
  • Toggle search form

Исследование Леха Мазура: ЛLM Persuasion Benchmark

Posted on 29.03.202629.03.2026 By

Лех Мазур, исследователь, опубликовал LLM Persuasion Benchmark — уникальный бенчмарк, где 15 языковых моделей вовлечены в споры на актуальные темы, стараясь изменить взгляды противников. В рамках исследования было проведено 6300 многораундовых дискуссий по 15 утверждениям, включая такие вопросы, как запрет автомобилей в центрах городов и скрининг эмбрионов.

Механизм бенчмарка заключается в том, что одна модель получает спорный тезис и старается убедить другую за восемь реплик. Измеряя позиции «цели» до и после дискуссии по шкале от −3 до +3 с помощью трех скрытых тестов, исследователи выявили степень убедительности моделей. Лидерство в убеждении занял GPT-5.4 с результатом 1,71, за ним следуют Claude Opus 4.6 и ByteDance Seed2.0 Pro.

В отдельной категории устойчивости Grok 4.20 Beta продемонстрировал выдающуюся стойкость к переубеждению. Бенчмарк наглядно показывает, что модель может быть красноречивой, но неэффективной в убеждении, либо же наоборот.

Новости

Навигация по записям

Предыдущая запись: Управление ИИ: Как соединить менеджмент и разработчиков
Следующая запись: Уход руководителей Coca-Cola и Walmart в эпоху ИИ

Новости

Samsung вводит чрезвычайное положение в бизнесе смартфонов Новости
Кирилл Комбаров представил уникальное приложение для футбольных тренировок Новости
ИИ-модели создают аналоговые часы: успехи и преодоления Новости
Противостояние профсоюзов из-за ИИ-актрисы Тилли Норвуд Новости
Realme запустила обновление, вдохновленное iOS 26 Новости
Новые умные часы Redmi Watch 6 поступят в продажу 23 октября Новости

Copyright © 2026 Электроника и Гаджеты .

Работает на PressBook Masonry Dark