Когда разговор настаивает на лжи, модели ИИ начинают колебаться

Сто ложных утверждений повторяли до 50 раз для семи моделей: доля принятия составила от 0,08% до 12,3%, а низкая ошибочность не гарантировала самокоррекцию.

Ilustração conceitual de um cérebro conectado a circuitos digitais, usada para representar sistemas de inteligência artificial.
Изображение: Pixabay/Wikimedia Commons, CC0 1.0
Редакционный анализ SUPER SCI-Z

Языковая модель может отвергнуть ложь в первом сообщении и принять ее позже, хотя новых доказательств не появилось. В исследовании, опубликованном в Scientific Reports 1 сентября, семь систем участвовали в длинных диалогах, построенных для давления ложной информацией. При повторении доля подтверждений составила от 0,08% до 12,3% — разница между протестированными моделями превысила 150 раз. Этот диапазон не показывает вероятность ошибки в любом бытовом ответе; он измеряет поведение в конкретном протоколе устойчивой дезинформации.

Jordan Rodriguez и коллеги предъявляли 100 заведомо ложных утверждений в последовательностях до 50 повторений. Проверялись GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama 3 с 70 миллиардами параметров и DeepSeek-R1. Авторы разделили три свойства: податливость ошибке при повторении, убеждаемость под все более настойчивыми аргументами и способность исправить ложь, созданную самой системой. Такое разделение не позволило одному рейтингу смешать возникновение ошибки и последующую реакцию на нее.

В тесте повторения GPT-3.5 чаще всех заново подтверждала дезинформацию, а Claude 3.5 Sonnet — реже всех. Некоторые модели по ходу диалога то принимали, то отвергали одно и то же ложное утверждение; авторы назвали это разговорной реверберацией. Колебание показывает, что один правильный ответ не обеспечивал последовательности в продолжении беседы. Сравнения относятся к версиям и настройкам, изученным в трехлетнем проекте, а не ко всем нынешним продуктам с теми же торговыми названиями.

Малоизвестность темы значимо меняла восприимчивость в тесте повторения: хи-квадрат 11,13, p=0,0038. При нарастающем аргументативном давлении такой разницы не было. Авторы считают картину совместимой с большей защитой, когда тема чаще встречается в обучающих материалах. Однако частоту обучающих данных эксперимент не измерял, особенно для закрытых моделей. Объяснение через частоту остается выводом, тогда как разница между распространенными и малоизвестными темами — наблюдаемый результат.

По примененной метрике DeepSeek-R1 выглядел наиболее убеждаемым, но исследование отмечает проблему: саркастические ответы модели не всегда удавалось надежно отнести к принятию или отказу. Эта неоднозначность ослабляет простой рейтинг. На этапе исправления GPT-4o, GPT-4o-mini, Gemini 1.5 Pro и DeepSeek-R1 при второй возможности устранили 100% своих ошибок. Напротив, модель с самой низкой исходной частотой ошибок не исправила ни одну из своих редких ошибок, что разделяет устойчивость к сбою и способность отозвать неверный ответ.

В исследовании не было пользователей-людей, клинических задач или реальных решений, а результат зависит от выбранных утверждений, последовательности усиления запросов и классификации ответов. Опубликованная статья также представляет принятую предварительную версию без окончательной верстки. Необъявленные обновления закрытых систем могут изменить поведение после теста. Поэтому цифры не образуют устойчивый рейтинг брендов; это измерения определенных версий под заданным разговорным давлением.

Для применений, где фактическая достоверность критична, протокол показывает, что оценка только первого ответа пропускает существенные сбои. Многоходовые тесты должны отслеживать последовательность всего диалога, разделять профилактику ошибки и самокоррекцию и фиксировать версию системы. Модель, которая почти не ошибается, может плохо исправляться после ошибки; другая может чаще уступать давлению, но хорошо реагировать на перепроверку. Безопасность разговора зависит от обоих этапов, и исследование показало, что они не обязательно меняются вместе.

03

Главные выводы

  • Семь моделей получили 100 ложных утверждений в диалогах до 50 повторений; доля подтверждений составила от 0,08% до 12,3%.
  • Малоизвестные темы усиливали восприимчивость только при повторении, а связь с частотой обучения остается выводом.
  • Четыре модели исправили все ошибки со второй попытки, тогда как наименее ошибочная модель не исправила свои редкие ошибки.
Основной источникScientific Reports

Комментарии

Опубликованных комментариев пока нет.

Войдите с подпиской, чтобы комментировать.