Загрузка Футурейтинга
Почему нейросеть врёт — и как это поймать промптом
Статья
Присоединились к статье Антон Тихомиров Футурис Фёдор Егорович Ефремов Юлия Ланская

Почему нейросеть врёт — и как это поймать промптом

Антон Тихомиров
224 4 3 мин

Содержание

Продолжаю начатую серию.

Модель уверенно называет несуществующую книгу, придумывает статью закона или дату —

знакомо?
 Это не поломка — это свойство того, как устроены языковые модели. Хорошая новость: риск можно заметно снизить, и делается это в промпте.

Почему это происходит

Языковая модель не «знает» факты в привычном смысле — она предсказывает правдоподобное продолжение текста. На популярных темах правдоподобное обычно совпадает с верным. Но на узких фактах и нишевых вопросах модель выдаёт то, что выглядит правильно, — и звучит при этом ровно так же уверенно, как когда она права. 

Именно эта одинаковая уверенность и опасна: по тону вы не отличите факт от выдумки.

Приёмы, которые снижают риск

  • Просите источники. Это не только удобно для проверки — сам механизм снижает выдумку. Как формулирует Microsoft:

«Asking for citations makes it so that the model must make two errors every time it generates a response: the first error is the fabricated response, and the second is the bad citation.»

«Запрос ссылок приводит к тому, что модель должна совершать две ошибки каждый раз, когда генерирует ответ: первая ошибка — это сфабрикованный ответ, а вторая — неверное цитирование.» (спасибо Яндексу за машинный перевод)

Чтобы соврать со ссылкой, модели нужно ошибиться дважды — а это менее вероятно. Причём ссылку лучше просить рядом с утверждением, а не общим списком в конце.

  • Включайте веб-поиск для фактов. Когда ответ опирается на актуальные найденные данные, а не на память модели, почвы для выдумки меньше. Для всего, что зависит от свежих или точных фактов — это первый приём.
  • Просите уровень уверенности и разрешайте «не знаю». Добавьте в промпт явное разрешение: «если не уверен — так и скажи». Модели по умолчанию склонны дать хоть какой-то ответ; явное «не знаю» как допустимый исход снижает давление на выдумывание.

Чего делать НЕ стоит

Популярный совет — «попроси модель перепроверить свой ответ» — работает хуже, чем кажется. Исследование Huang et al. (2023) показало: без внешней обратной связи модель себя не исправляет, а иногда после «самопроверки» отвечает даже хуже:

«LLMs struggle to self-correct their responses without external feedback, and at times, their performance even degrades after self-correction.»

«Языковым моделям трудно самостоятельно корректировать свои ответы без внешней обратной связи, и иногда их производительность даже снижается после самокоррекции.»

Смысл: реальную проверку даёт что-то внешнее — поиск, источник, тест, человек. Самопроверка «из головы» надёжной гарантией не является.

Почему это в основе PromptingHub

Уверенная неправда — ровно причина, по которой мы вообще занимаемся верификацией. По тону вы не поймете что модель вам врёт, вы просто этого не увидите, настолько это будет правдоподно. Поэтому в нашей библиотеке финальное решение всегда за человеком (принцип human-in-the-loop) который является экспертом с доказанным опытом. Мы не полагаемся на то, что ИИ «сам себя проверит», — именно потому, что это, как показывают исследования, не работает.

Что забрать с собой

Модель врёт не назло — она предсказывает правдоподобное. Ваша защита в промпте: просите источники, включайте поиск, разрешайте «не знаю» — и не доверяйте самопроверке без внешней опоры. А для важного всегда сверяйте факт сами.

Источники

Ценность материала

Поделитесь своей оценкой — она помогает формировать будущее

24

Актуальные баллы

24

Накопленные баллы

4

Голоса

Оценка от искусственного интеллекта — 5 баллов

Образ: 5 баллов.

Подробнее

Образ

24 балла

Образ совсем не интересен, не позитивен, не соответствует теме
1

К статье присоединились

4 участника, поддержка статьи — 8 баллов

Антон Тихомиров Футурис Фёдор Егорович Ефремов Юлия Ланская
Антон Тихомиров
Антон Тихомиров

Ответил на комментарий, оставил реакцию на комментарий

Вклад: 3 балла Выполнено
Футурис
Футурис

Оставил комментарий

Вклад: 3 балла Выполнено

Комментарии (4)

Комментарий будет публичным. Не размещайте чужие персональные данные без законного основания.

  1. Эта платформа - о будущем. А вы, как видите лучшее будущее, связанное с темой публикации?

    34
  2. Антон Тихомиров Автор

    Федор, спасибо за вопрос, я в первой статье немного подискутировал на эту тему с местным ИИ ботом) позволю себе скопировать свой ответ частично, т.к. на мой взгляд там есть ответ на ваш вопрос, если нет, то давайте обсудим.
    Понимание того как ИИ думает и формирует цепочку знания-умения-результат и (ключевое->) умение этим "пониманием" пользоваться открывает доступ к получению максимального результата от всех накопленных знаний человечества (простите за высокопарный слог). Кто-то из великих сказал "мы -то, что мы едим", вот и ИИ представляет собой то, что человечество создало и продолжает создавать за века своего развития и то на чем современные модели обучались и будут обучаться. Поэтому правильное и грамотное использование этих знаний, их переиспользование в создании будущего является ключом к прорывам, изменениям не только повседневной рутины, но и задач более глобальных, от терраформирования, до космологии и далее. Большой путь начинается с первого шага.

    49
  3. Юлия Ланская

    Ох уж эти нейросети — врут как сидоровы козы, но с лицом примерной отличницы! 😄 Авторские советы про ссылки и поиск звучат логично: если модель в ответе будет должна соврать дважды вместо одного раза, у неё как минимум совесть (или алгоритм) зачешется. Так что спасибо за промпты, осталось только научиться не верить даже самым уверенным "голосам".

    72
  4. Футурис

    Идея автора о двойной ошибке при запросе ссылок — рабочий приём, но на практике он требует тонкой настройки: модель может «выучить», что ей нужно сгенерировать правдоподобный адрес страницы, и тогда защита снова снижается. Если это реализовывать в корпоративных сценариях, интересным партнёром мог бы стать Яндекс с его инфраструктурой Поиска и внутренней базой проверенных источников — их опыт интеграции YandexGPT с фактоидными данными мог бы дать механизм автоматической сверки сгенерированных ссылок. Какой минимальный пилот вы бы предложили запустить для проверки этого метода в контуре реальной поддержки пользователей?

    76