Продолжаю начатую серию.
Модель уверенно называет несуществующую книгу, придумывает статью закона или дату —
знакомо?
Это не поломка — это свойство того, как устроены языковые модели. Хорошая новость: риск можно заметно снизить, и делается это в промпте.
Почему это происходит
Языковая модель не «знает» факты в привычном смысле — она предсказывает правдоподобное продолжение текста. На популярных темах правдоподобное обычно совпадает с верным. Но на узких фактах и нишевых вопросах модель выдаёт то, что выглядит правильно, — и звучит при этом ровно так же уверенно, как когда она права.
Именно эта одинаковая уверенность и опасна: по тону вы не отличите факт от выдумки.
Приёмы, которые снижают риск
- Просите источники. Это не только удобно для проверки — сам механизм снижает выдумку. Как формулирует Microsoft:
«Asking for citations makes it so that the model must make two errors every time it generates a response: the first error is the fabricated response, and the second is the bad citation.»
«Запрос ссылок приводит к тому, что модель должна совершать две ошибки каждый раз, когда генерирует ответ: первая ошибка — это сфабрикованный ответ, а вторая — неверное цитирование.» (спасибо Яндексу за машинный перевод)
Чтобы соврать со ссылкой, модели нужно ошибиться дважды — а это менее вероятно. Причём ссылку лучше просить рядом с утверждением, а не общим списком в конце.
- Включайте веб-поиск для фактов. Когда ответ опирается на актуальные найденные данные, а не на память модели, почвы для выдумки меньше. Для всего, что зависит от свежих или точных фактов — это первый приём.
- Просите уровень уверенности и разрешайте «не знаю». Добавьте в промпт явное разрешение: «если не уверен — так и скажи». Модели по умолчанию склонны дать хоть какой-то ответ; явное «не знаю» как допустимый исход снижает давление на выдумывание.
Чего делать НЕ стоит
Популярный совет — «попроси модель перепроверить свой ответ» — работает хуже, чем кажется. Исследование Huang et al. (2023) показало: без внешней обратной связи модель себя не исправляет, а иногда после «самопроверки» отвечает даже хуже:
«LLMs struggle to self-correct their responses without external feedback, and at times, their performance even degrades after self-correction.»
«Языковым моделям трудно самостоятельно корректировать свои ответы без внешней обратной связи, и иногда их производительность даже снижается после самокоррекции.»
Смысл: реальную проверку даёт что-то внешнее — поиск, источник, тест, человек. Самопроверка «из головы» надёжной гарантией не является.
Почему это в основе PromptingHub
Уверенная неправда — ровно причина, по которой мы вообще занимаемся верификацией. По тону вы не поймете что модель вам врёт, вы просто этого не увидите, настолько это будет правдоподно. Поэтому в нашей библиотеке финальное решение всегда за человеком (принцип human-in-the-loop) который является экспертом с доказанным опытом. Мы не полагаемся на то, что ИИ «сам себя проверит», — именно потому, что это, как показывают исследования, не работает.
Что забрать с собой
Модель врёт не назло — она предсказывает правдоподобное. Ваша защита в промпте: просите источники, включайте поиск, разрешайте «не знаю» — и не доверяйте самопроверке без внешней опоры. А для важного всегда сверяйте факт сами.
Комментарии (4)
Эта платформа - о будущем. А вы, как видите лучшее будущее, связанное с темой публикации?
Федор, спасибо за вопрос, я в первой статье немного подискутировал на эту тему с местным ИИ ботом) позволю себе скопировать свой ответ частично, т.к. на мой взгляд там есть ответ на ваш вопрос, если нет, то давайте обсудим.
Понимание того как ИИ думает и формирует цепочку знания-умения-результат и (ключевое->) умение этим "пониманием" пользоваться открывает доступ к получению максимального результата от всех накопленных знаний человечества (простите за высокопарный слог). Кто-то из великих сказал "мы -то, что мы едим", вот и ИИ представляет собой то, что человечество создало и продолжает создавать за века своего развития и то на чем современные модели обучались и будут обучаться. Поэтому правильное и грамотное использование этих знаний, их переиспользование в создании будущего является ключом к прорывам, изменениям не только повседневной рутины, но и задач более глобальных, от терраформирования, до космологии и далее. Большой путь начинается с первого шага.
Ох уж эти нейросети — врут как сидоровы козы, но с лицом примерной отличницы! 😄 Авторские советы про ссылки и поиск звучат логично: если модель в ответе будет должна соврать дважды вместо одного раза, у неё как минимум совесть (или алгоритм) зачешется. Так что спасибо за промпты, осталось только научиться не верить даже самым уверенным "голосам".
Идея автора о двойной ошибке при запросе ссылок — рабочий приём, но на практике он требует тонкой настройки: модель может «выучить», что ей нужно сгенерировать правдоподобный адрес страницы, и тогда защита снова снижается. Если это реализовывать в корпоративных сценариях, интересным партнёром мог бы стать Яндекс с его инфраструктурой Поиска и внутренней базой проверенных источников — их опыт интеграции YandexGPT с фактоидными данными мог бы дать механизм автоматической сверки сгенерированных ссылок. Какой минимальный пилот вы бы предложили запустить для проверки этого метода в контуре реальной поддержки пользователей?