Нейросеть говорит правду? Почему ИИ лжет и как отличить вымысел от фактов

Разбираемся, почему нейросети выдумывают факты, как работают галлюцинации ИИ и можно ли научить искусственный интеллект говорить только правду. Практические советы и научные объяснения.

Что такое галлюцинации нейросетей и почему они возникают

Галлюцинации нейросетей — это уверенные, но ложные ответы, которые генерирует искусственный интеллект. Они могут проявляться в виде вымышленных фактов, несуществующих цитат, ошибочных дат или полностью придуманных событий. Причина кроется в самой архитектуре генеративных языковых моделей.

В отличие от человека, нейросеть не обладает внутренним чувством истины. Её задача — создавать правдоподобный текст, а не проверять факты. Модель обучается на огромных массивах данных, собранных из интернета, включая форумы, блоги, новости и научные статьи. Если в обучающей выборке встречается ошибка или заблуждение, нейросеть может воспроизвести их как истину.

Кроме того, нейросети не умеют говорить «я не знаю». В процессе обучения их поощряют давать любой ответ, даже если он неверен, — это повышает шансы случайно угадать правильный вариант. В результате модель предпочитает выдумать факт, чем признаться в незнании.

Как устроено обучение: почему нейросеть не отличает правду от вымысла

Обучение генеративных моделей проходит в два этапа. На первом этапе нейросеть запоминает статистические закономерности текста: какие слова и фразы чаще всего встречаются вместе. На втором этапе её тестируют с помощью бенчмарков — наборов вопросов, на которые нужно дать правильный ответ.

Проблема в том, что большинство бенчмарков оценивают ответы только как правильные или неправильные. Ответ «я не знаю» приравнивается к ошибке. Таким образом, нейросеть получает одинаково низкую оценку как за откровенную ложь, так и за честное признание в незнании. Это стимулирует модель выдумывать ответы: даже если вероятность правильного ответа мала, попытка угадать не ухудшает результат.

Исследователи из OpenAI показали, что если для 20% фактов в обучающих данных встречается только одно упоминание, то нейросеть будет ошибаться в этих вопросах как минимум в 20% случаев. Особенно это касается дат, имён и других данных, которые нельзя вывести из контекста.

Реальные примеры: когда доверие к ИИ обходится дорого

Один из самых громких случаев произошёл в США, где два адвоката использовали ChatGPT для подготовки судебного документа. Нейросеть сгенерировала текст, полный ссылок на несуществующие судебные решения. Судья оштрафовал юристов на 5000 долларов и предписал отправить копию «литературного произведения» каждому из реальных судей, чьи имена в нём фигурировали.

Другой пример — медицинская консультация. Мужчина 60 лет отравился бромидом натрия, который нейросеть посоветовала в качестве заменителя поваренной соли. Это показывает, насколько опасными могут быть галлюцинации в областях, где ошибка стоит здоровья или жизни.

Даже в безобидных вопросах нейросети допускают грубые ошибки. Например, на вопрос о самом большом радиотелескопе в России модель GPT-4.1 nano назвала несуществующий телескоп «Сибирь» в Пермском крае, хотя правильный ответ — радиотелескоп БСА в Пущино. При повторных запросах система давала разные, но одинаково неверные ответы.

Почему нейросети не говорят «я не знаю»: математика тестирования

Ключевая причина, по которой нейросети предпочитают выдумывать, а не признаваться в незнании, — это система оценки. В девяти из десяти популярных бенчмарков ответы делятся только на две категории: правильные и неправильные. Ответ «я не знаю» считается неправильным и получает ноль баллов — так же, как и откровенная ложь.

Исследователи из OpenAI предложили изменить систему на трёхступенчатую: за правильный ответ начислять балл, за ошибку снимать три балла, а за отказ от ответа — ноль. В таком случае нейросети становится выгодно отвечать только тогда, когда она уверена в правильности хотя бы на 75%. Если штраф за ошибку увеличить до девяти баллов, порог уверенности поднимается до 90%.

Это математически обоснованный подход, который может научить нейросеть оценивать собственную компетентность. Однако пока такие изменения не внедрены в массовые версии GPT и других моделей.

Как отличить правду от вымысла: практические методы проверки

Существует несколько способов снизить риск столкнуться с галлюцинациями нейросетей. Во-первых, всегда проверяйте источники. Даже если нейросеть ссылается на конкретные статьи, журналы или авторов, это не гарантирует их существования. Лучше самостоятельно найти подтверждение в надёжных источниках.

Во-вторых, просите нейросеть «продемонстрировать работу». Если вы даёте задание собрать статистику или проанализировать данные, требуйте пошагового объяснения. Это снижает вероятность того, что модель просто выдумает результат.

В-третьих, углубляйтесь в тему. Задавайте уточняющие вопросы, просите конкретизировать детали. Если нейросеть начинает противоречить сама себе или даёт расплывчатые ответы, это повод усомниться в достоверности. Например, спросив о составе автомобильных шин, вы можете получить ответ «резина», но дальнейшие вопросы покажут, что модель не понимает разницы между натуральным и синтетическим каучуком.

Роль обучающих данных: почему интернет — не лучший учитель

Для обучения больших языковых моделей требуются терабайты текста. Учебников и энциклопедий недостаточно, поэтому разработчики вынуждены использовать данные из интернета — форумы, блоги, новости, социальные сети. В этом массиве содержится множество ошибок, противоречий и популярных заблуждений.

Например, нейросеть может воспроизвести миф о том, что схоласты спорили о количестве ангелов на кончике иглы. На самом деле такого обсуждения в схоластике не было — это ироничное высказывание теолога XVII века. Нейросеть, обученная на текстах, где этот миф повторяется как факт, будет выдавать его за истину.

Особая опасность — обучение на контенте, сгенерированном другими нейросетями. Если модель учится на галлюцинациях своих предшественников, ошибки могут накапливаться и усиливаться. Проект WikiProject AI Cleanup, запущенный в 2024 году, уже выявил множество ложных статей в Википедии, созданных с помощью ИИ, включая полностью вымышленную османскую крепость.

Можно ли научить нейросеть говорить только правду: перспективы и ограничения

Полностью устранить галлюцинации невозможно, но можно значительно снизить их частоту. Один из подходов — снабдить нейросеть внешней базой знаний, к которой она сможет обращаться за точной информацией. Это похоже на то, как человек пользуется справочником или интернетом.

Другой подход — научить модель оценивать степень своей уверенности. Если нейросеть понимает, что вероятность ошибки высока, она должна отказаться от ответа. Для этого нужно изменить систему тестирования, как предлагают исследователи OpenAI.

Однако даже самые совершенные модели будут ошибаться. Задача разработчиков — сделать так, чтобы частота ошибок была ниже, чем у человека-специалиста в конкретной области. Для медицинских и юридических консультаций порог уверенности должен быть максимально высоким, а для развлекательного контента — более низким.

Как жить в эпоху ИИстины: информационная гигиена и новые навыки

С ростом объёмов сгенерированного контента нам придётся вырабатывать новые привычки. Видео и фото больше не могут быть надёжными свидетельствами событий — их легко подделать с помощью ИИ. Точно так же, как люди когда-то научились не доверять всему напечатанному, теперь нужно учиться критически оценивать любой контент.

Появятся технические средства проверки фактов, системы отслеживания источников и курсы информационной гигиены. Уже сейчас существуют сервисы, которые оценивают вероятность того, что текст написан нейросетью. Например, GigaCheck от Сбера определяет сгенерированные тексты с высокой точностью.

Важно помнить: бороться нужно не с ИИ-контентом как таковым, а с некачественной информацией, независимо от её происхождения. Редакторы, учёные и журналисты должны фильтровать информацию так же тщательно, как и раньше. Технология — это инструмент, и то, как её использовать, зависит от людей.

Практические советы: как минимизировать риск столкнуться с ложью ИИ

Чтобы снизить вероятность получить от нейросети ложную информацию, следуйте нескольким простым правилам.

Проверяйте факты в надёжных источниках. Если нейросеть сообщает дату, имя или статистику, найдите подтверждение в официальных документах, энциклопедиях или авторитетных СМИ.

Используйте уточняющие вопросы. Не принимайте первый ответ за истину. Спрашивайте: «Откуда ты это знаешь?», «Можешь привести источник?», «Какие есть альтернативные точки зрения?».

Обращайте внимание на дату закрытия базы знаний. Бесплатные версии ChatGPT, например, не имеют доступа к событиям после октября 2023 года. Если вопрос касается недавних событий, нейросеть может выдумать ответ.

Избегайте расплывчатых запросов. Чем конкретнее вопрос, тем меньше у нейросети пространства для фантазии. Вместо «Расскажи о шинах» спросите «Из каких материалов состоит протектор зимней шины?».

Не доверяйте нейросети в вопросах здоровья, финансов и права. В этих областях цена ошибки слишком высока. Используйте ИИ только как вспомогательный инструмент, но окончательное решение принимайте на основе проверенной информации.

Вопросы и ответы

Почему нейросети выдумывают факты, если они обучены на реальных данных?

Нейросети не запоминают факты, а учатся статистическим закономерностям текста. Если в обучающих данных факт встречается редко или противоречиво, модель может его не запомнить. Кроме того, система оценки поощряет давать любой ответ, даже неверный, вместо того чтобы признаться в незнании.

Можно ли полностью устранить галлюцинации нейросетей?

Полностью устранить галлюцинации невозможно, но можно значительно снизить их частоту. Для этого используются внешние базы знаний, обучение оценке уверенности и изменение системы тестирования. Однако даже самые совершенные модели будут иногда ошибаться.

Как проверить, говорит ли нейросеть правду?

Всегда проверяйте источники, которые приводит нейросеть. Просите пошаговое объяснение, задавайте уточняющие вопросы. Если ответ кажется сомнительным или противоречивым, найдите подтверждение в независимых источниках. Используйте сервисы для определения сгенерированного текста.

Почему нейросеть не может просто сказать «я не знаю»?

Потому что в процессе обучения её не учили этому. В тестах ответ «я не знаю» считается неправильным и получает ноль баллов — так же, как и откровенная ложь. Нейросети выгоднее выдумать ответ, чем признаться в незнании, так как это не ухудшает результат.

Какие области самые рискованные для использования нейросетей?

Самые рискованные области — медицина, юриспруденция, финансы и безопасность. Ошибка в этих сферах может стоить здоровья, денег или репутации. Используйте ИИ только как вспомогательный инструмент, но окончательные решения принимайте на основе проверенной информации.

Как разработчики планируют решать проблему галлюцинаций?

Исследователи предлагают изменить систему тестирования: ввести трёхступенчатую оценку, где за ошибку снимается больше баллов, чем за отказ от ответа. Также разрабатываются методы, позволяющие нейросети оценивать степень своей уверенности и отказываться от ответа, если вероятность ошибки высока.

Что такое проект WikiProject AI Cleanup?

Это проект, запущенный в 2024 году для поиска и удаления ложной информации, добавленной в Википедию с помощью генеративного ИИ. Волонтёры находят статьи, полностью сгенерированные нейросетями, включая вымышленные факты и несуществующие объекты.