Технологии и будущее

Ответы искусственного интеллекта: почему нейросети выдумывают факты

Ответ искусственного интеллекта может звучать убедительно и при этом содержать выдуманную дату, перепутанное имя или ссылку на источник, которого не существует. Это не обязательно означает, что модель сломалась.

Ответы искусственного интеллекта: почему нейросети выдумывают факты

Часто она делает именно то, для чего устроена: продолжает текст так, чтобы он был связным и подходил к запросу. А связность — ещё не проверка фактов.

Чтобы понять, почему нейросети ошибаются, полезно различать два понятия: правдоподобие и истинность. Для языковой модели это не одно и то же. Она умеет строить фразы, похожие на ответы из справочника, но сама по себе не всегда умеет установить, верно ли каждое утверждение. Отсюда и галлюцинации искусственного интеллекта — уверенные ответы, у которых нет достаточной опоры в контексте или источниках.

Природа статистического предсказания: как нейросеть собирает слова

Большая языковая модель не хранит факты как аккуратно заполненную энциклопедию с карточками и ссылками на первоисточники. В её параметрах закодированы закономерности, усвоенные во время обучения на больших массивах текста. Модель вычисляет, какие продолжения последовательности токенов — слов или их частей — лучше подходят к данному контексту, а затем шаг за шагом генерирует ответ.

Контекстом служит запрос пользователя вместе с уже написанной частью ответа. На каждом шаге модель рассчитывает вероятности для возможного следующего токена. Затем выбранный токен добавляется к тексту, и вычисление повторяется. На выбор могут влиять настройки генерации: например, они меняют степень вариативности продолжений. Но даже если модель выбирает наиболее вероятный вариант, это не превращает его в проверенное утверждение.

Здесь и возникает важное различие. Во время обучения модель подстраивается под закономерности текста, а не проходит экзамен на истинность каждого предложения. Связные ответы получаются потому, что модель научилась улавливать языковые и смысловые связи. Но сама по себе эта способность не гарантирует, что в нужном месте она вспомнит правильную дату, не перепутает двух похожих учёных или отличит надёжное описание от многократно скопированной ошибки.

На знакомом вопросе ответ может быть точным: модель видела похожие формулировки и усвоила устойчивую связь между ними. На редком или узком запросе картина меняется. Может не хватить надёжных примеров, запрос окажется двусмысленным, а в обучающих материалах встретятся разные версии. Тогда модель всё равно способна выдать гладкое продолжение — просто потому, что незнание не всегда оформляется как пауза или отказ.

Это не означает, что модель каждый раз случайно подставляет слово из мешка. Её ответ зависит от запроса, контекста и усвоенных связей между словами и понятиями. Но вероятность продолжения текста — не то же самое, что степень достоверности факта. Уверенный тон тоже не служит мерой точности: он может быть одинаковым и у верного, и у ошибочного ответа.

Нейросеть может хорошо продолжать рассуждение и плохо замечать, где рассуждению уже не на что опереться.

История термина: от «дорисовки» лиц до цифровых выдумок

Слово «галлюцинация» употреблялось в компьютерном зрении задолго до того, как стало привычным описанием ошибок языковых моделей. В работе Саймона Бейкера и Такео Канаде Hallucinating Faces, опубликованной в 1999 году, так называли способ восстановить детали лица по изображению низкого качества. Алгоритм достраивал элементы, которые плохо различались на исходном снимке, опираясь на закономерности, обнаруженные в изображениях лиц.

В этом контексте «дорисовка» была задачей реконструкции: по неполному сигналу получить более детализированное изображение. Результат мог выглядеть убедительно, но он не обязательно совпадал с реальными деталями исходного лица. Уже здесь есть сходство с современной языковой генерацией: алгоритм дополняет неполные данные тем, что считает подходящим по усвоенным закономерностям.

Позже термин закрепился в обработке естественного языка. Языковая модель тоже способна достраивать недостающее, но вместо пикселей появляются факты, названия, даты и объяснения. Если такое дополнение не подтверждается контекстом или источниками, оно становится неудачной реконструкцией, а не просто удачной формулировкой.

Сходство полезно, но аналогия не полная. В задаче восстановления изображения дополнительные детали могут быть правдоподобными, не будучи точной копией оригинала. В ответе на вопрос о реальном событии читателя обычно интересует именно соответствие фактам. Поэтому проблема не в том, что модель «творчески» дополнила текст, а в том, что неподтверждённое дополнение подано как достоверное.

Анатомия ошибки: внутренние и внешние галлюцинации

Один из способов разбирать ошибки — смотреть, с чем именно расходится ответ: с предоставленным контекстом или с фактами, которые можно проверить независимо. В этой классификации важна не уверенность тона и не величина ошибки, а её отношение к источнику.

Внутренняя галлюцинация — это противоречие контексту, который был дан модели. Например, в приложенном документе сказано, что исследование охватывало взрослых участников, а в пересказе модель утверждает, что в нём участвовали дети. Или исходный текст сообщает, что проект отложили, а ответ пересказывает это как отмену. Здесь дело не просто в том, что модель добавила сведения, которых в документе нет: отсутствие утверждения ещё не означает противоречия. Ошибка возникает, когда ответ приписывает источнику несовместимое с ним содержание.

Внешняя галлюцинация — неподтверждённое или неверное утверждение, которое нельзя обосновать ни данным контекстом, ни надёжными внешними сведениями. Например, модель отвечает на вопрос о малоизвестном событии, придумывает точную дату или приписывает автору публикацию, которой тот не выпускал. Важна оговорка: если у ответа нет ссылки, это ещё не доказывает, что он ложен. Но без опоры на источник его трудно проверить, а при сверке могут обнаружиться выдуманные подробности.

Тип ошибкиС чем сравнивают ответПример
ВнутренняяС предоставленным текстомВ источнике сказано, что проект отложен, а пересказ сообщает, что его отменили
ВнешняяС проверяемыми сведениями вне контекстаМодель называет несуществующую публикацию или неверную дату события

На практике граница зависит от задачи. Если пользователь просит пересказать документ, основным ориентиром становится сам документ: нужно не приписывать ему того, чего в нём нет, и не искажать сказанное. Если вопрос касается фактов за пределами этого документа, понадобятся внешние источники. Один ответ может одновременно неверно пересказывать источник и добавлять неподтверждённую деталь.

Ошибки возникают не только в редких именах и датах. Модель может перепутать причинно-следственную связь, превратить предположение в установленный факт, соединить сведения о разных людях с одинаковыми фамилиями или заполнить пробел в пересказе типичной, но не подтверждённой деталью. Чем точнее запрос требует конкретики, тем заметнее цена такого достраивания.

Почему интернет-данные становятся ловушкой для моделей

Большие языковые модели обучаются на обширных массивах текста, в том числе на материалах из интернета. Там встречаются справочные статьи, новости, форумы, учебные тексты, переводы и множество других жанров. Этот корпус может содержать и точные сведения, и устаревшие публикации, и ошибки, и противоречия. Сам факт, что утверждение часто встречается в текстах, не делает его истинным.

Частотность — лишь один из факторов, по которым модель улавливает языковые закономерности. Нельзя буквально сказать, что она видит ложное утверждение тысячу раз и поэтому принимает его за истину: обучение сложнее простого подсчёта повторов. Но многократно встречающиеся формулировки действительно могут закрепляться как привычные продолжения. При этом корректная информация может быть разбросана по специализированным источникам, изложена разными словами или вообще отсутствовать в доступных модели данных.

Есть и временная ловушка. Текст мог быть точным на момент публикации, но устареть: изменились правила, обновились результаты исследования, организация сменила руководство. Если модель отвечает на вопрос о текущем положении дел, старые сведения могут оказаться неуместными. Без обращения к актуальному источнику она не всегда способна определить, какое из противоречащих друг другу утверждений относится к настоящему времени.

Другой источник сложности — качество самого материала. В интернете соседствуют первичные документы, пересказы, копии пересказов и страницы, где одно и то же утверждение повторяется без проверки. Модель усваивает связи в тексте, но не обязательно располагает надёжной историей происхождения каждого фрагмента. Поэтому повторяемость не равна независимому подтверждению: десяток страниц могут восходить к одному ошибочному сообщению.

К этому добавляется контент, созданный другими нейросетями. Если такие тексты попадают в новые обучающие наборы, они могут передавать дальше ошибки, обобщения и выдуманные ссылки. Это не означает, что любая модель обязательно обучается на подобных материалах или что ошибки с каждым поколением неизбежно усиливаются. Но чем труднее установить происхождение текста, тем сложнее отделить независимые свидетельства от многократного копирования одной версии.

И, наконец, нельзя сводить модель к устройству, которое считает все источники одинаково ценными. Современные системы могут проходить дополнительную настройку и использовать механизмы поиска или фильтрации. Однако базовая языковая способность сама по себе не равна проверке репутации источника. Если модель не подключена к актуальным документам и не умеет надёжно оценивать их качество, убедительный ответ ещё не говорит о том, откуда именно взялось его фактическое основание.

Технология RAG как способ приземлить ИИ на реальные факты

RAG — сокращение от Retrieval-Augmented Generation, то есть генерации с дополнением через поиск. Перед тем как составить ответ, такая система ищет подходящие материалы во внешней базе: например, в наборе документов организации, справочнике или поисковом индексе. Найденные фрагменты добавляются к запросу, чтобы модель могла использовать их как контекст.

В типичном варианте документы заранее разбивают на фрагменты и индексируют. Запрос тоже преобразуется в представление, по которому система ищет близкие по смыслу материалы. Затем отобранные фрагменты передаются языковой модели. Та формулирует ответ, опираясь на исходный вопрос и добавленный контекст. В некоторых системах поиск устроен иначе или дополняется фильтрами, но общий замысел тот же: не полагаться только на сведения, усвоенные во время обучения.

У RAG есть очевидное преимущество перед ответом без поиска: в контексте могут оказаться документы, которых не было в обучающих данных, а сведения можно обновлять вместе с базой. Но фраза «ответ основан на источниках» не означает, что источники автоматически надёжны или что модель точно передала их содержание.

На точность влияют несколько звеньев:

  • Качество базы. Если в ней есть устаревшие, неполные или ошибочные документы, поиск способен принести их в ответ.
  • Релевантность найденных фрагментов. Система может подобрать текст на похожую тему, который не отвечает на вопрос, или пропустить важное уточнение.
  • Полнота контекста. Отрывок может содержать вывод без условий и оговорок, от которых зависит его смысл.
  • Работа модели с материалом. Даже подходящий фрагмент можно неверно пересказать, смешать с другими сведениями или дополнить тем, чего в нём нет.
  • Проверяемость ответа. Ссылка на документ помогает читателю сверить утверждение, но сама по себе не доказывает, что именно этот документ его подтверждает.

Поэтому RAG снижает зависимость ответа от внутренних параметров модели и может сделать проверку удобнее, но не гарантирует фактическую точность. Надёжность зависит от качества источников, поиска и того, насколько внимательно модель использует предоставленный контекст. Если система не умеет находить нужный документ или игнорирует существенную оговорку, внешний поиск не спасает от ошибки.

RAG добавляет модели опору, но не превращает найденный текст в проверенный факт автоматически.

Полезная система RAG должна не только извлекать материалы, но и показывать, на какие фрагменты опирается ответ. Это позволяет заметить, когда ссылка ведёт на документ с другим смыслом, а цитируемый кусок не подтверждает сформулированный вывод. Для важных решений такая проверка остаётся необходимой: машинное резюме удобно, но первоисточник точнее показывает, что именно было сказано и при каких условиях.

Почему уверенность ответа не равна его точности

Читателя часто сбивает форма. Ответ оформлен аккуратно, объяснение выстроено по пунктам, рядом появляются конкретные названия и числа — значит, кажется, что модель уверена. Но стиль генерации не следует принимать за независимую оценку достоверности. Языковая модель способна одинаково гладко изложить подтверждённое сведение и правдоподобную догадку.

Особенно осторожно стоит относиться к деталям, которые легко проверить отдельно, но трудно заметить в общем потоке текста: датам, именам, названиям публикаций, цитатам, числам и ссылкам. Ошибка в одном таком элементе может изменить смысл всего ответа. Например, в пересказе исследования достаточно перепутать условие эксперимента, чтобы вывод выглядел убедительным, но относился уже не к тому случаю.

Есть и ловушка точного незнания. Если попросить модель назвать конкретную цифру там, где она не располагает надёжной опорой, она может не остановиться на общем ответе, а предложить число с пояснением. Подробность создаёт впечатление основательности, хотя сама по себе не подтверждает источник. Уместное признание неопределённости полезнее выдуманной точности — но не каждая система одинаково хорошо умеет отказываться от ответа.

Поэтому полезно смотреть не только на сам ответ, но и на то, как он связан с источником. Если система утверждает, что пересказывает документ, можно проверить, действительно ли там есть соответствующая мысль и не пропущены ли оговорки. Если речь о внешнем факте, стоит искать независимое подтверждение, особенно когда на кону здоровье, деньги, право или безопасность. А если модель привела цитату, её лучше сверить с оригиналом: кавычки в ответе не доказывают, что слова были произнесены именно так.

Галлюцинации не исчезают оттого, что модель стала больше или научилась писать ещё естественнее. Меняются возможности систем, способы обучения и инструменты поиска, но генерация связного текста остаётся не тождественной проверке истины. В одних задачах нейросеть полезна как собеседник, который помогает сформулировать мысль или набросать пересказ; в других её ответ должен вести к источнику, а не подменять его.

Именно так разумнее читать ответы искусственного интеллекта: не как заведомую ложь и не как готовую справку, а как текст, который может быть полезным, пока его фактические опоры не перепутаны с гладкой формулировкой. Чем выше цена ошибки, тем важнее увидеть не только то, что модель сказала, но и на чём это сказанное держится.

Частые вопросы

Почему нейросеть уверенно врет?
Нейросеть не проверяет истинность утверждений, а лишь подбирает наиболее вероятные продолжения слов. Уверенный тон — это особенность стиля генерации, которая не зависит от того, является ли ответ правдой или выдумкой.
Что такое галлюцинации искусственного интеллекта?
Это уверенные ответы модели, у которых нет достаточной опоры в контексте или надежных источниках. Они возникают, когда нейросеть заполняет пробелы в знаниях правдоподобными, но фактически неверными данными.
В чем разница между внутренней и внешней галлюцинацией?
Внутренняя галлюцинация противоречит предоставленному пользователем контексту, а внешняя представляет собой утверждение, которое нельзя подтвердить ни контекстом, ни надежными внешними данными.
Помогает ли поиск по документам (RAG) избежать ошибок?
RAG снижает зависимость от внутренних параметров модели, но не гарантирует точность. Ошибки могут возникать из-за низкого качества документов в базе, неверного выбора фрагментов или неправильного пересказа информации моделью.
Можно ли доверять ссылкам, которые дает нейросеть?
Не всегда. Модель может придумать ссылку на несуществующий источник или неверно интерпретировать содержание реального документа, поэтому для важных задач рекомендуется проверять первоисточники самостоятельно.