Технологии и будущее

Искусственный интеллект для написания текста: пределы возможностей

От 3% до 27% ответов разных языковых моделей могут содержать галлюцинации — правдоподобные, но ошибочные сведения. Разброс зависит от модели и условий проверки.

Искусственный интеллект для написания текста: пределы возможностей

Это не случайный сбой на периферии системы: риск связан с самим способом генерации текста.

Искусственный интеллект для написания текста умеет поддерживать тему, строить связные фразы и подражать заданному стилю. Но связность не равна точности, а грамматически выверенный ответ не подтверждает, что его факты проверены. Чтобы понять ограничения таких систем, нужно рассмотреть, как они выбирают каждое следующее слово и что происходит, когда в задаче появляются источники, длинные документы и требования к достоверности.

Как языковая модель строит текст

Большая языковая модель получает входной текст и продолжает его последовательностью токенов. Токеном может быть слово, часть слова или знак. Для каждого шага алгоритм оценивает вероятности возможных продолжений с учётом предыдущего контекста, затем выбирает один из вариантов. После этого расчёт повторяется для следующего фрагмента.

Модель не хранит сведения в виде обычной базы данных, где запросу соответствует запись с проверенным значением. Во время обучения она настраивает параметры на больших массивах текста и усваивает статистические закономерности: какие слова, конструкции и темы часто встречаются вместе. При генерации она использует эти закономерности, чтобы построить продолжение, которое подходит к уже полученному фрагменту.

Отсюда возникает разница между убедительной формой и достоверным содержанием. Если вопрос сформулирован так, что ожидает точный год или название исследования, модель может выдать конкретный ответ даже без надёжного основания. Продолжение оказывается языково вероятным. Проверка факта — отдельная задача.

Это объясняет и способность системы менять стиль. Если пользователь просит ответить коротко, академично или в форме инструкции, модель подбирает конструкции, соответствующие этим образцам. При этом стилистическая настройка не добавляет знаний о предмете. Текст может стать строже по тону, но его фактическая погрешность от этого не исчезает.

Модель рассчитывает вероятное продолжение текста. Достоверность утверждения требует отдельной проверки.

Так работают принципы языковых моделей: предсказание токенов создаёт непрерывный текст, а не последовательность записей из проверенного справочника. Поэтому автоматизация создания контента может ускорять подготовку черновиков, пересказов и стандартных формулировок, но сама по себе не заменяет редакторскую проверку.

Галлюцинации: когда правдоподобие расходится с фактами

Галлюцинацией называют случай, когда модель формулирует фактически неверное утверждение как связный и уверенный ответ. Ошибка может касаться даты, числа, названия работы или причинной связи. Внешне она не обязательно отличается от корректной фразы: грамматика и тон не служат индикаторами точности.

По данным исследования Vectara, частота галлюцинаций у разных текстовых моделей варьируется от 3% до 27%. Этот диапазон нельзя переносить на любой запрос как универсальную вероятность ошибки. Результат зависит от модели, типа задания, критериев оценки и способа проверки. Однако даже нижняя граница показывает, что генерацию нельзя считать безошибочной операцией.

Особенно заметен риск в задачах с источниками. В исследовании Deakin University, посвящённом академическим обзорам, GPT-4o подготовила 176 ссылок. Полностью сфабрикованными оказались 19,9% из них; суммарная доля вымышленных или содержащих ошибки ссылок составила 56,2%. Этот результат относится к конкретному эксперименту и не описывает все модели и сценарии. Но он показывает, почему библиографию, DOI, названия журналов и цитируемые выводы необходимо сверять с первичными публикациями.

Модель может соединить знакомые элементы в комбинацию, которой нет в реальности. Например, правдоподобное название статьи может состоять из типичных для дисциплины слов, а фамилии авторов и год публикации — соответствовать распространённым шаблонам. Уверенная подача здесь не уменьшает риск. Напротив, она затрудняет обнаружение ошибки, если читатель не открывает сам источник.

На точность влияет и формулировка запроса. Чем конкретнее требуется назвать параметр, тем выше цена неподтверждённой догадки. В свободном пересказе несущественная неточность может остаться незаметной. В технической инструкции, научном обзоре или материале о здоровье та же ошибка способна изменить смысл.

Проверку лучше строить вокруг отдельных утверждений, а не вокруг общего впечатления от ответа:

  • Числа и даты сверять с исходным документом или базой данных.
  • Ссылки открывать и проверять, соответствует ли публикация указанной теме.
  • Причинные выводы отделять от фактов, которые непосредственно приведены в источнике.
  • Если подтверждения нет, формулировать это как неопределённость, а не заполнять пробел догадкой.

Это не устраняет все ошибки, но меняет режим работы с текстом: результат генерации становится материалом для проверки, а не готовым доказательством.

Почему длинный контекст теряет середину

Языковые модели способны принимать длинные документы, но размер контекстного окна не гарантирует одинаково точную работу со всеми его частями. В исследованиях этого эффекта используют выражение «lost in the middle»: модель лучше извлекает сведения, расположенные в начале или конце длинного текста, чем факты из его средней части.

В фактуре приведено сравнение: точность извлечения может превышать 80%, когда ключевая информация находится у края документа, и падать ниже 40%, когда она помещена в середине. Эти значения описывают конкретную постановку задачи, а не постоянную характеристику любой модели. Важен сам механизм: наличие информации во входном контексте ещё не означает, что она будет одинаково доступна для ответа.

Для пользователя проблема выглядит как пропуск детали. Модель пересказывает документ в целом, но игнорирует оговорку, исключение или условие, находившееся между большими блоками текста. При запросе на сравнение нескольких версий она может смешать параметры. При подготовке обзора — опустить ограничение, без которого вывод становится чрезмерно широким.

Есть и технический фактор объёма. Текст преобразуется в токены, причём их количество не совпадает напрямую с числом слов или страниц. Для англоязычного материала приводится ориентир: один токен соответствует примерно четырём символам или около 0,75 слова. Для русского соотношение может отличаться из-за устройства слов и токенизации. Поэтому длинный документ иногда занимает больше контекста, чем кажется по его объёму в знаках.

Практический вывод для работы с большими файлами состоит в том, чтобы не полагаться только на запрос «прочитай всё и ничего не упусти». Полезнее разбивать материал на тематические части, просить сначала извлечь конкретные положения, а затем сверять итоговый синтез с исходными фрагментами. Если важное ограничение находится в середине документа, его стоит вынести в отдельный запрос или явно указать, что именно нужно проверить.

Увеличение контекстного окна расширяет объём доступного материала. Оно не превращает модель в безошибочную систему поиска по каждой строке. Длина входа и качество извлечения — разные параметры.

RAG: поиск перед генерацией

Один из способов уменьшить фактические ошибки — архитектура RAG, то есть генерация с дополнением поиском. Сначала система ищет релевантные фрагменты во внешних источниках или подготовленном корпусе документов. Затем передаёт их модели вместе с запросом. Модель формирует ответ, опираясь на найденный материал.

Здесь цепочка состоит из нескольких операций: поиск, отбор фрагментов, передача контекста, формулирование ответа. Ошибка возможна на каждом этапе. Поисковая система может не найти нужный документ. Индекс может содержать устаревшую версию. В контекст могут попасть похожие, но нерелевантные выдержки. Наконец, модель может неверно пересказать найденный текст или приписать источнику вывод, которого в нём нет.

RAG снижает зависимость генерации от того, какие закономерности модель усвоила при обучении, потому что добавляет сведения из внешнего источника непосредственно перед ответом. По данным фактуры, в одном из описанных сценариев для GPT-4o частота галлюцинаций снизилась примерно с 15% до диапазона 3–7%. Это существенное улучшение, но не нулевая ошибка. Результат относится к конкретной системе и условиям оценки; его нельзя автоматически переносить на любой продукт с поиском.

Качество такой архитектуры определяется не только языковой моделью. Имеют значение свежесть корпуса, точность поиска, размер фрагмента, способ ранжирования и возможность проверить, какой источник поддерживает конкретную фразу. Если интерфейс показывает ссылки, читателю всё равно нужно открыть их: наличие ссылки ещё не подтверждает, что она действительно обосновывает ответ.

Для редакционной работы RAG полезен там, где требуется опираться на заданный набор материалов: внутренние документы, научные публикации, инструкции или архив. Он делает происхождение ответа более прослеживаемым. Но финальная проверка остаётся необходимой, особенно если текст содержит точные числа, выводы или утверждения о причинно-следственных связях.

Детекторы ИИ-текста и пределы автоматической атрибуции

Детекторы пытаются определить, сгенерирован ли текст языковой моделью. Обычно они оценивают статистические особенности: предсказуемость слов, регулярность конструкции и другие характеристики распределения текста. Такой подход даёт оценку вероятности, а не надёжное установление авторства.

В исследовании Стэнфордского университета 2023 года зафиксировали до 61,22% ложноположительных срабатываний при анализе работ авторов, для которых английский не был родным. Это означает, что детектор может пометить человеческий текст как машинный. Другой результат, приведённый в фактуре, касается редакторской правки: даже минимальное использование GPT-4o для улучшения человеческого текста приводило к ошибочной классификации в 10–75% случаев. Диапазон зависит от условий эксперимента и не является общей точностью всех детекторов.

Причина в том, что статистический профиль текста меняется от темы, языка, длины и редакторской обработки. Человек может писать предсказуемо и шаблонно. Модель может создавать более разнообразные конструкции. После правок граница становится ещё менее определённой.

Поэтому детектор не даёт бесспорного доказательства ни происхождения текста, ни нарушения правил. Его оценка может стать поводом для дополнительного разговора или проверки процесса подготовки работы, но не должна подменять доказательства. Для редакции, учебного заведения или работодателя вывод о способе создания текста требует более широкого контекста: черновиков, источников, истории правок и объяснения автором своих решений.

Это ограничение связано с той же природой генеративных моделей. Если признаки машинного текста статистические и зависят от распределения слов, то любое изменение стиля влияет на оценку. Детектор измеряет сходство с некоторым профилем, а не наблюдает процесс написания напрямую.

Где проходит граница автоматизации

Точность генерации текста ИИ зависит от того, насколько задача допускает вероятностный ответ и насколько легко проверить результат. Переформулировать черновик, предложить заголовки или сократить повторяющийся текст проще, чем составить достоверный обзор с десятками источников. В первом случае человек быстро оценивает качество по исходному материалу. Во втором нужно отдельно установить, существуют ли ссылки и подтверждают ли они выводы.

В работе с нейросетью полезно разделять три операции:

1. Генерация формулировки. Модель помогает получить черновик, структуру, краткое изложение или варианты подачи.

2. Поиск основания. Система или редактор подбирают документы, которые должны поддерживать фактические утверждения.

3. Проверка результата. Человек сверяет цифры, цитаты, ссылки и выводы с первичными материалами.

Смешение этих операций создаёт ложное ощущение надёжности. Если модель написала уверенный абзац и добавила список источников, это ещё не означает, что поиск и проверка состоялись. Если подключён RAG, остаётся проверить качество выдачи. Если текст прошёл через детектор, его оценка не устанавливает авторство.

Будущее нейросетей в копирайтинге будет зависеть не только от увеличения моделей и контекстных окон. Значение имеют качество поиска, доступ к актуальным данным, прозрачность ссылок, точность извлечения информации и способы обнаруживать ошибки до публикации. Увеличение вычислительной мощности может расширить набор задач, но не отменяет требований к проверке.

Искусственный интеллект для написания текста уже пригоден как инструмент подготовки и преобразования материала. Его сильная сторона — скорость построения связной языковой формы. Ограничения генеративного ИИ проявляются там, где от текста требуется подтверждённая фактическая точность, устойчивое внимание к длинному документу и доказуемое происхождение каждого утверждения. Масштабирование улучшает отдельные параметры. Полной гарантии достоверности оно не даёт.

Частые вопросы

Почему нейросеть придумывает факты и ссылки?
Модель предсказывает наиболее вероятное продолжение текста, основываясь на статистических закономерностях, а не на проверке достоверности. Она может комбинировать знакомые слова в правдоподобные, но несуществующие названия или данные.
Как снизить риск галлюцинаций при работе с ИИ?
Следует проверять каждое утверждение по первичным источникам, сверять числа и даты, а также открывать все предоставленные ссылки. Полезно разбивать сложные задачи на части и требовать от модели формулировать неопределенность, если подтверждения нет.
Насколько надежны детекторы ИИ-текста?
Детекторы дают лишь вероятностную оценку, а не доказательство авторства. Они часто ошибаются, помечая человеческий текст как машинный, особенно если автор не является носителем языка или текст прошел редакторскую правку.
Помогает ли увеличение контекстного окна лучше обрабатывать длинные документы?
Увеличение окна расширяет объем доступного материала, но не гарантирует точность. Модели склонны лучше извлекать информацию из начала и конца текста, пропуская детали из его середины.
Гарантирует ли использование RAG отсутствие ошибок?
Нет, RAG лишь снижает частоту галлюцинаций, добавляя внешние данные перед генерацией. Ошибки могут возникнуть на этапе поиска, отбора фрагментов или при неверной интерпретации найденного текста моделью.