Что происходит, когда вы нажимаете «Отправить»
Представьте, что вы написали в чат: «Столица Франции —». Почти любой человек мысленно закончит фразу словом «Париж». Не потому, что полез в справочник, а потому, что это единственное правдоподобное продолжение. Вот ровно этим и занимается нейросеть. Всегда. Каждую секунду своей работы.
Когда вы отправляете вопрос, модель не переключается в режим «поиск ответа». Она берёт весь ваш текст целиком и решает одну-единственную задачу: какой кусочек текста правдоподобнее всего идёт дальше. Выбрала кусочек — приписала его к вашему тексту — и задала себе тот же вопрос заново, уже с учётом того, что сама только что написала. И так, слово за словом, пока не решит, что пора остановиться.
Поэтому ответ и печатается на экране постепенно: это не анимация для красоты. Модель действительно сочиняет его прямо сейчас, слева направо, и в момент первого слова ещё «не знает», чем закончит. Готового ответа, который просто загружается, нигде нет.
Токены: нейросеть не видит букв
Первое, что происходит с вашим сообщением, — оно рубится на кусочки. Эти кусочки называют токенами. Токен — не буква и не всегда слово: это частый кусок текста, который модель выучила как единое целое. «Привет» — скорее всего, один токен. «Токенизация» — два-три. Пробел перед словом — часть токена. Эмодзи — отдельный токен.
Дальше каждый токен превращается в длинный ряд чисел — набор координат, который описывает его смысл. Слова с близким значением получают близкие координаты: «кот» окажется рядом с «котёнком» и «кошкой», а «банк» будет болтаться где-то между «деньгами» и «рекой», пока соседние слова не подскажут, о чём речь. Нейросеть работает только с этими числами. Букв она не видит вообще.
Отсюда растёт знаменитая странность: модель блестяще пишет эссе, но может сбиться, если попросить её посчитать буквы в слове. Для неё слово — это один неделимый кусок, а не последовательность символов. Всё равно что просить человека назвать количество пикселей в картинке, на которую он смотрит.
Для русского языка у токенов есть ещё одно последствие, о котором редко пишут. Английский текст режется экономно: одно короткое слово — часто один токен. Русский — примерно в два-три раза «дороже»: одно слово обычно распадается на два-три токена из-за приставок, суффиксов и окончаний. Практический вывод: русский текст быстрее упирается в лимиты и расходует больше ресурсов на тот же объём. Если гоните через модель большой документ и упираетесь в ограничения, английский оригинал пройдёт дальше русского перевода.
Главный трюк: предсказание следующего кусочка
Теперь самое важное. Внутри модели нет базы фактов, нет справочника и нет отдельного блока «ответы на вопросы». Есть огромная математическая функция, которая принимает на вход всю цепочку токенов и выдаёт на выходе список вероятностей — насколько уместен каждый возможный следующий токен.
Выглядит это примерно так. Вы написали «Столица Франции —», и модель получает что-то вроде:
«Париж» — 94% «город» — 2% «это» — 1% «крупный» — 0,4% … и ещё десятки тысяч вариантов с долями процента
Модель вытягивает один вариант из этого списка, дописывает его и пересчитывает всё заново — уже для фразы «Столица Франции — Париж». Дальше самым вероятным окажется точка или запятая, потом следующее слово, и так до конца ответа. Ни на одном шаге она не задаёт себе вопрос «а правда ли это?». Единственный вопрос всегда один: «что тут обычно пишут дальше?».
И вот тут прячется вся магия и вся беда одновременно. Чтобы хорошо угадывать следующее слово в миллиардах текстов, недостаточно запомнить обороты речи. Приходится нечаянно выучить и грамматику, и логику, и арифметику, и то, что за вопросом обычно следует ответ, а за условием задачи — решение. Способность рассуждать выросла как побочный эффект очень упорного угадывания. Но сам механизм остался прежним: угадывание следующего кусочка, и ничего больше.
Откуда она это знает: обучение — не библиотека
Обучение выглядит скучнее, чем принято думать. Модели показывают гигантский объём текста и на каждом шаге закрывают следующее слово: «угадай». Она угадывает, ошибается, и после каждой ошибки её внутренние коэффициенты — веса — чуть-чуть подкручиваются в сторону правильного ответа. Ни учителя, ни объяснений, ни «запомни, это важно». Миллиарды повторов одного упражнения.
Ключевая вещь, из которой дальше следует всё остальное: прочитанные тексты нигде не сохраняются. Они не лежат в архиве внутри модели. После обучения от них остаются только числа — миллиарды коэффициентов, в которых растворены закономерности всех текстов сразу. Это как если бы человек прочитал миллион книг и начисто забыл сам процесс чтения: ни одной обложки, ни одной страницы, ни одного момента «где я это вычитал». Осталось только очень сильное чутьё на то, как складываются фразы и чем обычно заканчиваются вопросы.
Поэтому фраза «модель поискала в своей базе» — неправда. Искать негде. Когда вы спрашиваете про войну 1812 года, модель не достаёт учебник, а восстанавливает ответ по следам, которые сотни тысяч текстов об этой войне оставили в её коэффициентах. Частые, много раз повторённые факты восстанавливаются надёжно. Редкие — например, дата рождения не самого известного человека или номер конкретного судебного дела — восстанавливаются плохо: следа почти нет, а продолжение всё равно нужно выдать.
После основного обучения модель дообучают вести себя как собеседник: показывают примеры хороших ответов, а люди и специальные модели-оценщики отмечают, какие варианты лучше. Так она учится отвечать вежливо, структурно и по делу. Но и это не добавляет ей внутренней проверки фактов — только манеру.
Почему на один вопрос — разные ответы
Задайте один и тот же вопрос дважды — получите два разных ответа. Это не сбой и не признак того, что модель «передумала».
Помните список вероятностей? Модель не обязана всегда брать из него верхнюю строчку. Обычно она вытягивает вариант случайно, но с учётом весов: у слова с вероятностью 60% шансов быть выбранным больше, чем у слова с 5%, но второе тоже иногда выпадает. Силой этой случайности управляет параметр с красивым названием «температура».
| Температура | Как ведёт себя модель | Для каких задач |
|---|---|---|
| Низкая (близко к 0) | Почти всегда берёт самый вероятный вариант. Ответы предсказуемые, суховатые, повторяемые | Факты, код, перевод, извлечение данных из документа |
| Средняя | Баланс: связно, но с вариациями формулировок | Обычный разговор, письма, объяснения |
| Высокая | Охотно берёт редкие слова. Больше неожиданных ходов, выше риск бессвязицы | Идеи, тексты, стихи, брейншторм |
Есть и вторая причина, менее очевидная. Даже при минимальной температуре ответы могут не совпадать дословно: вычисления идут на тысячах видеокарт параллельно, а порядок сложения огромного количества дробных чисел слегка меняется от запуска к запуску. Разница микроскопическая, но иногда её хватает, чтобы на одном шаге два почти равных варианта поменялись местами — а дальше ответ уходит по другой ветке.
Практический вывод приятный: если ответ не понравился, перегенерируйте его. Вы не «спорите с моделью» — вы просто тянете другой билет. А если ответ понравился и нужен именно он, скопируйте его себе: точно такой же второй раз может не выпасть.
Контекст: короткая память длиной в один разговор
У модели есть рабочее пространство — контекстное окно. Это весь текст, который она видит прямо сейчас: ваш вопрос, предыдущие сообщения диалога, прикреплённый файл, найденная поиском страница, служебная инструкция сервиса. Всё это складывается в одну длинную ленту, и по ней модель предсказывает продолжение.
Окно не бесконечное. Когда разговор становится слишком длинным, самые ранние сообщения из него вытесняются — и модель ведёт себя так, будто их не было. Отсюда знакомое ощущение, что к концу долгого диалога она «поглупела» и забыла договорённости из начала. Она не устала: начало просто выпало из поля зрения.
Здесь же прячется единственное различие, которое модель действительно умеет держать, и его стоит запомнить. Есть текст, который лежит в контексте прямо сейчас, — его можно перечитать и процитировать дословно. И есть знание из коэффициентов — оно восстанавливается по следам и может быть искажено. Поэтому прикреплённый документ модель пересказывает точнее, чем факт «из головы»: в первом случае она читает, во втором — реконструирует.
А «память», которая есть у некоторых сервисов, устроена не мистически: она сохраняет заметки о вас в отдельном хранилище и незаметно подкладывает их в начало нового разговора. Сама модель при этом не меняется — её коэффициенты после обучения застыли. Ваши сообщения её не переучивают.
Почему она не отличает, вспомнила или сочинила
Теперь главное — то, ради чего стоило разбираться со всем предыдущим.
Внутри модели нет двух отдельных систем: одной, которая помнит, и второй, которая выдумывает. Есть одна, и работает она одинаково в обоих случаях. Когда вы спрашиваете, кто написал «Войну и мир», модель выдаёт «Толстой», потому что это самое правдоподобное продолжение. Когда вы просите её сослаться на исследование, которого не существует, она выдаёт гладкое правдоподобное название, фамилию автора и год — по той же самой причине и тем же самым способом. Ничто внутри не переключается. Вспоминание и сочинение — одна операция.
Почему она не может себя проверить? Когда человек что-то помнит, он обычно помнит и обстоятельства: где прочитал, кто рассказал, на каком уроке услышал. Этот след и даёт разницу между «я точно знаю» и «кажется, где-то встречал». У модели такого следа нет вовсе — тексты не сохранились, источника не осталось. Ей просто не с чем сверяться, даже в принципе.
И беглость делает только хуже. Модель училась выдавать текст, который хорошо читается. Правдоподобие — вот что оптимизировали, а не истинность. Поэтому выдуманная ссылка выходит такой же отполированной, как настоящая: без дрожи в голосе, без запинки, без оговорки «я не уверена». Сигнал, по которому мы обычно ловим чужую неуверенность, тут просто не вырабатывается, потому что неуверенности внутри и не было. Кстати, та же оптимизация на гладкость порождает и узнаваемый «ИИ-стиль» — по каким признакам его видно и как убрать, мы разбирали отдельно.
Это не теория. В мае 2026 года Арбитражный суд Западно-Сибирского округа оштрафовал компанию на 50 000 ₽ за кассационную жалобу, набитую несуществующей судебной практикой: часть дел не существовала, часть была совсем о другом, цитаты из высших судов оказались выдуманными. А 9 сентября 2026 года Верховный суд отдельно указал, что участники спора обязаны сами проверять данные, полученные от нейросети, — поводом стала ссылка представителя на пункт 15 постановления Пленума, в котором всего 14 пунктов.
Почему модель предпочитает угадать, а не сказать «не знаю»
Есть и вторая причина, куда более прозаичная. Модели годами проверяли тестами, где считается только доля правильных ответов. В такой системе честное «не знаю» гарантированно даёт 0 баллов, а наугад названная дата даёт маленький, но шанс попасть. Угадывать выгоднее — и модели выучили именно это.
Исследователи OpenAI показали разницу на цифрах в работе 2025 года. На наборе фактических вопросов старая модель отвечала почти всегда: правильных ответов 24%, но ошибочных — 75%, а признавалась в незнании лишь в 1% случаев. Более новая модель давала сопоставимую точность, 22%, но при этом воздерживалась от ответа в 52% случаев — и доля ошибок упала с 75% до 26%. Точность почти та же, а доверия к такой модели куда больше: она молчит там, где раньше сочиняла.
Так что «нейросеть врёт» — неточная формулировка. Врать — значит знать правду и говорить другое. Модель не знает правды и не знает, что не знает. Она заполняет пробел самым правдоподобным текстом, потому что другого режима у неё нет.
6 приёмов, которые реально помогают
Хорошая новость: если понять механику, ошибки становятся предсказуемыми — а значит, управляемыми. Вот что работает на практике (а если хочется разобраться с формулировками запросов подробнее — у нас есть пошаговое руководство по промптам).
1. Спрашивайте «где», а не «уверен ли ты»
«Ты уверен?» вызывает представление уверенности — модель просто допишет правдоподобные заверения. «Дай ссылку на источник и процитируй нужный абзац» либо даёт проверяемый факт, либо обнажает, что цитировать нечего.
2. Давайте текст, а не просите вспомнить
Прикреплённый документ, вставленный фрагмент, включённый поиск переводят задачу из «сочини» в «прочитай» — это самый сильный способ снизить долю выдумок. Готовые формулировки есть в промптах для работы с файлами.
3. Разрешите сказать «не знаю»
Добавьте в запрос: «если данных нет, так и напиши, не придумывай». Звучит наивно, но заметно повышает шанс честного ответа — вы снимаете установку «лучше угадать».
4. Перепроверяйте всё, что выглядит как реквизит
Номера дел, статьи законов, даты, цены, имена авторов, DOI и URL — зона самого высокого риска: это редкие факты, следа от которых в коэффициентах почти не остаётся.
5. Задайте вопрос двум моделям
Выдумки у разных моделей разные, а реальные факты совпадают. Если ChatGPT, Claude и DeepSeek дают один ответ — он, скорее всего, верный. Разошлись — идите к первоисточнику.
6. Начинайте сложное с чистого диалога
В длинном разговоре начало вытесняется, а ранние ошибки модель тащит дальше как факт. Новая задача — новый чат, и все нужные вводные разом.
5 мифов о нейросетях
| Миф | Как на самом деле |
|---|---|
| Она ищет ответ в интернете | Только если поиск явно включён. По умолчанию модель опирается на коэффициенты, собранные при обучении, и не знает, что произошло на этой неделе |
| Она учится на моих сообщениях прямо в диалоге | После обучения модель не меняется. В разговоре работает только контекстное окно, и с его концом всё исчезает |
| Внутри лежит база фактов | Внутри лежат числа. Факты восстанавливаются по следам, а не достаются из ячейки |
| Если ответ уверенный — значит, точный | Уверенность — свойство стиля, а не знания. Выдуманная цитата звучит ровно так же гладко, как настоящая |
| Она понимает смысл так же, как человек | Она улавливает статистические связи между кусочками текста. Результат часто неотличим от понимания, но механизм другой — и ломается он в других местах |
Проверьте сами, как это работает
В Нейрочате собраны все лучшие нейросети — ChatGPT, Claude, DeepSeek, Gemini, Grok — без VPN и сложных настроек. Задайте один вопрос двум моделям и сравните ответы.
▶ Попробовать бесплатноЧасто задаваемые вопросы
Она дописывает ваш текст по одному кусочку слова за раз. На каждом шаге модель оценивает, каким может быть следующий кусочек, выбирает один из вероятных вариантов, приписывает его к уже написанному и повторяет всё заново. Готовый ответ нигде не лежит — он собирается прямо во время печати, слева направо.
Потому что вспоминание и выдумывание — для неё одна и та же операция. Модель не хранит тексты, на которых училась: они растворены в миллиардах числовых коэффициентов. Когда нужного факта в этих коэффициентах нет, модель всё равно собирает правдоподобное продолжение — так появляются несуществующие исследования, номера дел и цитаты. Отличить их по стилю невозможно: выдуманная ссылка выглядит так же гладко, как настоящая.
На каждом шаге модель получает не один вариант продолжения, а список вариантов с вероятностями, и вытягивает из него случайный с учётом весов. Этой случайностью управляет параметр «температура»: чем он выше, тем охотнее модель берёт менее вероятные слова. Плюс на разных серверах порядок вычислений слегка отличается, поэтому даже при минимальной температуре ответы могут не совпадать дословно.
Сама модель после обучения не меняется — ваши сообщения не переписывают её коэффициенты. Всё, что она «помнит», — это текст, который поместился в контекстное окно текущего диалога, плюс отдельная функция памяти, если сервис её поддерживает: она просто подкладывает сохранённые заметки в начало разговора. Когда диалог становится слишком длинным, ранние сообщения вытесняются, и модель ведёт себя так, будто их не было.
Удобнее всего Нейрочат: ChatGPT, Claude, DeepSeek, Gemini и Grok открываются в одном окне, без VPN и зарубежной карты, интерфейс на русском, оплата российской картой. Один и тот же вопрос можно задать двум-трём моделям подряд и сравнить ответы — это самый простой способ поймать выдумку.