Могут ли нейросети думать
Фрагмент лекции: «Все что нужно знать про ИИ айтишнику», 34:20 — отсюда взято содержание этой главы.
Это самый частый вопрос лекции и единственный, на который у автора есть готовый резкий ответ: нет, не думают, это алгоритмы. Позиция понятная, и в практической своей части она верна. Но выдать её за решённый научный вопрос было бы нечестно: спор о том, что именно происходит внутри больших моделей, ведётся всерьёз, с обеих сторон в нём стоят рецензируемые работы, и он не закрыт.
Поэтому глава устроена в три слоя. Сначала — проверяемое: что модель делает механически, шаг за шагом, и в каком месте этого конвейера мог бы поместиться смысл. Потом — спор: обе позиции с настоящими источниками. И только потом — мнения, помеченные как мнения, включая мнение автора лекции.
Что модель делает механически
К этому месту трека у вас уже есть все детали. Соберём их в одну цепочку.
- Текст превращается в числа. Символы становятся токенами, токены — векторами. Модель не видит слова «кот»: она видит номер в словаре и связанный с ним вектор из нескольких тысяч чисел. Подробно — в главе «Представления».
- Числа проходят через веса. Прямой проход — это последовательность матричных умножений и нелинейностей с фиксированными коэффициентами, полученными на обучении. Никаких ветвлений «если факт сомнителен — уточнить» там нет: это одна и та же арифметика на любом входе. Механизм — в главе «Большие языковые модели».
- На выходе — распределение вероятностей следующего токена. Не ответ, не мысль, не утверждение — вектор длиной в размер словаря, где каждому токену сопоставлено число. Условие этого распределения — весь префикс: системный промпт, история диалога, ваш вопрос.
- Один токен выбирается из распределения. Здесь и только здесь появляется случайность.
- Выбранный токен дописывается к префиксу, и всё повторяется. Пока не выпадет токен конца ответа или не кончится лимит.
- Считает это ускоритель. Тысячи параллельных умножений матриц — почему для этого нужны видеокарты.
матрицы и нелинейности"] D --> E["Распределение
следующего токена"] E --> F["Выбор одного токена"] F --> G{"Конец ответа?"} G -->|нет| C G -->|да| H["Текст ответа"] D -.-> X1["Здесь нет цели"] E -.-> X2["Здесь нет убеждения"] F -.-> X3["Здесь нет проверки истинности"] style X1 fill:#7f1d1d,color:#fff style X2 fill:#7f1d1d,color:#fff style X3 fill:#7f1d1d,color:#fff
Пунктирные ветки — не украшение, а суть главы. Пройдите по конвейеру и попробуйте показать пальцем на шаг, где модель хотела бы что-то, считала бы что-то истинным или проверяла бы утверждение перед выдачей. Такого шага в списке нет — и это не упрощение ради лекции, а полное описание того, что происходит при генерации.
| Чего нет | Что вместо этого | Почему это важно на практике |
|---|---|---|
| Цели, намерения | Функция от префикса к распределению | Модель ничего не «хочет» получить от диалога |
| Убеждения, картины мира как отдельного объекта | Веса, одинаковые для любого запроса | Нельзя «переубедить» модель — можно изменить префикс |
| Шага проверки истинности | Ранжирование по правдоподобию продолжения | Ложное и истинное конкурируют на равных основаниях |
| Памяти между вызовами | Пересылка всей истории заново | См. главу «Токены и контекст» |
Отсюда же лекционная формула: LLM — это «T9 с накопителем». Аналогия рабочая ровно наполовину, и обе половины полезны. Верно: задача та же, что у T9, — предсказать продолжение, а «накопитель» отражает то, что модель впитала объём текста, несопоставимый с телефонным словарём. Неверно: T9 хранит таблицу частот, а языковая модель никакой таблицы не хранит — она хранит обученную функцию, которая вычисляет распределение для контекста, никогда не встречавшегося в данных. По той же причине формулировка «нейросети — это те же цепи Маркова» неточна, и в главах 02 и 06 она уже поправлена: корректно говорить, что языковая модель задаёт распределение следующего токена при условии всего префикса, а не таблицу переходов по последним n словам.
Почему модель уверенно выдумывает
Это самый практически важный вывод главы, и он выводится прямо из конвейера выше.
Модель училась на одной задаче: по префиксу предсказать следующий токен так, чтобы он походил на то, что стояло в обучающем тексте. У этой задачи нет ни варианта ответа «не знаю», ни штрафа за уверенность. В обучающих текстах люди редко пишут «я не уверен» — они пишут связно и утвердительно. Значит, связное и утвердительное продолжение получает высокую вероятность независимо от того, соответствует ли оно действительности.
Для модели «правдоподобно» и «верно» — не разные вещи. Это не сбой реализации и не недоработка, которую починят следующим релизом: это прямое следствие постановки задачи обучения. Когда вы спрашиваете про несуществующую функцию библиотеки, модель не «врёт» — она честно выдаёт самое правдоподобное продолжение, а правдоподобное продолжение вопроса про функцию — это красивая сигнатура функции.
Свежая аргументация в ту же сторону — работа Why Language Models Hallucinate (Kalai et al., 2025): и претрейн, и способ оценки моделей на бенчмарках систематически поощряют угадывание вместо воздержания, потому что за пустой ответ ставится ноль, а за угаданный — иногда балл. Обзор явления целиком — Survey of Hallucination in Natural Language Generation (Ji et al., 2022).
Второе следствие того же механизма: уверенность в тексте ответа не связана с вероятностью правоты. Формулировка «безусловно, это так» — это тоже просто токены с высокой вероятностью. Просить модель «оценить свою уверенность от 0 до 100» бесполезно по той же причине, по которой бесполезно просить её не выдумывать: число будет правдоподобным, а не откалиброванным. Нюанс: работа Language Models (Mostly) Know What They Know (Kadavath et al., 2022) показывает, что внутренние вероятности модели коррелируют с корректностью лучше, чем её словесные самооценки, — но это сигнал в логитах, а не сознательное «я не знаю».
Как убедиться в этом самому
Простейшая проверка занимает минуту: задайте один и тот же вопрос несколько раз и посмотрите на разброс.
import collections
QUESTION = "В каком году вышла первая версия библиотеки libfoobarbaz?"
def ask(client, prompt: str) -> str:
"""Один вызов модели. Ответ — сэмпл из распределения, а не значение функции."""
resp = client.messages.create(
model="claude-opus-4-8",
max_tokens=64,
messages=[{"role": "user", "content": prompt}],
)
return resp.content[0].text.strip()
def spread(client, prompt: str, n: int = 8) -> dict[str, int]:
"""Прогоняем один и тот же запрос n раз и считаем, насколько ответы сходятся.
Разброс — дешёвый внешний сигнал недостоверности: если модель знает факт,
восемь прогонов дают восемь одинаковых ответов."""
return collections.Counter(ask(client, prompt) for _ in range(n))
# Про существующую библиотеку разброса почти не будет.
# Про выдуманную вы получите несколько разных лет, каждый — с уверенной формулировкой.
Это же наблюдение — основа техники self-consistency и вообще внешней валидации: у модели нет внутреннего детектора истины, но у вас есть согласованность нескольких прогонов, совпадение с найденным источником и результат выполнения сгенерированного артефакта. Инженерная сторона вопроса разобрана в треке по ИИ-инженерии; здесь важно только, откуда берётся сама проблема.
Спор о понимании: обе стороны
Теперь честная часть. Из того, что в конвейере нет отдельного шага «подумать», строго не следует, что понимания нет: у человеческого мозга тоже нет нейрона с табличкой «здесь мысль». Спор идёт именно об этом, и он не решён.
Позиция «понимания нет, это статистика формы»
Китайская комната. Джон Сёрл, Minds, Brains, and Programs (1980). Мысленный эксперимент: человек заперт в комнате с книгой правил и получает записки с китайскими иероглифами. Он не знает китайского, но по правилам подбирает иероглифы для ответа, и снаружи выглядит как носитель языка. Вывод Сёрла: манипуляция символами по правилам даёт синтаксис, но не даёт семантики, а значит, ни одна программа сама по себе не понимает.
Что важно не переврать: это аргумент против конкретного тезиса «правильная программа = разум», а не доказательство теоремы. Возражения ему ровесники самого эксперимента — главное из них, «системный ответ»: понимания нет у человека внутри комнаты, но вопрос был про систему целиком.
Из формы не выучивается значение. Bender и Koller, Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data (ACL 2020). Аргумент строже: модель, обученная только на форме языка, не имеет доступа к референции — к связи между словом и тем, о чём слово. Соответственно, приписывать ей понимание значения не на чем.
Стохастические попугаи. Bender, Gebru, McMillan-Major, Shmitchell, On the Dangers of Stochastic Parrots (FAccT 2021). Работу часто цитируют неточно, поэтому по пунктам: авторы утверждают, что языковая модель сшивает последовательности из обучающих данных по статистике, не имея референции к значению и коммуникативного намерения; и что главный риск здесь социальный — люди принимают беглый текст за осмысленное высказывание. Основной объём статьи посвящён вполне земным вещам: цене обучения, непрозрачности датасетов, воспроизводству предвзятостей. Это не «модели бесполезны», а «не приписывайте им то, чего в них нет».
Позиция «что-то содержательное всё же возникает»
Внезапно возникающие способности. Wei et al., Emergent Abilities of Large Language Models (2022). Наблюдение: на ряде задач качество моделей меньшего масштаба неотличимо от случайного, а после некоторого порога резко вырастает. Из этого делался вывод, что при росте масштаба появляются качественно новые способности, которых не было и которые не предсказывались.
Критика этой работы. Schaeffer, Miranda, Koyejo, Are Emergent Abilities of Large Language Models a Mirage? (NeurIPS 2023). Показано, что скачки во многом порождаются выбором метрики: если мерять задачу «всё или ничего» — строгим совпадением строк или точностью многозначного ответа, — плавное улучшение выглядит как резкий порог. При переходе на непрерывные метрики на тех же прогонах кривая становится гладкой. Это не отменяет роста качества, но подрывает интерпретацию «возникло нечто новое».
Интерпретируемость. Самый интересный аргумент, потому что он не философский, а измеримый. Внутри моделей находят структуры, которых их прямо не учили строить:
- Emergent World Representations (Li et al., ICLR 2023): модель, обученная только предсказывать следующий ход в записях партий в отелло, содержит внутри восстановимое состояние доски — и если это внутреннее состояние отредактировать, меняются предсказания ходов. То есть представление не декоративно, а причинно участвует в вычислении.
- Language Models Represent Space and Time (Gurnee & Tegmark, 2023): в активациях линейно восстанавливаются координаты городов и даты событий.
- Scaling Monosemanticity (Anthropic, 2024): разреженные автокодировщики выделяют интерпретируемые признаки, воздействие на которые предсказуемо меняет поведение модели.
Аккуратная формулировка того, что отсюда следует: у модели есть внутренние представления предметной области, а не только статистика поверхностной формы. Это заметно сильнее, чем «попугай», и заметно слабее, чем «понимает». Систематически эта область разобрана в статье «Интерпретируемость и безопасность».
Тест Тьюринга и почему он оказался плохим критерием
Алан Тьюринг в Computing Machinery and Intelligence (1950) предложил заменить неопределённый вопрос «может ли машина мыслить» операциональным: сможет ли собеседник в переписке отличить машину от человека. Ход был методологически честный — вместо спора об определениях предлагался эксперимент.
Проблема в том, что тест проверяет неотличимость поведения, а не наличие понимания, и разошёлся с задачей в обе стороны:
- Ложные срабатывания. ELIZA Джозефа Вейценбаума (1966) работала на нескольких десятках подстановочных правил и вызывала у людей стойкое ощущение, что её понимают, — эффект настолько устойчивый, что получил собственное имя. В 2014 году шумиха вокруг «первой программы, прошедшей тест Тьюринга» касалась бота, который изображал тринадцатилетнего подростка, плохо говорящего по-английски: любая несуразность списывалась на возраст и язык. Тест меряет не интеллект машины, а склонность человека его достраивать.
- Ложные отказы. Систему легко разоблачить по признакам, не имеющим отношения к мышлению: скорость ответа, безупречная орфография, отказ обсуждать запрещённые темы. Современная модель проваливает тест не потому, что глупа, а потому, что не притворяется.
Практический вывод: «неотличимо от человека в чате» — это утверждение о качестве имитации, а не о наличии понимания. Использовать это как аргумент в любую сторону нельзя.
Где заканчивается факт и начинается позиция
Теперь разложим то, что звучит в лекции, на два столбца. Это важнее любого из предыдущих разделов: смешивание проверяемого и мировоззренческого — главный способ испортить хороший тезис.
| Утверждение из лекции | Статус |
|---|---|
| Ответ модели получается счётом над числами, без шага проверки истинности | Проверяемо, верно |
| Модель уверенно выдаёт неверное, потому что училась правдоподобию | Проверяемо, верно |
| У модели нет собственных целей и инициативы вне предоставленных инструментов | Проверяемо, верно для развёрнутых сегодня систем |
| «Интеллекта там нет и не будет» | Мнение. Прогноз, а не установленный факт |
| «Они никогда не будут понимать вашу речь» | Мнение. Зависит от определения «понимать», которое и является предметом спора |
| «Паника вокруг ИИ выгодна рынку» | Мнение. Правдоподобное, но это интерпретация мотивов, а не измерение |
Чтобы не осталось недосказанности: позиция автора лекции — это позиция, а не итог науки. «Никогда» — сильное слово, требующее либо доказательства невозможности, либо определения понимания, с которым согласны обе стороны; ни того, ни другого сегодня нет.
При этом по делу автор прав, и это стоит зафиксировать отдельно. Практический вывод «не используйте модель как источник истины» верен независимо от исхода философского спора. Даже если завтра выяснится, что внутри моделей есть богатая модель мира, механизм генерации от этого не изменится: распределение по правдоподобию, сэмплирование, никакой встроенной проверки. Инженерные меры остаются теми же в обоих сценариях.
Что делать практически
Одно правило заменяет длинный список советов:
Модель хороша там, где результат проверить дешевле, чем произвести.
Оно сразу сортирует задачи. SQL-запрос выполняется на тестовой базе. Патч прогоняется тестами. Извлечённые из документа поля сверяются со схемой и суммой. А юридическое заключение или медицинская рекомендация выглядят убедительно ровно настолько же — и проверяются на порядок дороже.
Отсюда три меры, каждая из которых бьёт ровно в механизм из первого раздела:
- Заземление на источники. Раз в весах нет ваших документов, их нужно положить в контекст и потребовать цитат, а цитаты — проверить программно на дословное вхождение в исходный текст. Без проверки цитат вы получаете правдоподобную выдумку со ссылками. Как это устроено в проде — RAG; что это даёт в вводном изложении — глава «RAG, MCP и агенты».
- Автоматическая валидация. Схема ответа, компиляция, тесты, инварианты предметной области. Провал валидации — это ветка исполнения с повтором и фолбэком, а не строка в логе.
- Человек в контуре для необратимых решений. Не для всех — это дорого и не масштабируется, — а ровно там, где откат невозможен: деньги, удаление, публикация, юридические последствия.
Измерять всё это нужно на своих данных, а не на публичных бенчмарках: как собрать eval-датасет из полусотни реальных запросов — в статье «Оценка и бенчмарки». Сужение множества правдоподобных продолжений формулировкой запроса — тема следующей главы.
Страх замены и «восстание машин»
Эту часть лекции автор проговаривает эмоционально, поэтому изложим спокойно и по частям.
Что проверяемо. У развёрнутых сегодня систем нет собственных целей, нет инициативы и нет доступа к миру за пределами предоставленных инструментов. Модель не запускается сама: она отвечает на запрос и останавливается. Всё, что она может сделать во внешнем мире, ограничено списком инструментов, которые ей выдал разработчик, и правами, с которыми эти инструменты работают. Агент, у которого нет доступа к платёжному API, не потратит ваши деньги ни при каком промпте.
Из этого, впрочем, следует не «бояться нечего», а «бояться нужно другого». Реальная поверхность атаки — не пробуждение воли, а инъекция инструкций: любой текст, попавший в контекст, — письмо, страница, содержимое файла — модель обрабатывает одинаково, и она не отличает данные от команд. Если у агента широкие права на инструменты, вредный текст превращается в удалённое выполнение действий. Это инженерная проблема с инженерными решениями — разделением каналов доверия, ограничением прав, подтверждением необратимых операций, — и разбирается она в статье «Безопасность и инъекции».
Что является мнением. Тезис «паника вокруг ИИ выгодна рынку» — это интерпретация мотивов, и как мнение она вполне защитима: и восторг, и ужас одинаково хорошо продают. Но мнение не становится фактом от того, что звучит трезво.
Что существует отдельно. Содержательная дискуссия о рисках ИИ ведётся всерьёз — про надёжность автономных систем, про концентрацию возможностей, про то, как ставить и проверять цели у систем, которые действуют. Иронизировать над ней нет причин. Важно другое: эта дискуссия почти не пересекается с вопросом «думает ли модель». Автономная система может нанести вред, не имея ни капли понимания, — ровно так же, как это делает неправильно настроенный скрипт с правами root, только быстрее и на большем масштабе. Смешивать вопрос о сознании с вопросом о безопасности — ошибка в обе стороны.
Про то, что происходит с профессией разработчика на практике, — в главе «SDD, оркестрация и разговоры о замене специалистов».
Круг замкнулся
Трек начался с вопроса, который казался не имеющим отношения к ИИ: почему компьютер не умеет в случайность. Машина детерминирована, генераторы называются генераторами псевдослучайных чисел, и настоящей случайности взять неоткуда.
Здесь этот круг замыкается. Вероятность в ответе языковой модели появилась не потому, что машина стала недетерминированной, и не потому, что она начала сомневаться. Она появилась потому, что мы сами построили стохастическую модель: задачу, ответом на которую является не значение, а распределение. Прямой проход по-прежнему детерминирован — на одном и том же входе с одним и тем же состоянием он даёт побитово тот же вектор вероятностей. Недетерминированным ответ делает ровно один шаг: выбор токена из распределения.
Ровно поэтому один и тот же вопрос даёт разные ответы, и ровно поэтому это не признак размышления. Вероятность в ответе пришла из модели, а не из понимания.
Единственная культурная отсылка, которую стоит взять из лекции: у Дугласа Адамса суперкомпьютер семь с половиной миллионов лет считает ответ на главный вопрос жизни, вселенной и всего такого и выдаёт «42» — потому что никто не удосужился сформулировать вопрос. Мораль ровно та же, что у этой главы: качество ответа определяется постановкой задачи, а не размером машины.
Источники
- Turing, Computing Machinery and Intelligence (Mind, 1950) — игра в имитацию
- Searle, Minds, Brains, and Programs (1980) — китайская комната
- Bender & Koller, Climbing towards NLU (ACL 2020) — форма и значение
- Bender, Gebru, McMillan-Major, Shmitchell, On the Dangers of Stochastic Parrots (FAccT 2021)
- Wei et al., Emergent Abilities of Large Language Models (2022)
- Schaeffer, Miranda, Koyejo, Are Emergent Abilities a Mirage? (NeurIPS 2023) — критика предыдущей работы
- Li et al., Emergent World Representations (ICLR 2023) — восстановимое состояние доски внутри модели
- Gurnee & Tegmark, Language Models Represent Space and Time (2023)
- Anthropic, Scaling Monosemanticity (2024) — интерпретируемые признаки
- Kadavath et al., Language Models (Mostly) Know What They Know (2022) — калибровка
- Kalai et al., Why Language Models Hallucinate (2025) — выдумка как следствие цели обучения и способа оценки
- Ji et al., Survey of Hallucination in Natural Language Generation (2022)
Мини-итог
- Конвейер генерации полностью описывается пятью шагами — токены, векторы, прямой проход, распределение, выбор токена, — и ни на одном из них нет цели, убеждения или проверки истинности.
- Уверенная выдумка — не сбой, а следствие цели обучения: модель училась продолжать текст правдоподобно, а не воздерживаться; «правдоподобно» и «верно» для неё не разные вещи.
- Уверенность в формулировке ответа не связана с вероятностью его правоты; полезны только внешние сигналы — согласованность прогонов, совпадение с источником, успешное выполнение артефакта.
- Спор не решён: китайская комната и «стохастические попугаи» против внезапно возникающих способностей и интерпретируемости, причём у второй стороны есть и своя внутренняя критика (Schaeffer et al.).
- Аккуратная формулировка того, что показала интерпретируемость: у моделей есть внутренние представления предметной области — это сильнее «попугая» и слабее «понимания».
- Тест Тьюринга проверяет неотличимость поведения, а не понимание, и ошибается в обе стороны — ELIZA его почти проходила, современная модель его проваливает, потому что не притворяется.
- «Интеллекта там нет и не будет» — позиция автора лекции, а не установленный факт; при этом практический вывод «не используйте модель как источник истины» верен при любом исходе спора.
- Работающее правило: модель хороша там, где результат проверить дешевле, чем произвести; отсюда заземление на источники, автоматическая валидация и человек в контуре для необратимых решений.
- У моделей нет собственных целей и доступа к миру вне выданных инструментов; реальные риски связаны с правами инструментов и инъекциями, а не с пробуждением воли, и обсуждаются отдельно от вопроса о мышлении.
Что дальше
Если модель не понимает вопрос, а подбирает правдоподобное продолжение, то управлять ею можно ровно одним способом: менять префикс так, чтобы множество правдоподобных продолжений сузилось до нужного. Это и есть промптинг — не заклинание, а инженерная работа с контекстом. Начнём с шаблона, который одинаково хорошо работает и с моделью, и с живым исполнителем.