Куда идёт Digit
Дат здесь нет намеренно. Всё, что ниже, делается по мере того, как предыдущий шаг оказывается измеримо готовым, а не к числу в календаре — и обещать сроки значило бы назвать цифру, которой неоткуда взяться.
Порядок шагов, наоборот, не произволен: каждый следующий опирается на измерение предыдущего. Где шаг сделан, стоит число. Где не сделан — сказано, чего не хватает.
Шаг 1. Ответ с разрешимым происхождением
Состояние: стоит и измерено.
Содержание ответа не порождается моделью. Оно приходит из одного из трёх источников: детерминированной утилиты, дословной цитаты с якорем на файл или сертификата над проверенными морфизмами. Модель выбирает источник, но не пишет содержание.
Это первый шаг, потому что всё остальное имеет смысл только над ним. Быстрый агент, который убедительно сочиняет, — не заготовка для хорошего агента, а другой продукт.
| голая модель | здесь | |
|---|---|---|
| выдуманные факты | 100 % | 0,0 % |
| ложные ответы | 40 % | 3,0 % |
Остаточная ошибка названа и не спрятана: верная цитата не на тот вопрос — система находит настоящий фрагмент, приводит дословно, а отвечает он не на то, о чём спрашивали.
Шаг 2. Своя модель вместо чужого облака
Состояние: стоит, работает без сети.
Маршрутизатор обучен под этот агент и опубликован открыто вместе с обучающими данными и проигравшими вариантами. Ставится одной командой: Digit сам скачивает сервер и веса, ничего доустанавливать не нужно.
Замер, который стоит знать: основную работу сделали данные, а не размер модели. Тот же датасет на втрое меньшей базе даёт осознанный отказ 90,7 % против 91,3 %. Русскоязычные базы проиграли обычным.
Шаг 3. Русский без нейросети
Состояние: стоит, включается там, где полезно.
Разбор запроса правилами — морфология и лексикон поверх каталога утилит. Быстрее модели в семьсот раз и точнее её же на маршрутизации.
| правила | модель | |
|---|---|---|
| выбор инструмента | 96,0 % | 85,0 % |
| точность аргументов | 100,0 % | 90,1 % |
| задержка | 1 мс | ~1 с |
Какой это замер: у правил — прогон rules-only по всему набору задач, у
модели — опорный прогон маршрутизатора 1.7B в bf16 по основной его части.
Обе пары чисел стоят рядом в одном месте — в описании каскада
(digit_cli/ruleparse/cascade.py), — и оттуда сюда и приведены.
До 2026-08-08 в правой колонке стояли 87 % и 93 %. Это не выдумка и не опечатка: это другой замер — строка квантованного варианта той же модели из таблицы деградации в её карточке, лучшая строка таблицы. Карточка сама пишет про этот отрыв, что на 250 задачах он равен пяти задачам и читать его надо как шум, а не как «квантование улучшило модель». Сравнивать лучший квант с правилами и называть это сравнением с моделью — значит выбрать себе удобную строку. Выбрана опорная.
И честная граница, из-за которой правила не заменяют модель, а становятся первым каскадом: на генерации, композиции шагов и ответах по корпусу они дают ноль. Плюс измеренное свойство связки: ошибки каскада складываются, а не заменяются, поэтому позади сильной модели правила включать нельзя — они портят главную метрику. Позади локальной — улучшают.
Шаг 4. Проверка суждений
Состояние: стоит, доступно командой.
Человек пишет правило словами — система строит из него спецификацию, гоняет через компилятор и детектор логических ошибок и отвечает тем, что проверено. Ответ различает три исхода, а не два: проверено и верно, проверено и неверно с указанием упавшей проверки, и честное «не удалось формализовать».
На 1 161 замере — ноль тихих ошибок: ни одного случая, когда правило построилось, компилятор его принял, а означает оно не то, что написано словами. Детектор ловит 1 698 подделок из 1 698 при нуле ложных отказов.
Ограничение, которое печатается в каждом ответе, включая зелёный: проверено построение правила, а не истинность посылки. «На экспорт начислять НДС 20 %» получит такой же зелёный — у системы нет модели мира.
Шаг 5. Модель, которая пишет спецификации
Состояние: обучена и опубликована, встраивание впереди.
Обученная модель на 1,7 млрд параметров пишет корректные спецификации без справочника в запросе — и обыгрывает модель в восемь раз крупнее, которой справочник дали.
| проходят компилятор | |
|---|---|
| та же модель без обучения | 0 из 150 |
| модель в 8 раз больше, со справочником | 79 из 150 |
| обученная, без справочника | 150 из 150 |
Известная слабость названа в карточке: 127 документов из 1 491 прошли компилятор, но остались без теоремы. Причина измерена и лежит в данных — ни один обучающий документ не содержал утилиту и теорему одновременно. Модель честно унаследовала пробел.
Шаг 6. Память, которая растёт
Состояние: стоит.
Раньше вся память ехала в системный промпт каждого запроса, поэтому её потолок был 2 200 символов — карточка-шпаргалка, а не архив. Теперь заметки живут отдельно, а в запрос попадает только относящееся к делу.
| было | стало | |
|---|---|---|
| вмещается заметок | 22 | 1 229 |
| вес запроса при 800 заметках | 33 719 токенов | 1 344 |
| поиск | — | 0,1 мс, офлайн |
Заметки связываются вики-ссылками в обе стороны и раскладываются по секторам, так что это уже сеть, а не список.
Шаг 7. Цифровой портрет
Состояние: строится.
Накопление того, как владелец формулирует и что решал. Внутри — жёсткая граница, и она важнее самой возможности:
- как вы формулируете — измеримо и воспроизводимо;
- что вы решали — факт с источником, такой ответ можно показать людям;
- что вы ответили бы — догадка, помеченная как догадка, и только вам.
Третий слой не станет ответом от вашего имени наружу. Причина не в осторожности, а в устройстве: весь Digit держится на том, что содержание не сочиняется, а двойник по определению сочиняет.
Чего здесь не будет: психологических типологий. У них нет доказанной предсказательной силы, и система, построенная на них, убедительно врала бы — ровно то, против чего написано всё остальное.
Что остаётся нерешённым
Это не «когда-нибудь потом», а честный список того, что мешает прямо сейчас.
Композиция шагов. Задачи в несколько действий даются и правилам, и модели одинаково плохо. Ни у одной стороны нет измеренного решения.
Истинность посылок. Формальная система проверяет вывод из посылок, а не сами посылки. Спецификация, безупречная по форме и ложная по существу, пройдёт все проверки зелёной. Это граница метода, а не недоделка.
Живые формулировки. Все замеры разбора сделаны на машинных наборах фраз. «Ноль тихих ошибок» — утверждение про два словаря, а не про то, как пишут люди. Первое, что нужно после встраивания, — собрать настоящие запросы и перемерить.
Наследие форка. Digit вырос из Hermes Agent, и часть его команд и навыков — оттуда. Разделение идёт: то, что видит человек, уже наше, но работа не закончена.
Что из перечисленного уже проверено и какими числами — на странице измерений. Где проходят границы гарантии — на странице ограничений.