ИИ в продакшене: латентность, кэширование, роутинг моделей, стоимость, наблюдаемость
Что меняется, когда LLM-прототип становится сервисом с SLO и счётом за инференс: из чего складывается латентность и как её резать, как считать и ловить деньги на …
Локально и без аккаунта. Аккаунта нет, регистрация не нужна: введённое в инструменты остаётся в localStorage браузера и на сервер не уходит.
Свой счётчик считает открытия страниц и дочитывания: уезжает адрес и десятая доля текста. Без cookies и чужих счётчиков, IP не хранится, Do Not Track уважается. Как это проверить
Репозиторий портала не выложен, «открытым кодом» мы его не зовём. Открыто это:
Живёт портал на донатах, платных консультациях и разборах по запросу и покупке Workbench.
Планов делать курсы платными нет.
Выкладка от 16 сентября 2026, срез 95043e5
Что изменилось на портале с вашего прошлого захода. Полный список выкладок — в разделе «Что изменилось» на странице «О нас».
87 материалов в этой теме.
Что меняется, когда LLM-прототип становится сервисом с SLO и счётом за инференс: из чего складывается латентность и как её резать, как считать и ловить деньги на …
Инференс языковой модели — это умножение матриц, упирающееся не в арифметику, а в пропускную способность видеопамяти. Чем GPU отличается от CPU, сколько памяти требует …
Как отвечать на запросы к произвольным отрезкам массива за O(log n), когда массив всё время меняется: биты дерева Фенвика, каноническое разбиение дерева отрезков, …
Как хранить граф в памяти: список рёбер, матрица и списки смежности, CSR; чем они различаются по времени, памяти и локальности, как извлекать базовые свойства графа и как …
Как классифицировать нагрузку по узкому месту, что означает и чего не означает каждая строка спецификации, почему чужие бенчмарки отвечают на чужой вопрос и как поставить …
Как устроена виртуальная машина под вашим кодом: планировщики и очереди выполнения, редукции и вытеснение, dirty-планировщики, поколенческий GC на процесс, аллокаторы и …
Что на самом деле стоит системный вызов, почему буферизация даёт больше, чем любая замена библиотеки, как устроены epoll и io_uring, где живут лишние копии данных и как …
Репозиторий растёт по трём независимым осям — глубина истории, ширина дерева, вес содержимого — и каждая ось лечится своим механизмом. Разбираем submodules и subtree как …
Как Rust делает гонки данных невыразимыми: потоки и scoped threads, каналы как передача владения, Send и Sync как два предложения, Arc и Mutex, атомики и порядки памяти — …
Как построить бенчмарк, которому можно верить: разогрев до стационарного режима, подавление шума, устойчивая статистика вместо «среднее ± сигма» и разбор классических …
Future как инертный автомат состояний, а не как поток: кто вызывает poll, зачем нужны Waker и Pin, как устроен рантайм tokio, восемь классических грабель — от блокировки …
Строгий разбор O-нотации, трёх методов амортизированного анализа и модели памяти — почему O(1) бывает в сто раз медленнее O(log n) и как считать стоимость структуры …
По этому запросу ничего не найдено.