Локальные модели: llama.cpp, Ollama, vLLM, LM Studio, квантизация, требования к железу
Арифметика VRAM и пропускной способности памяти, честная экономика своего GPU против API, как устроена квантизация и что она ломает, четыре рантайма и их ниши, …
Локально и без аккаунта. Аккаунта нет, регистрация не нужна: введённое в инструменты остаётся в localStorage браузера и на сервер не уходит.
Свой счётчик считает открытия страниц и дочитывания: уезжает адрес и десятая доля текста. Без cookies и чужих счётчиков, IP не хранится, Do Not Track уважается. Как это проверить
Репозиторий портала не выложен, «открытым кодом» мы его не зовём. Открыто это:
Живёт портал на донатах, платных консультациях и разборах по запросу и покупке Workbench.
Планов делать курсы платными нет.
Выкладка от 16 сентября 2026, срез 95043e5
Что изменилось на портале с вашего прошлого захода. Полный список выкладок — в разделе «Что изменилось» на странице «О нас».
5 материалов в этой теме.
Арифметика VRAM и пропускной способности памяти, честная экономика своего GPU против API, как устроена квантизация и что она ломает, четыре рантайма и их ниши, …
Как превратить обученную модель в дешёвый и предсказуемый сервис: roofline-анализ узких мест, квантизация от математики до INT4, дистилляция, прунинг, компиляция графа, …
Инференс языковой модели — это умножение матриц, упирающееся не в арифметику, а в пропускную способность видеопамяти. Чем GPU отличается от CPU, сколько памяти требует …
Как из предсказания следующего токена вырастает LLM: токенизация, архитектура decoder-only, законы масштабирования, SFT и LoRA, выравнивание через RLHF и DPO, а также …
Языковая модель как распределение следующего токена при условии всего контекста: конвейер от текста до логитов, что на самом деле добавил механизм внимания, почему вход …
По этому запросу ничего не найдено.