Статья
Локальные модели: llama.cpp, Ollama, vLLM, LM Studio, квантизация, требования к железу
Арифметика VRAM и пропускной способности памяти, честная экономика своего GPU против API, как устроена квантизация и что она ломает, четыре рантайма и их ниши, …