Продвинутый RAG: graph RAG, агентный поиск, контекстное сжатие, кэширование
Что делать, когда обычный RAG перестал вытягивать: обогащение чанков контекстом, графовое индексирование, агентные циклы поиска, каскад сжатия контекста и три уровня кэша …
21 материалов в этой теме.
Что делать, когда обычный RAG перестал вытягивать: обогащение чанков контекстом, графовое индексирование, агентные циклы поиска, каскад сжатия контекста и три уровня кэша …
Как заставить модель тратить больше вычислений на трудную задачу: рассуждение цепочкой, голосование по выборкам, поиск по дереву мыслей и самопроверка — с кодом, …
Как перестать выбирать модель по маркетинговым графикам: что на самом деле измеряют публичные бенчмарки и где они врут, как собрать собственный датасет из 50 примеров, …
Как устроен промпт с точки зрения инженера: почему работают инструкции и примеры, где они ломаются, как задать формат ответа и как всё это измерить и оценить по …
Когда несколько агентов действительно лучше одного, а когда это дорогой способ размножить ошибки: топологии оркестрации, роли и критики, протокол передачи контекста, …
Арифметика VRAM и пропускной способности памяти, честная экономика своего GPU против API, как устроена квантизация и что она ломает, четыре рантайма и их ниши, …
Инженерная модель LLM: что такое токен и почему он ломает арифметику, как устроены prefill и decode, сколько стоит контекст, что делает температура и почему её убрали из …
Обзорная карта прикладного трека по LLM: чем ИИ-инженерия отличается от ML, что модели реально умеют и где ломаются, лестница от промпта до мультиагента, экономика и …
Что меняется, когда LLM-прототип становится сервисом с SLO и счётом за инференс: из чего складывается латентность и как её резать, как считать и ловить деньги на …
Как устроено дообучение LLM изнутри: арифметика памяти, низкоранговые адаптеры, 4-битная квантизация, сборка датасета, рабочие конфиги, оценка деградации и честная …
Как из предсказания следующего токена вырастает LLM: токенизация, архитектура decoder-only, законы масштабирования, SFT и LoRA, выравнивание через RLHF и DPO, а также …
Как из одного вызова модели получается агент: цикл ReAct, проектирование инструментов, стратегии планирования, четыре уровня памяти, экономика длинных траекторий и …
По этому запросу ничего не найдено.