Статья
Внимание и трансформеры
Механизм внимания с первых принципов: от узкого места seq2seq до scaled dot-product, многоголовости, RoPE, полного блока трансформера, KV-кэша и продакшн-инференса.
2 материалов в этой теме.
Механизм внимания с первых принципов: от узкого места seq2seq до scaled dot-product, многоголовости, RoPE, полного блока трансформера, KV-кэша и продакшн-инференса.
Как из предсказания следующего токена вырастает LLM: токенизация, архитектура decoder-only, законы масштабирования, SFT и LoRA, выравнивание через RLHF и DPO, а также …
По этому запросу ничего не найдено.