Эмбеддинги и обучение представлений
Как сеть превращает объекты в векторы, на каких задачах учатся хорошие представления (word2vec, контрастное обучение, CLIP, self-supervised), как их измерять и как …
17 материалов в этой теме.
Как сеть превращает объекты в векторы, на каких задачах учатся хорошие представления (word2vec, контрастное обучение, CLIP, self-supervised), как их измерять и как …
Почему на изображениях полносвязная сеть безнадёжна, как устроена свёртка изнутри, что такое рецептивное поле, как эволюционировали архитектуры от LeNet до ConvNeXt и что …
Как сеть обрабатывает последовательности произвольной длины: развёртка во времени, BPTT, проблема исчезающих градиентов и почему вентильные архитектуры LSTM и GRU её …
От одного нейрона Розенблатта до алгоритма, который считает градиент по миллиардам параметров за один проход: линейная разделимость, зоопарк активаций, правило цепочки на …
Полный разбор того, что происходит между «есть архитектура» и «есть работающая модель»: ландшафт потерь, SGD и Adam, learning rate schedule, инициализация весов, …
Что такое нейронная сеть с первых принципов, чем она отличается от классического ML, почему работает глубина — и как устроен весь трек: от перцептрона до деплоя и …
Как превратить обученную модель в дешёвый и предсказуемый сервис: roofline-анализ узких мест, квантизация от математики до INT4, дистилляция, прунинг, компиляция графа, …
Почему модель приняла такое решение, что с ней будет при сдвиге данных и атаке, и как выстроить эшелонированную защиту в проде: атрибуция и механистическая …
Как обучать нейросети на данных без сетки и без порядка: перестановочная симметрия, передача сообщений, GCN/GraphSAGE/GAT/GIN, пределы выразительности, переглаживание и …
Как научить сеть порождать новые данные: вариационная нижняя граница и VAE, минимаксная игра GAN, диффузионные модели и их связь с оценкой score-функции — с выводами, …
Механизм внимания с первых принципов: от узкого места seq2seq до scaled dot-product, многоголовости, RoPE, полного блока трансформера, KV-кэша и продакшн-инференса.
Как из предсказания следующего токена вырастает LLM: токенизация, архитектура decoder-only, законы масштабирования, SFT и LoRA, выравнивание через RLHF и DPO, а также …
По этому запросу ничего не найдено.