Обучение на практике: отрицательные результаты одного проекта
Разбор одного реального проекта: почему отказу приходится учить отдельным классом данных, почему датасет оказался важнее размера базовой модели, почему русскоязычный …
Локально и без аккаунта. Аккаунта нет, регистрация не нужна: введённое в инструменты остаётся в localStorage браузера и на сервер не уходит.
Свой счётчик считает открытия страниц и дочитывания: уезжает адрес и десятая доля текста. Без cookies и чужих счётчиков, IP не хранится, Do Not Track уважается. Как это проверить
Репозиторий портала не выложен, «открытым кодом» мы его не зовём. Открыто это:
Живёт портал на донатах, платных консультациях и разборах по запросу и покупке Workbench.
Планов делать курсы платными нет.
Выкладка от 16 сентября 2026, срез 95043e5
Что изменилось на портале с вашего прошлого захода. Полный список выкладок — в разделе «Что изменилось» на странице «О нас».
18 материалов в этой теме.
Разбор одного реального проекта: почему отказу приходится учить отдельным классом данных, почему датасет оказался важнее размера базовой модели, почему русскоязычный …
Как устроены колоночные форматы и хранилища данных: Parquet изнутри, кодирование и сжатие, pruning, ClickHouse и DuckDB, табличные форматы Iceberg и Delta, компакция и …
Как менять SQL-модели и пайплайны без страха: пирамида тестов для трансформаций, unit-тесты на фикстурах, среды поверх хранилища, сборка только изменённого, сравнение …
Из чего складывается счёт за хранилище данных: модели биллинга, чтение плана распределённого запроса, семь рычагов оптимизации, лестница материализации, конкуренция и …
Как превратить события в решения: модель данных и tracking plan, качество данных, диагностика падения метрик и парадокс Симпсона, лестница причинной достоверности (A/B, …
Парадигма, в которой центр программы — не объект, а данные: отделение кода от данных и схемы от представления, раскладка «массив структур против структуры массивов», ECS …
Как устроен непрерывный поток данных: лог Kafka, время события и водяные знаки, окна, состояние и чекпоинты Flink, а также честный разбор того, что на самом деле означает …
Как устроена пакетная обработка больших данных: модель MapReduce, движок Spark, shuffle, партиционирование, перекос и инкрементальные пересчёты.
Как из отдельных джоб собрать управляемый пайплайн: DAG и планировщики, Airflow и dbt, идемпотентность записи, backfill, SLA и типичные грабли продакшена.
Как превратить сырые таблицы в структуру, которая переживёт пять лет изменений бизнеса: нормальные формы, размерное моделирование Кимбалла, SCD, Data Vault и выбор между …
Как устроен слой приёма данных из внешних систем: анатомия коннектора, пагинация и лимиты API, состояние и чекпоинты, файловые дропы и вебхуки, реакция на дрейф схемы, …
Как измерять качество данных, останавливать плохие загрузки до публикации, договариваться с поставщиками через контракты, строить колоночный линидж и выстраивать …
По этому запросу ничего не найдено.