docs: расширены материалы Lakehouse, убрана заглушка в карьерном блоке

- Зачем:
  - менти спрашивают, что такое Lakehouse и чем он отличается от
    классического DWH — во введении секции не было ответа и ссылки;
  - материалы по Iceberg лежали в «Дополнительных материалах», где их
    не найти по пути через секцию Lakehouse;
  - заглушка «в подготовке» выглядела незавершённостью раздела
- Что:
  - во введение секции добавлено объяснение отличия Lakehouse от
    классического DWH (открытые форматы, объектное хранилище,
    независимое масштабирование движков);
  - добавлено введение: статья Arenadata «Как не утонуть в данных:
    выбираем между DWH, Data Lake и Lakehouse» (Habr);
  - добавлен блок «Глубже про Iceberg»: видео Владимира Озерова
    «Как на самом деле работает Apache Iceberg» и статья VK Tech
    «Введение в устройство Parquet и Iceberg» (с пометкой о сложности);
  - из «Дополнительных материалов» в этот блок перенесены статья
    ivan-shamaev про Iceberg и видео «Spark + Iceberg in 1 Hour»;
  - удалена строка «Видео по прохождению собеседований из сообщества
    ОМ — в подготовке»
- Проверка:
  - mkdocs build --strict (без ошибок);
  - все три новые ссылки отвечают 200 (проверены с обходом прокси)

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
2026-07-12 19:35:41 +03:00
co-authored by Claude Fable 5
parent 70d6da761f
commit efa4dd9a3e
+9 -5
View File
@@ -366,7 +366,6 @@ Apache Airflow — инструмент для оркестрации ETL-про
#### Поиск работы и собеседования
- [Как подтвердить опыт без трудовой / Хабр против работяг](https://www.youtube.com/watch?v=GHqABzA1zi8)
- Видео по прохождению собеседований из сообщества ОМ — *в подготовке*
- Практика: мок-собеседования с ментором — тренировка ответов, разбор слабых мест, психологическая подготовка к реальным интервью.
#### Помощь с прохождением испытательного срока
@@ -427,10 +426,11 @@ NiFi — визуальный конструктор потоков данных
### Lakehouse (Spark, Iceberg, Trino)
Lakehouse — отдельное направление в DE, построенное на разделении compute и storage, открытых табличных форматах (Iceberg, Delta) и движках распределённой обработки (Spark, Trino). Роадмап фокусируется на классическом DWH-стеке, поэтому здесь цель — знакомство, но с настоящей практикой, а не только теорией.
Lakehouse — архитектурный подход, который объединяет дешевизну и гибкость Data Lake с «взрослыми» возможностями классического DWH. В классическом DWH данные и вычисления живут внутри одной СУБД, в её собственном закрытом формате. В Lakehouse хранение и вычисления разделены: данные лежат в дешёвом хранилище (обычно объектном, вроде S3) в открытых форматах, слой табличных метаданных добавляет поверх файлов привычные по СУБД гарантии — схемы, транзакции, историю изменений, — а вычислительные движки подключаются к одним и тем же данным снаружи и масштабируются независимо; их может быть несколько разных одновременно. Конкретные технологии на каждом уровне варьируются: табличные форматы — Iceberg, Delta Lake, Hudi; движки Spark, Trino, Flink и другие. Роадмап фокусируется на классическом DWH-стеке, поэтому здесь цель — знакомство, но с настоящей практикой, а не только теорией: стенд ниже собирает один из типовых наборов этого конструктора.
Материалы:
- Введение в тему: [«Как не утонуть в данных: выбираем между DWH, Data Lake и Lakehouse» (Habr, Arenadata)](https://habr.com/ru/companies/arenadata/articles/885722/) — что такое Lakehouse, чем он отличается от классического DWH и Data Lake и зачем появился
- [DataLearn: «Что такое Apache Spark»](https://youtu.be/Tl9YzC-dQLI) — введение в Spark с нуля, ~40 минут
Практика — курс [«Lakehouse без магии»](https://github.com/dementev-dev/mini-lakehouse-lab) на стенде mini-lakehouse-lab (Spark + Iceberg + Trino + MinIO, всё локально в Docker, без облаков и регистраций):
@@ -440,6 +440,13 @@ Lakehouse — отдельное направление в DE, построен
- одна таблица из двух движков: запись через Spark, чтение через Trino — и почему это работает без копирования данных;
- schema evolution, time travel и обслуживание таблиц (compaction, expire_snapshots) — с параллелями к знакомым VACUUM/REORGANIZE из мира Postgres/Greenplum.
Глубже про Iceberg (опционально, лучше после практики на стенде):
- [«Как на самом деле работает Apache Iceberg» — Владимир Озеров, HighLoad Channel (Youtube)](https://www.youtube.com/watch?v=_3fsE2a2FO4)
- [Введение в устройство Parquet и Iceberg (Habr, VK Tech)](https://habr.com/ru/companies/vktech/articles/959398/) — подробный и местами непростой разбор форматов изнутри
- [Введение в Apache Iceberg: основы, архитектура, как работает](https://ivan-shamaev.ru/apache-iceberg-tutorial-architecture-how-to-work/#__Apache_Iceberg-2)
- [Spark + Iceberg in 1 Hour: Memory Tuning, Joins, Partition (Youtube, англ.)](https://www.youtube.com/watch?v=3R-SLYK-P_0)
### dbt
dbt (data build tool) — инструмент для трансформации данных в хранилище.
@@ -480,9 +487,6 @@ dbt (data build tool) — инструмент для трансформации
- Клон проекта [dementev_dev/sandbox_db_public-форк](https://gitflic.ru/project/dementev_dev/sandbox_db_public-fork)
- [System Design. Разбор книги "Высоконагруженные приложения". Глава 1 - Youtube](https://www.youtube.com/watch?v=owjrIB_5go8) — отличный видео-конспект первой главы Клеппмана на русском.
- [Индексы в БД - Youtube](https://www.youtube.com/watch?v=DyqtBiDrz3g)
- [Spark + Iceberg in 1 Hour - Memory Tuning, Joins, Partition - Youtube](https://www.youtube.com/watch?v=3R-SLYK-P_0)
- [Введение в устройство Parquet и Iceberg - habr](https://habr.com/ru/companies/vktech/articles/959398/)
- [Введение в Apache Iceberg. Основы, архитектура, как работает?](https://ivan-shamaev.ru/apache-iceberg-tutorial-architecture-how-to-work/#__Apache_Iceberg-2)
- [Алгоритмы: теория и практика. Методы – Stepik](https://stepik.org/course/217/info)
- [Алгоритмы: теория и практика. Структуры данных – Stepik](https://stepik.org/course/1547/promo)
- [Apache Hadoop для самых маленьких: HDFS, RACK-AWARENESS, репликация и Data Locality - Youtube](https://youtu.be/0fsY5bW2l84)