From efa4dd9a3eac66dd4748df4a7fae0834e7b2f734 Mon Sep 17 00:00:00 2001 From: Dmitry Dementev Date: Sun, 12 Jul 2026 19:32:41 +0300 Subject: [PATCH] =?UTF-8?q?docs:=20=D1=80=D0=B0=D1=81=D1=88=D0=B8=D1=80?= =?UTF-8?q?=D0=B5=D0=BD=D1=8B=20=D0=BC=D0=B0=D1=82=D0=B5=D1=80=D0=B8=D0=B0?= =?UTF-8?q?=D0=BB=D1=8B=20Lakehouse,=20=D1=83=D0=B1=D1=80=D0=B0=D0=BD?= =?UTF-8?q?=D0=B0=20=D0=B7=D0=B0=D0=B3=D0=BB=D1=83=D1=88=D0=BA=D0=B0=20?= =?UTF-8?q?=D0=B2=20=D0=BA=D0=B0=D1=80=D1=8C=D0=B5=D1=80=D0=BD=D0=BE=D0=BC?= =?UTF-8?q?=20=D0=B1=D0=BB=D0=BE=D0=BA=D0=B5?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - Зачем: - менти спрашивают, что такое Lakehouse и чем он отличается от классического DWH — во введении секции не было ответа и ссылки; - материалы по Iceberg лежали в «Дополнительных материалах», где их не найти по пути через секцию Lakehouse; - заглушка «в подготовке» выглядела незавершённостью раздела - Что: - во введение секции добавлено объяснение отличия Lakehouse от классического DWH (открытые форматы, объектное хранилище, независимое масштабирование движков); - добавлено введение: статья Arenadata «Как не утонуть в данных: выбираем между DWH, Data Lake и Lakehouse» (Habr); - добавлен блок «Глубже про Iceberg»: видео Владимира Озерова «Как на самом деле работает Apache Iceberg» и статья VK Tech «Введение в устройство Parquet и Iceberg» (с пометкой о сложности); - из «Дополнительных материалов» в этот блок перенесены статья ivan-shamaev про Iceberg и видео «Spark + Iceberg in 1 Hour»; - удалена строка «Видео по прохождению собеседований из сообщества ОМ — в подготовке» - Проверка: - mkdocs build --strict (без ошибок); - все три новые ссылки отвечают 200 (проверены с обходом прокси) Co-Authored-By: Claude Fable 5 --- README.md | 14 +++++++++----- 1 file changed, 9 insertions(+), 5 deletions(-) diff --git a/README.md b/README.md index 0960287..7cfa18a 100644 --- a/README.md +++ b/README.md @@ -366,7 +366,6 @@ Apache Airflow — инструмент для оркестрации ETL-про #### Поиск работы и собеседования - [Как подтвердить опыт без трудовой / Хабр против работяг](https://www.youtube.com/watch?v=GHqABzA1zi8) -- Видео по прохождению собеседований из сообщества ОМ — *в подготовке* - Практика: мок-собеседования с ментором — тренировка ответов, разбор слабых мест, психологическая подготовка к реальным интервью. #### Помощь с прохождением испытательного срока @@ -427,10 +426,11 @@ NiFi — визуальный конструктор потоков данных ### Lakehouse (Spark, Iceberg, Trino) -Lakehouse — отдельное направление в DE, построенное на разделении compute и storage, открытых табличных форматах (Iceberg, Delta) и движках распределённой обработки (Spark, Trino). Роадмап фокусируется на классическом DWH-стеке, поэтому здесь цель — знакомство, но с настоящей практикой, а не только теорией. +Lakehouse — архитектурный подход, который объединяет дешевизну и гибкость Data Lake с «взрослыми» возможностями классического DWH. В классическом DWH данные и вычисления живут внутри одной СУБД, в её собственном закрытом формате. В Lakehouse хранение и вычисления разделены: данные лежат в дешёвом хранилище (обычно объектном, вроде S3) в открытых форматах, слой табличных метаданных добавляет поверх файлов привычные по СУБД гарантии — схемы, транзакции, историю изменений, — а вычислительные движки подключаются к одним и тем же данным снаружи и масштабируются независимо; их может быть несколько разных одновременно. Конкретные технологии на каждом уровне варьируются: табличные форматы — Iceberg, Delta Lake, Hudi; движки — Spark, Trino, Flink и другие. Роадмап фокусируется на классическом DWH-стеке, поэтому здесь цель — знакомство, но с настоящей практикой, а не только теорией: стенд ниже собирает один из типовых наборов этого конструктора. Материалы: +- Введение в тему: [«Как не утонуть в данных: выбираем между DWH, Data Lake и Lakehouse» (Habr, Arenadata)](https://habr.com/ru/companies/arenadata/articles/885722/) — что такое Lakehouse, чем он отличается от классического DWH и Data Lake и зачем появился - [DataLearn: «Что такое Apache Spark»](https://youtu.be/Tl9YzC-dQLI) — введение в Spark с нуля, ~40 минут Практика — курс [«Lakehouse без магии»](https://github.com/dementev-dev/mini-lakehouse-lab) на стенде mini-lakehouse-lab (Spark + Iceberg + Trino + MinIO, всё локально в Docker, без облаков и регистраций): @@ -440,6 +440,13 @@ Lakehouse — отдельное направление в DE, построен - одна таблица из двух движков: запись через Spark, чтение через Trino — и почему это работает без копирования данных; - schema evolution, time travel и обслуживание таблиц (compaction, expire_snapshots) — с параллелями к знакомым VACUUM/REORGANIZE из мира Postgres/Greenplum. +Глубже про Iceberg (опционально, лучше после практики на стенде): + +- [«Как на самом деле работает Apache Iceberg» — Владимир Озеров, HighLoad Channel (Youtube)](https://www.youtube.com/watch?v=_3fsE2a2FO4) +- [Введение в устройство Parquet и Iceberg (Habr, VK Tech)](https://habr.com/ru/companies/vktech/articles/959398/) — подробный и местами непростой разбор форматов изнутри +- [Введение в Apache Iceberg: основы, архитектура, как работает](https://ivan-shamaev.ru/apache-iceberg-tutorial-architecture-how-to-work/#__Apache_Iceberg-2) +- [Spark + Iceberg in 1 Hour: Memory Tuning, Joins, Partition (Youtube, англ.)](https://www.youtube.com/watch?v=3R-SLYK-P_0) + ### dbt dbt (data build tool) — инструмент для трансформации данных в хранилище. @@ -480,9 +487,6 @@ dbt (data build tool) — инструмент для трансформации - Клон проекта [dementev_dev/sandbox_db_public-форк](https://gitflic.ru/project/dementev_dev/sandbox_db_public-fork) - [System Design. Разбор книги "Высоконагруженные приложения". Глава 1 - Youtube](https://www.youtube.com/watch?v=owjrIB_5go8) — отличный видео-конспект первой главы Клеппмана на русском. - [Индексы в БД - Youtube](https://www.youtube.com/watch?v=DyqtBiDrz3g) -- [Spark + Iceberg in 1 Hour - Memory Tuning, Joins, Partition - Youtube](https://www.youtube.com/watch?v=3R-SLYK-P_0) -- [Введение в устройство Parquet и Iceberg - habr](https://habr.com/ru/companies/vktech/articles/959398/) -- [Введение в Apache Iceberg. Основы, архитектура, как работает?](https://ivan-shamaev.ru/apache-iceberg-tutorial-architecture-how-to-work/#__Apache_Iceberg-2) - [Алгоритмы: теория и практика. Методы – Stepik](https://stepik.org/course/217/info) - [Алгоритмы: теория и практика. Структуры данных – Stepik](https://stepik.org/course/1547/promo) - [Apache Hadoop для самых маленьких: HDFS, RACK-AWARENESS, репликация и Data Locality - Youtube](https://youtu.be/0fsY5bW2l84)