From 6871172da38a450f665974ad123fdf3cd16f51a5 Mon Sep 17 00:00:00 2001 From: Dmitry Dementev Date: Thu, 22 Jan 2026 21:29:58 +0300 Subject: [PATCH] =?UTF-8?q?=D0=93=D0=BB=D0=B0=D0=B2=D1=8B=20=D0=B8=D0=B7?= =?UTF-8?q?=202=D1=85=20=D0=BA=D0=BD=D0=B8=D0=B6=D0=B5=D0=BA?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- README.md | 8 ++++++++ 1 file changed, 8 insertions(+) diff --git a/README.md b/README.md index a84fd84..f0e7bb8 100644 --- a/README.md +++ b/README.md @@ -86,10 +86,13 @@ SQL и моделирование данных специально идут р Цель — не стать архитектором, а **уметь читать и объяснять структуру данных**, чтобы писать осмысленные запросы и трансформации. Материалы (включая демо DWH-модель из этого репозитория): +- Мартин Клеппман — «Высоконагруженные приложения» - Глава 2: Модели данных и языки запросов. - Для понимания, чем реляционная модель (SQL) отличается от документной (NoSQL) и графовой, и почему для аналитики мы всё ещё любим таблицы + (Важно: не перепутайте главу 2 с Частью 2 про распределенные данные!). - [Яндекс Практикум: что такое нормализация, простыми словами (для самых начинающих)](https://practicum.yandex.ru/blog/chto-takoe-normalizaciya-dannyh/) - [Базы данных. 1,2,3 нормальные формы. - Youtube](https://www.youtube.com/watch?v=zwQzL80U51c) - [Введение в структуру хранилища данных](dwh-modeling/README.md) - Теория про Slowly Changing Dimensions: [SCD](dwh-modeling/SCD.md) +- (Опционально) Ральф Кимбалл — «Инструментарий хранения и анализа данных» (The Data Warehouse Toolkit) - первые 3 главы - Практика по моделированию статусов клиента: [домашка STG → ODS → DDS → DM](dwh-modeling/Homework_Customer_Status_DDS_DM.md) - Еще про Data Vault: - Конспект и примеры из этого репозитория: [DataVault.md](dwh-modeling/DataVault.md) @@ -206,6 +209,10 @@ Apache Airflow — инструмент для оркестрации ETL-про Разбираем, чем Greenplum отличается от PostgreSQL и зачем нужны MPP-хранилища. Предварительно: +- Мартин Клеппман — «Высоконагруженные приложения» (Фундамент для MPP) + - Глава 1: Надежность, масштабируемость. (Разбираемся с терминами Latency, Throughput и видами масштабирования). + - Глава 3 (только конец главы!): Читаем разделы «Обработка транзакций или аналитика?» (OLTP or OLAP?) и «Хранение по столбцам». + - Зачем: Это физика работы Greenplum. Вы поймете, почему `SELECT *` — это дорого, а агрегаты — быстро, и почему в аналитике данные сжимают. - Простое введение: [Greenplum | Что это такое и как оно работает? - Youtube](https://www.youtube.com/watch?v=rLG9Z_HcKPY) - Оно же, но текстом: https://halltape.github.io/HalltapeRoadmapDE/GREENPLUM/ - [Визуализатор распределения Greenplum](https://gpskew.rzvde.pro/) @@ -346,6 +353,7 @@ dbt (data build tool) — инструмент для трансформации # Дополнительные материалы - [ananevsyu/SandBox_DB_public: Песочница для изучения различных технологий связанных с инженерией данных](https://gitflic.ru/project/ananevsyu/sandbox_db_public) - Клон проекта [dementev_dev/sandbox_db_public-форк](https://gitflic.ru/project/dementev_dev/sandbox_db_public-fork) +- [System Design. Разбор книги "Высоконагруженные приложения". Глава 1 - Youtube](https://www.youtube.com/watch?v=owjrIB_5go8) — отличный видео-конспект первой главы Клеппмана на русском. - [Индексы в БД - Youtube](https://www.youtube.com/watch?v=DyqtBiDrz3g) - [Spark + Iceberg in 1 Hour - Memory Tuning, Joins, Partition - Youtube](https://www.youtube.com/watch?v=3R-SLYK-P_0) - [Введение в устройство Parquet и Iceberg - habr](https://habr.com/ru/companies/vktech/articles/959398/)