feat(course): добавлен модуль 3 про raw ingest и чтение в Spark
- Зачем: - нужен следующий практический шаг после модулей 1-2: доставить raw-данные в MinIO и впервые прочитать их через Spark. - Что: - добавлен ноутбук модуля 3 с raw ingest, first read, проверкой схемы, null-анализом и поиском аномалий. - обновлены START_HERE, stack reference и docker-compose для data bundle в ./data и mount в /opt/data. - добавлены правила игнорирования data bundle, .gitkeep для пустой директории и обновлён статус плана модуля. - Проверка: - docker compose config. - выполнение notebooks/03_raw_ingest_and_first_read.ipynb на локальном data bundle.
This commit is contained in:
@@ -110,10 +110,13 @@ docker compose run --rm iceberg-catalog-init
|
||||
- адрес: `http://localhost:8888`
|
||||
- `./notebooks` смонтирован как `/opt/work`
|
||||
- `./src` смонтирован read-only как `/opt/src`
|
||||
- `./data` смонтирован read-only как `/opt/data`
|
||||
- `PYTHONPATH=/opt/src`
|
||||
|
||||
Первый ноутбук курса: `notebooks/01_environment_and_smoke_test.ipynb`.
|
||||
|
||||
Для Модуля 3 локально скачанный data bundle должен лежать на хосте в `./data/nyc_taxi` и будет доступен внутри Jupyter по пути `/opt/data/nyc_taxi`.
|
||||
|
||||
## Как связаны Spark, Trino, PostgreSQL и MinIO
|
||||
|
||||
- `Spark` использует каталог `lakehouse` через `JdbcCatalog`.
|
||||
|
||||
Reference in New Issue
Block a user