- Зачем:
- STG-слой использовал legacy-имена (batch_id, load_dttm, src_created_at_ts),
тогда как ODS/DDS/DM уже работали с каноном (_load_id, _load_ts, event_ts).
Студент видел разные имена для одного понятия — это убрано.
- Что:
- переименованы колонки в 9 STG DDL: batch_id→_load_id, load_dttm→_load_ts,
src_created_at_ts→event_ts; добавлен NOT NULL для _load_id во всех таблицах.
- обновлены 9 STG Load, 9 STG DQ, 9 ODS Load, 9 ODS DQ (INSERT/SELECT/WHERE).
- обновлены DAG-файлы bookings_to_gp_stage.py и bookings_to_gp_ods.py
(встроенный SQL резолвера, комментарии; Python-идентификаторы не тронуты).
- обновлены тесты и ~15 документов (naming_conventions, PRD, db_schema,
design-docs, qa-plan, README, TESTING и др.).
- Проверка:
- grep -rn 'load_dttm\|src_created_at_ts' sql/ airflow/ tests/ — 0 совпадений.
- make test — 4 passed.
- e2e-etl: day1 прошёл полностью, day2 стартовал без ошибок.
40 lines
1.2 KiB
SQL
40 lines
1.2 KiB
SQL
-- Загрузка ODS по airplanes: Полная перезагрузка (TRUNCATE + INSERT).
|
|
-- Почему: для справочников-снимков в Greenplum на AO-таблицах
|
|
-- эффективнее перетереть данные целиком, чем делать медленный UPDATE.
|
|
|
|
TRUNCATE TABLE ods.airplanes;
|
|
|
|
INSERT INTO ods.airplanes (
|
|
airplane_code,
|
|
model,
|
|
range_km,
|
|
speed_kmh,
|
|
_load_id,
|
|
_load_ts
|
|
)
|
|
WITH src AS (
|
|
-- Выбираем последний снимок из STG для текущего батча
|
|
SELECT
|
|
s.airplane_code,
|
|
s.model::json->>'ru' AS model,
|
|
NULLIF(s.range, '')::INTEGER AS range_km,
|
|
NULLIF(s.speed, '')::INTEGER AS speed_kmh,
|
|
ROW_NUMBER() OVER (
|
|
PARTITION BY s.airplane_code
|
|
ORDER BY s._load_ts DESC, s.event_ts DESC NULLS LAST
|
|
) AS rn
|
|
FROM stg.airplanes AS s
|
|
WHERE s._load_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
|
|
)
|
|
SELECT
|
|
s.airplane_code,
|
|
s.model,
|
|
s.range_km,
|
|
s.speed_kmh,
|
|
'{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
|
|
now()
|
|
FROM src AS s
|
|
WHERE s.rn = 1;
|
|
|
|
ANALYZE ods.airplanes;
|