feat(sql): явное управление storage и автоматизированный E2E-тест через REST API

- Зачем:
  - необходимо визуализировать выбор типа хранения (Heap vs Append-Only) для учебных целей.
  - автоматизировать проверку всей цепочки DWH для исключения ручных ошибок.
  - сделать процесс отладки прозрачным и наглядным через стандартные инструменты Airflow.
- Что:
  - внедрена клауза WITH (appendonly=...) во все DDL; ODS-справочники переведены на AO Row и TRUNCATE+INSERT.
  - создан скрипт scripts/e2e_etl.sh для полного прогона ETL (DDL + 2 дня данных) через REST API.
  - исправлены баги типизации (INTEGER[]), именования полей (amount, passenger_id) и удалены фантомные колонки (contact_data).
  - обновлен e2e-etl-test-protocol.md: добавлен раздел по отладке, чтению логов и перезапуску задач через API.
  - исправлены pytest-контракты под новую логику загрузки.
- Проверка:
  - успешный прогон `make e2e-smoke` (полный цикл от очистки до витрины).
This commit is contained in:
2026-03-03 22:38:26 +03:00
parent dd6274b948
commit 22a0590e1b
34 changed files with 484 additions and 526 deletions
+31 -50
View File
@@ -1,67 +1,48 @@
-- Загрузка DDS dim_passengers: SCD1 UPSERT (UPDATE изменившихся + INSERT новых).
-- Statement 1: UPDATE существующих записей (если атрибуты изменились).
WITH src AS (
-- Учебный комментарий: Используем TEMP TABLE для подготовки дельты.
-- Это избавляет от дублирования сложной оконной функции в UPDATE и INSERT блоках.
CREATE TEMP TABLE tmp_passengers_src ON COMMIT DROP AS
SELECT
d.passenger_id,
d.passenger_name
FROM (
SELECT
d.passenger_id,
d.passenger_name
FROM (
SELECT
t.passenger_id,
t.passenger_name,
ROW_NUMBER() OVER (
PARTITION BY t.passenger_id
ORDER BY t.event_ts DESC NULLS LAST, t._load_ts DESC, t.ticket_no DESC
) AS rn
FROM ods.tickets AS t
WHERE t.passenger_id IS NOT NULL
AND t.passenger_id <> ''
AND t.passenger_name IS NOT NULL
AND t.passenger_name <> ''
) AS d
WHERE d.rn = 1
)
t.passenger_id,
t.passenger_name,
ROW_NUMBER() OVER (
PARTITION BY t.passenger_id
ORDER BY t.event_ts DESC NULLS LAST, t._load_ts DESC, t.ticket_no DESC
) AS rn
FROM ods.tickets AS t
WHERE t.passenger_id IS NOT NULL
AND t.passenger_id <> ''
AND t.passenger_name IS NOT NULL
AND t.passenger_name <> ''
) AS d
WHERE d.rn = 1;
-- Statement 1: UPDATE существующих записей (если атрибуты изменились).
UPDATE dds.dim_passengers AS d
SET passenger_name = s.passenger_name,
updated_at = now(),
_load_id = '{{ run_id }}',
_load_ts = now()
FROM src AS s
WHERE d.passenger_bk = s.passenger_id
FROM tmp_passengers_src AS s
WHERE d.passenger_id = s.passenger_id
AND d.passenger_name IS DISTINCT FROM s.passenger_name;
-- Statement 2: INSERT новых записей (MAX(sk) + ROW_NUMBER()).
WITH src AS (
SELECT
d.passenger_id,
d.passenger_name
FROM (
SELECT
t.passenger_id,
t.passenger_name,
ROW_NUMBER() OVER (
PARTITION BY t.passenger_id
ORDER BY t.event_ts DESC NULLS LAST, t._load_ts DESC, t.ticket_no DESC
) AS rn
FROM ods.tickets AS t
WHERE t.passenger_id IS NOT NULL
AND t.passenger_id <> ''
AND t.passenger_name IS NOT NULL
AND t.passenger_name <> ''
) AS d
WHERE d.rn = 1
),
-- Учебный комментарий: Генерация SK через MAX() + ROW_NUMBER()
-- Этот подход работает безопасно только потому, что Airflow запускает
-- джобы загрузки для одной таблицы строго последовательно (concurrency=1).
-- При параллельной загрузке возникнет состояние гонки (race condition) и возможны дубли SK.
max_sk AS (
WITH max_sk AS (
-- Учебный комментарий: Генерация SK через MAX() + ROW_NUMBER()
-- Этот подход работает безопасно только потому, что Airflow запускает
-- джобы загрузки для одной таблицы строго последовательно (concurrency=1).
SELECT COALESCE(MAX(passenger_sk), 0) AS v
FROM dds.dim_passengers
)
INSERT INTO dds.dim_passengers (
passenger_sk,
passenger_bk,
passenger_id,
passenger_name,
created_at,
updated_at,
@@ -76,11 +57,11 @@ SELECT
now(),
'{{ run_id }}',
now()
FROM src AS s
FROM tmp_passengers_src AS s
WHERE NOT EXISTS (
SELECT 1
FROM dds.dim_passengers AS d
WHERE d.passenger_bk = s.passenger_id
WHERE d.passenger_id = s.passenger_id
);
ANALYZE dds.dim_passengers;