feat(sql): явное управление storage и автоматизированный E2E-тест через REST API
- Зачем: - необходимо визуализировать выбор типа хранения (Heap vs Append-Only) для учебных целей. - автоматизировать проверку всей цепочки DWH для исключения ручных ошибок. - сделать процесс отладки прозрачным и наглядным через стандартные инструменты Airflow. - Что: - внедрена клауза WITH (appendonly=...) во все DDL; ODS-справочники переведены на AO Row и TRUNCATE+INSERT. - создан скрипт scripts/e2e_etl.sh для полного прогона ETL (DDL + 2 дня данных) через REST API. - исправлены баги типизации (INTEGER[]), именования полей (amount, passenger_id) и удалены фантомные колонки (contact_data). - обновлен e2e-etl-test-protocol.md: добавлен раздел по отладке, чтению логов и перезапуску задач через API. - исправлены pytest-контракты под новую логику загрузки. - Проверка: - успешный прогон `make e2e-smoke` (полный цикл от очистки до витрины).
This commit is contained in:
@@ -2,6 +2,9 @@
|
||||
|
||||
CREATE SCHEMA IF NOT EXISTS dds;
|
||||
|
||||
-- Тип таблицы: Heap (стандартная).
|
||||
-- Обоснование: Необходим row-level UPDATE для реализации SCD1 UPSERT.
|
||||
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
|
||||
CREATE TABLE IF NOT EXISTS dds.dim_airplanes (
|
||||
airplane_sk INTEGER NOT NULL,
|
||||
airplane_bk TEXT NOT NULL,
|
||||
@@ -14,4 +17,7 @@ CREATE TABLE IF NOT EXISTS dds.dim_airplanes (
|
||||
_load_id TEXT NOT NULL,
|
||||
_load_ts TIMESTAMP NOT NULL DEFAULT now()
|
||||
)
|
||||
WITH (appendonly=false)
|
||||
DISTRIBUTED BY (airplane_sk);
|
||||
|
||||
COMMENT ON TABLE dds.dim_airplanes IS 'Измерение моделей самолетов (DDS).';
|
||||
|
||||
@@ -2,6 +2,9 @@
|
||||
|
||||
CREATE SCHEMA IF NOT EXISTS dds;
|
||||
|
||||
-- Тип таблицы: Heap (стандартная).
|
||||
-- Обоснование: Необходим row-level UPDATE для реализации SCD1 UPSERT.
|
||||
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
|
||||
CREATE TABLE IF NOT EXISTS dds.dim_airports (
|
||||
airport_sk INTEGER NOT NULL,
|
||||
airport_bk TEXT NOT NULL,
|
||||
@@ -15,4 +18,7 @@ CREATE TABLE IF NOT EXISTS dds.dim_airports (
|
||||
_load_id TEXT NOT NULL,
|
||||
_load_ts TIMESTAMP NOT NULL DEFAULT now()
|
||||
)
|
||||
WITH (appendonly=false)
|
||||
DISTRIBUTED BY (airport_sk);
|
||||
|
||||
COMMENT ON TABLE dds.dim_airports IS 'Измерение аэропортов (DDS).';
|
||||
|
||||
@@ -2,6 +2,8 @@
|
||||
|
||||
CREATE SCHEMA IF NOT EXISTS dds;
|
||||
|
||||
-- Тип таблицы: Append-Only Row-oriented (zstd:1).
|
||||
-- Обоснование: Статичные данные без обновлений. Обеспечивает эффективное сжатие.
|
||||
CREATE TABLE IF NOT EXISTS dds.dim_calendar (
|
||||
calendar_sk INTEGER NOT NULL,
|
||||
date_actual DATE NOT NULL,
|
||||
@@ -12,4 +14,7 @@ CREATE TABLE IF NOT EXISTS dds.dim_calendar (
|
||||
day_name TEXT NOT NULL,
|
||||
is_weekend BOOLEAN NOT NULL
|
||||
)
|
||||
WITH (appendonly=true, orientation=row, compresstype=zstd, compresslevel=1)
|
||||
DISTRIBUTED BY (calendar_sk);
|
||||
|
||||
COMMENT ON TABLE dds.dim_calendar IS 'Измерение календаря (DDS).';
|
||||
|
||||
@@ -2,13 +2,19 @@
|
||||
|
||||
CREATE SCHEMA IF NOT EXISTS dds;
|
||||
|
||||
-- Тип таблицы: Heap (стандартная).
|
||||
-- Обоснование: Необходим row-level UPDATE для реализации SCD1 UPSERT.
|
||||
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
|
||||
CREATE TABLE IF NOT EXISTS dds.dim_passengers (
|
||||
passenger_sk INTEGER NOT NULL,
|
||||
passenger_bk TEXT NOT NULL,
|
||||
passenger_id TEXT NOT NULL,
|
||||
passenger_name TEXT NOT NULL,
|
||||
created_at TIMESTAMP NOT NULL DEFAULT now(),
|
||||
updated_at TIMESTAMP NOT NULL DEFAULT now(),
|
||||
_load_id TEXT NOT NULL,
|
||||
_load_ts TIMESTAMP NOT NULL DEFAULT now()
|
||||
)
|
||||
WITH (appendonly=false)
|
||||
DISTRIBUTED BY (passenger_sk);
|
||||
|
||||
COMMENT ON TABLE dds.dim_passengers IS 'Измерение пассажиров (DDS).';
|
||||
|
||||
@@ -41,14 +41,14 @@ BEGIN
|
||||
v_dup_sk;
|
||||
END IF;
|
||||
|
||||
-- Нет дублей по BK.
|
||||
SELECT COUNT(*) - COUNT(DISTINCT passenger_bk)
|
||||
-- Нет дублей по BK (ID).
|
||||
SELECT COUNT(*) - COUNT(DISTINCT passenger_id)
|
||||
INTO v_dup_bk
|
||||
FROM dds.dim_passengers;
|
||||
|
||||
IF v_dup_bk <> 0 THEN
|
||||
RAISE EXCEPTION
|
||||
'DQ FAILED: в dds.dim_passengers найдены дубликаты passenger_bk: %',
|
||||
'DQ FAILED: в dds.dim_passengers найдены дубликаты passenger_id: %',
|
||||
v_dup_bk;
|
||||
END IF;
|
||||
|
||||
@@ -64,7 +64,7 @@ BEGIN
|
||||
WHERE NOT EXISTS (
|
||||
SELECT 1
|
||||
FROM dds.dim_passengers AS d
|
||||
WHERE d.passenger_bk = s.passenger_id
|
||||
WHERE d.passenger_id = s.passenger_id
|
||||
);
|
||||
|
||||
IF v_missing_bk <> 0 THEN
|
||||
@@ -78,8 +78,8 @@ BEGIN
|
||||
INTO v_null_count
|
||||
FROM dds.dim_passengers
|
||||
WHERE passenger_sk IS NULL
|
||||
OR passenger_bk IS NULL
|
||||
OR passenger_bk = ''
|
||||
OR passenger_id IS NULL
|
||||
OR passenger_id = ''
|
||||
OR passenger_name IS NULL
|
||||
OR passenger_name = ''
|
||||
OR created_at IS NULL
|
||||
|
||||
@@ -1,67 +1,48 @@
|
||||
-- Загрузка DDS dim_passengers: SCD1 UPSERT (UPDATE изменившихся + INSERT новых).
|
||||
|
||||
-- Statement 1: UPDATE существующих записей (если атрибуты изменились).
|
||||
WITH src AS (
|
||||
-- Учебный комментарий: Используем TEMP TABLE для подготовки дельты.
|
||||
-- Это избавляет от дублирования сложной оконной функции в UPDATE и INSERT блоках.
|
||||
CREATE TEMP TABLE tmp_passengers_src ON COMMIT DROP AS
|
||||
SELECT
|
||||
d.passenger_id,
|
||||
d.passenger_name
|
||||
FROM (
|
||||
SELECT
|
||||
d.passenger_id,
|
||||
d.passenger_name
|
||||
FROM (
|
||||
SELECT
|
||||
t.passenger_id,
|
||||
t.passenger_name,
|
||||
ROW_NUMBER() OVER (
|
||||
PARTITION BY t.passenger_id
|
||||
ORDER BY t.event_ts DESC NULLS LAST, t._load_ts DESC, t.ticket_no DESC
|
||||
) AS rn
|
||||
FROM ods.tickets AS t
|
||||
WHERE t.passenger_id IS NOT NULL
|
||||
AND t.passenger_id <> ''
|
||||
AND t.passenger_name IS NOT NULL
|
||||
AND t.passenger_name <> ''
|
||||
) AS d
|
||||
WHERE d.rn = 1
|
||||
)
|
||||
t.passenger_id,
|
||||
t.passenger_name,
|
||||
ROW_NUMBER() OVER (
|
||||
PARTITION BY t.passenger_id
|
||||
ORDER BY t.event_ts DESC NULLS LAST, t._load_ts DESC, t.ticket_no DESC
|
||||
) AS rn
|
||||
FROM ods.tickets AS t
|
||||
WHERE t.passenger_id IS NOT NULL
|
||||
AND t.passenger_id <> ''
|
||||
AND t.passenger_name IS NOT NULL
|
||||
AND t.passenger_name <> ''
|
||||
) AS d
|
||||
WHERE d.rn = 1;
|
||||
|
||||
-- Statement 1: UPDATE существующих записей (если атрибуты изменились).
|
||||
UPDATE dds.dim_passengers AS d
|
||||
SET passenger_name = s.passenger_name,
|
||||
updated_at = now(),
|
||||
_load_id = '{{ run_id }}',
|
||||
_load_ts = now()
|
||||
FROM src AS s
|
||||
WHERE d.passenger_bk = s.passenger_id
|
||||
FROM tmp_passengers_src AS s
|
||||
WHERE d.passenger_id = s.passenger_id
|
||||
AND d.passenger_name IS DISTINCT FROM s.passenger_name;
|
||||
|
||||
-- Statement 2: INSERT новых записей (MAX(sk) + ROW_NUMBER()).
|
||||
WITH src AS (
|
||||
SELECT
|
||||
d.passenger_id,
|
||||
d.passenger_name
|
||||
FROM (
|
||||
SELECT
|
||||
t.passenger_id,
|
||||
t.passenger_name,
|
||||
ROW_NUMBER() OVER (
|
||||
PARTITION BY t.passenger_id
|
||||
ORDER BY t.event_ts DESC NULLS LAST, t._load_ts DESC, t.ticket_no DESC
|
||||
) AS rn
|
||||
FROM ods.tickets AS t
|
||||
WHERE t.passenger_id IS NOT NULL
|
||||
AND t.passenger_id <> ''
|
||||
AND t.passenger_name IS NOT NULL
|
||||
AND t.passenger_name <> ''
|
||||
) AS d
|
||||
WHERE d.rn = 1
|
||||
),
|
||||
-- Учебный комментарий: Генерация SK через MAX() + ROW_NUMBER()
|
||||
-- Этот подход работает безопасно только потому, что Airflow запускает
|
||||
-- джобы загрузки для одной таблицы строго последовательно (concurrency=1).
|
||||
-- При параллельной загрузке возникнет состояние гонки (race condition) и возможны дубли SK.
|
||||
max_sk AS (
|
||||
WITH max_sk AS (
|
||||
-- Учебный комментарий: Генерация SK через MAX() + ROW_NUMBER()
|
||||
-- Этот подход работает безопасно только потому, что Airflow запускает
|
||||
-- джобы загрузки для одной таблицы строго последовательно (concurrency=1).
|
||||
SELECT COALESCE(MAX(passenger_sk), 0) AS v
|
||||
FROM dds.dim_passengers
|
||||
)
|
||||
INSERT INTO dds.dim_passengers (
|
||||
passenger_sk,
|
||||
passenger_bk,
|
||||
passenger_id,
|
||||
passenger_name,
|
||||
created_at,
|
||||
updated_at,
|
||||
@@ -76,11 +57,11 @@ SELECT
|
||||
now(),
|
||||
'{{ run_id }}',
|
||||
now()
|
||||
FROM src AS s
|
||||
FROM tmp_passengers_src AS s
|
||||
WHERE NOT EXISTS (
|
||||
SELECT 1
|
||||
FROM dds.dim_passengers AS d
|
||||
WHERE d.passenger_bk = s.passenger_id
|
||||
WHERE d.passenger_id = s.passenger_id
|
||||
);
|
||||
|
||||
ANALYZE dds.dim_passengers;
|
||||
|
||||
@@ -2,6 +2,9 @@
|
||||
|
||||
CREATE SCHEMA IF NOT EXISTS dds;
|
||||
|
||||
-- Тип таблицы: Heap (стандартная).
|
||||
-- Обоснование: Необходим row-level UPDATE для реализации SCD2 (закрытие версий).
|
||||
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
|
||||
CREATE TABLE IF NOT EXISTS dds.dim_routes (
|
||||
route_sk INTEGER NOT NULL,
|
||||
route_bk TEXT NOT NULL,
|
||||
@@ -19,4 +22,7 @@ CREATE TABLE IF NOT EXISTS dds.dim_routes (
|
||||
_load_id TEXT NOT NULL,
|
||||
_load_ts TIMESTAMP NOT NULL DEFAULT now()
|
||||
)
|
||||
WITH (appendonly=false)
|
||||
DISTRIBUTED BY (route_sk);
|
||||
|
||||
COMMENT ON TABLE dds.dim_routes IS 'Измерение маршрутов (DDS).';
|
||||
|
||||
+26
-51
@@ -1,44 +1,40 @@
|
||||
-- Загрузка DDS dim_routes: SCD2 с hashdiff.
|
||||
|
||||
-- Учебный комментарий: Используем TEMP TABLE для подготовки дельты.
|
||||
-- Это избавляет от дублирования логики hashdiff в UPDATE и INSERT блоках.
|
||||
CREATE TEMP TABLE tmp_routes_src ON COMMIT DROP AS
|
||||
SELECT
|
||||
route_no,
|
||||
departure_airport,
|
||||
arrival_airport,
|
||||
airplane_code,
|
||||
days_of_week,
|
||||
departure_time,
|
||||
duration,
|
||||
md5(
|
||||
COALESCE(departure_airport, '') || '|' ||
|
||||
COALESCE(arrival_airport, '') || '|' ||
|
||||
COALESCE(airplane_code, '') || '|' ||
|
||||
COALESCE(days_of_week::TEXT, '') || '|' ||
|
||||
COALESCE(departure_time::TEXT, '') || '|' ||
|
||||
COALESCE(duration::TEXT, '')
|
||||
) AS hashdiff,
|
||||
ROW_NUMBER() OVER (PARTITION BY route_no ORDER BY validity DESC) AS rn
|
||||
FROM ods.routes;
|
||||
|
||||
-- Statement 1: Закрыть устаревшие версии (valid_to = текущая дата).
|
||||
WITH src AS (
|
||||
SELECT
|
||||
route_no,
|
||||
departure_airport,
|
||||
arrival_airport,
|
||||
airplane_code,
|
||||
days_of_week,
|
||||
departure_time,
|
||||
duration,
|
||||
md5(
|
||||
COALESCE(departure_airport, '') || '|' ||
|
||||
COALESCE(arrival_airport, '') || '|' ||
|
||||
COALESCE(airplane_code, '') || '|' ||
|
||||
COALESCE(days_of_week, '') || '|' ||
|
||||
COALESCE(departure_time::TEXT, '') || '|' ||
|
||||
COALESCE(duration::TEXT, '')
|
||||
) AS hashdiff,
|
||||
ROW_NUMBER() OVER (PARTITION BY route_no ORDER BY validity DESC) AS rn
|
||||
FROM ods.routes
|
||||
)
|
||||
UPDATE dds.dim_routes AS d
|
||||
SET valid_to = CURRENT_DATE,
|
||||
updated_at = now(),
|
||||
_load_id = '{{ run_id }}',
|
||||
_load_ts = now()
|
||||
FROM src AS s
|
||||
FROM tmp_routes_src AS s
|
||||
WHERE s.rn = 1
|
||||
AND d.route_bk = s.route_no
|
||||
AND d.valid_to IS NULL
|
||||
AND d.hashdiff <> s.hashdiff;
|
||||
|
||||
-- Statement 1.1: Закрыть "исчезнувшие" маршруты.
|
||||
WITH src AS (
|
||||
SELECT
|
||||
route_no,
|
||||
ROW_NUMBER() OVER (PARTITION BY route_no ORDER BY validity DESC) AS rn
|
||||
FROM ods.routes
|
||||
)
|
||||
UPDATE dds.dim_routes AS d
|
||||
SET valid_to = CURRENT_DATE,
|
||||
updated_at = now(),
|
||||
@@ -47,37 +43,16 @@ SET valid_to = CURRENT_DATE,
|
||||
WHERE d.valid_to IS NULL
|
||||
AND NOT EXISTS (
|
||||
SELECT 1
|
||||
FROM src AS s
|
||||
FROM tmp_routes_src AS s
|
||||
WHERE s.rn = 1
|
||||
AND s.route_no = d.route_bk
|
||||
);
|
||||
|
||||
-- Statement 2: Вставить новые версии (для изменённых и новых route_no).
|
||||
WITH src AS (
|
||||
SELECT
|
||||
route_no,
|
||||
departure_airport,
|
||||
arrival_airport,
|
||||
airplane_code,
|
||||
days_of_week,
|
||||
departure_time,
|
||||
duration,
|
||||
md5(
|
||||
COALESCE(departure_airport, '') || '|' ||
|
||||
COALESCE(arrival_airport, '') || '|' ||
|
||||
COALESCE(airplane_code, '') || '|' ||
|
||||
COALESCE(days_of_week, '') || '|' ||
|
||||
COALESCE(departure_time::TEXT, '') || '|' ||
|
||||
COALESCE(duration::TEXT, '')
|
||||
) AS hashdiff,
|
||||
ROW_NUMBER() OVER (PARTITION BY route_no ORDER BY validity DESC) AS rn
|
||||
FROM ods.routes
|
||||
),
|
||||
max_sk AS (
|
||||
WITH max_sk AS (
|
||||
-- Учебный комментарий: Генерация SK через MAX() + ROW_NUMBER()
|
||||
-- Этот подход работает безопасно только потому, что Airflow запускает
|
||||
-- джобы загрузки для одной таблицы строго последовательно (concurrency=1).
|
||||
-- При параллельной загрузке возникнет состояние гонки (race condition) и возможны дубли SK.
|
||||
SELECT COALESCE(MAX(route_sk), 0) AS v
|
||||
FROM dds.dim_routes
|
||||
)
|
||||
@@ -121,7 +96,7 @@ SELECT
|
||||
now(),
|
||||
'{{ run_id }}',
|
||||
now()
|
||||
FROM src AS s
|
||||
FROM tmp_routes_src AS s
|
||||
WHERE s.rn = 1
|
||||
AND NOT EXISTS (
|
||||
SELECT 1
|
||||
|
||||
@@ -2,6 +2,8 @@
|
||||
|
||||
CREATE SCHEMA IF NOT EXISTS dds;
|
||||
|
||||
-- Тип таблицы: Append-Only Row-oriented (zstd:1).
|
||||
-- Обоснование: Редко дополняемые данные без обновлений. Обеспечивает эффективное сжатие.
|
||||
CREATE TABLE IF NOT EXISTS dds.dim_tariffs (
|
||||
tariff_sk INTEGER NOT NULL,
|
||||
fare_conditions TEXT NOT NULL,
|
||||
@@ -10,4 +12,7 @@ CREATE TABLE IF NOT EXISTS dds.dim_tariffs (
|
||||
_load_id TEXT NOT NULL,
|
||||
_load_ts TIMESTAMP NOT NULL DEFAULT now()
|
||||
)
|
||||
WITH (appendonly=true, orientation=row, compresstype=zstd, compresslevel=1)
|
||||
DISTRIBUTED BY (tariff_sk);
|
||||
|
||||
COMMENT ON TABLE dds.dim_tariffs IS 'Измерение тарифов (DDS).';
|
||||
|
||||
@@ -6,6 +6,10 @@ CREATE SCHEMA IF NOT EXISTS dds;
|
||||
-- В классическом DWH (Кимбалл) таблица фактов идентифицируется набором её
|
||||
-- измерений или дегенеративных ключей (в нашем случае: ticket_no + flight_id).
|
||||
-- Добавление отдельного ID только тратит место и не несёт аналитической ценности.
|
||||
|
||||
-- Тип таблицы: Heap (стандартная).
|
||||
-- Обоснование: Необходим row-level UPDATE для обновления статусов (is_boarded).
|
||||
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
|
||||
CREATE TABLE IF NOT EXISTS dds.fact_flight_sales (
|
||||
calendar_sk INTEGER,
|
||||
departure_airport_sk INTEGER,
|
||||
@@ -24,4 +28,7 @@ CREATE TABLE IF NOT EXISTS dds.fact_flight_sales (
|
||||
_load_id TEXT NOT NULL,
|
||||
_load_ts TIMESTAMP NOT NULL DEFAULT now()
|
||||
)
|
||||
WITH (appendonly=false)
|
||||
DISTRIBUTED BY (ticket_no);
|
||||
|
||||
COMMENT ON TABLE dds.fact_flight_sales IS 'Факт продаж билетов (DDS).';
|
||||
|
||||
@@ -4,7 +4,7 @@
|
||||
-- Обновляем только мутабельные поля; SK измерений не перезаписываем.
|
||||
UPDATE dds.fact_flight_sales AS f
|
||||
SET seat_no = bp.seat_no,
|
||||
price = seg.segment_amount,
|
||||
price = seg.amount,
|
||||
is_boarded = (bp.ticket_no IS NOT NULL),
|
||||
_load_id = '{{ run_id }}',
|
||||
_load_ts = now()
|
||||
@@ -16,7 +16,7 @@ WHERE f.ticket_no = seg.ticket_no
|
||||
AND f.flight_id = seg.flight_id
|
||||
AND (
|
||||
f.is_boarded IS DISTINCT FROM (bp.ticket_no IS NOT NULL)
|
||||
OR f.price IS DISTINCT FROM seg.segment_amount
|
||||
OR f.price IS DISTINCT FROM seg.amount
|
||||
OR f.seat_no IS DISTINCT FROM bp.seat_no
|
||||
);
|
||||
|
||||
@@ -36,7 +36,7 @@ WITH fact_src AS (
|
||||
tkt.book_ref,
|
||||
bkg.book_date::DATE AS book_date,
|
||||
bp.seat_no,
|
||||
seg.segment_amount AS price,
|
||||
seg.amount AS price,
|
||||
(bp.ticket_no IS NOT NULL) AS is_boarded
|
||||
FROM ods.segments AS seg
|
||||
JOIN ods.tickets AS tkt
|
||||
@@ -48,8 +48,6 @@ WITH fact_src AS (
|
||||
-- Учебный комментарий: Late-arriving dimensions (Опаздывающие измерения)
|
||||
-- Мы используем LEFT JOIN, так как факт (рейс/билет) может прийти раньше,
|
||||
-- чем справочник (пассажир/маршрут) обновится в DDS.
|
||||
-- В результате SK будет NULL. В более сложных пайплайнах такие факты
|
||||
-- либо обогащаются dummy-значениями (-1, "Неизвестно"), либо откладываются.
|
||||
LEFT JOIN dds.dim_routes AS rte
|
||||
ON rte.route_bk = flt.route_no
|
||||
AND flt.scheduled_departure::DATE >= rte.valid_from
|
||||
@@ -65,7 +63,7 @@ WITH fact_src AS (
|
||||
LEFT JOIN dds.dim_tariffs AS tar
|
||||
ON tar.fare_conditions = seg.fare_conditions
|
||||
LEFT JOIN dds.dim_passengers AS pax
|
||||
ON pax.passenger_bk = tkt.passenger_id
|
||||
ON pax.passenger_id = tkt.passenger_id
|
||||
LEFT JOIN ods.boarding_passes AS bp
|
||||
ON bp.ticket_no = seg.ticket_no
|
||||
AND bp.flight_id = seg.flight_id
|
||||
|
||||
Reference in New Issue
Block a user