feat(sql): явное управление storage и автоматизированный E2E-тест через REST API

- Зачем:
  - необходимо визуализировать выбор типа хранения (Heap vs Append-Only) для учебных целей.
  - автоматизировать проверку всей цепочки DWH для исключения ручных ошибок.
  - сделать процесс отладки прозрачным и наглядным через стандартные инструменты Airflow.
- Что:
  - внедрена клауза WITH (appendonly=...) во все DDL; ODS-справочники переведены на AO Row и TRUNCATE+INSERT.
  - создан скрипт scripts/e2e_etl.sh для полного прогона ETL (DDL + 2 дня данных) через REST API.
  - исправлены баги типизации (INTEGER[]), именования полей (amount, passenger_id) и удалены фантомные колонки (contact_data).
  - обновлен e2e-etl-test-protocol.md: добавлен раздел по отладке, чтению логов и перезапуску задач через API.
  - исправлены pytest-контракты под новую логику загрузки.
- Проверка:
  - успешный прогон `make e2e-smoke` (полный цикл от очистки до витрины).
This commit is contained in:
2026-03-03 22:38:26 +03:00
parent dd6274b948
commit 22a0590e1b
34 changed files with 484 additions and 526 deletions
+6
View File
@@ -2,6 +2,9 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Append-Only Row-oriented (zstd:1).
-- Обоснование: Используется паттерн TRUNCATE+INSERT (полный снимок).
-- Для узких таблиц Row-store производительнее Column-store при чтении всей строки.
CREATE TABLE IF NOT EXISTS ods.airplanes (
airplane_code TEXT NOT NULL,
model TEXT NOT NULL,
@@ -10,4 +13,7 @@ CREATE TABLE IF NOT EXISTS ods.airplanes (
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=true, orientation=row, compresstype=zstd, compresslevel=1)
DISTRIBUTED BY (airplane_code);
COMMENT ON TABLE ods.airplanes IS 'Справочник моделей самолетов (ODS).';
+19 -76
View File
@@ -1,52 +1,9 @@
-- Загрузка ODS по airplanes: SCD1 (UPDATE изменившихся + INSERT новых).
-- Загрузка ODS по airplanes: Полная перезагрузка (TRUNCATE + INSERT).
-- Почему: для справочников-снимков в Greenplum на AO-таблицах
-- эффективнее перетереть данные целиком, чем делать медленный UPDATE.
-- Statement 1: UPDATE существующих строк.
-- Нормализация JSON: извлекаем русское название модели из поля с мультиязычностью.
-- Почему: источник хранит переводы как {"en": "...", "ru": "..."},
-- в ODS оставляем только один язык для упрощения downstream-логики.
WITH src AS (
SELECT
s.airplane_code,
s.model::json->>'ru' AS model,
NULLIF(s.range, '')::INTEGER AS range_km,
NULLIF(s.speed, '')::INTEGER AS speed_kmh,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airplanes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
UPDATE ods.airplanes AS o
SET model = s.model,
range_km = s.range_km,
speed_kmh = s.speed_kmh,
_load_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
_load_ts = now()
FROM src AS s
WHERE s.rn = 1
AND o.airplane_code = s.airplane_code
AND (
o.model IS DISTINCT FROM s.model
OR o.range_km IS DISTINCT FROM s.range_km
OR o.speed_kmh IS DISTINCT FROM s.speed_kmh
);
TRUNCATE TABLE ods.airplanes;
-- Statement 2: INSERT новых строк.
-- Нормализация JSON: извлекаем русское название модели из поля с мультиязычностью.
WITH src AS (
SELECT
s.airplane_code,
s.model::json->>'ru' AS model,
NULLIF(s.range, '')::INTEGER AS range_km,
NULLIF(s.speed, '')::INTEGER AS speed_kmh,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airplanes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
INSERT INTO ods.airplanes (
airplane_code,
model,
@@ -55,6 +12,20 @@ INSERT INTO ods.airplanes (
_load_id,
_load_ts
)
WITH src AS (
-- Выбираем последний снимок из STG для текущего батча
SELECT
s.airplane_code,
s.model::json->>'ru' AS model,
NULLIF(s.range, '')::INTEGER AS range_km,
NULLIF(s.speed, '')::INTEGER AS speed_kmh,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airplanes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
SELECT
s.airplane_code,
s.model,
@@ -63,34 +34,6 @@ SELECT
'{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
now()
FROM src AS s
WHERE s.rn = 1
AND NOT EXISTS (
SELECT 1
FROM ods.airplanes AS o
WHERE o.airplane_code = s.airplane_code
);
-- Statement 3: DELETE ключей, которых нет в snapshot текущего батча.
-- Это делает ODS для справочника действительно "current state".
WITH src_keys AS (
SELECT d.airplane_code
FROM (
SELECT
s.airplane_code,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airplanes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
) AS d
WHERE d.rn = 1
)
DELETE FROM ods.airplanes AS o
WHERE NOT EXISTS (
SELECT 1
FROM src_keys AS s
WHERE s.airplane_code = o.airplane_code
);
WHERE s.rn = 1;
ANALYZE ods.airplanes;
+6
View File
@@ -2,6 +2,9 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Append-Only Row-oriented (zstd:1).
-- Обоснование: Используется паттерн TRUNCATE+INSERT (полный снимок).
-- Для узких таблиц Row-store производительнее Column-store при чтении всей строки.
CREATE TABLE IF NOT EXISTS ods.airports (
airport_code TEXT NOT NULL,
airport_name TEXT NOT NULL,
@@ -12,4 +15,7 @@ CREATE TABLE IF NOT EXISTS ods.airports (
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=true, orientation=row, compresstype=zstd, compresslevel=1)
DISTRIBUTED BY (airport_code);
COMMENT ON TABLE ods.airports IS 'Справочник аэропортов (ODS).';
+21 -84
View File
@@ -1,60 +1,9 @@
-- Загрузка ODS по airports: SCD1 (UPDATE изменившихся + INSERT новых).
-- Загрузка ODS по airports: Полная перезагрузка (TRUNCATE + INSERT).
-- Почему: для справочников-снимков в Greenplum на AO-таблицах
-- эффективнее перетереть данные целиком, чем делать медленный UPDATE.
-- Statement 1: UPDATE существующих строк.
-- Нормализация JSON: извлекаем русские названия из полей с мультиязычностью.
-- Почему: источник хранит переводы как {"en": "...", "ru": "..."},
-- в ODS оставляем только один язык для упрощения downstream-логики.
WITH src AS (
SELECT
s.airport_code,
s.airport_name::json->>'ru' AS airport_name,
s.city::json->>'ru' AS city,
s.country::json->>'ru' AS country,
s.coordinates,
s.timezone,
ROW_NUMBER() OVER (
PARTITION BY s.airport_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airports AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
UPDATE ods.airports AS o
SET airport_name = s.airport_name,
city = s.city,
country = s.country,
coordinates = s.coordinates,
timezone = s.timezone,
_load_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
_load_ts = now()
FROM src AS s
WHERE s.rn = 1
AND o.airport_code = s.airport_code
AND (
o.airport_name IS DISTINCT FROM s.airport_name
OR o.city IS DISTINCT FROM s.city
OR o.country IS DISTINCT FROM s.country
OR o.coordinates IS DISTINCT FROM s.coordinates
OR o.timezone IS DISTINCT FROM s.timezone
);
TRUNCATE TABLE ods.airports;
-- Statement 2: INSERT новых строк.
-- Нормализация JSON: извлекаем русские названия из полей с мультиязычностью.
WITH src AS (
SELECT
s.airport_code,
s.airport_name::json->>'ru' AS airport_name,
s.city::json->>'ru' AS city,
s.country::json->>'ru' AS country,
s.coordinates,
s.timezone,
ROW_NUMBER() OVER (
PARTITION BY s.airport_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airports AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
INSERT INTO ods.airports (
airport_code,
airport_name,
@@ -65,6 +14,22 @@ INSERT INTO ods.airports (
_load_id,
_load_ts
)
WITH src AS (
-- Выбираем последний снимок из STG для текущего батча
SELECT
s.airport_code,
s.airport_name::json->>'ru' AS airport_name,
s.city::json->>'ru' AS city,
s.country::json->>'ru' AS country,
s.coordinates,
s.timezone,
ROW_NUMBER() OVER (
PARTITION BY s.airport_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airports AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
SELECT
s.airport_code,
s.airport_name,
@@ -75,34 +40,6 @@ SELECT
'{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
now()
FROM src AS s
WHERE s.rn = 1
AND NOT EXISTS (
SELECT 1
FROM ods.airports AS o
WHERE o.airport_code = s.airport_code
);
-- Statement 3: DELETE ключей, которых нет в snapshot текущего батча.
-- Это делает ODS для справочника действительно "current state".
WITH src_keys AS (
SELECT d.airport_code
FROM (
SELECT
s.airport_code,
ROW_NUMBER() OVER (
PARTITION BY s.airport_code
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.airports AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
) AS d
WHERE d.rn = 1
)
DELETE FROM ods.airports AS o
WHERE NOT EXISTS (
SELECT 1
FROM src_keys AS s
WHERE s.airport_code = o.airport_code
);
WHERE s.rn = 1;
ANALYZE ods.airports;
+6
View File
@@ -2,6 +2,9 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Heap (стандартная).
-- Обоснование: Необходим row-level UPDATE для реализации UPSERT/SCD1.
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
CREATE TABLE IF NOT EXISTS ods.boarding_passes (
ticket_no TEXT NOT NULL,
flight_id INTEGER NOT NULL,
@@ -12,4 +15,7 @@ CREATE TABLE IF NOT EXISTS ods.boarding_passes (
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=false)
DISTRIBUTED BY (ticket_no);
COMMENT ON TABLE ods.boarding_passes IS 'Посадочные талоны (ODS).';
+6
View File
@@ -2,6 +2,9 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Heap (стандартная).
-- Обоснование: Необходим row-level UPDATE для реализации UPSERT/SCD1.
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
CREATE TABLE IF NOT EXISTS ods.bookings (
book_ref TEXT NOT NULL,
book_date TIMESTAMP WITH TIME ZONE NOT NULL,
@@ -10,4 +13,7 @@ CREATE TABLE IF NOT EXISTS ods.bookings (
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=false)
DISTRIBUTED BY (book_ref);
COMMENT ON TABLE ods.bookings IS 'Бронирования (ODS).';
+6
View File
@@ -2,6 +2,9 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Heap (стандартная).
-- Обоснование: Необходим row-level UPDATE для реализации UPSERT/SCD1.
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
CREATE TABLE IF NOT EXISTS ods.flights (
flight_id INTEGER NOT NULL,
route_no TEXT NOT NULL,
@@ -14,4 +17,7 @@ CREATE TABLE IF NOT EXISTS ods.flights (
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=false)
DISTRIBUTED BY (flight_id);
COMMENT ON TABLE ods.flights IS 'Рейсы (ODS).';
+10 -4
View File
@@ -2,16 +2,22 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Append-Only Row-oriented (zstd:1).
-- Обоснование: Используется паттерн TRUNCATE+INSERT (полный снимок).
-- Для узких таблиц Row-store производительнее Column-store при чтении всей строки.
CREATE TABLE IF NOT EXISTS ods.routes (
route_no TEXT NOT NULL,
validity TEXT NOT NULL,
departure_airport TEXT NOT NULL,
arrival_airport TEXT NOT NULL,
airplane_code TEXT NOT NULL,
days_of_week TEXT,
departure_time TIME,
duration INTERVAL,
days_of_week INTEGER[],
departure_time TIME NOT NULL,
duration INTERVAL NOT NULL,
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
DISTRIBUTED BY (route_no);
WITH (appendonly=true, orientation=row, compresstype=zstd, compresslevel=1)
DISTRIBUTED BY (route_no, validity);
COMMENT ON TABLE ods.routes IS 'Справочник маршрутов (ODS).';
+24 -91
View File
@@ -1,63 +1,9 @@
-- Загрузка ODS по routes: SCD1 (UPDATE изменившихся + INSERT новых).
-- Загрузка ODS по routes: Полная перезагрузка (TRUNCATE + INSERT).
-- Почему: для справочников-снимков в Greenplum на AO-таблицах
-- эффективнее перетереть данные целиком, чем делать медленный UPDATE.
-- Statement 1: UPDATE существующих строк.
WITH src AS (
SELECT
s.route_no,
s.validity,
s.departure_airport,
s.arrival_airport,
s.airplane_code,
s.days_of_week,
NULLIF(s.scheduled_time, '')::TIME AS departure_time,
NULLIF(s.duration, '')::INTERVAL AS duration,
ROW_NUMBER() OVER (
PARTITION BY s.route_no, s.validity
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.routes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
UPDATE ods.routes AS o
SET departure_airport = s.departure_airport,
arrival_airport = s.arrival_airport,
airplane_code = s.airplane_code,
days_of_week = s.days_of_week,
departure_time = s.departure_time,
duration = s.duration,
_load_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
_load_ts = now()
FROM src AS s
WHERE s.rn = 1
AND o.route_no = s.route_no
AND o.validity = s.validity
AND (
o.departure_airport IS DISTINCT FROM s.departure_airport
OR o.arrival_airport IS DISTINCT FROM s.arrival_airport
OR o.airplane_code IS DISTINCT FROM s.airplane_code
OR o.days_of_week IS DISTINCT FROM s.days_of_week
OR o.departure_time IS DISTINCT FROM s.departure_time
OR o.duration IS DISTINCT FROM s.duration
);
TRUNCATE TABLE ods.routes;
-- Statement 2: INSERT новых строк.
WITH src AS (
SELECT
s.route_no,
s.validity,
s.departure_airport,
s.arrival_airport,
s.airplane_code,
s.days_of_week,
NULLIF(s.scheduled_time, '')::TIME AS departure_time,
NULLIF(s.duration, '')::INTERVAL AS duration,
ROW_NUMBER() OVER (
PARTITION BY s.route_no, s.validity
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.routes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
INSERT INTO ods.routes (
route_no,
validity,
@@ -70,49 +16,36 @@ INSERT INTO ods.routes (
_load_id,
_load_ts
)
WITH src AS (
-- Выбираем последний снимок из STG для текущего батча
SELECT
s.route_no,
s.validity,
s.departure_airport,
s.arrival_airport,
s.airplane_code,
s.days_of_week::INTEGER[] AS days_of_week,
NULLIF(s.scheduled_time, '')::TIME AS departure_time,
NULLIF(s.duration, '')::INTERVAL AS duration,
ROW_NUMBER() OVER (
PARTITION BY s.route_no, s.validity
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.routes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
SELECT
s.route_no,
s.validity,
s.departure_airport,
s.arrival_airport,
s.airplane_code,
s.days_of_week,
s.days_of_week::INTEGER[],
s.departure_time,
s.duration,
'{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
now()
FROM src AS s
WHERE s.rn = 1
AND NOT EXISTS (
SELECT 1
FROM ods.routes AS o
WHERE o.route_no = s.route_no
AND o.validity = s.validity
);
-- Statement 3: DELETE ключей, которых нет в snapshot текущего батча.
-- Это делает ODS для справочника действительно "current state".
WITH src_keys AS (
SELECT d.route_no, d.validity
FROM (
SELECT
s.route_no,
s.validity,
ROW_NUMBER() OVER (
PARTITION BY s.route_no, s.validity
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.routes AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
) AS d
WHERE d.rn = 1
)
DELETE FROM ods.routes AS o
WHERE NOT EXISTS (
SELECT 1
FROM src_keys AS s
WHERE s.route_no = o.route_no
AND s.validity = o.validity
);
WHERE s.rn = 1;
ANALYZE ods.routes;
+11 -5
View File
@@ -2,11 +2,17 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Append-Only Row-oriented (zstd:1).
-- Обоснование: Используется паттерн TRUNCATE+INSERT (полный снимок).
-- Для узких таблиц Row-store производительнее Column-store при чтении всей строки.
CREATE TABLE IF NOT EXISTS ods.seats (
airplane_code TEXT NOT NULL,
seat_no TEXT NOT NULL,
fare_conditions TEXT NOT NULL,
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
airplane_code TEXT NOT NULL,
seat_no TEXT NOT NULL,
fare_conditions TEXT NOT NULL,
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=true, orientation=row, compresstype=zstd, compresslevel=1)
DISTRIBUTED BY (airplane_code);
COMMENT ON TABLE ods.seats IS 'Справочник мест в самолетах (ODS).';
+18 -68
View File
@@ -1,41 +1,9 @@
-- Загрузка ODS по seats: SCD1 (UPDATE изменившихся + INSERT новых).
-- Загрузка ODS по seats: Полная перезагрузка (TRUNCATE + INSERT).
-- Почему: для справочников-снимков в Greenplum на AO-таблицах
-- эффективнее перетереть данные целиком, чем делать медленный UPDATE.
-- Statement 1: UPDATE существующих строк.
WITH src AS (
SELECT
s.airplane_code,
s.seat_no,
s.fare_conditions,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code, s.seat_no
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.seats AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
UPDATE ods.seats AS o
SET fare_conditions = s.fare_conditions,
_load_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
_load_ts = now()
FROM src AS s
WHERE s.rn = 1
AND o.airplane_code = s.airplane_code
AND o.seat_no = s.seat_no
AND o.fare_conditions IS DISTINCT FROM s.fare_conditions;
TRUNCATE TABLE ods.seats;
-- Statement 2: INSERT новых строк.
WITH src AS (
SELECT
s.airplane_code,
s.seat_no,
s.fare_conditions,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code, s.seat_no
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.seats AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
INSERT INTO ods.seats (
airplane_code,
seat_no,
@@ -43,6 +11,19 @@ INSERT INTO ods.seats (
_load_id,
_load_ts
)
WITH src AS (
-- Выбираем последний снимок из STG для текущего батча
SELECT
s.airplane_code,
s.seat_no,
s.fare_conditions,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code, s.seat_no
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.seats AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
)
SELECT
s.airplane_code,
s.seat_no,
@@ -50,37 +31,6 @@ SELECT
'{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text,
now()
FROM src AS s
WHERE s.rn = 1
AND NOT EXISTS (
SELECT 1
FROM ods.seats AS o
WHERE o.airplane_code = s.airplane_code
AND o.seat_no = s.seat_no
);
-- Statement 3: DELETE ключей, которых нет в snapshot текущего батча.
-- Это делает ODS для справочника действительно "current state".
WITH src_keys AS (
SELECT d.airplane_code, d.seat_no
FROM (
SELECT
s.airplane_code,
s.seat_no,
ROW_NUMBER() OVER (
PARTITION BY s.airplane_code, s.seat_no
ORDER BY s.load_dttm DESC, s.src_created_at_ts DESC NULLS LAST
) AS rn
FROM stg.seats AS s
WHERE s.batch_id = '{{ ti.xcom_pull(task_ids="resolve_stg_batch_id") }}'::text
) AS d
WHERE d.rn = 1
)
DELETE FROM ods.seats AS o
WHERE NOT EXISTS (
SELECT 1
FROM src_keys AS s
WHERE s.airplane_code = o.airplane_code
AND s.seat_no = o.seat_no
);
WHERE s.rn = 1;
ANALYZE ods.seats;
+14 -7
View File
@@ -2,13 +2,20 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Heap (стандартная).
-- Обоснование: Необходим row-level UPDATE для реализации UPSERT/SCD1.
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
CREATE TABLE IF NOT EXISTS ods.segments (
ticket_no TEXT NOT NULL,
flight_id INTEGER NOT NULL,
fare_conditions TEXT NOT NULL,
segment_amount NUMERIC(10,2),
event_ts TIMESTAMP,
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
ticket_no TEXT NOT NULL,
flight_id INTEGER NOT NULL,
fare_conditions TEXT NOT NULL,
amount NUMERIC(10,2) NOT NULL,
event_ts TIMESTAMP,
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=false)
DISTRIBUTED BY (ticket_no);
COMMENT ON TABLE ods.segments IS 'Сегменты перелета (ODS).';
+5 -5
View File
@@ -8,7 +8,7 @@ WITH src AS (
s.ticket_no,
NULLIF(s.flight_id, '')::INTEGER AS flight_id,
s.fare_conditions,
NULLIF(s.price, '')::NUMERIC(10,2) AS segment_amount,
NULLIF(s.price, '')::NUMERIC(10,2) AS amount,
s.src_created_at_ts AS event_ts,
s.batch_id,
s.load_dttm,
@@ -25,7 +25,7 @@ SELECT * FROM src WHERE rn = 1;
-- 2. UPDATE существующих строк.
UPDATE ods.segments AS o
SET fare_conditions = s.fare_conditions,
segment_amount = s.segment_amount,
amount = s.amount,
event_ts = s.event_ts,
_load_id = s.batch_id, -- Сохраняем оригинальный lineage из STG
_load_ts = s.load_dttm -- Фиксируем время STG как водяной знак для ODS
@@ -34,7 +34,7 @@ WHERE o.ticket_no = s.ticket_no
AND o.flight_id = s.flight_id
AND (
o.fare_conditions IS DISTINCT FROM s.fare_conditions
OR o.segment_amount IS DISTINCT FROM s.segment_amount
OR o.amount IS DISTINCT FROM s.amount
OR o.event_ts IS DISTINCT FROM s.event_ts
);
@@ -43,7 +43,7 @@ INSERT INTO ods.segments (
ticket_no,
flight_id,
fare_conditions,
segment_amount,
amount,
event_ts,
_load_id,
_load_ts
@@ -52,7 +52,7 @@ SELECT
s.ticket_no,
s.flight_id,
s.fare_conditions,
s.segment_amount,
s.amount,
s.event_ts,
s.batch_id,
s.load_dttm
+6
View File
@@ -2,6 +2,9 @@
CREATE SCHEMA IF NOT EXISTS ods;
-- Тип таблицы: Heap (стандартная).
-- Обоснование: Необходим row-level UPDATE для реализации UPSERT/SCD1.
-- Использование Append-Only при частых обновлениях приводит к раздуванию (bloat) таблицы.
CREATE TABLE IF NOT EXISTS ods.tickets (
ticket_no TEXT NOT NULL,
book_ref TEXT NOT NULL,
@@ -12,4 +15,7 @@ CREATE TABLE IF NOT EXISTS ods.tickets (
_load_id TEXT NOT NULL,
_load_ts TIMESTAMP NOT NULL DEFAULT now()
)
WITH (appendonly=false)
DISTRIBUTED BY (ticket_no);
COMMENT ON TABLE ods.tickets IS 'Билеты (ODS).';