Уход от запуска DAG за конкретную дату.

Теперь новый запуск генерирует и переливает новый, следующий день
This commit is contained in:
2025-12-10 21:53:17 +03:00
parent 7a9b2d182e
commit 29490828f4
9 changed files with 80 additions and 62 deletions
+8 -17
View File
@@ -1,10 +1,11 @@
-- Генерация учебного дня в демо-БД bookings.
-- Если данные за указанный день уже существуют, генерация не выполняется.
-- Этот скрипт всегда добавляет следующий учебный день после максимальной даты
-- в таблице bookings.bookings (или несколько дней от стартовой даты, если база пуста).
-- Логическая дата запуска DAG ({{ ds }}) здесь не используется для выбора дня —
-- она служит только меткой батча и попадает в логи/стейдж.
DO $$
DECLARE
v_has_day boolean;
v_load_date date := {{ params.load_date }}::date;
v_max_book_date timestamptz;
v_start_date timestamptz;
v_end_date timestamptz;
@@ -17,19 +18,6 @@ BEGIN
RAISE EXCEPTION 'Таблица bookings.bookings не найдена. Сначала выполните make bookings-init.';
END IF;
-- Проверяем, есть ли уже данные за нужный день
SELECT EXISTS (
SELECT 1
FROM bookings.bookings
WHERE book_date::date = v_load_date
)
INTO v_has_day;
IF v_has_day THEN
RAISE NOTICE 'Данные за % уже есть в bookings.bookings — генерация не требуется.', v_load_date;
RETURN;
END IF;
-- Ищем последнюю сгенерированную дату
SELECT max(book_date) INTO v_max_book_date FROM bookings.bookings;
@@ -50,10 +38,13 @@ BEGIN
CALL continue(v_end_date, v_jobs);
END IF;
RAISE NOTICE 'Сгенерированы данные в bookings.bookings за интервал [% - %).',
date_trunc('day', v_start_date),
date_trunc('day', v_end_date);
-- Ждём завершения фоновых джобов генератора, чтобы данные успели записаться
WHILE busy() LOOP
PERFORM pg_sleep(1);
END LOOP;
PERFORM dblink_disconnect(unnest(dblink_get_connections()));
END $$;
+8 -15
View File
@@ -1,10 +1,10 @@
-- Проверка количества строк между источником stg.bookings_ext и стейджем stg.bookings.
-- Считаем строки за то же окно инкремента, что и при загрузке,
-- используя batch_id и "старый" максимум src_created_at_ts.
-- Считаем строки за то же окно инкремента, что и при загрузке:
-- все записи во внешней таблице с book_date больше максимального src_created_at_ts
-- из предыдущих батчей должны совпасть по количеству со строками текущего batch_id.
DO $$
DECLARE
v_load_date date := {{ params.load_date }}::date;
v_batch_id text := {{ params.batch_id | tojson }}::text;
v_prev_ts timestamp;
v_src_count bigint;
@@ -17,17 +17,11 @@ BEGIN
WHERE batch_id <> v_batch_id
OR batch_id IS NULL;
IF v_prev_ts IS NULL THEN
-- Полная загрузка: считаем все строки во внешней таблице
SELECT COUNT(*) INTO v_src_count FROM stg.bookings_ext;
ELSE
-- Инкремент: считаем только строки за текущее окно
SELECT COUNT(*)
INTO v_src_count
FROM stg.bookings_ext
WHERE book_date > v_prev_ts
AND book_date <= (v_load_date + INTERVAL '1 day');
END IF;
-- Источник: считаем строки во внешней таблице, которые вошли в новое окно
SELECT COUNT(*)
INTO v_src_count
FROM stg.bookings_ext
WHERE book_date > COALESCE(v_prev_ts, TIMESTAMP '1900-01-01 00:00:00');
-- Считаем строки, реально вставленные в stg.bookings в этом батче
SELECT COUNT(*)
@@ -47,4 +41,3 @@ BEGIN
v_src_count,
v_stg_count;
END $$;
+3 -5
View File
@@ -1,7 +1,7 @@
-- Загрузка инкремента из stg.bookings_ext в stg.bookings.
-- Окно инкремента определяется по src_created_at_ts:
-- берем строки, где book_date больше максимального src_created_at_ts
-- среди "старых" батчей и не позже конца учебного дня.
-- берём строки, где book_date больше максимального src_created_at_ts
-- среди "старых" батчей; верхняя граница по дате не используется.
INSERT INTO stg.bookings (
book_ref,
@@ -27,6 +27,4 @@ WHERE book_date > COALESCE(
OR batch_id IS NULL
),
TIMESTAMP '1900-01-01 00:00:00'
)
AND book_date <= ({{ params.load_date }}::date + INTERVAL '1 day');
);