Files
clickstream-data-platform/generator/tests/test_day.py
T
ddadminandClaude Opus 5 eb433ad023 feat(generator): день-функция — трафик, визиты и просмотры страниц
Зачем: план состава отдаёт дневную аудиторию, но событий у мира ещё не было.
День-функция превращает аудиторию в поток просмотров — на нём стоят лабы про
сборку визитов и про витрины, а следующий этап вешает на него торговые события.

Что:
- `day.py` — день как чистая функция зерна и номера дня: суточная волна в
  местном времени посетителя, визиты по документированным правилам нарезки,
  все 47 колонок выгрузки; шов для торговых событий — ряды `page` и `product`;
- `reference.py` — справочники-литералы: профили устройств, города Поволжья с
  настоящими гео-id Яндекса, источники трафика, карта сайта;
- `catalog.py` и `data/catalog/products.csv` — каталог на 180 позиций, общий у
  генератора и будущего словаря ClickHouse;
- `weights.py` — выбор по целым весам, один на план и на день;
- паспорт куки (устройство и город) переехал в план состава; броски приписаны
  последними, поэтому измеренные числа канонического мира не сдвинулись;
- словарь: «визит» закреплён за сессией, одноимённое понятие плана стало
  «днём активности»; статьи в `CONTEXT.md`;
- решения по ходу — в спеку генератора, раздел 9; наполнение
  `ParsedParamsKey1` отложено тикетом #47.

Проверка: `make lint`, `make typecheck`, `make test` — 353 passed (было 297).
Счётчики плана после правки те же: приток 3827,64/день, дневная аудитория
6235–7124, 68 119 посетителей за 14 дней, 170 двухкуковых пар. День 0 —
45 810 событий за 0,6 с, снимок 14 дней — 5,9 с при пороге 30 с на день.
Две слепые линии ревью, десять находок, все закрыты и перепроверены.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-02 16:12:17 +03:00

358 lines
16 KiB
Python

"""День-функция: чистота, форма волны, правила резки визитов, шов для #40.
Числа мира тесты сторожат вилками спеки, а не точными значениями: менти
крутит конфигурацию, и падать тесты должны там, где сдвинулся вывод («средний
день ~50 тыс. событий», «ночью провал, вечером пик»), а не при каждой правке.
"""
import inspect
import re
from dataclasses import replace
from typing import Any
import numpy as np
import pytest
from numpy.typing import NDArray
from clickstream_generator import catalog, day, plan, reference, schema, world
from clickstream_generator.reference import Page
from clickstream_generator.seeds import CANONICAL_SEED
WEEKDAY = 2
WEEKEND = 5
@pytest.fixture(autouse=True)
def fresh_memo():
"""Когорты запоминаются; тесты сравнивают вычисления, а не ссылки."""
plan.cohort.cache_clear()
@pytest.fixture(scope="module")
def weekday() -> day.Day:
"""Один буднийный день на весь модуль: пересчитывать его тестам незачем."""
return day.stream(CANONICAL_SEED, WEEKDAY)
def readable(column: NDArray[Any]) -> list[Any]:
"""Колонка в сравнимом виде: массив внутри ячейки — в список."""
if column.dtype == object:
return [
cell.tolist() if isinstance(cell, np.ndarray) else cell for cell in column
]
return column.tolist()
def snapshot(events: day.Day) -> dict[str, Any]:
"""Слепок дня для сравнений: всё, что день отдал наружу.
Порядок колонок в слепке живёт отдельным списком: словари сравниваются
без оглядки на него, а порядок — часть обещания (он же порядок
контракта схемы). Швы `page` и `product` — тоже часть отдаваемого, и
сторожить их надо тем же слепком, а не отдельной памятью.
"""
return {
"order": list(events.columns),
"values": [readable(column) for column in events.columns.values()],
"page": events.page.tolist(),
"product": events.product.tolist(),
}
def local_seconds(events: day.Day) -> NDArray[np.int64]:
"""Секунда события внутри модельных суток — в поясе счётчика."""
midnight = np.datetime64(world.ORIGIN, "s") + np.timedelta64(events.day, "D")
away = np.timedelta64(world.COUNTER_TIMEZONE_MINUTES, "m")
return (events.columns["UTCEventTime"] - midnight + away).astype("int64")
def hourly(events: day.Day) -> NDArray[np.int64]:
return np.bincount(local_seconds(events) // 3600, minlength=24)
def test_the_snapshot_notices_everything_the_day_hands_out(weekday: day.Day):
"""Сторож сторожей: слепок обязан замечать порядок колонок и швы.
Слепок слепой к чему-нибудь — это три зелёных теста детерминизма при
поехавшем выводе, а не одна пропущенная мелочь.
"""
original = snapshot(weekday)
reordered = day.Day(
day=weekday.day,
columns=dict(reversed(list(weekday.columns.items()))),
page=weekday.page,
product=weekday.product,
)
assert snapshot(reordered) != original
moved = weekday.product.copy()
moved[0] += 1
assert snapshot(replace(weekday, product=moved)) != original
shifted = weekday.page.copy()
shifted[0] += 1
assert snapshot(replace(weekday, page=shifted)) != original
def test_a_day_is_a_pure_function_of_the_seed_and_the_day():
first = snapshot(day.stream(CANONICAL_SEED, 3))
plan.cohort.cache_clear()
assert snapshot(day.stream(CANONICAL_SEED, 3)) == first
def test_a_day_generated_alone_is_the_same_day():
"""День D не зависит от того, прожиты ли дни до него."""
alone = snapshot(day.stream(CANONICAL_SEED, 3))
plan.cohort.cache_clear()
for earlier in range(3):
day.stream(CANONICAL_SEED, earlier)
assert snapshot(day.stream(CANONICAL_SEED, 3)) == alone
def test_the_next_day_does_not_move_the_days_before_it():
before = [snapshot(day.stream(CANONICAL_SEED, number)) for number in range(2)]
day.stream(CANONICAL_SEED, 2)
assert [snapshot(day.stream(CANONICAL_SEED, n)) for n in range(2)] == before
def test_another_seed_is_another_day():
ours = snapshot(day.stream(CANONICAL_SEED, 1))
assert snapshot(day.stream(CANONICAL_SEED + 1, 1)) != ours
def test_events_do_not_start_before_the_origin():
with pytest.raises(ValueError):
day.stream(CANONICAL_SEED, -1)
def test_every_column_of_the_contract_is_present_and_typed(weekday: day.Day):
"""Состав колонок решает контракт схемы; день обязан отдать их все."""
assert list(weekday.columns) == [column.name for column in schema.COLUMNS]
for column in schema.COLUMNS:
values = weekday.columns[column.name]
assert values.size == len(weekday), column.name
if column.clickhouse_type.startswith("Array("):
cells = {cell.dtype for cell in values[:1000]}
assert cells == {np.dtype(column.numpy_dtype)}, column.name
else:
assert values.dtype == np.dtype(column.numpy_dtype), column.name
def test_what_is_left_to_the_trade_ticket_is_empty_not_missing(weekday: day.Day):
"""Пусто — пустой массив и пустая строка, а ключ есть у каждого события.
Проверяются все колонки будущих торговых событий, а не выбранные: тикет
#40 добавит свои, и они должны попасть под тот же сторож.
"""
waiting = [
column
for column in schema.COLUMNS
if column.group in (schema.ColumnGroup.ECOMMERCE, schema.ColumnGroup.PARAMS)
]
assert len(waiting) > 10
for column in waiting:
cells = weekday.columns[column.name][:1000]
if column.clickhouse_type.startswith("Array("):
assert all(cell.size == 0 for cell in cells), column.name
else:
assert set(cells) == {""}, column.name
assert set(weekday.columns["EventType"].tolist()) == {"pageview"}
def test_no_column_hides_a_hole(weekday: day.Day):
"""`None` в колонке — та же пропажа ключа, только позже и незаметнее."""
for column in schema.COLUMNS:
values = weekday.columns[column.name]
if values.dtype != object:
continue
kind = np.ndarray if column.clickhouse_type.startswith("Array(") else str
assert all(isinstance(cell, kind) for cell in values[:1000]), column.name
def test_identifiers_survive_json(weekday: day.Day):
"""Числа выше 2^53 в JSON округляются — идентификаторам столько не нужно."""
for name in ("WatchID", "VisitID", "ClientID"):
assert weekday.columns[name].max() < day.ID_LIMIT
assert weekday.columns[name].dtype == np.uint64
def test_the_event_id_is_unique_because_it_deduplicates(weekday: day.Day):
"""`WatchID` — ключ склейки при переигровке дня (спека, раздел 4)."""
watch = weekday.columns["WatchID"]
assert len(set(watch.tolist())) == watch.size
def test_a_visit_belongs_to_one_cookie(weekday: day.Day):
visit = weekday.columns["VisitID"]
cookie = weekday.columns["ClientID"]
pairs = set(zip(visit.tolist(), cookie.tolist(), strict=True))
assert len(pairs) == len(set(visit.tolist()))
def test_the_visit_cutting_rules_rebuild_the_generator_visits(weekday: day.Day):
"""Правило лабы: та же кука, пауза не длиннее таймаута — тот же визит.
Сборка сессий по правилам из докстринга модуля обязана совпасть с
`VisitID` — на этой сверке стоит лаба сессий.
"""
second = local_seconds(weekday)
cookie = weekday.columns["ClientID"]
order = np.lexsort((second, cookie))
cookie, second = cookie[order], second[order]
visit = weekday.columns["VisitID"][order]
started = np.ones(visit.size, dtype=bool)
started[1:] = (cookie[1:] != cookie[:-1]) | (
second[1:] - second[:-1] > world.VISIT_TIMEOUT_SECONDS
)
rebuilt = np.cumsum(started)
# Совпадение обоюдное: сколько пар «собранный визит — `VisitID`», столько
# же и тех, и других. Одного равенства мало — оно ловит только склейку
# двух визитов в один, а разрыв одного визита надвое проходит мимо.
matched = set(zip(rebuilt.tolist(), visit.tolist(), strict=True))
assert len(matched) == int(rebuilt.max())
assert len(matched) == len(set(visit.tolist()))
def test_the_day_boundary_cuts_the_visits(weekday: day.Day):
"""Событий за границей модельных суток в дне нет — партиция дня целая."""
second = local_seconds(weekday)
assert second.min() >= 0
assert second.max() < day.DAY_SECONDS
date = np.datetime64(world.ORIGIN, "D") + np.timedelta64(weekday.day, "D")
assert set(weekday.columns["EventDate"].tolist()) == {date.astype("O")}
def test_the_counter_timezone_moves_the_date_apart_from_utc(weekday: day.Day):
"""`toDate(UTCEventTime)` ≠ `EventDate`: сутки считаются в поясе счётчика."""
utc_date = weekday.columns["UTCEventTime"].astype("datetime64[D]")
assert np.any(utc_date != weekday.columns["EventDate"])
def test_the_scale_of_an_average_day_is_about_fifty_thousand(weekday: day.Day):
"""Порядок величины (спека, раздел 5); итог сложится после #40."""
assert 30_000 < len(weekday) < 70_000
visits = len(set(weekday.columns["VisitID"].tolist()))
assert 6_000 < visits < 14_000
def test_the_wave_dips_at_night_and_peaks_in_the_evening(weekday: day.Day):
counters = hourly(weekday)
average = counters.mean()
assert counters[2:6].max() < average / 2
assert counters[18:22].max() > 1.5 * average
assert 0 <= int(counters.argmin()) <= 6
assert 11 <= int(counters.argmax()) <= 22
def test_the_weekend_is_shaped_unlike_a_weekday(weekday: day.Day):
"""Форма, а не объём: выходной раскачивается позже буднего."""
weekend = hourly(day.stream(CANONICAL_SEED, WEEKEND))
workday = hourly(weekday)
morning = slice(7, 10)
assert weekend[morning].sum() / weekend.sum() < (
workday[morning].sum() / workday.sum()
)
def test_the_funnel_converts_about_two_percent_of_visits(weekday: day.Day):
visits = len(set(weekday.columns["VisitID"].tolist()))
ordered = int((weekday.page == Page.CONFIRMATION).sum())
assert 0.01 < ordered / visits < 0.04
def test_the_promised_orders_reach_the_confirmation(weekday: day.Day):
"""Гарантия двухкуковых пар: назначенный планом заказ обязан состояться."""
audience = plan.audience(CANONICAL_SEED, weekday.day)
promised = set(audience.client_id[audience.assigned_order].tolist())
assert promised
confirmed = weekday.columns["ClientID"][weekday.page == Page.CONFIRMATION]
assert promised <= set(confirmed.tolist())
def test_the_cart_always_follows_a_product_card(weekday: day.Day):
"""Шов для #40: товар в корзине посетитель до того открывал."""
order = np.lexsort((local_seconds(weekday), weekday.columns["VisitID"]))
by_visit = weekday.page[order]
carts = np.flatnonzero(by_visit == Page.CART)
assert carts.size > 0
assert np.all(by_visit[carts - 1] == Page.PRODUCT)
def test_the_product_of_a_card_is_the_seam_for_trade_events(weekday: day.Day):
"""`product` — товар карточки и −1 у прочих страниц; больше ничего."""
goods = catalog.catalog()
card = weekday.page == Page.PRODUCT
assert np.all(weekday.product[~card] == -1)
assert np.all(weekday.product[card] >= 0)
assert np.all(weekday.product[card] < goods.sku.size)
shown = zip(weekday.columns["URL"][card], weekday.product[card], strict=True)
for url, number in list(shown)[:200]:
# У страницы входа в адресе ещё метки перехода — путь до знака «?».
assert url.split("?")[0].endswith(f"/product/{goods.sku[number]}")
def test_the_referer_is_the_page_before(weekday: day.Day):
"""Внутри визита реферер — предыдущий адрес; на входе — адрес источника."""
order = np.lexsort((local_seconds(weekday), weekday.columns["VisitID"]))
url = weekday.columns["URL"][order]
referer = weekday.columns["Referer"][order]
visit = weekday.columns["VisitID"][order]
inside = np.flatnonzero(visit[1:] == visit[:-1]) + 1
assert np.all(referer[inside] == url[inside - 1])
entry = np.flatnonzero(visit[1:] != visit[:-1]) + 1
known = {source.referer for source in reference.TRAFFIC_SOURCES}
assert set(referer[entry].tolist()) <= known
def test_the_passport_of_a_cookie_does_not_change_between_days():
"""Кука — браузер на устройстве: во всех её днях профиль и город одни."""
passports: dict[int, tuple[Any, ...]] = {}
for number in (0, 1, 2):
events = day.stream(CANONICAL_SEED, number)
seen = zip(
events.columns["ClientID"].tolist(),
events.columns["Browser"].tolist(),
events.columns["ScreenWidth"].tolist(),
events.columns["RegionCity"].tolist(),
strict=True,
)
for cookie, *passport in seen:
assert passports.setdefault(cookie, tuple(passport)) == tuple(passport)
def test_geography_is_one_region_of_presence(weekday: day.Day):
"""Магазин с одним складом: свой миллионник, свой регион, тонкий хвост."""
cities = weekday.columns["RegionCity"]
assert (cities == "Samara").mean() > 0.25
assert set(weekday.columns["RegionCountry"].tolist()) == {reference.COUNTRY_NAME}
assert set(weekday.columns["RegionCountryID"].tolist()) == {
reference.COUNTRY_REGION_ID
}
def test_addresses_are_not_routable(weekday: day.Day):
"""Правдоподобные публичные адреса принадлежат живым организациям."""
fixed = ("192.0.2.", "198.51.100.", "203.0.113.", "198.18.")
def cgnat(address: str) -> bool:
first, second, *_ = (int(byte) for byte in address.split("."))
return first == reference.MOBILE_IP_FIRST_BYTE and 64 <= second < 128
for address in set(weekday.columns["IPAddress"].tolist()):
assert address.startswith(fixed) or cgnat(address), address
def test_phones_carry_a_model_and_desktops_do_not(weekday: day.Day):
phone = weekday.columns["DeviceCategory"] == reference.PHONE_CATEGORY
assert phone.mean() > 0.5
assert np.all(weekday.columns["MobilePhoneModel"][~phone] == "")
assert np.all(weekday.columns["MobilePhoneModel"][phone] != "")
def test_randomness_is_drawn_in_whole_numbers():
"""Дисциплина спеки (раздел 2): целые числа, никакой системной математики."""
source = inspect.getsource(day)
assert set(re.findall(r"\brng\.(\w+)", source)) <= {"integers"}
assert not re.search(r"^\s*import (random|math)\b", source, re.MULTILINE)