Files
clickstream-data-platform/generator/tests/test_catalog.py
T
ddadminandClaude Opus 5 eb433ad023 feat(generator): день-функция — трафик, визиты и просмотры страниц
Зачем: план состава отдаёт дневную аудиторию, но событий у мира ещё не было.
День-функция превращает аудиторию в поток просмотров — на нём стоят лабы про
сборку визитов и про витрины, а следующий этап вешает на него торговые события.

Что:
- `day.py` — день как чистая функция зерна и номера дня: суточная волна в
  местном времени посетителя, визиты по документированным правилам нарезки,
  все 47 колонок выгрузки; шов для торговых событий — ряды `page` и `product`;
- `reference.py` — справочники-литералы: профили устройств, города Поволжья с
  настоящими гео-id Яндекса, источники трафика, карта сайта;
- `catalog.py` и `data/catalog/products.csv` — каталог на 180 позиций, общий у
  генератора и будущего словаря ClickHouse;
- `weights.py` — выбор по целым весам, один на план и на день;
- паспорт куки (устройство и город) переехал в план состава; броски приписаны
  последними, поэтому измеренные числа канонического мира не сдвинулись;
- словарь: «визит» закреплён за сессией, одноимённое понятие плана стало
  «днём активности»; статьи в `CONTEXT.md`;
- решения по ходу — в спеку генератора, раздел 9; наполнение
  `ParsedParamsKey1` отложено тикетом #47.

Проверка: `make lint`, `make typecheck`, `make test` — 353 passed (было 297).
Счётчики плана после правки те же: приток 3827,64/день, дневная аудитория
6235–7124, 68 119 посетителей за 14 дней, 170 двухкуковых пар. День 0 —
45 810 событий за 0,6 с, снимок 14 дней — 5,9 с при пороге 30 с на день.
Две слепые линии ревью, десять находок, все закрыты и перепроверены.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-02 16:12:17 +03:00

80 lines
2.9 KiB
Python

"""Каталог товаров: форма файла, а не его длина.
Файл дорастает механически, поэтому ни один тест не считает его строки и
не знает ни одного артикула наизусть. Сторожится ровно то, на что опираются
генератор и словарь ClickHouse: колонки, вид артикула, известные категории,
целая цена.
"""
import csv
import re
import numpy as np
from clickstream_generator import catalog
SKU = re.compile(r"^[A-Z]{4}-\d{4}$")
# Вилка цены, копейки: от сотни рублей до полумиллиона. Сторож от нуля,
# от минуса и от цены, случайно записанной в рублях.
PRICE_RANGE = (10_000, 50_000_000)
def rows() -> list[dict[str, str]]:
with catalog.CATALOG_PATH.open(encoding="utf-8", newline="") as source:
return list(csv.DictReader(source))
def test_the_file_has_the_columns_the_dictionary_expects():
with catalog.CATALOG_PATH.open(encoding="utf-8", newline="") as source:
assert next(csv.reader(source)) == list(catalog.COLUMNS)
def test_the_catalog_is_not_empty():
assert rows()
def test_every_article_is_unique_and_named_by_its_category():
known = {category.name: category.prefix for category in catalog.CATEGORIES}
articles = set()
for row in rows():
sku = row["sku"]
assert SKU.match(sku), sku
assert sku.split("-")[0] == known[row["category"]], sku
articles.add(sku)
assert len(articles) == len(rows())
def test_every_row_is_filled_and_priced_in_whole_kopecks():
low, high = PRICE_RANGE
for row in rows():
assert row["name"].strip()
assert row["brand"].strip()
assert row["price"].isdigit(), row["price"]
assert low <= int(row["price"]) <= high, row["sku"]
def test_every_category_of_the_assortment_is_covered():
"""Каталог покрывает ассортимент целиком: пустых категорий не бывает."""
present = {row["category"] for row in rows()}
assert present == {category.name for category in catalog.CATEGORIES}
def test_categories_are_told_apart_by_prefix_and_by_address():
prefixes = {category.prefix for category in catalog.CATEGORIES}
slugs = {category.slug for category in catalog.CATEGORIES}
assert len(prefixes) == len(slugs) == len(catalog.CATEGORIES)
def test_the_catalog_is_grouped_by_category_whatever_the_file_order():
goods = catalog.catalog()
assert goods.count.sum() == goods.sku.size
for number in range(len(catalog.CATEGORIES)):
first = goods.first[number]
rows_here = goods.grouped[first : first + goods.count[number]]
assert np.all(goods.category[rows_here] == number)
def test_the_catalog_is_read_once():
assert catalog.catalog() is catalog.catalog()