Зачем: план состава отдаёт дневную аудиторию, но событий у мира ещё не было. День-функция превращает аудиторию в поток просмотров — на нём стоят лабы про сборку визитов и про витрины, а следующий этап вешает на него торговые события. Что: - `day.py` — день как чистая функция зерна и номера дня: суточная волна в местном времени посетителя, визиты по документированным правилам нарезки, все 47 колонок выгрузки; шов для торговых событий — ряды `page` и `product`; - `reference.py` — справочники-литералы: профили устройств, города Поволжья с настоящими гео-id Яндекса, источники трафика, карта сайта; - `catalog.py` и `data/catalog/products.csv` — каталог на 180 позиций, общий у генератора и будущего словаря ClickHouse; - `weights.py` — выбор по целым весам, один на план и на день; - паспорт куки (устройство и город) переехал в план состава; броски приписаны последними, поэтому измеренные числа канонического мира не сдвинулись; - словарь: «визит» закреплён за сессией, одноимённое понятие плана стало «днём активности»; статьи в `CONTEXT.md`; - решения по ходу — в спеку генератора, раздел 9; наполнение `ParsedParamsKey1` отложено тикетом #47. Проверка: `make lint`, `make typecheck`, `make test` — 353 passed (было 297). Счётчики плана после правки те же: приток 3827,64/день, дневная аудитория 6235–7124, 68 119 посетителей за 14 дней, 170 двухкуковых пар. День 0 — 45 810 событий за 0,6 с, снимок 14 дней — 5,9 с при пороге 30 с на день. Две слепые линии ревью, десять находок, все закрыты и перепроверены. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
80 lines
2.9 KiB
Python
80 lines
2.9 KiB
Python
"""Каталог товаров: форма файла, а не его длина.
|
|
|
|
Файл дорастает механически, поэтому ни один тест не считает его строки и
|
|
не знает ни одного артикула наизусть. Сторожится ровно то, на что опираются
|
|
генератор и словарь ClickHouse: колонки, вид артикула, известные категории,
|
|
целая цена.
|
|
"""
|
|
|
|
import csv
|
|
import re
|
|
|
|
import numpy as np
|
|
|
|
from clickstream_generator import catalog
|
|
|
|
SKU = re.compile(r"^[A-Z]{4}-\d{4}$")
|
|
|
|
# Вилка цены, копейки: от сотни рублей до полумиллиона. Сторож от нуля,
|
|
# от минуса и от цены, случайно записанной в рублях.
|
|
PRICE_RANGE = (10_000, 50_000_000)
|
|
|
|
|
|
def rows() -> list[dict[str, str]]:
|
|
with catalog.CATALOG_PATH.open(encoding="utf-8", newline="") as source:
|
|
return list(csv.DictReader(source))
|
|
|
|
|
|
def test_the_file_has_the_columns_the_dictionary_expects():
|
|
with catalog.CATALOG_PATH.open(encoding="utf-8", newline="") as source:
|
|
assert next(csv.reader(source)) == list(catalog.COLUMNS)
|
|
|
|
|
|
def test_the_catalog_is_not_empty():
|
|
assert rows()
|
|
|
|
|
|
def test_every_article_is_unique_and_named_by_its_category():
|
|
known = {category.name: category.prefix for category in catalog.CATEGORIES}
|
|
articles = set()
|
|
for row in rows():
|
|
sku = row["sku"]
|
|
assert SKU.match(sku), sku
|
|
assert sku.split("-")[0] == known[row["category"]], sku
|
|
articles.add(sku)
|
|
assert len(articles) == len(rows())
|
|
|
|
|
|
def test_every_row_is_filled_and_priced_in_whole_kopecks():
|
|
low, high = PRICE_RANGE
|
|
for row in rows():
|
|
assert row["name"].strip()
|
|
assert row["brand"].strip()
|
|
assert row["price"].isdigit(), row["price"]
|
|
assert low <= int(row["price"]) <= high, row["sku"]
|
|
|
|
|
|
def test_every_category_of_the_assortment_is_covered():
|
|
"""Каталог покрывает ассортимент целиком: пустых категорий не бывает."""
|
|
present = {row["category"] for row in rows()}
|
|
assert present == {category.name for category in catalog.CATEGORIES}
|
|
|
|
|
|
def test_categories_are_told_apart_by_prefix_and_by_address():
|
|
prefixes = {category.prefix for category in catalog.CATEGORIES}
|
|
slugs = {category.slug for category in catalog.CATEGORIES}
|
|
assert len(prefixes) == len(slugs) == len(catalog.CATEGORIES)
|
|
|
|
|
|
def test_the_catalog_is_grouped_by_category_whatever_the_file_order():
|
|
goods = catalog.catalog()
|
|
assert goods.count.sum() == goods.sku.size
|
|
for number in range(len(catalog.CATEGORIES)):
|
|
first = goods.first[number]
|
|
rows_here = goods.grouped[first : first + goods.count[number]]
|
|
assert np.all(goods.category[rows_here] == number)
|
|
|
|
|
|
def test_the_catalog_is_read_once():
|
|
assert catalog.catalog() is catalog.catalog()
|