feat(generator): день-функция — трафик, визиты и просмотры страниц
Зачем: план состава отдаёт дневную аудиторию, но событий у мира ещё не было. День-функция превращает аудиторию в поток просмотров — на нём стоят лабы про сборку визитов и про витрины, а следующий этап вешает на него торговые события. Что: - `day.py` — день как чистая функция зерна и номера дня: суточная волна в местном времени посетителя, визиты по документированным правилам нарезки, все 47 колонок выгрузки; шов для торговых событий — ряды `page` и `product`; - `reference.py` — справочники-литералы: профили устройств, города Поволжья с настоящими гео-id Яндекса, источники трафика, карта сайта; - `catalog.py` и `data/catalog/products.csv` — каталог на 180 позиций, общий у генератора и будущего словаря ClickHouse; - `weights.py` — выбор по целым весам, один на план и на день; - паспорт куки (устройство и город) переехал в план состава; броски приписаны последними, поэтому измеренные числа канонического мира не сдвинулись; - словарь: «визит» закреплён за сессией, одноимённое понятие плана стало «днём активности»; статьи в `CONTEXT.md`; - решения по ходу — в спеку генератора, раздел 9; наполнение `ParsedParamsKey1` отложено тикетом #47. Проверка: `make lint`, `make typecheck`, `make test` — 353 passed (было 297). Счётчики плана после правки те же: приток 3827,64/день, дневная аудитория 6235–7124, 68 119 посетителей за 14 дней, 170 двухкуковых пар. День 0 — 45 810 событий за 0,6 с, снимок 14 дней — 5,9 с при пороге 30 с на день. Две слепые линии ревью, десять находок, все закрыты и перепроверены. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,79 @@
|
||||
"""Каталог товаров: форма файла, а не его длина.
|
||||
|
||||
Файл дорастает механически, поэтому ни один тест не считает его строки и
|
||||
не знает ни одного артикула наизусть. Сторожится ровно то, на что опираются
|
||||
генератор и словарь ClickHouse: колонки, вид артикула, известные категории,
|
||||
целая цена.
|
||||
"""
|
||||
|
||||
import csv
|
||||
import re
|
||||
|
||||
import numpy as np
|
||||
|
||||
from clickstream_generator import catalog
|
||||
|
||||
SKU = re.compile(r"^[A-Z]{4}-\d{4}$")
|
||||
|
||||
# Вилка цены, копейки: от сотни рублей до полумиллиона. Сторож от нуля,
|
||||
# от минуса и от цены, случайно записанной в рублях.
|
||||
PRICE_RANGE = (10_000, 50_000_000)
|
||||
|
||||
|
||||
def rows() -> list[dict[str, str]]:
|
||||
with catalog.CATALOG_PATH.open(encoding="utf-8", newline="") as source:
|
||||
return list(csv.DictReader(source))
|
||||
|
||||
|
||||
def test_the_file_has_the_columns_the_dictionary_expects():
|
||||
with catalog.CATALOG_PATH.open(encoding="utf-8", newline="") as source:
|
||||
assert next(csv.reader(source)) == list(catalog.COLUMNS)
|
||||
|
||||
|
||||
def test_the_catalog_is_not_empty():
|
||||
assert rows()
|
||||
|
||||
|
||||
def test_every_article_is_unique_and_named_by_its_category():
|
||||
known = {category.name: category.prefix for category in catalog.CATEGORIES}
|
||||
articles = set()
|
||||
for row in rows():
|
||||
sku = row["sku"]
|
||||
assert SKU.match(sku), sku
|
||||
assert sku.split("-")[0] == known[row["category"]], sku
|
||||
articles.add(sku)
|
||||
assert len(articles) == len(rows())
|
||||
|
||||
|
||||
def test_every_row_is_filled_and_priced_in_whole_kopecks():
|
||||
low, high = PRICE_RANGE
|
||||
for row in rows():
|
||||
assert row["name"].strip()
|
||||
assert row["brand"].strip()
|
||||
assert row["price"].isdigit(), row["price"]
|
||||
assert low <= int(row["price"]) <= high, row["sku"]
|
||||
|
||||
|
||||
def test_every_category_of_the_assortment_is_covered():
|
||||
"""Каталог покрывает ассортимент целиком: пустых категорий не бывает."""
|
||||
present = {row["category"] for row in rows()}
|
||||
assert present == {category.name for category in catalog.CATEGORIES}
|
||||
|
||||
|
||||
def test_categories_are_told_apart_by_prefix_and_by_address():
|
||||
prefixes = {category.prefix for category in catalog.CATEGORIES}
|
||||
slugs = {category.slug for category in catalog.CATEGORIES}
|
||||
assert len(prefixes) == len(slugs) == len(catalog.CATEGORIES)
|
||||
|
||||
|
||||
def test_the_catalog_is_grouped_by_category_whatever_the_file_order():
|
||||
goods = catalog.catalog()
|
||||
assert goods.count.sum() == goods.sku.size
|
||||
for number in range(len(catalog.CATEGORIES)):
|
||||
first = goods.first[number]
|
||||
rows_here = goods.grouped[first : first + goods.count[number]]
|
||||
assert np.all(goods.category[rows_here] == number)
|
||||
|
||||
|
||||
def test_the_catalog_is_read_once():
|
||||
assert catalog.catalog() is catalog.catalog()
|
||||
Reference in New Issue
Block a user