feat(generator): корзина отвязана от страницы, у товара — уровень спроса

- Зачем:
  - приёмка #40 нашла в торговых данных два точных равенства, каких в живом
    магазине не бывает: событие корзины случалось ровно у визитов со
    страницей /cart, а внутри такого визита в корзину уходили все открытые
    карточки. Привлекательность товара было нечем измерить, а аналитик читал
    бы эти равенства как склейку в разметке.
- Что:
  - класть в корзину может любой визит, открывший карточку; страница /cart
    осталась шагом воронки, а у визита, дошедшего до неё, корзина непуста.
  - у товара появился уровень спроса — колонка каталога с тремя значениями
    и два ряда вероятностей в числах мира: намерение визита берётся из шага
    воронки, а не из метки покупателя, которая уже действует через неё.
  - уровни рассыпаны по каталогу одной колодой: одинакового расклада по
    категориям нет, связи с ценой нет, и то и другое сторожится тестами.
  - числа мира перемерены: конверсия карточки в корзину 8,62% (по уровням
    13,1 / 9,2 / 5,8), кладут без открытия корзины 41,4% таких визитов,
    средний день 49 834 события, конверсия визита в покупку 2,43%.
  - спека генератора и мастер-спека приведены к новой форме каталога.
- Проверка:
  - make lint && make typecheck && make test — 394 passed (было 383).
  - трафиковая половина побайтово та же: sha256 по (URL, времени, WatchID)
    всех просмотров за 14 канонических дней совпадает со снимком до правки.
This commit is contained in:
2026-08-02 22:46:30 +03:00
parent 4165f10cdd
commit c0f4d21df9
10 changed files with 734 additions and 248 deletions
+92
View File
@@ -6,8 +6,10 @@
целая цена.
"""
import collections
import csv
import re
import statistics
import numpy as np
@@ -78,6 +80,96 @@ def test_categories_are_told_apart_by_prefix_and_by_address():
assert len(prefixes) == len(slugs) == len(catalog.CATEGORIES)
def test_every_row_carries_a_known_demand_level():
"""Уровень спроса есть у каждой строки, и уровней ровно три."""
known = set(catalog.DEMAND_LEVELS)
by_category: dict[str, set[str]] = {}
for row in rows():
by_category.setdefault(row["category"], set()).add(row["demand"])
assert set().union(*by_category.values()) == known
# Уровни рассыпаны по всему ассортименту: категории целиком из магнитов
# или целиком из залежавшегося в магазине не бывает.
for category, here in by_category.items():
assert here == known, category
def test_the_demand_is_scattered_and_not_dealt_out_evenly():
"""Одинаковый расклад в каждой категории — та же неправдоподобная ровность.
Ровно её тикет и вычищал из данных: в живом магазине магнитов в посуде и
в одежде не поровну. Уровень тянется из одной колоды на весь каталог,
поэтому доли категорий расходятся сами.
"""
magnets: dict[str, int] = {}
for row in rows():
magnets.setdefault(row["category"], 0)
magnets[row["category"]] += row["demand"] == catalog.DEMAND_LEVELS[0]
assert len(set(magnets.values())) > 1, magnets
def price_tells_the_level(catalogue: list[dict[str, str]]) -> bool:
"""Читается ли уровень спроса по цене товара.
Спрашивается двумя способами сразу, потому что каждый по отдельности
обманывается: по четвертям цены — все ли три уровня встречаются в каждой,
и по медиане цены уровня — не съехала ли она от медианы каталога. Одни
только края списка ничего не стерегут: четырёх исключений в самых
дешёвых и самых дорогих строках хватает, чтобы вернуть в них все уровни.
"""
known = set(catalog.DEMAND_LEVELS)
by_price = sorted(catalogue, key=lambda row: int(row["price"]))
step = len(by_price) // 4
quarters = [by_price[start : start + step] for start in range(0, 4 * step, step)]
if any({row["demand"] for row in part} != known for part in quarters):
return True
whole = statistics.median(int(row["price"]) for row in catalogue)
for level in catalog.DEMAND_LEVELS:
here = [int(row["price"]) for row in catalogue if row["demand"] == level]
if not 0.7 < statistics.median(here) / whole < 1.3:
return True
return False
def derived_from_price(catalogue: list[dict[str, str]]) -> list[dict[str, str]]:
"""Подложный каталог: уровень выведен из цены, по краям — исключения.
Исключения подобраны так, чтобы в самой дешёвой и самой дорогой четверти
нашлись все три уровня: столько и нужно, чтобы обмануть проверку, которая
смотрит только на края списка.
"""
magnet, usual, slow = catalog.DEMAND_LEVELS
by_price = sorted(catalogue, key=lambda row: int(row["price"]))
counted = collections.Counter(row["demand"] for row in catalogue)
deck = [level for level in catalog.DEMAND_LEVELS for _ in range(counted[level])]
forged = [
dict(row, demand=level) for row, level in zip(by_price, deck, strict=True)
]
forged[0]["demand"] = slow
forged[-1]["demand"] = magnet
forged[-2]["demand"] = usual
return forged
def test_the_demand_level_is_not_the_price_in_disguise():
"""Отклонённый вариант: выводить склонность из цены (спека, раздел 9).
Жёсткая связь дала бы менти ровно то, что мы в неё вложили: «дорогое
залёживается» читалось бы из каталога, а не из данных.
"""
assert not price_tells_the_level(rows())
# Сторож сторожа: подмени уровни ценой — проверка обязана покраснеть,
# и краевые исключения её не должны обманывать.
assert price_tells_the_level(derived_from_price(rows()))
def test_the_demand_level_reaches_the_arrays_row_by_row():
goods = catalog.catalog()
assert [catalog.DEMAND_LEVELS[number] for number in goods.demand.tolist()] == [
row["demand"] for row in rows()
]
def test_the_catalog_is_grouped_by_category_whatever_the_file_order():
goods = catalog.catalog()
assert goods.count.sum() == goods.sku.size