feat(generator): корзина отвязана от страницы, у товара — уровень спроса
- Зачем: - приёмка #40 нашла в торговых данных два точных равенства, каких в живом магазине не бывает: событие корзины случалось ровно у визитов со страницей /cart, а внутри такого визита в корзину уходили все открытые карточки. Привлекательность товара было нечем измерить, а аналитик читал бы эти равенства как склейку в разметке. - Что: - класть в корзину может любой визит, открывший карточку; страница /cart осталась шагом воронки, а у визита, дошедшего до неё, корзина непуста. - у товара появился уровень спроса — колонка каталога с тремя значениями и два ряда вероятностей в числах мира: намерение визита берётся из шага воронки, а не из метки покупателя, которая уже действует через неё. - уровни рассыпаны по каталогу одной колодой: одинакового расклада по категориям нет, связи с ценой нет, и то и другое сторожится тестами. - числа мира перемерены: конверсия карточки в корзину 8,62% (по уровням 13,1 / 9,2 / 5,8), кладут без открытия корзины 41,4% таких визитов, средний день 49 834 события, конверсия визита в покупку 2,43%. - спека генератора и мастер-спека приведены к новой форме каталога. - Проверка: - make lint && make typecheck && make test — 394 passed (было 383). - трафиковая половина побайтово та же: sha256 по (URL, времени, WatchID) всех просмотров за 14 канонических дней совпадает со снимком до правки.
This commit is contained in:
@@ -6,8 +6,10 @@
|
||||
целая цена.
|
||||
"""
|
||||
|
||||
import collections
|
||||
import csv
|
||||
import re
|
||||
import statistics
|
||||
|
||||
import numpy as np
|
||||
|
||||
@@ -78,6 +80,96 @@ def test_categories_are_told_apart_by_prefix_and_by_address():
|
||||
assert len(prefixes) == len(slugs) == len(catalog.CATEGORIES)
|
||||
|
||||
|
||||
def test_every_row_carries_a_known_demand_level():
|
||||
"""Уровень спроса есть у каждой строки, и уровней ровно три."""
|
||||
known = set(catalog.DEMAND_LEVELS)
|
||||
by_category: dict[str, set[str]] = {}
|
||||
for row in rows():
|
||||
by_category.setdefault(row["category"], set()).add(row["demand"])
|
||||
assert set().union(*by_category.values()) == known
|
||||
# Уровни рассыпаны по всему ассортименту: категории целиком из магнитов
|
||||
# или целиком из залежавшегося в магазине не бывает.
|
||||
for category, here in by_category.items():
|
||||
assert here == known, category
|
||||
|
||||
|
||||
def test_the_demand_is_scattered_and_not_dealt_out_evenly():
|
||||
"""Одинаковый расклад в каждой категории — та же неправдоподобная ровность.
|
||||
|
||||
Ровно её тикет и вычищал из данных: в живом магазине магнитов в посуде и
|
||||
в одежде не поровну. Уровень тянется из одной колоды на весь каталог,
|
||||
поэтому доли категорий расходятся сами.
|
||||
"""
|
||||
magnets: dict[str, int] = {}
|
||||
for row in rows():
|
||||
magnets.setdefault(row["category"], 0)
|
||||
magnets[row["category"]] += row["demand"] == catalog.DEMAND_LEVELS[0]
|
||||
assert len(set(magnets.values())) > 1, magnets
|
||||
|
||||
|
||||
def price_tells_the_level(catalogue: list[dict[str, str]]) -> bool:
|
||||
"""Читается ли уровень спроса по цене товара.
|
||||
|
||||
Спрашивается двумя способами сразу, потому что каждый по отдельности
|
||||
обманывается: по четвертям цены — все ли три уровня встречаются в каждой,
|
||||
и по медиане цены уровня — не съехала ли она от медианы каталога. Одни
|
||||
только края списка ничего не стерегут: четырёх исключений в самых
|
||||
дешёвых и самых дорогих строках хватает, чтобы вернуть в них все уровни.
|
||||
"""
|
||||
known = set(catalog.DEMAND_LEVELS)
|
||||
by_price = sorted(catalogue, key=lambda row: int(row["price"]))
|
||||
step = len(by_price) // 4
|
||||
quarters = [by_price[start : start + step] for start in range(0, 4 * step, step)]
|
||||
if any({row["demand"] for row in part} != known for part in quarters):
|
||||
return True
|
||||
|
||||
whole = statistics.median(int(row["price"]) for row in catalogue)
|
||||
for level in catalog.DEMAND_LEVELS:
|
||||
here = [int(row["price"]) for row in catalogue if row["demand"] == level]
|
||||
if not 0.7 < statistics.median(here) / whole < 1.3:
|
||||
return True
|
||||
return False
|
||||
|
||||
|
||||
def derived_from_price(catalogue: list[dict[str, str]]) -> list[dict[str, str]]:
|
||||
"""Подложный каталог: уровень выведен из цены, по краям — исключения.
|
||||
|
||||
Исключения подобраны так, чтобы в самой дешёвой и самой дорогой четверти
|
||||
нашлись все три уровня: столько и нужно, чтобы обмануть проверку, которая
|
||||
смотрит только на края списка.
|
||||
"""
|
||||
magnet, usual, slow = catalog.DEMAND_LEVELS
|
||||
by_price = sorted(catalogue, key=lambda row: int(row["price"]))
|
||||
counted = collections.Counter(row["demand"] for row in catalogue)
|
||||
deck = [level for level in catalog.DEMAND_LEVELS for _ in range(counted[level])]
|
||||
forged = [
|
||||
dict(row, demand=level) for row, level in zip(by_price, deck, strict=True)
|
||||
]
|
||||
forged[0]["demand"] = slow
|
||||
forged[-1]["demand"] = magnet
|
||||
forged[-2]["demand"] = usual
|
||||
return forged
|
||||
|
||||
|
||||
def test_the_demand_level_is_not_the_price_in_disguise():
|
||||
"""Отклонённый вариант: выводить склонность из цены (спека, раздел 9).
|
||||
|
||||
Жёсткая связь дала бы менти ровно то, что мы в неё вложили: «дорогое
|
||||
залёживается» читалось бы из каталога, а не из данных.
|
||||
"""
|
||||
assert not price_tells_the_level(rows())
|
||||
# Сторож сторожа: подмени уровни ценой — проверка обязана покраснеть,
|
||||
# и краевые исключения её не должны обманывать.
|
||||
assert price_tells_the_level(derived_from_price(rows()))
|
||||
|
||||
|
||||
def test_the_demand_level_reaches_the_arrays_row_by_row():
|
||||
goods = catalog.catalog()
|
||||
assert [catalog.DEMAND_LEVELS[number] for number in goods.demand.tolist()] == [
|
||||
row["demand"] for row in rows()
|
||||
]
|
||||
|
||||
|
||||
def test_the_catalog_is_grouped_by_category_whatever_the_file_order():
|
||||
goods = catalog.catalog()
|
||||
assert goods.count.sum() == goods.sku.size
|
||||
|
||||
Reference in New Issue
Block a user