Зачем: план состава отдаёт дневную аудиторию, но событий у мира ещё не было. День-функция превращает аудиторию в поток просмотров — на нём стоят лабы про сборку визитов и про витрины, а следующий этап вешает на него торговые события. Что: - `day.py` — день как чистая функция зерна и номера дня: суточная волна в местном времени посетителя, визиты по документированным правилам нарезки, все 47 колонок выгрузки; шов для торговых событий — ряды `page` и `product`; - `reference.py` — справочники-литералы: профили устройств, города Поволжья с настоящими гео-id Яндекса, источники трафика, карта сайта; - `catalog.py` и `data/catalog/products.csv` — каталог на 180 позиций, общий у генератора и будущего словаря ClickHouse; - `weights.py` — выбор по целым весам, один на план и на день; - паспорт куки (устройство и город) переехал в план состава; броски приписаны последними, поэтому измеренные числа канонического мира не сдвинулись; - словарь: «визит» закреплён за сессией, одноимённое понятие плана стало «днём активности»; статьи в `CONTEXT.md`; - решения по ходу — в спеку генератора, раздел 9; наполнение `ParsedParamsKey1` отложено тикетом #47. Проверка: `make lint`, `make typecheck`, `make test` — 353 passed (было 297). Счётчики плана после правки те же: приток 3827,64/день, дневная аудитория 6235–7124, 68 119 посетителей за 14 дней, 170 двухкуковых пар. День 0 — 45 810 событий за 0,6 с, снимок 14 дней — 5,9 с при пороге 30 с на день. Две слепые линии ревью, десять находок, все закрыты и перепроверены. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
38 lines
2.2 KiB
Python
38 lines
2.2 KiB
Python
"""Выбор по целым весам — общий приём плана состава и дня-функции.
|
|
|
|
Дисциплина спеки (раздел 2): случайность тянется целыми числами, плавающие
|
|
распределения системной математики не зовутся — они расходятся между
|
|
версиями numpy и архитектурами CPU, а обещано побайтовое совпадение. Отсюда
|
|
и способ: веса складываются в накопленный ряд, бросок попадает в чью-то долю
|
|
общего веса, и кто долю занимал — тот и выбран.
|
|
|
|
Модуль маленький нарочно: у приёма одно определение на весь генератор,
|
|
иначе дисциплина живёт копиями и расходится с ними.
|
|
"""
|
|
|
|
import numpy as np
|
|
from numpy.typing import NDArray
|
|
|
|
|
|
def pick(
|
|
rng: np.random.Generator, cumulative: NDArray[np.int64], size: int
|
|
) -> NDArray[np.int64]:
|
|
"""Куда попал бросок в общий вес — тот вариант и вышел."""
|
|
return np.searchsorted(cumulative, rng.integers(0, cumulative[-1], size), "right")
|
|
|
|
|
|
def pick_row(
|
|
rng: np.random.Generator, cumulative: NDArray[np.int64], rows: NDArray[np.int64]
|
|
) -> NDArray[np.int64]:
|
|
"""То же, но у каждого броска своя строка таблицы весов.
|
|
|
|
Строки уложены встык — каждая начинается там, где кончилась предыдущая, —
|
|
и поиск идёт по одному ряду: столько же работы, сколько на одну таблицу.
|
|
Общий вес у строк поэтому обязан совпадать; у повёрнутой суточной волны
|
|
он совпадает по построению.
|
|
"""
|
|
total = cumulative[0, -1]
|
|
shelf = (cumulative + np.arange(cumulative.shape[0])[:, None] * total).ravel()
|
|
draw = rows * total + rng.integers(0, total, rows.size)
|
|
return np.searchsorted(shelf, draw, "right") - rows * cumulative.shape[1]
|