Чистота ASR-сегментов: подтвердить долю загрязнённых на трёх записях #11
Notifications
Due Date
No due date set.
Blocks
Depends on
#14 Выбрать единицу привязки спикера к тексту
ddmitry/local-transcriber
#10 Калибровка диаризации: порог кластеризации и модель эмбеддингов на русской речи
ddmitry/local-transcriber
Reference: ddmitry/local-transcriber#11
Reference in New Issue
Block a user
Часть карты: Карта: диаризация спикеров в транскрипте (#8)
Question
Воспроизводится ли доля загрязнённых ASR-сегментов на других записях?
На контрольной встрече с тремя участниками 27% сегментов содержали не менее
секунды чужой речи, и на них пришлось больше половины времени транскрипта.
Причина — границы сегментов идут по тишине (Silero VAD), а собеседники в ВКС
отвечают встык. Вывод сделан на одной записи; планка проекта по ADR-006 — три.
разговор на двоих: есть гипотеза, что на двоих загрязнение заметно ниже, чем
на встрече с тремя и более участниками;
разведки;
записи эти числа сильно расходились (27% против 51%);
дольше секунды — это разные по вредности случаи.
Ответ — таблица по записям и вывод, является ли загрязнение общим свойством
материала или особенностью многолюдных встреч.
Решение: смешение говорящих внутри ASR-сегмента воспроизводится на всех трёх проверенных записях, но его тяжесть заметно зависит от состава разговора.
На двух разговорах на двоих вместе получено 38 / 562 сегмента (6,8%) и 4,20 / 28,49 минуты (14,7%). Значит, исходные 27% / 51% нельзя переносить на все созвоны: на двух людях смешение примерно в четыре раза реже по сегментам и в 3,5 раза реже по времени. Но оно не исчезает, поэтому мажоритарная метка на весь ASR-сегмент остаётся заметным огрублением и не может считаться безопасным общим решением без пословной привязки или явной пометки качества.
Метод:
gigaam-v3-e2e-rnntINT8 + откалиброванная диаризация WeSpeaker ResNet34 LM,threshold=0.89,num_clusters=-1. Поддакивания <1 с считались отдельно; время категории — сумма длительностей ASR-сегментов, не DER и не сумма времени речи. Диаризация остаётся опорной, а не эталонной разметкой.Воспроизводимый отчёт: Смешение говорящих внутри ASR-сегментов. Коммит:
b8092aa.Проверки: три полных прогона
bench_conflict.py; SHA-256 медиа совпали с отчётом о калибровке;ruff check,ruff format --checkиgit diff --checkпрошли успешно.