Чистота ASR-сегментов: подтвердить долю загрязнённых на трёх записях #11

Closed
opened 2026-08-12 15:05:32 +03:00 by ddmitry · 1 comment
Owner

Часть карты: Карта: диаризация спикеров в транскрипте (#8)

Question

Воспроизводится ли доля загрязнённых ASR-сегментов на других записях?

На контрольной встрече с тремя участниками 27% сегментов содержали не менее
секунды чужой речи, и на них пришлось больше половины времени транскрипта.
Причина — границы сегментов идут по тишине (Silero VAD), а собеседники в ВКС
отвечают встык. Вывод сделан на одной записи; планка проекта по ADR-006 — три.

  • повторить измерение чистоты на трёх и более записях, обязательно включив
    разговор на двоих: есть гипотеза, что на двоих загрязнение заметно ниже, чем
    на встрече с тремя и более участниками;
  • использовать настройки, выбранные в тикете калибровки, а не значения из
    разведки;
  • посчитать отдельно долю сегментов и долю времени транскрипта — на контрольной
    записи эти числа сильно расходились (27% против 51%);
  • отделить поддакивания от потерянных реплик: чужая речь короче секунды и
    дольше секунды — это разные по вредности случаи.

Ответ — таблица по записям и вывод, является ли загрязнение общим свойством
материала или особенностью многолюдных встреч.

Часть карты: [Карта: диаризация спикеров в транскрипте](https://git.dementev.space/ddmitry/local-transcriber/issues/8) (#8) ## Question Воспроизводится ли доля загрязнённых ASR-сегментов на других записях? На контрольной встрече с тремя участниками 27% сегментов содержали не менее секунды чужой речи, и на них пришлось больше половины времени транскрипта. Причина — границы сегментов идут по тишине (Silero VAD), а собеседники в ВКС отвечают встык. Вывод сделан на одной записи; планка проекта по ADR-006 — три. - повторить измерение чистоты на трёх и более записях, обязательно включив разговор на двоих: есть гипотеза, что на двоих загрязнение заметно ниже, чем на встрече с тремя и более участниками; - использовать настройки, выбранные в тикете калибровки, а не значения из разведки; - посчитать отдельно долю сегментов и долю времени транскрипта — на контрольной записи эти числа сильно расходились (27% против 51%); - отделить поддакивания от потерянных реплик: чужая речь короче секунды и дольше секунды — это разные по вредности случаи. Ответ — таблица по записям и вывод, является ли загрязнение общим свойством материала или особенностью многолюдных встреч.
ddmitry added the wayfinder:task label 2026-08-12 15:05:32 +03:00
ddmitry self-assigned this 2026-08-14 11:23:35 +03:00
Author
Owner

Решение: смешение говорящих внутри ASR-сегмента воспроизводится на всех трёх проверенных записях, но его тяжесть заметно зависит от состава разговора.

Запись Участников Сегменты с чужой репликой ≥1 с Доля времени таких сегментов
Data Test 3 74 / 274 (27,0%) 11,20 / 21,89 мин (51,2%)
T2 BDMA 2 14 / 223 (6,3%) 1,53 / 12,56 мин (12,2%)
Yantar 2 24 / 339 (7,1%) 2,67 / 15,93 мин (16,8%)

На двух разговорах на двоих вместе получено 38 / 562 сегмента (6,8%) и 4,20 / 28,49 минуты (14,7%). Значит, исходные 27% / 51% нельзя переносить на все созвоны: на двух людях смешение примерно в четыре раза реже по сегментам и в 3,5 раза реже по времени. Но оно не исчезает, поэтому мажоритарная метка на весь ASR-сегмент остаётся заметным огрублением и не может считаться безопасным общим решением без пословной привязки или явной пометки качества.

Метод: gigaam-v3-e2e-rnnt INT8 + откалиброванная диаризация WeSpeaker ResNet34 LM, threshold=0.89, num_clusters=-1. Поддакивания <1 с считались отдельно; время категории — сумма длительностей ASR-сегментов, не DER и не сумма времени речи. Диаризация остаётся опорной, а не эталонной разметкой.

Воспроизводимый отчёт: Смешение говорящих внутри ASR-сегментов. Коммит: b8092aa.

Проверки: три полных прогона bench_conflict.py; SHA-256 медиа совпали с отчётом о калибровке; ruff check, ruff format --check и git diff --check прошли успешно.

Решение: смешение говорящих внутри ASR-сегмента воспроизводится на всех трёх проверенных записях, но его тяжесть заметно зависит от состава разговора. | Запись | Участников | Сегменты с чужой репликой ≥1 с | Доля времени таких сегментов | |---|---:|---:|---:| | Data Test | 3 | 74 / 274 (27,0%) | 11,20 / 21,89 мин (51,2%) | | T2 BDMA | 2 | 14 / 223 (6,3%) | 1,53 / 12,56 мин (12,2%) | | Yantar | 2 | 24 / 339 (7,1%) | 2,67 / 15,93 мин (16,8%) | На двух разговорах на двоих вместе получено 38 / 562 сегмента (6,8%) и 4,20 / 28,49 минуты (14,7%). Значит, исходные 27% / 51% нельзя переносить на все созвоны: на двух людях смешение примерно в четыре раза реже по сегментам и в 3,5 раза реже по времени. Но оно не исчезает, поэтому мажоритарная метка на весь ASR-сегмент остаётся заметным огрублением и не может считаться безопасным общим решением без пословной привязки или явной пометки качества. Метод: `gigaam-v3-e2e-rnnt` INT8 + откалиброванная диаризация WeSpeaker ResNet34 LM, `threshold=0.89`, `num_clusters=-1`. Поддакивания <1 с считались отдельно; время категории — сумма длительностей ASR-сегментов, не DER и не сумма времени речи. Диаризация остаётся опорной, а не эталонной разметкой. Воспроизводимый отчёт: [Смешение говорящих внутри ASR-сегментов](https://git.dementev.space/ddmitry/local-transcriber/src/branch/feature/8-diarization-map/docs/benchmarks/2026-08-14-asr-segment-speaker-mixing.md). Коммит: `b8092aa`. Проверки: три полных прогона `bench_conflict.py`; SHA-256 медиа совпали с отчётом о калибровке; `ruff check`, `ruff format --check` и `git diff --check` прошли успешно.
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Reference: ddmitry/local-transcriber#11