- Зачем: - спецификация не должна оставлять неоднозначности перед реализацией диаризации. - Что: - уточнены сведение слов, таймкоды и предупреждение о малом кластере. - очищены терминология и граница между ADR и спецификацией. - сохранён результат сравнения WeSpeaker и CAMPPlus. - Проверка: - git diff --cached --check и проверка относительных ссылок.
4.1 KiB
Локальная транскрипция
Контекст описывает язык проекта для локального распознавания аудио и видео.
Language
Движок распознавания: Программная среда, которая загружает и исполняет модели распознавания. Обновление движка само по себе не означает изменение выбранной модели или рекомендаций пользователю. Avoid: Модель, ASR-модель
Поддерживаемая модель: Модель, которую пользователь может выбрать явно и для которой проект обеспечивает работоспособный путь транскрипции. Этот статус не означает автоматический выбор или рекомендацию для большинства пользователей. Avoid: Доступная модель, дефолт
Модель по умолчанию: Поддерживаемая модель, которую проект выбирает без явного указания модели пользователем для определённого пути выполнения. Avoid: Рекомендуемая модель, поддерживаемая модель
Опорная разметка: Разметка, принятая за точку отсчёта при измерении чего-то другого. Опорной её делает роль в измерении, а не качество: она не выверена вручную и сама может содержать ошибки, поэтому посчитанная по ней величина осмысленна как порядок, но не как точное значение. Avoid: Эталонная разметка, истинная разметка, ground truth
Сегмент распознавания: Непрерывный временной фрагмент аудио, для которого движок возвращает связный текст с общим контекстом. Может содержать речь нескольких говорящих и не равен реплике говорящего. Avoid: Реплика, фраза говорящего
Слово с временной привязкой: Распознанное слово, положение которого известно на временной шкале записи. Минимальная единица, которой назначается говорящий. Avoid: Токен, ASR-сегмент
Разметка говорящих: Упорядоченный набор временных интервалов речи, каждому из которых назначена анонимная метка говорящего. Не содержит распознанного текста, имени участника или голосового эмбеддинга. Avoid: Результат диаризации, сегменты говорящих
Голосовой кластер: Анонимная группа интервалов разметки говорящих, которые диаризатор относит к одному голосу. Не обязательно соответствует реальному участнику встречи: диаризация может создать ложный или малый кластер. Avoid: Участник, человек
Реплика говорящего: Последовательность соседних слов с временной привязкой, назначенных одному говорящему. Это единица структуры готового транскрипта, а не запуска модели распознавания. Avoid: Сегмент распознавания, ASR-сегмент