- Зачем: - решения карты должны стать устойчивой основой для реализации диаризации. - Что: - добавлены ADR-007 и спецификация пословной диаризации. - дополнен доменный словарь и удалены закрытые направления из backlog. - Проверка: - git diff --cached --check.
4.1 KiB
Локальная транскрипция
Контекст описывает язык проекта для локального распознавания аудио и видео.
Language
Движок распознавания: Программная среда, которая загружает и исполняет модели распознавания. Обновление движка само по себе не означает изменение выбранной модели или рекомендаций пользователю. Avoid: Модель, ASR-модель
Поддерживаемая модель: Модель, которую пользователь может выбрать явно и для которой проект обеспечивает работоспособный путь транскрипции. Этот статус не означает автоматический выбор или рекомендацию для большинства пользователей. Avoid: Доступная модель, дефолт
Модель по умолчанию: Поддерживаемая модель, которую проект выбирает без явного указания модели пользователем для определённого пути выполнения. Avoid: Рекомендуемая модель, поддерживаемая модель
Опорная разметка: Разметка, принятая за точку отсчёта при измерении чего-то другого. Опорной её делает роль в измерении, а не качество: она не выверена вручную и сама может содержать ошибки, поэтому посчитанная по ней величина осмысленна как порядок, но не как точное значение. Avoid: Эталонная разметка, истинная разметка, ground truth
Сегмент распознавания: Непрерывный временной фрагмент аудио, для которого движок возвращает связный текст с общим контекстом. Может содержать речь нескольких говорящих и не равен реплике говорящего. Avoid: Реплика, фраза говорящего
Слово с временной привязкой: Распознанное слово, положение которого известно на временной шкале записи. Минимальная единица, которой назначается говорящий. Avoid: Токен, ASR-сегмент
Разметка говорящих: Упорядоченный набор временных интервалов речи, каждому из которых назначена анонимная метка говорящего. Не содержит распознанного текста, имени участника или голосового эмбеддинга. Avoid: Результат диаризации, сегменты говорящих
Голосовой кластер: Анонимная группа интервалов разметки говорящих, которые диаризатор относит к одному голосу. Не равен подтверждённому участнику встречи: ложный или малый кластер сохраняет отдельную метку. Avoid: Участник, человек
Реплика говорящего: Последовательность соседних слов с временной привязкой, назначенных одному говорящему. Это единица структуры готового транскрипта, а не запуска модели распознавания. Avoid: Сегмент распознавания, ASR-сегмент