- Зачем: - потребовалось отделить временный результат диаризации от итоговых реплик транскрипта. - Что: - добавлено определение разметки говорящих и перечислены нежелательные синонимы. - уточнено, что разметка не содержит текст, имена участников и голосовые эмбеддинги. - Проверка: - выполнена команда git diff --cached --check.
3.6 KiB
Локальная транскрипция
Контекст описывает язык проекта для локального распознавания аудио и видео.
Language
Движок распознавания: Программная среда, которая загружает и исполняет модели распознавания. Обновление движка само по себе не означает изменение выбранной модели или рекомендаций пользователю. Avoid: Модель, ASR-модель
Поддерживаемая модель: Модель, которую пользователь может выбрать явно и для которой проект обеспечивает работоспособный путь транскрипции. Этот статус не означает автоматический выбор или рекомендацию для большинства пользователей. Avoid: Доступная модель, дефолт
Модель по умолчанию: Поддерживаемая модель, которую проект выбирает без явного указания модели пользователем для определённого пути выполнения. Avoid: Рекомендуемая модель, поддерживаемая модель
Опорная разметка: Разметка, принятая за точку отсчёта при измерении чего-то другого. Опорной её делает роль в измерении, а не качество: она не выверена вручную и сама может содержать ошибки, поэтому посчитанная по ней величина осмысленна как порядок, но не как точное значение. Avoid: Эталонная разметка, истинная разметка, ground truth
Сегмент распознавания: Непрерывный временной фрагмент аудио, для которого движок возвращает связный текст с общим контекстом. Может содержать речь нескольких говорящих и не равен реплике говорящего. Avoid: Реплика, фраза говорящего
Слово с временной привязкой: Распознанное слово, положение которого известно на временной шкале записи. Минимальная единица, которой назначается говорящий. Avoid: Токен, ASR-сегмент
Разметка говорящих: Упорядоченный набор временных интервалов речи, каждому из которых назначена анонимная метка говорящего. Не содержит распознанного текста, имени участника или голосового эмбеддинга. Avoid: Результат диаризации, сегменты говорящих
Реплика говорящего: Последовательность соседних слов с временной привязкой, назначенных одному говорящему. Это единица структуры готового транскрипта, а не запуска модели распознавания. Avoid: Сегмент распознавания, ASR-сегмент