Files
local-transcriber/CONTEXT.md
Dmitriy Dementiev 26d4ca2f4a docs(context): добавлены термины диаризации
- Зачем:
  - решение о пословной привязке должно использовать единый язык во всех документах карты.
- Что:
  - определены сегмент распознавания и слово с временной привязкой.
  - реплика говорящего отделена от единицы запуска модели распознавания.
- Проверка:
  - git diff --check.
2026-08-14 14:16:01 +03:00

3.2 KiB

Локальная транскрипция

Контекст описывает язык проекта для локального распознавания аудио и видео.

Language

Движок распознавания: Программная среда, которая загружает и исполняет модели распознавания. Обновление движка само по себе не означает изменение выбранной модели или рекомендаций пользователю. Avoid: Модель, ASR-модель

Поддерживаемая модель: Модель, которую пользователь может выбрать явно и для которой проект обеспечивает работоспособный путь транскрипции. Этот статус не означает автоматический выбор или рекомендацию для большинства пользователей. Avoid: Доступная модель, дефолт

Модель по умолчанию: Поддерживаемая модель, которую проект выбирает без явного указания модели пользователем для определённого пути выполнения. Avoid: Рекомендуемая модель, поддерживаемая модель

Опорная разметка: Разметка, принятая за точку отсчёта при измерении чего-то другого. Опорной её делает роль в измерении, а не качество: она не выверена вручную и сама может содержать ошибки, поэтому посчитанная по ней величина осмысленна как порядок, но не как точное значение. Avoid: Эталонная разметка, истинная разметка, ground truth

Сегмент распознавания: Непрерывный временной фрагмент аудио, для которого движок возвращает связный текст с общим контекстом. Может содержать речь нескольких говорящих и не равен реплике говорящего. Avoid: Реплика, фраза говорящего

Слово с временной привязкой: Распознанное слово, положение которого известно на временной шкале записи. Минимальная единица, которой назначается говорящий. Avoid: Токен, ASR-сегмент

Реплика говорящего: Последовательность соседних слов с временной привязкой, назначенных одному говорящему. Это единица структуры готового транскрипта, а не запуска модели распознавания. Avoid: Сегмент распознавания, ASR-сегмент