Files
local-transcriber/CONTEXT.md
T
Dmitriy Dementiev b8333ba583 docs(diarization): зафиксированы ADR и спецификация
- Зачем:
  - решения карты должны стать устойчивой основой для реализации диаризации.
- Что:
  - добавлены ADR-007 и спецификация пословной диаризации.
  - дополнен доменный словарь и удалены закрытые направления из backlog.
- Проверка:
  - git diff --cached --check.
2026-08-14 15:55:25 +03:00

4.1 KiB

Локальная транскрипция

Контекст описывает язык проекта для локального распознавания аудио и видео.

Language

Движок распознавания: Программная среда, которая загружает и исполняет модели распознавания. Обновление движка само по себе не означает изменение выбранной модели или рекомендаций пользователю. Avoid: Модель, ASR-модель

Поддерживаемая модель: Модель, которую пользователь может выбрать явно и для которой проект обеспечивает работоспособный путь транскрипции. Этот статус не означает автоматический выбор или рекомендацию для большинства пользователей. Avoid: Доступная модель, дефолт

Модель по умолчанию: Поддерживаемая модель, которую проект выбирает без явного указания модели пользователем для определённого пути выполнения. Avoid: Рекомендуемая модель, поддерживаемая модель

Опорная разметка: Разметка, принятая за точку отсчёта при измерении чего-то другого. Опорной её делает роль в измерении, а не качество: она не выверена вручную и сама может содержать ошибки, поэтому посчитанная по ней величина осмысленна как порядок, но не как точное значение. Avoid: Эталонная разметка, истинная разметка, ground truth

Сегмент распознавания: Непрерывный временной фрагмент аудио, для которого движок возвращает связный текст с общим контекстом. Может содержать речь нескольких говорящих и не равен реплике говорящего. Avoid: Реплика, фраза говорящего

Слово с временной привязкой: Распознанное слово, положение которого известно на временной шкале записи. Минимальная единица, которой назначается говорящий. Avoid: Токен, ASR-сегмент

Разметка говорящих: Упорядоченный набор временных интервалов речи, каждому из которых назначена анонимная метка говорящего. Не содержит распознанного текста, имени участника или голосового эмбеддинга. Avoid: Результат диаризации, сегменты говорящих

Голосовой кластер: Анонимная группа интервалов разметки говорящих, которые диаризатор относит к одному голосу. Не равен подтверждённому участнику встречи: ложный или малый кластер сохраняет отдельную метку. Avoid: Участник, человек

Реплика говорящего: Последовательность соседних слов с временной привязкой, назначенных одному говорящему. Это единица структуры готового транскрипта, а не запуска модели распознавания. Avoid: Сегмент распознавания, ASR-сегмент