From b260dab0476afce6d72129d72b4fcb1abbdfbc3c Mon Sep 17 00:00:00 2001 From: Dmitriy Dementiev Date: Fri, 14 Aug 2026 15:18:59 +0300 Subject: [PATCH] =?UTF-8?q?docs(domain):=20=D0=B4=D0=BE=D0=B1=D0=B0=D0=B2?= =?UTF-8?q?=D0=BB=D0=B5=D0=BD=D0=B0=20=D1=80=D0=B0=D0=B7=D0=BC=D0=B5=D1=82?= =?UTF-8?q?=D0=BA=D0=B0=20=D0=B3=D0=BE=D0=B2=D0=BE=D1=80=D1=8F=D1=89=D0=B8?= =?UTF-8?q?=D1=85?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - Зачем: - потребовалось отделить временный результат диаризации от итоговых реплик транскрипта. - Что: - добавлено определение разметки говорящих и перечислены нежелательные синонимы. - уточнено, что разметка не содержит текст, имена участников и голосовые эмбеддинги. - Проверка: - выполнена команда git diff --cached --check. --- CONTEXT.md | 4 ++++ 1 file changed, 4 insertions(+) diff --git a/CONTEXT.md b/CONTEXT.md index 1c44474..6891e37 100644 --- a/CONTEXT.md +++ b/CONTEXT.md @@ -28,6 +28,10 @@ _Avoid_: Реплика, фраза говорящего Распознанное слово, положение которого известно на временной шкале записи. Минимальная единица, которой назначается говорящий. _Avoid_: Токен, ASR-сегмент +**Разметка говорящих**: +Упорядоченный набор временных интервалов речи, каждому из которых назначена анонимная метка говорящего. Не содержит распознанного текста, имени участника или голосового эмбеддинга. +_Avoid_: Результат диаризации, сегменты говорящих + **Реплика говорящего**: Последовательность соседних слов с временной привязкой, назначенных одному говорящему. Это единица структуры готового транскрипта, а не запуска модели распознавания. _Avoid_: Сегмент распознавания, ASR-сегмент