fix(cli)!: источник языка в шапке транскрипта на русском

- Зачем:
  - в одной строке шапки смешивались английские и русские значения, а при неизвестном языке в неё попадало служебное «unknown (не определён)».
- Что:
  - формулировки источника языка вынесены константами в formatter и переведены на русский.
  - оба бэкенда используют общий признак UNKNOWN_LANGUAGE вместо «auto» и «unknown».
  - неизвестный язык печатается одной строкой, без служебного значения.
- Проверка:
  - uv run pytest -q: 242 passed, 1 skipped.
  - ruff check .: 48 замечаний, столько же, сколько до правки.

BREAKING CHANGE: в шапке транскрипта значения detected и forced заменены на «определён автоматически» и «задан явно»; при неизвестном языке строка выглядит как «- **Язык**: не определён».
This commit is contained in:
Dmitriy Dementiev
2026-08-12 11:52:50 +03:00
parent 995dbe61f8
commit 9f11c32979
9 changed files with 90 additions and 32 deletions
+4 -2
View File
@@ -8,7 +8,7 @@ from dataclasses import dataclass
from pathlib import Path
from typing import Any
from local_transcriber.types import Segment, TranscribeResult
from local_transcriber.types import UNKNOWN_LANGUAGE, Segment, TranscribeResult
@dataclass(frozen=True)
@@ -216,7 +216,9 @@ class OnnxAsrBackend:
_notify(on_status, "Транскрибирую (onnx-asr)...")
segments: list[Segment] = []
result_language = language or _model_language(self._model_spec) or "unknown"
result_language = (
language or _model_language(self._model_spec) or UNKNOWN_LANGUAGE
)
for vad_seg in model.recognize(
audio_array, sample_rate=16000, language=language
+2 -2
View File
@@ -12,7 +12,7 @@ from typing import Any
from huggingface_hub import snapshot_download
from huggingface_hub.errors import LocalEntryNotFoundError
from local_transcriber.types import Segment, TranscribeResult
from local_transcriber.types import UNKNOWN_LANGUAGE, Segment, TranscribeResult
# (model_alias, compute_type) → HF repo
MODEL_REPOS: dict[tuple[str, str], str] = {
@@ -159,7 +159,7 @@ class OpenVINOBackend:
f"Транскрибирую (OpenVINO)... [{len(segments)} сегм.]",
)
detected_language = language or "auto"
detected_language = language or UNKNOWN_LANGUAGE
language_probability = 1.0 if language else 0.0
return TranscribeResult(