feat(auto): выбран ONNX по умолчанию без CUDA

- Зачем:
  - пользователям без NVIDIA нужен самый быстрый и читаемый CPU-профиль без дополнительных параметров.
- Что:
  - auto-политика изменена на CUDA при наличии nvidia-smi, иначе ONNX GigaAM RNN-T int8.
  - сохранён приоритет явных значений CLI и конфигурации для OpenVINO и FasterWhisper CPU.
  - обновлены тесты, README, PRD, ADR, GPU-документация и вывод benchmark.
- Проверка:
  - uv run pytest -q: 232 passed, 1 skipped.
  - uv lock --check и git diff --cached --check.
This commit is contained in:
Dmitriy Dementiev
2026-08-12 10:45:05 +03:00
parent 12e17020bf
commit 136e93765c
13 changed files with 177 additions and 115 deletions
@@ -304,23 +304,21 @@ INT8 почти равен ему. Они лучше удерживают `FineB
### Что это означает для профиля по умолчанию
Результаты поддерживают ONNX GigaAM RNN-T как основной кандидат для русской
речи на CPU: он быстрее всех на обеих машинах, дважды занял первое место по
читаемости и пригодности для конспекта и использует VAD. Но делать его
безусловным глобальным `--device auto` преждевременно:
Результаты поддерживают ONNX GigaAM RNN-T как основной CPU-профиль: он быстрее
всех на обеих машинах, дважды занял первое место по читаемости и пригодности
для конспекта и использует VAD. После обсуждения принята простая политика:
`--device auto` выбирает CUDA при наличии `nvidia-smi`, иначе ONNX.
Ограничения выбора сохраняются:
- GigaAM ориентирован на русский язык и хуже сохраняет латиницу, аббревиатуры,
названия систем и компаний;
- OpenVINO Whisper остаётся многоязычным путём и умеет использовать Intel GPU;
- Turbo лучше GigaAM по WER и техническим терминам, хотя хуже подготовлен для
непосредственного чтения;
- изменение существующего auto-пути будет несовместимым изменением поведения и
требует отдельной продуктовой задачи с language-aware выбором.
Практичный кандидат на будущую политику: `CUDA` для NVIDIA, OpenVINO для Intel
GPU, ONNX GigaAM RNN-T для явно русской речи на CPU, OpenVINO/Whisper для других
языков и явный выбор Turbo для технически насыщенных встреч. В рамках текущей
задачи эта политика не реализуется.
- изменение существующего auto-пути является несовместимым изменением поведения;
явные значения из CLI и конфигурации остаются способом сохранить прежний
OpenVINO/Whisper-профиль или выбрать Turbo для технически насыщенных встреч.
## Вывод
@@ -338,8 +336,9 @@ GPU, ONNX GigaAM RNN-T для явно русской речи на CPU, OpenVIN
протокола может потребоваться последующая расстановка пунктуации.
- Автоматических предупреждений о повторах или потере хвоста после обновления
не было; ручная проверка нашла у medium одиночный ложный сегмент в конце RSQM.
- Модель по умолчанию и порядок `--device auto` оставлены без изменений. Решение
об их изменении требует отдельной продуктовой задачи.
- В самом benchmark-коммите модель по умолчанию и порядок `--device auto` не
менялись; по итогам анализа отдельно принято решение использовать ONNX на
машинах без CUDA.
- Повторный Ryzen-прогон подтвердил, что прежний блок из 11 повторов `medium`
не воспроизводится: четыре последовательных прохода дали одинаковый текст без
повторов и ложного хвоста. Это подтверждение для контрольного файла, а не