docs: уточнены ограничения авто-профиля и профиль turbo

- Зачем:
  - документация обещала large-v3-turbo на NVIDIA, где он недоступен, и умалчивала, что модель по умолчанию без CUDA понимает только русскую речь.
- Что:
  - large-v3-turbo перенесён из таблицы faster-whisper в раздел OpenVINO с измеренными размерами моделей.
  - языковое ограничение авто-профиля и предупреждение CLI описаны в README, gpu.md и ADR-006.
  - в backlog добавлен пункт про turbo для faster-whisper, в gpu.md снято расхождение по скорости openvino-cpu.
- Проверка:
  - вычитка diff, проверка якорной ссылки на docs/gpu.md.
This commit is contained in:
Dmitriy Dementiev
2026-08-12 11:53:09 +03:00
parent 9f11c32979
commit dae9d107c9
5 changed files with 73 additions and 10 deletions
+1 -1
View File
@@ -64,7 +64,7 @@ transcribe <путь_к_файлу> [опции]
- **Дата транскрипции**: 2026-03-17 14:30:05
- **Модель**: large-v3
- **Язык**: ru (detected) / ru (forced)
- **Язык**: ru (задан явно) / ru (определён автоматически)
- **Длительность**: 01:23:45
- **Устройство**: CUDA (NVIDIA GeForce RTX 3060)
+9 -3
View File
@@ -107,6 +107,11 @@ GigaAM v3 E2E RNN-T — модель по умолчанию на машинах
Порядок `--device auto`: CUDA при наличии `nvidia-smi`, иначе ONNX. OpenVINO и
FasterWhisper CPU остаются доступными через явный CLI-аргумент или конфиг.
GigaAM понимает только русскую речь, поэтому для остальных языков автоматический
профиль не годится — нужен явный Whisper. Несовместимый язык работу не
останавливает: CLI предупреждает о нём до начала распознавания и называет
подходящий профиль.
Модели:
- **`gigaam-v3-e2e-rnnt`** — модель по умолчанию: практически равна обычному
GigaAM по скорости, немного уступает по WER, но выдаёт готовую пунктуацию для
@@ -132,10 +137,11 @@ FasterWhisper CPU остаются доступными через явный CL
## Открытые вопросы / следующие шаги
- **Galлюцинации Whisper medium на длинных файлах** — отдельный продуктовый риск, требующий собственного исследования. Возможно, имеет смысл ограничить максимальную длину чанка для openvino-medium, или дать предупреждение пользователю.
- **Галлюцинации Whisper medium на длинных файлах** — отдельный продуктовый риск, требующий собственного исследования. Возможно, имеет смысл ограничить максимальную длину чанка для openvino-medium, или дать предупреждение пользователю.
- **Canary** (`nemo-canary-1b-v2`) — тяжелее, но multilingual + пунктуация. Кандидат на «лучшее качество за разумную скорость» для тех, кому важна пунктуация.
- Проверить профиль на других языках и при необходимости добавить явные
многоязычные рекомендации; автоматическая политика намеренно не зависит от языка.
- Проверить качество на других языках и при необходимости дополнить
многоязычные рекомендации. Сама автоматическая политика от языка не зависит:
она предупреждает о несовместимости, но профиль за пользователя не меняет.
## Отклонённые альтернативы
+16
View File
@@ -252,6 +252,22 @@ SQL`), словарь пользовательский в `.transcriber.toml`.
---
### `large-v3-turbo` для faster-whisper
**Что:** Добавить `large-v3-turbo` в каталог faster-whisper, чтобы модель была
доступна с `--device cuda` и `--device cpu`, а не только через OpenVINO.
**Почему:** На CPU turbo INT8 оказался быстрее `medium` и точнее по WER
([сравнение от 2026-08-12](benchmarks/2026-08-12-openvino-large-v3-turbo-comparison.md)),
и владельцам NVIDIA этот профиль сейчас недоступен без ручного указания
репозитория HuggingFace.
**Почему откладывается:** каталог faster-whisper в проекте собран из
репозиториев `Systran`, и для turbo нужно сначала выяснить, какая CT2-сборка
годится, проверить её происхождение и качество, и только потом вносить в код.
---
## Отклонённые направления
*(пока пусто — добавлять сюда то, что попробовали и решили не делать, с причиной)*
+12 -1
View File
@@ -6,7 +6,7 @@
- `cuda` — строго NVIDIA GPU, ошибка если недоступен
- `openvino` — авто-выбор OpenVINO GPU или CPU
- `openvino-gpu` — строго Intel GPU через OpenVINO
- `openvino-cpu` — строго CPU через OpenVINO (ускорение 2-4x на x86)
- `openvino-cpu` — строго CPU через OpenVINO (3-10x на x86, зависит от модели)
- `cpu` — строго CPU (faster-whisper/CTranslate2)
## Какой бэкенд на каком оборудовании
@@ -22,6 +22,10 @@
\* По результатам контрольных прогонов на Intel и AMD CPU. Реальная скорость
зависит от CPU, модели и записи.
Автоматический профиль без NVIDIA рассчитан на русскую речь: GigaAM других
языков не понимает. Для них берите Whisper — `openvino-cpu` на x86 или `cpu`
на любой платформе.
## OpenVINO
OpenVINO ускоряет inference на x86 процессорах (Intel и AMD) через оптимизированные инструкции
@@ -44,6 +48,13 @@ OpenVINO ускоряет inference на x86 процессорах (Intel и AM
| large-v3 | OpenVINO/whisper-large-v3-int8-ov | OpenVINO/whisper-large-v3-fp16-ov |
| large-v3-turbo | OpenVINO/whisper-large-v3-turbo-int8-ov | OpenVINO/whisper-large-v3-turbo-fp16-ov |
Размер в кеше HuggingFace: `medium` int8 — 748 MB, `large-v3-turbo` int8 —
790 MB, `large-v3-turbo` fp16 — 1552 MB. Это меньше, чем у тех же моделей для
faster-whisper, потому что веса уже квантизированы.
Модель `large-v3-turbo` доступна только в OpenVINO: для `--device cuda` и
`--device cpu` каталог faster-whisper заканчивается на `large-v3`.
### Результаты тестирования OpenVINO
Актуальное сравнение OpenVINO 2026.3 на трёх русскоязычных встречах: