docs(benchmark): расширено сравнение моделей на русских встречах

- Зачем:
  - выбор CPU-модели должен опираться на несколько реальных записей, а не на единичный прогон.
- Что:
  - добавлены скорость, WER и качественное сравнение пяти моделей на трёх встречах.
  - обновлены рекомендации README и открытый вопрос ADR-006 для E2E RNN-T.
- Проверка:
  - git diff --cached --check.
This commit is contained in:
Dmitriy Dementiev
2026-08-11 15:45:28 +03:00
parent 7392d72bca
commit f0d7d06f93
3 changed files with 167 additions and 8 deletions
+7 -7
View File
@@ -286,14 +286,14 @@ language = "en"
| `parakeet-v3` | ~600 MB | 12-20× | 25 языков | ✅ |
\* Наблюдение на AMD Ryzen 7 8845H, Windows, `int8`, запись 14:51. Это не
приёмочный замер для целевого Intel Core i5.
приёмочный замер для целевого Intel Core i5. Методика и качественное сравнение:
[benchmark GigaAM и Whisper](docs/benchmarks/2026-08-11-gigaam-model-comparison.md).
> **Рекомендация**: для русского по-прежнему используйте проверенный `gigaam-v3`
> (см. [ADR-006](docs/adr/006-onnx-asr-backend.md)). E2E-модели добавляют
> пунктуацию и нормализацию, но их скорость на слабых CPU не измерялась;
> `gigaam-v3-e2e-rnnt` декодирует последовательно и особенно медленна на длинных
> записях. `parakeet-v3` на русском воспроизводит проблемы из
> [ADR-005](docs/adr/005-parakeet-evaluation.md).
> **Рекомендация**: для готового читаемого русского текста
> используйте `gigaam-v3-e2e-rnnt`, для последующей машинной обработки — более
> точный по словам `gigaam-v3` без пунктуации. Вывод проверен на трёх реальных
> записях общей длительностью 43:37. `parakeet-v3` на русском воспроизводит
> проблемы из [ADR-005](docs/adr/005-parakeet-evaluation.md).
GigaAM Multilingual сама распознаёт русский, английский, казахский, кыргызский и
узбекский внутри одной записи. `onnx-asr` не передаёт этой модели подсказку