docs(benchmark): расширено сравнение моделей на русских встречах
- Зачем: - выбор CPU-модели должен опираться на несколько реальных записей, а не на единичный прогон. - Что: - добавлены скорость, WER и качественное сравнение пяти моделей на трёх встречах. - обновлены рекомендации README и открытый вопрос ADR-006 для E2E RNN-T. - Проверка: - git diff --cached --check.
This commit is contained in:
@@ -286,14 +286,14 @@ language = "en"
|
||||
| `parakeet-v3` | ~600 MB | 12-20× | 25 языков | ✅ |
|
||||
|
||||
\* Наблюдение на AMD Ryzen 7 8845H, Windows, `int8`, запись 14:51. Это не
|
||||
приёмочный замер для целевого Intel Core i5.
|
||||
приёмочный замер для целевого Intel Core i5. Методика и качественное сравнение:
|
||||
[benchmark GigaAM и Whisper](docs/benchmarks/2026-08-11-gigaam-model-comparison.md).
|
||||
|
||||
> **Рекомендация**: для русского по-прежнему используйте проверенный `gigaam-v3`
|
||||
> (см. [ADR-006](docs/adr/006-onnx-asr-backend.md)). E2E-модели добавляют
|
||||
> пунктуацию и нормализацию, но их скорость на слабых CPU не измерялась;
|
||||
> `gigaam-v3-e2e-rnnt` декодирует последовательно и особенно медленна на длинных
|
||||
> записях. `parakeet-v3` на русском воспроизводит проблемы из
|
||||
> [ADR-005](docs/adr/005-parakeet-evaluation.md).
|
||||
> **Рекомендация**: для готового читаемого русского текста
|
||||
> используйте `gigaam-v3-e2e-rnnt`, для последующей машинной обработки — более
|
||||
> точный по словам `gigaam-v3` без пунктуации. Вывод проверен на трёх реальных
|
||||
> записях общей длительностью 43:37. `parakeet-v3` на русском воспроизводит
|
||||
> проблемы из [ADR-005](docs/adr/005-parakeet-evaluation.md).
|
||||
|
||||
GigaAM Multilingual сама распознаёт русский, английский, казахский, кыргызский и
|
||||
узбекский внутри одной записи. `onnx-asr` не передаёт этой модели подсказку
|
||||
|
||||
Reference in New Issue
Block a user