From a06dbe63a3b27e45771caa9caa64e4e6e46d7b16 Mon Sep 17 00:00:00 2001 From: Dmitriy Dementiev Date: Tue, 11 Aug 2026 16:28:45 +0300 Subject: [PATCH] =?UTF-8?q?docs(benchmark):=20=D1=81=D1=80=D0=B0=D0=B2?= =?UTF-8?q?=D0=BD=D0=B5=D0=BD=D1=8B=20GigaAM=20Large=20=D0=B8=20Parakeet?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Зачем: - зафиксировать сравнение моделей на одном и том же массиве записей - сохранить воспроизводимый набор файлов для будущих прогонов Что: - добавлены метрики и качественный вывод по Parakeet v3 - записаны точные имена, размеры и SHA-256 видео и эталонов - обновлена рекомендация в README Проверка: - git diff --check --- README.md | 7 +-- .../2026-08-11-gigaam-model-comparison.md | 47 +++++++++++++++++++ 2 files changed, 51 insertions(+), 3 deletions(-) diff --git a/README.md b/README.md index cfcca3b..52ecb70 100644 --- a/README.md +++ b/README.md @@ -287,7 +287,7 @@ language = "en" | `gigaam-multilingual-large-ctc` | ~590 MB | 4,8×* | ru, en, kk, ky, uz | ❌ | | `gigaam-v3-e2e-ctc` | ~300 MB | 11,9×* | ru | ✅ | | `gigaam-v3-e2e-rnnt` | ~300 MB | 11,5×* | ru | ✅ | -| `parakeet-v3` | ~600 MB | 12-20× | 25 языков | ✅ | +| `parakeet-v3` | ~600 MB | 7,6×* | 25 языков | ✅ | \* Наблюдение на AMD Ryzen 7 8845H, Windows, `int8`, три записи общей длительностью 43:37. Это не приёмочный замер для целевого Intel Core i5. @@ -299,8 +299,9 @@ language = "en" > точный по словам `gigaam-v3` без пунктуации. Для смешанной речи с приоритетом > качества используйте `gigaam-multilingual-large-ctc`: она примерно вдвое > медленнее small-варианта, но приблизилась к monolingual GigaAM по WER. -> `parakeet-v3` на русском воспроизводит проблемы из -> [ADR-005](docs/adr/005-parakeet-evaluation.md). +> `parakeet-v3` в 1,58 раза быстрее Large и ставит пунктуацию, но на тех же +> трёх записях хуже по WER и вставляет ложные английские фразы в русскую речь; +> это подтверждает проблемы из [ADR-005](docs/adr/005-parakeet-evaluation.md). Обе GigaAM Multilingual сами распознают русский, английский, казахский, кыргызский и узбекский внутри одной записи. `onnx-asr` не передаёт этим моделям diff --git a/docs/benchmarks/2026-08-11-gigaam-model-comparison.md b/docs/benchmarks/2026-08-11-gigaam-model-comparison.md index f613cb5..883d13a 100644 --- a/docs/benchmarks/2026-08-11-gigaam-model-comparison.md +++ b/docs/benchmarks/2026-08-11-gigaam-model-comparison.md @@ -30,6 +30,21 @@ Сырые записи и внешние транскрипты не коммитятся в репозиторий. +### Манифест файлов + +На тестовом ноутбуке все файлы находятся в `C:\Users\ddmitry\Videos\OBS`. +Размер и SHA-256 позволяют проверить, что в повторном прогоне используется та +же версия записи или ориентира. + +| Набор | Роль | Имя файла | Размер, байт | SHA-256 | +|---|---|---|---:|---| +| BDMA | видео | `2026-07-29 T2 BDMA уточнение задачи от Ильи.mp4` | 19 216 865 | `51866D247FE3EDA134CDD884F707B1F1DB8855B492E8BD14D2B56B62476255ED` | +| BDMA | ориентир | `2026-07-29 T2 BDMA уточнение задачи от Ильи.md` | 18 000 | `9098548743A86F868DFCDD906BCDE34ED1CE5A935602CBE399F4BCEDA8685B3C` | +| RSQM | видео | `2026-02-18 RSQM дейлик внутренний.mp4` | 19 694 785 | `E72000BE43A5E04BFB670B0A16D85D8AEA51A02A285ED778FF5726767E97E9B0` | +| RSQM | ориентир | `2026-02-18 RSQM дейлик внутренний_transcript.md` | 16 128 | `260DF5D6964817434092005936127C0DC2C22682B7CB20FF07D14C5D81B8D287` | +| DataCat | видео | `2026-03-23 T2 DataCat - архитектура в контуре заказчика - первое обсуждение с Машей.mp4` | 22 584 108 | `ACFF960A68AAA6A305F7E7053BB0642B5DA265B68865ABD018E7C9A8980AC3F5` | +| DataCat | ориентир | `2026-03-23 T2 DataCat - архитектура в контуре заказчика - первое обсуждение с Машей-transcript-whsper.md` | 24 874 | `7943944A0A046EAA3A1384CAC47D36B381FBEF2FCFDF18089411619F00725456` | + ## Запись 1: уточнение задачи BDMA Файл `2026-07-29 T2 BDMA уточнение задачи от Ильи.mp4`, длительность 14:51, @@ -42,6 +57,7 @@ | GigaAM v3 | **72,6 с** | **12,27×** | 26,5% | 0 | | GigaAM Multilingual CTC | 84,8 с | 10,51× | 27,9% | 0 | | GigaAM Multilingual Large CTC | 192,0 с | 4,64× | 27,5% | 0 | +| Parakeet v3 | 119,2 с | 7,47× | 28,2% | 338 | | GigaAM v3 E2E RNN-T | 76,1 с | 11,71× | 29,0% | 326 | | GigaAM v3 E2E CTC | **72,6 с** | **12,27×** | 31,8% | 338 | @@ -58,12 +74,14 @@ cached-прогон для точного замера. | RSQM | GigaAM v3 | 75,1 с | 11,25× | **23,1%** | | RSQM | Multilingual CTC | 82,7 с | 10,21× | 24,4% | | RSQM | Multilingual Large CTC | 163,4 с | 5,17× | 23,8% | +| RSQM | Parakeet v3 | 103,7 с | 8,14× | 29,1% | | RSQM | E2E RNN-T | 72,8 с | 11,60× | 25,4% | | RSQM | E2E CTC | **71,1 с** | **11,88×** | 28,0% | | RSQM | FasterWhisper medium | 686,1 с | 1,23× | **19,7%** | | DataCat | GigaAM v3 | **74,8 с** | **11,79×** | 27,5% | | DataCat | Multilingual CTC | 94,2 с | 9,36× | 27,9% | | DataCat | Multilingual Large CTC | 189,6 с | 4,65× | 26,7% | +| DataCat | Parakeet v3 | 122,7 с | 7,19× | 27,9% | | DataCat | E2E RNN-T | 78,0 с | 11,31× | **26,4%** | | DataCat | E2E CTC | 76,0 с | 11,60× | 28,3% | | DataCat | FasterWhisper medium | 954,5 с | 0,92× | **21,9%** | @@ -84,6 +102,7 @@ WER ниже посчитан как micro-average: сумма ошибок по | GigaAM Multilingual Large CTC | 545,0 с | 4,80× | **26,2%** | 0 | | GigaAM v3 E2E RNN-T | 226,9 с | 11,54× | 26,9% | 290 | | GigaAM Multilingual CTC | 261,7 с | 10,00× | 26,9% | 0 | +| Parakeet v3 | 345,6 с | 7,57× | 28,3% | 301 | | GigaAM v3 E2E CTC | **219,7 с** | **11,91×** | 29,3% | 305 | \* Для BDMA использована оценка 871 секунд чистого inference: первый запуск @@ -96,6 +115,26 @@ Multilingual Small медленнее обычного GigaAM на 18%, а вы Multilingual Large в 2,08 раза медленнее Small и в 2,45 раза медленнее обычного GigaAM, но всё ещё в 4,6 раза быстрее FasterWhisper. +### GigaAM Multilingual Large против Parakeet v3 + +Large точнее Parakeet на каждой записи: 27,5% против 28,2% WER на BDMA, +23,8% против 29,1% на RSQM и 26,7% против 27,9% на DataCat. В сумме Large +получила 26,2% WER против 28,3%. Особенно заметна разница в пропусках: +103 удаления у Large против 264 у Parakeet. + +Parakeet обработала набор за 345,6 секунды против 545,0 секунды у Large, то +есть была в 1,58 раза быстрее, и сразу расставила пунктуацию. Однако ручное +чтение выявило частые ложные переключения языка. В русских репликах RSQM +появляются `Yeah`, `No`, `Just die`, `What foo`; в DataCat — `Don't`, +`Skid of all`, `Talk no`, `Boy`. Это не единичная орфографическая ошибка, а +искажение обычной русской речи. Large в тех же местах сохраняет русский смысл, +хотя передаёт английские термины фонетически и не ставит пунктуацию. + +На этом массиве Large предпочтительнее по качеству и сохранности содержания. +Parakeet интересна как более быстрый вариант с пунктуацией, но для русских +встреч требует обязательной ручной проверки и не рекомендуется как основной +профиль. + ## Качественное чтение Независимый reviewer сначала прочитал полные тексты без таблицы метрик, затем @@ -120,6 +159,9 @@ GigaAM, но всё ещё в 4,6 раза быстрее FasterWhisper. с monolingual GigaAM по совокупному WER: 26,2% против 26,0%. При ручном чтении скрытой деградации не найдено, но пунктуации по-прежнему нет, а термины передаются преимущественно фонетически (`файнбиай`, `найфай`, `терадата`). +- Parakeet v3 быстрее Large и выдаёт пунктуацию, но хуже по WER на всех трёх + записях, чаще пропускает слова и вставляет ложные английские фразы в русскую + речь. Для этого массива преимущество в читаемости не компенсирует искажения. Длинных автономных галлюцинаций не найдено. Есть локальные потенциально опасные искажения имён и терминов: `Иришка`, `Lutriness`, «расчёт @@ -146,6 +188,9 @@ FasterWhisper лучше сохраняет `API`, `ETL`, `Open Platform`; об `gigaam-multilingual-large-ctc`. Она устойчиво лучше Small и почти равна monolingual GigaAM по WER, но требует 545 секунд против 262 секунд на том же наборе. Small остаётся вариантом с приоритетом скорости. +- `parakeet-v3` в 1,58 раза быстрее Large и содержит пунктуацию, однако хуже + по WER на всех трёх записях и нестабилен на русской речи. Использовать его + стоит только там, где скорость и готовая пунктуация важнее сохранности текста. - `gigaam-v3-e2e-ctc` преимуществ на этом наборе не показала. - FasterWhisper medium остаётся выбором для важных записей с плотной терминологией, если допустима обработка около realtime. По трём файлам она в @@ -165,6 +210,8 @@ FasterWhisper лучше сохраняет `API`, `ETL`, `Open Platform`; об uv run transcribe --device onnx --model --compute-type int8 ``` +Для всех прогонов явно передавался язык `--language ru`. + Время измерялось на прогретом кеше модели. WER считался после удаления метаданных и таймкодов, приведения к нижнему регистру, замены `ё` на `е` и удаления пунктуации.