Куда движутся ONNX Runtime и OpenVINO: сравнение жизненного цикла #9

Closed
opened 2026-08-12 15:05:31 +03:00 by ddmitry · 2 comments
Owner

Часть карты: Карта: диаризация спикеров в транскрипте (#8)

Question

Куда движется развитие движков, на которых стоит проект, и что это значит для
диаризации?

Разведка показала, что установленная сборка onnxruntime даёт только
CPUExecutionProvider и AzureExecutionProvider — то есть сегодня OpenVINO
остаётся единственным путём к Intel iGPU и NPU, а целевая аудитория по ADR-006
это как раз машины с Intel-графикой без NVIDIA. Одновременно onnx-asr знает о
провайдерах CUDA, CoreML, TensorRT, DirectML и WebGPU, но не об OpenVINO EP.

Нужна фактическая картина, а не ощущение «ONNX побеждает»:

  • статус и темп развития ONNX Runtime и его execution providers, в первую
    очередь DirectML и OpenVINO EP: что из них живое, что в поддерживающем режиме,
    какие есть заявления о сворачивании;
  • статус OpenVINO и OpenVINO GenAI: развивается ли линейка, что происходит с
    поддержкой Whisper и с NPU;
  • соотношение слоёв: OpenVINO читает ONNX, у ORT есть OpenVINO EP — то есть это
    не конкуренты на одном уровне, и надо понять, какой из способов получить
    Intel-ускорение выглядит более долгоживущим;
  • чем на практике различаются сборки onnxruntime, onnxruntime-directml и
    onnxruntime-openvino по платформам и по доступности колёс для Python 3.13.

Итог — markdown-сводка в docs/research/, со ссылками на первоисточники.

Решение о консолидации проекта на ONNX Runtime в этой карте не принимается: оно
вынесено за скоуп и зависит от того, что покажет эта сводка. От тикета нужен
фактический материал для двух решений внутри карты — единицы привязки и
поведения диаризации на --device openvino-*.

Дополнение: WinML, AMD и Apple

По запросу автора исследование расширено, чтобы понять не только жизненный цикл
движков, но и переносимость текущих моделей проекта:

  • полноценно разобрать WinML как successor DirectML, включая Python-поставку и
    доступные vendor EP;
  • сравнить готовые пути для AMD на Windows и Linux и для Apple Silicon;
  • разобрать, почему ONNX/ONNX Runtime Web служит общим слоем между браузерами:
    WASM baseline, WebGPU/WebNN, fallback и ограничения конкретных моделей;
  • построить матрицу «ASR/диаризационная модель × устройство × движок»: загрузка,
    operator coverage и CPU fallback, сохранение таймкодов, wheel для CPython 3.13;
  • отделить подтверждённую совместимость от предположения и от проверки, которой
    нужен отдельный локальный benchmark.

Расширение даёт карте данные о переносимости, но не принимает вынесенное за
скоуп решение о консолидации проекта на одном runtime.

Часть карты: [Карта: диаризация спикеров в транскрипте](https://git.dementev.space/ddmitry/local-transcriber/issues/8) (#8) ## Question Куда движется развитие движков, на которых стоит проект, и что это значит для диаризации? Разведка показала, что установленная сборка `onnxruntime` даёт только `CPUExecutionProvider` и `AzureExecutionProvider` — то есть сегодня OpenVINO остаётся единственным путём к Intel iGPU и NPU, а целевая аудитория по ADR-006 это как раз машины с Intel-графикой без NVIDIA. Одновременно `onnx-asr` знает о провайдерах CUDA, CoreML, TensorRT, DirectML и WebGPU, но не об OpenVINO EP. Нужна фактическая картина, а не ощущение «ONNX побеждает»: - статус и темп развития ONNX Runtime и его execution providers, в первую очередь DirectML и OpenVINO EP: что из них живое, что в поддерживающем режиме, какие есть заявления о сворачивании; - статус OpenVINO и OpenVINO GenAI: развивается ли линейка, что происходит с поддержкой Whisper и с NPU; - соотношение слоёв: OpenVINO читает ONNX, у ORT есть OpenVINO EP — то есть это не конкуренты на одном уровне, и надо понять, какой из способов получить Intel-ускорение выглядит более долгоживущим; - чем на практике различаются сборки `onnxruntime`, `onnxruntime-directml` и `onnxruntime-openvino` по платформам и по доступности колёс для Python 3.13. Итог — markdown-сводка в `docs/research/`, со ссылками на первоисточники. Решение о консолидации проекта на ONNX Runtime в этой карте не принимается: оно вынесено за скоуп и зависит от того, что покажет эта сводка. От тикета нужен фактический материал для двух решений внутри карты — единицы привязки и поведения диаризации на `--device openvino-*`. ## Дополнение: WinML, AMD и Apple По запросу автора исследование расширено, чтобы понять не только жизненный цикл движков, но и переносимость текущих моделей проекта: - полноценно разобрать WinML как successor DirectML, включая Python-поставку и доступные vendor EP; - сравнить готовые пути для AMD на Windows и Linux и для Apple Silicon; - разобрать, почему ONNX/ONNX Runtime Web служит общим слоем между браузерами: WASM baseline, WebGPU/WebNN, fallback и ограничения конкретных моделей; - построить матрицу «ASR/диаризационная модель × устройство × движок»: загрузка, operator coverage и CPU fallback, сохранение таймкодов, wheel для CPython 3.13; - отделить подтверждённую совместимость от предположения и от проверки, которой нужен отдельный локальный benchmark. Расширение даёт карте данные о переносимости, но не принимает вынесенное за скоуп решение о консолидации проекта на одном runtime.
ddmitry added the wayfinder:research label 2026-08-12 15:05:31 +03:00
ddmitry self-assigned this 2026-08-12 15:41:51 +03:00
Author
Owner

Ответ

Исследование завершено: сводка о жизненном цикле и переносимости движков.

Ключевые факты:

  • ядро ONNX Runtime активно развивается; DirectML переведён в sustained engineering, новая Windows-разработка идёт через Windows ML;
  • OpenVINO EP не deprecated, но готовый wheel отстаёт от core ORT и нативного OpenVINO; для Intel более долгоживущая ставка — нативный OpenVINO/OpenVINO GenAI;
  • OpenVINO GenAI с 2026.0 уже отдаёт word-level timestamps на CPU/GPU/NPU: ограничение openvino-* находится в проектном backend-контракте, а не в движке;
  • Windows ML — доступная production-поставка ORT для Python, но vendor EP требуют Windows App SDK bootstrap, загрузки и явной регистрации; для AMD доступны legacy DirectML и MIGraphX;
  • на Linux AMD активный путь — MIGraphX; на Apple Silicon переносимый baseline — ORT CPU, ускоритель — CoreML Preview; OpenVINO/GenAI на Apple работает только на CPU;
  • браузерный выбор объясняется сочетанием единого ONNX-артефакта и ORT Web: WASM служит переносимым baseline, WebGPU/WebNN — опциональными ускорителями с operator subset и fallback;
  • наличие wheel или EP не доказывает совместимость модели, полный offload или сохранение контракта. Для GigaAM и моделей диаризации составлена минимальная матрица smoke/profile/golden tests.

Новых тикетов этой карты не добавлено: изменение контракта таймкодов уже входит в «Выбрать единицу привязки спикера к тексту», fallback-поведение — в «UX диаризации: флаг, число участников, зависимость и поведение на OpenVINO». Реализация и бенчмарки новых AMD/Apple/browser-путей лежат за пунктом назначения карты.

Артефакт зафиксирован коммитом 4c7f292.

## Ответ Исследование завершено: [сводка о жизненном цикле и переносимости движков](https://git.dementev.space/ddmitry/local-transcriber/src/commit/4c7f2920c1a7729807557771d02377a8940c3303/docs/research/2026-08-12-onnx-runtime-openvino-lifecycle.md). Ключевые факты: - ядро ONNX Runtime активно развивается; DirectML переведён в sustained engineering, новая Windows-разработка идёт через Windows ML; - OpenVINO EP не deprecated, но готовый wheel отстаёт от core ORT и нативного OpenVINO; для Intel более долгоживущая ставка — нативный OpenVINO/OpenVINO GenAI; - OpenVINO GenAI с 2026.0 уже отдаёт word-level timestamps на CPU/GPU/NPU: ограничение `openvino-*` находится в проектном backend-контракте, а не в движке; - Windows ML — доступная production-поставка ORT для Python, но vendor EP требуют Windows App SDK bootstrap, загрузки и явной регистрации; для AMD доступны legacy DirectML и MIGraphX; - на Linux AMD активный путь — MIGraphX; на Apple Silicon переносимый baseline — ORT CPU, ускоритель — CoreML Preview; OpenVINO/GenAI на Apple работает только на CPU; - браузерный выбор объясняется сочетанием единого ONNX-артефакта и ORT Web: WASM служит переносимым baseline, WebGPU/WebNN — опциональными ускорителями с operator subset и fallback; - наличие wheel или EP не доказывает совместимость модели, полный offload или сохранение контракта. Для GigaAM и моделей диаризации составлена минимальная матрица smoke/profile/golden tests. Новых тикетов этой карты не добавлено: изменение контракта таймкодов уже входит в [«Выбрать единицу привязки спикера к тексту»](https://git.dementev.space/ddmitry/local-transcriber/issues/14), fallback-поведение — в [«UX диаризации: флаг, число участников, зависимость и поведение на OpenVINO»](https://git.dementev.space/ddmitry/local-transcriber/issues/16). Реализация и бенчмарки новых AMD/Apple/browser-путей лежат за пунктом назначения карты. Артефакт зафиксирован коммитом [`4c7f292`](https://git.dementev.space/ddmitry/local-transcriber/commit/4c7f2920c1a7729807557771d02377a8940c3303).
Author
Owner

Редакционная переработка опубликована отдельным коммитом, без amend: 388de09.

Документ перестроен от слоёв и жизненного цикла к поставке по платформам, возможностям текущих моделей и последствиям для проекта. Исходный исследовательский коммит 4c7f292 сохранён в истории.

Редакционная переработка опубликована отдельным коммитом, без amend: [388de09](https://git.dementev.space/ddmitry/local-transcriber/src/commit/388de09c423f9631f4893599e378378f43f6a21b/docs/research/2026-08-12-onnx-runtime-openvino-lifecycle.md). Документ перестроен от слоёв и жизненного цикла к поставке по платформам, возможностям текущих моделей и последствиям для проекта. Исходный исследовательский коммит 4c7f292 сохранён в истории.
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Reference: ddmitry/local-transcriber#9