Pipecat протестировала 23 STT-модели для голосовых агентов: единого лидера нет
Pipecat от Daily опубликовала открытый бенчмарк 23 моделей распознавания речи в реальном времени: 1000 живых фраз, оценка задержки (TTFS) и семантической точности. Результаты образуют кривую Парето: NVIDIA Nemotron 3.0 ASR — самая быстрая (221 мс медиана), Meta muse-voice-transcribe-1.0 — самая точная (0,83% semantic WER).
- Бенчмарк: 1000 реальных фраз, стриминг, метрики TTFS и semantic WER, код и данные открыты
- Nemotron 3.0 ASR: 221 мс медиана TTFS при 1,95% semantic WER
- Meta muse-voice-transcribe-1.0: 0,83% semantic WER при 392 мс TTFS
- 16 из 23 моделей уступают лидерам сразу по скорости и точности
Читать дальше
ИИ