OpenAI выпустила две новые модели распознавания речи: GPT Transcribe для обработки аудиофайлов и GPT Live Transcribe для потоковой расшифровки речи с низкой задержкой. Обе модели уже доступны через API и ориентированы на разработчиков, которым нужны мультиязычное распознавание, учет текстового контекста и работа в реальном времени.
GPT Transcribe: быстрее офлайн‑расшифровки
GPT Transcribe предназначена для пакетной обработки аудио и видеофайлов. По данным OpenAI, модель способна обрабатывать записи примерно в 34 раза быстрее реального времени, что делает ее удобной для транскрибации интервью, подкастов, лекций и корпоративных архивов. Она поддерживает учет предварительного текстового контекста и списка ключевых слов, что помогает точнее распознавать профессиональную терминологию, имена и названия компаний.
GPT Live Transcribe: ставка на низкую задержку
Вторая модель — GPT Live Transcribe — оптимизирована для потокового распознавания речи. Она предназначена для голосовых интерфейсов, звонков, видеоконференций и других сценариев, где критична минимальная задержка между произнесенной фразой и появлением текста. Модель также поддерживает мультиязычный ввод и контекстные подсказки.
Что показывают тесты
По данным Artificial Analysis, GPT Transcribe демонстрирует уровень ошибок в словах (WER) 3,3% на бенчмарке AA‑WER, что примерно на 0,7 процентного пункта лучше, чем у GPT-4o Transcribe. В общем рейтинге модель пока не занимает первое место.
Модель | WER |
Alibaba Fun‑Realtime‑ASR‑Preview | 1,7% |
ElevenLabs Scribe v2 | 2,2% |
Microsoft MAI‑Transcribe-1.5 | 2,4% |
Mistral Voxtral Small | 2,8% |
Gemini 3.1 Pro | 2,8% |
OpenAI GPT Transcribe | 3,3% |
OpenAI заметно улучшила собственные модели распознавания речи, но по текущим независимым оценкам они все еще уступают лидерам рынка.
GPT Transcribe стоит $0,0045 за минуту аудио, а GPT Live Transcribe — $0,017 за минуту. Модели стали заметно дешевле.
