Статьи / Профиль Ko4Ai / Хабр

Ko4Ai 3 мар в 16:00

Швейцарский ножик для распознавания речи

Средний

12 мин

11K

Python * TypeScript * Звук

Кейс

ASR-системы в проде - это тяжёлые, специализированные решения под конкретные сценарии. Но что делать, если нужен универсальный инструмент, который умеет распознать длинное аудио, диаризовать спикеров, обработать пачку файлов и при этом не требует целого GPU кластера?

В этой серии статей я разбираю, как собрать «швейцарский ножик» для распознавания речи на базе Whisper: выбрать модель, победить галлюцинации, стабилизировать обработку длинных аудио и выжать максимум из обычной видеокарты.

Первая часть - про выбор ASR, оптимизацию инференса и практические грабли, с которыми сталкиваешься, когда пытаешься превратить open-source модель в рабочий инструмент.

+13

Швейцарский ножик для распознавания речи

Информация

Специализация