Pull to refresh
3
Александр Кузнецов@Ko4Ai

Product Owner

7
Subscribers
Send message

Швейцарский ножик для распознавания речи

Level of difficultyMedium
Reading time12 min
Reach and readers11K

ASR-системы в проде - это тяжёлые, специализированные решения под конкретные сценарии. Но что делать, если нужен универсальный инструмент, который умеет распознать длинное аудио, диаризовать спикеров, обработать пачку файлов и при этом не требует целого GPU кластера?

В этой серии статей я разбираю, как собрать «швейцарский ножик» для распознавания речи на базе Whisper: выбрать модель, победить галлюцинации, стабилизировать обработку длинных аудио и выжать максимум из обычной видеокарты.

Первая часть - про выбор ASR, оптимизацию инференса и практические грабли, с которыми сталкиваешься, когда пытаешься превратить open-source модель в рабочий инструмент.

Читать далее

Information

Rating
Does not participate
Location
Россия
Registered
Activity

Specialization

ML разработчик
Python
TypeScript
JavaScript