Обновить

Комментарии 8

Для диаризации вы какой моделью пользуетесь? Там требуется токен или лицензионное соглашение?

В решении не готовый diarization pipeline вроде pyannote, а свой стек:
1. эмбеддинги спикеров — speechbrain/spkrec-ecapa-voxceleb (ECAPA-TDNN, 192-d);

2.кластеризация — UMAP + HDBSCAN + GMM.

для этой SpeechBrain-модели отдельный HF-токен и принятие лицензии не требуется.

Рекомендую взглянуть на проект MOSS-Transcribe-Diarize он довольно свежий, работает пусть и медленно, но качественно, правда эмбедднги не извлекает. Я так понял там Qwen зафайнтюнили так что он транскрибацию и диаризацию делает

извлечение эмбеддингов использую wespeaker/wespeaker-voxceleb-redimnet2-B6-LM

Спасибо! 🤝

Вчера только выложил https://habr.com/ru/articles/1066622/, там как раз говорил о планах распознавания интервью стейкхолдеров

как устроена модел?

На github схема данных есть в доках.

На мой взгляд, самая сильная часть идеи это уход от обычного "транскрипт + summary" к фиксации позиций в разрезе "speaker + entity".

На реальных BI-внедрениях проблема часто не в том, что договорённости не записали, а в том, что разные стейкхолдеры по-разному понимают одну и ту же метрику или бизнес-сущность. А через несколько месяцев уже никто не помнит, почему в итоге выбрали именно такой вариант.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации