Комментарии 8
Для диаризации вы какой моделью пользуетесь? Там требуется токен или лицензионное соглашение?
В решении не готовый diarization pipeline вроде pyannote, а свой стек:
1. эмбеддинги спикеров — speechbrain/spkrec-ecapa-voxceleb (ECAPA-TDNN, 192-d);
2.кластеризация — UMAP + HDBSCAN + GMM.
для этой SpeechBrain-модели отдельный HF-токен и принятие лицензии не требуется.
Рекомендую взглянуть на проект MOSS-Transcribe-Diarize он довольно свежий, работает пусть и медленно, но качественно, правда эмбедднги не извлекает. Я так понял там Qwen зафайнтюнили так что он транскрибацию и диаризацию делает
извлечение эмбеддингов использую wespeaker/wespeaker-voxceleb-redimnet2-B6-LM
Вчера только выложил https://habr.com/ru/articles/1066622/, там как раз говорил о планах распознавания интервью стейкхолдеров
как устроена модел?
На мой взгляд, самая сильная часть идеи это уход от обычного "транскрипт + summary" к фиксации позиций в разрезе "speaker + entity".
На реальных BI-внедрениях проблема часто не в том, что договорённости не записали, а в том, что разные стейкхолдеры по-разному понимают одну и ту же метрику или бизнес-сущность. А через несколько месяцев уже никто не помнит, почему в итоге выбрали именно такой вариант.

AudioToText: управление требованиями через записи встреч