Обновить
0

Пользователь

Отправить сообщение

Спасибо, интересно и полезно: попробую применить ваш подход в голосовом ассистенте вместо VAD. Но очень удивили замеры в первой таблице. Неужели действительно 3мс и 5мс от конца реплики до первого звука ответа?

Не помню, пробовал ли без ризонинга. Надо поэкспериментировать, спасибо за подсказку.

Сейчас перезапустил свою колонку-ассистента с whisper small: 827-855 мс на транскибацию нескольких "Андромеда, как дела?".
На gigaAM – 83-110 мс (на разные реплики - данные из предыдущих метрик).
Обе модели на mac-mini м4 16GB, с прогревом.

Чтобы было ощущение реального разговора с ассистентом, локальные llm не особо подходят. Долго думают. Самый быстрый ответ приходит от Cerebras – 200-500 мс. А вот про wake, vad, stt и tts локально – вам выше правильно написали. Только вместо whisper лучше взять gigaAM, она быстрее работает. Если хорошо помню, на порядок быстрее.

Информация

В рейтинге
Не участвует
Зарегистрирован
Активность