Обновить

NVIDIA показала голосовой AI, который умеет слушать и отвечать одновременно

NVIDIA представила NemotronLabs VoiceChat — голосовую модель для диалогов в реальном времени. В отличие от классической связки ASR → LLM → TTS, здесь понимание речи и её генерация объединены в одной архитектуре.

Главная особенность — полный дуплекс. Пользователь может перебить агента прямо во время ответа, а система продолжит разговор без переключения в отдельный режим. Модель также умеет вызывать инструменты прямо в процессе диалога — например, запрашивать данные из внешнего сервиса.

За обработку аудио отвечает Conformer-модуль, после чего аудиоток поступает в NVIDIA Nemotron Nano 9B v2. Отдельный канал используется для генерации сценариев вызова инструментов, а TTS-декодер превращает результат обратно в речь.

При этом проект пока рассчитан скорее на разработчиков: для запуска требуется NVIDIA GPU минимум с 80 ГБ видеопамяти. Выпущенная версия использует один фиксированный голос и не поддерживает клонирование голоса.

Сам экспериментальный код и инструкции NVIDIA разместила в репозитории VoiceChat на GitHub.

Похоже, голосовые агенты постепенно уходят от сценария «сначала договорите, потом я отвечу» к действительно живому разговору.

✔ Код — журнал о технологиях https://t.me/kodjournal подпишитесь на наш Telegram-канал! 😎

Теги:
+2
Комментарии0

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

Я перестал пользоваться самыми умными ИИ‑моделями. Программировать стало быстрее и дешевле

Публикации