Обновить
32K+

Голосовые интерфейсы *

управляем устройствами при помощи голосовых команд

23,65
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Мы опубликовали стабильный, быстрый, качественный и доступный синтез ещё для 29 языков России

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели13K

В прошлый раз у нас получилось покрыть 20 самых популярных языков России и СНГ с рядом оговорок. Но основным недостатком моделей было то, что значительная группа языков была вообще не покрыта, в основном многочисленные языки Кавказа, Дагестана и Чечни. С лингвистической точки зрения из популярных крупных языковых групп были не покрыты абхазо-адыгские и нахско-дагестанские языки.

Что сделали в этот раз?

Новости

Alpha Connect: Подключаем Альфу к Home Assistant с помощью своей интеграции

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели13K

Привет, Хабр!

Время от времени я возвращаюсь к своему PET-проекту приватного и независимого от сторонних сервисов голосового ассистента под кодовым названием «Альфа», который разработан для голосового взаимодействия с умным домом на базе Home Assistant. Простыми словами — это приватная умная колонка для управления умным домом. В этот раз я решил заняться вопросом «нормального» взаимодействия «Альфы» и Home Assistant. А что из этого вышло — читайте далее.

Читать далее

Готовит ли OpenAI новую революцию в IT?

Время на прочтение3 мин
Охват и читатели12K

Некоторое время назад появилась новость, что Сэм Альтман и Джонни Айв начали совместный проект. Тогда практически ничего не сообщалось о том, что именно они собираются делать. Говорилось лишь о том, что речь идет не о программном обеспечении, а о каком-то новом устройстве.

И вот недавно появились подробности, что этим устройством станет нечто вроде умной колонки. Честно говоря, сначала это разочаровало. Рынок умных колонок уже давно существует. Есть Amazon Echo, Apple HomePod, Яндекс Алиса и др. Казалось бы, зачем делать еще одну? В этом инсайде есть и еще одна деталь, а именно: устройство будет ориентировано прежде всего на голосовое взаимодействие. Но здесь снова возникает вопрос - а в чем собственно новизна? Ведь все умные колонки и так управляются голосом.

Но тут же, параллельно, OpenAI выпускает Voice Mode в ChatGPT. Причем, это уже не просто диктовка текста. Разница между обычной диктовкой и Voice Mode очень даже существенная. При диктовке ты говоришь, заканчиваешь фразу, ждешь распознавания, исправляешь ошибки, отправляешь сообщение. Voice Mode работает гораздо круче. Голосовой ассистент слушает постоянно, реагирует практически мгновенно, без пауз, поддерживая таким образом естественный темп разговора. Может даже говорить одновременно с пользователем. Через пару-тройку фраз перестаешь воспринимать происходящее как работу с программой. Возникает ощущение разговора с человеком.

И где же революция?

Как добавить в умную колонку новые команды и ничего не сломать

Время на прочтение7 мин
Охват и читатели16K

Чтобы дать команду умной колонке, не обязательно говорить активационное слово «Алиса»: есть быстрые команды — короткие фразы, с помощью которых можно управлять музыкой, громкостью или умным домом. Например, чтобы переключить трек, достаточно просто сказать «дальше», а чтобы убавить звук — «тише». Весь список команд можно посмотреть в настройках вашего аккаунта в приложении «Дом с Алисой».

Быстрые команды удобнее не только пользователям, но и системе: запросы через слово «Алиса» требуют обращения к модели распознавания речи ASR, которой из‑за её размеров необходимы серверные вычислительные ресурсы, а модель быстрых команд устроена гораздо компактнее. Она работает прямо на устройстве, а значит, ограничена вычислительными ресурсами самой колонки — её CPU и оперативной памятью. Из‑за этого модель нельзя сильно увеличить: ей приходится оставаться компактной, зато запрос обрабатывается быстрее. 

За распознавание быстрых команд отвечает нейросеть. Её архитектура почти полностью совпадает с решением для наушников Яндекс Дропс, которое подробно описал в своей статье Григорий Афанасенко. Разница в основном в масштабе: наша модель весит всего от 0,5 до 1,5 МБ в зависимости от железа конкретного устройства.

Со временем перед нами встала задача добавить к базовым командам «лайк» и «дизлайк» для управления треками, а также команды «включи блютус» и «выключи блютус». Особенно это актуально для Станции Стрит, которую часто берут с собой на природу, где нет интернета. Но главным было гарантировать абсолютное отсутствие ухудшения на уже запущенных командах и не слишком сильно увеличивать потребление ресурсов на устройстве.

Читать далее

Диктофоны и жизнь после жизни

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели12K

Мы занимаемся разработкой и производством диктофонов для безопасности Edic‑mini и аудиобейджей «Свидетель» для улучшения качества работы с клиентами (запись общения с клиентами, далее перевод записи в текст и речевая аналитика).

Читать далее

Чат для сложных продаж: YandexGPT и звонки через МТС Exolve Web Voice SDK

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели8.5K

Привет, Хабр!

Чат-бот может быстро ответить на типовые вопросы о товаре, стоимости или доступных вариантах. Но в сложных продажах часть диалогов неизбежно доходит до вопросов, которые удобнее обсудить с человеком: подобрать условия, сравнить несколько предложений, уточнить детали оплаты или принять решение прямо сейчас.

В такой момент пользователю важно дать простой способ перейти от переписки к разговору, не заставляя его искать номер телефона, оставлять заявку и ждать обратного звонка.

В статье соберём чат, который отвечает на вопросы по выбранному туристическому направлению, оценивает контекст диалога и при подходящем сценарии предлагает позвонить менеджеру прямо из браузера.

Стек: FastAPI, Pydantic, requests, YandexGPT, Vite и Web SDK МТС Exolve.

Читать далее

Голосовой ИИ-репетитор изнутри: архитектура разговора в реальном времени

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели9.6K

Доброго времени суток!

меня зовут Кирилл, хочу рассказать вам о своем проекте Aisha – ИИ репетиторе английского языка для разговорной практики. Об идее, отличиях, технических аспектах.

Читать далее

Как мы разрабатывали TTS для Ил-2 Штурмовик

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели10K

Так получилось, что нам посчастливилось принять участие в разработке синтеза для новой версии игры "Ил-2 Штурмовик". Это был длинный путь, но в итоге у нас получилось:

Что получилось?

Когда эффективнее автоматизировать 70% вместо 90%, или Почему финтех-боту иногда лучше замолчать?

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.7K

Этот текст завершает первую и вторую части трилогии о внедрении LLM в клиентские сервисы. Если раньше мы обсуждали ИИ-агентов и базовую архитектуру, то третья статья получилась самая «бизнесовая» в цикле.

Предлагаю спуститься с небес на землю и без презентационной магии, на основе операционных финтех-кейсов разобрать, где автоматизация приносит деньги и разгружает линию, а где боту нужно вовремя замолчать и передать трубку человеку.

Читать далее

Наш синтез для экранных читалок (SAPI5) для 20 языков России стал лучше

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели7.7K

Мы не так давно опубликовали SAPI5-обёртку для нашего синтеза на 20 языков России и СНГ. В этот раз опять немного сошлись звёзды и мы уже публикуем улучшение наших читалок. Чтобы не растекаться мыслью по древу и не повторяться, вот краткий список улучшений (полную подводку можно прочитать в прошлой статье):

Покажите список улучшений

Как я решил проблему русской диктовки для ИИ

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.7K

По мере погружения в ИИ и вайб‑кодинг, я столкнулся с одним неудобным моментом — отсутствием возможности диктовать на русском языке в некоторых программах. И если OpenAI в своем приложении позаботились об этом, то в Anthropic такой возможности на тот момент просто не оказалось. А мне уже так понравилось, откинувшись на спинку кресла с чашкой чая, надиктовывать промпты без клавиатуры.

Но я быстро нашел выход, хоть и костыльный — просто диктовать свой текст в окошке GPT, потом копировать его и вставлять в Claude. Вроде несложно, но и удобным этот метод я бы не назвал. И я задумался, как этот процесс оптимизировать.

И какая же идея могла прийти в голову в 3 часа ночи человеку, который полжизни занимается программированием? Ну конечно же — разработать свое приложение.

Посоветовавшись с Claude и GPT, я набросал небольшой план и приступил к разработке.

Поскольку я работаю на macOS, то для начала не стал заморачиваться с мультиплатформенностью и решил делать все на Swift.

Читать далее

Я устал гадать, мне лучше или хуже, и сделал систему непрерывного измерения температуры

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели17K

Я болею не часто, но видимо из-за того что редко - получается "очень метко".

В прошлый раз это был ковид: тогда я плохо понимал, что со мной происходит, и ситуация едва не закончилась совсем плохо. В этот раз всё выглядело банальнее — высокая температура, которая долго не сбивалась.

Обычный градусник показывал 38–39 °C. И вроде бы все мы понимаем: если температура высокая, долго держится и стандартные средства не помогают, это уже повод как минимум связываться с врачом. Но есть нюанс: чтобы принимать решения не на ощущениях, а на данных, температуру нужно измерять регулярно.

А вот тут начинается бытовая инженерия.

Читать далее

Анатомия гибридного NLU: 6 слоев между вашим клиентом и галлюцинациями нейросети

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели8.2K

В прошлом материале мы подробно разобрали кейс внедрения ИИ-ассистента. Сегодня пойдем глубже и препарируем саму архитектуру системы, которая позволяет боту оставаться полезным и безопасным в жестких рамках финтеха. 

Гибридная архитектура голосового бота в финтехе — это не «NLU + LLM», а набор слоёв, где каждый отвечает за свою часть риска и пользы: ASR (Automatic Speech Recognition – автоматическое распознавание речи), NLU, routing, API, knowledge, compliance, voice и LLM-оркестрация. В такой системе самое слабое звено почти всегда важнее самой сильной модели. Если knowledge устарела, API не даёт факты, а routing не умеет передавать на человека, никакая LLM не спасёт.  

Читать далее

Ближайшие события

Салют, включи кинотеатр. Управление AV-ресивером и ТВ по локальной сети

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели10K

Всем добра! Речь пойдет о ресивере Yamaha RX-V575 и телевизоре Samsung UE50F6800AB. Оба устройства не первой свежести, более того, телевизор имеет устаревший и не развиваемый более интерфейс. Однако, полученные результаты могут оказаться полезными для владельцев множества других устройств Yamaha и Samsung. Не все ведь меняют технику ежегодно :)

Статья является логическим продолжением материала об универсальном голосовом шлюзе в том смысле, что показывает куда может двигаться мысль в части улучшения комфорта. Т.е., как и раньше, идея состоит не в том, чтобы разбирать детали, а в том чтобы показать ход мысли. Для деталей есть репозиторий с комментариями.

Сразу оговорюсь, что не стоит дальше читать, если вы:

Читать далее

Обзор нейросети Suno v5 в 2026 году: чем она лучше Udio и Riffusion после выхода обновления 5.5?

Время на прочтение9 мин
Охват и читатели12K

Вы заметили, как часто в чарты популярных стриминговых сервисов стали попадать сгенерированные нейросетями треки? Иногда их можно спутать с реальными творениями, созданными людьми. Например, в феврале 2026 чарты «Яндекс Музыки» и VK впервые возглавил сгенерированный трек. Проект СДП на стихи Есенина набрал 4,2 млн слушателей за месяц, став хитом. 

Но сколько сил вкладывают люди, чтобы создать свой трек, не используя нейросеть? Если сравнить затраты средств и сил на создание реального трека и нейросетевого, думаю ответ очевиден — ИИ-контент создавать гораздо проще. Правда, зачастую он получается не самого лучшего качества. А если все-таки можно сделать что-то достойное при помощи нейросети? Это мы и проверим.

В статье протестируем возможности Suno v5 и ее конкурентов. Попробуем сгенерировать композиции в нескольких жанрах: от джаза и шансона до тяжелого рока. Также мы оценим качество генерации женского и мужского вокала на русском и английском.

Читать далее

Сначала архитектура, потом «магия»: наш путь от сценарных голосовых ботов к умным ассистентам

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели9.8K

В финтехе почти никогда не происходит по красивому сценарию, который обычно рисуют в презентациях: подключили LLM — и внезапно получили умного, почти «человеческого» голосового агента. Эта картинка слишком удобная, чтобы быть правдой. В реальности всё развивается намного медленнее и, если честно, местами довольно приземлённо.

Есть популярный миф. Мол, сначала бот живёт на жёстких сценариях. Потом к нему подключают LLM — и он сам превращается в почти живого собеседника. Звучит красиво. В реальности так не работает. Если посмотреть на реальные проекты в финтехе, всё происходит гораздо проще и… скучнее.

Этот материал — результат работы технической команды СВОЙ Тех. Как Project Manager, я прошел с коллегами путь от простых блок-схем до гибридных систем и хочу поделиться реальным опытом того, что остается «за кадром» красивых презентаций об искусственном интеллекте.

Читать далее

Голосовой агент — это не чатбот с телефоном: 40 часов экономии и $100, сожженные на ботах

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели8.6K

Я однажды примерно за сутки сжег около $100 на голосовом агенте.

Не на большом запуске. Не на огромной базе. Не на хитрой рекламной кампании. Просто на небольшом пуле холодных контактов, где агент периодически попадал на voicemail, IVR, секретарей и других ботов.

В какой-то момент два не очень умных голосовых процесса могли довольно долго вежливо говорить друг другу что-то в духе:

Читать далее

Книга: «Эффективный разговорный ИИ. Создаем чат-ботов, которые действительно работают»

Время на прочтение3 мин
Охват и читатели9.3K

Привет, Хаброжители! Новые мощные фреймворки для разработки чат-ботов и модели генеративного ИИ практически сняли ограничения, связанные с некорректным распознаванием намерений пользователя и генерацией бессодержательных ответов. Освойте разработку чат-ботов на основе больших языковых моделей (LLM) и других современных инструментов, а также проектирование разговорных систем, ориентированных на реальный пользовательский опыт.

Читать далее

Голосовое управление роботом-перевозчиком паллет: что показал первый тест

Время на прочтение5 мин
Охват и читатели9.8K

Голосовое управление роботами часто выглядит как простая идея: человек произносит команду, робот ее распознает и выполняет действие. В бытовых сценариях мы уже привыкли к голосовым ассистентам, поэтому кажется логичным перенести тот же подход на складскую технику.

Читать далее

Алиса в вашем умном доме. Или Маруся. Или Салют

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели15K

Универсальный шлюз для работы с разными голосовыми помощниками и разными умными домами и умными устройствами.

Читать далее
1
23 ...