Голосовые интерфейсы *

управляем устройствами при помощи голосовых команд

СтатьиПостыНовостиАвторыКомпании

@bugman 26 мар 2023 в 15:35

Что не так с умными колонками и голосовыми ассистентами?

8 мин

42K

Машинное обучение * Искусственный интеллектУмный домГолосовые интерфейсы *

Мнение

Если вы когда-нибудь слышали фразу "дьявол в деталях", вы понимаете, что условная Лада Гранта от условного Мерседеса отличается не более, чем на несколько процентов. Фактически обе машины ездят и возят своих пассажиров - это и есть главная их функция. Но внимание к мелочам и продуманный пользовательский опыт (UX) это и есть те самые несколько процентов, которые так разительно влияют на наше восприятие продукта.

Попробуем применить этот угол зрения к умным колонкам и голосовым ассистентам. И попытаемся понять, почему же все они пока ещё Гранты. И чего именно им не хватает до Мерседесов.

Что же с ним не так и как это исправить?

+49

345

@sterling239 20 фев 2023 в 13:09

Как я сделал синтез своего голоса

Простой

12 мин

47K

Блог компании SberDevicesГолосовые интерфейсы * ЗвукИскусственный интеллектМашинное обучение *

Кейс

Всем привет! Меня зовут Гриша Стерлинг, я занимаюсь синтезом речи в SberDevices. Недавно прошла конференция AI Journey, где я рассказал, как сделал синтез своего голоса. За 15 минут выступления я не успел рассказать все, поэтому решил написать большой пост с деталями. Он будет интересен датасаентистам, людям из бизнеса и ai‑энтузиастам. Приглашаю всех под кат.

+25

@elezarkun 15 фев 2023 в 07:58

Как мы делали AEC для воспроизведения звука через HDMI на Станции Макс

Средний

7 мин

21K

Блог компании ЯндексГолосовые интерфейсы * ЗвукПроизводство и разработка электроники * Умный дом

В недавнем апдейте прошивки для Яндекс Станции Макс мы добавили поддержку вывода звука по кабелю HDMI при просмотре фильмов. Если у вашего телевизора хорошая акустика (или к нему подключена качественная аудиосистема), теперь можно слушать аудиодорожку через неё. Это обновление мы выпустили только сейчас, потому что оно потребовало нетривиальных технических решений. Например, нужно было сделать эхоподавление для HDMI. Вот об этом и поговорим — сначала обсудим историю технологий и проблемы с подавлением собственного звука устройства, а затем перейдём к нашему решению.

Читать дальше →

+35

@kseniaegorova 14 фев 2023 в 15:20

Выпускные проекты наших «бауманцев»

11 мин

6.7K

Блог компании VKУчебный процесс в ITГолосовые интерфейсы *

Новая порция выпускных проектов, на этот раз — студентов нашего образовательного проекта в МГТУ им. Баумана. Ребята сами опишут свои разработки, а посмотреть видео с защиты можно здесь. Если вы хотите попасть на учебу в образовательные центры VK, информацию об открытых наборах и курсах можно найти здесь.

+18

@Roosh 10 фев 2023 в 13:04

Что под капотом «ответов на вопросы» Маруси?

16 мин

4.8K

Блог компании VKМашинное обучение * Голосовые интерфейсы *

Привет, это команда ответов на вопросы Маруси.

Этот материал состоит из двух частей. Это вторая часть (первая часть). В ней мы чуть глубже копнём технический аспект того, как устроены ответы на вопросы Маруси.

В первой части мы поверхностно рассмотрели механизм, позволяющий нашему голосовому помощнику понимать вопросы и реагировать на них. Теперь поговорим о том, как мы некоторое время назад создавали систему ответов на вопросы, и с помощью каких решений достигался результат, соответствующий как требованиям пользователей, так и техническим ограничениям.

Материал может быть интересен тем, кто только начинает свой путь в NLP или разрабатывает аналогичные решения, но не обладает несколькими стойками c DGX.

+33

@Amvera_Speech 9 фев 2023 в 10:12

Предоставляем бесплатное облачное распознавание речи ASR

Простой

2 мин

3.9K

Блог компании AmveraOpen source * Семантические сети * Машинное обучение * Голосовые интерфейсы *

В этой статье мы, расскажем, как сделали первое действительно бесплатное облачное распознавание речи и как им воспользоваться.

Разработчики систем распознавания речи, как правило, используют поминутную тарификацию распознавания. В одной из прошлых статей я уточнял почему считаю это далеко не всегда правильным (если кратко, то при такой тарификации вендоры округляют длительность в большую сторону, а значит, за распознавание коротких записей вы заметно переплачиваете, а при большом трафике это очень дорого).

Давайте теперь разберемся, действительно ли для вендоров экономически оправданно брать деньги с хобби-проектов и небольших компаний, которым нужно распознавать не миллионы, а всего лишь десятки или сотни минут в день.

@telecomgod 2 фев 2023 в 05:00

Как создать бота для своей отрасли бизнеса

4 мин

2.7K

Блог компании МТТГолосовые интерфейсы * Облачные сервисы *

Туториал

Всем привет! В прошлый раз мы начали работать с готовыми переменными, научились использовать их в сценариях и в блоках. Сегодня задача будет чуть сложнее: рассмотрим три типичных сценария, в которых будем записывать в переменные ответы абонентов. Как и обычно, любой из этих сценариев вы затем сможете легко изменить под свои задачи.

@Roosh 1 фев 2023 в 08:04

Как Маруся отвечает на вопросы пользователей обо всём на свете

10 мин

15K

Блог компании VKМашинное обучение * Голосовые интерфейсы *

Привет, это команда ответов на вопросы Маруси. Мы все привыкли к тому, что голосовые помощники отвечают на любые вопросы. Не всегда правильно, но обычно вполне толково и с пользой. А вы когда‑нибудь задумывались, как это устроено? Сейчас расскажем на примере нашей Маруси.

Материал состоит из двух частей, это первая часть. В ней мы дадим поверхностный обзор того как устроена Маруся, локализуем место навыка «ответов на вопросы» и расскажем на концептуальном уровне, как можно решать эту задачу.

+39

@snakers4 20 янв 2023 в 07:32

Обновляем сравнение систем распознавания русского языка

2 мин

7.1K

Машинное обучение * Искусственный интеллектГолосовые интерфейсы *

Аналитика

Наконец-то пришло время обновить наше исследование качества систем распознавания русского языка. Лучше поздно, чем никогда! С момента прошлого исследования утекло много воды … и мы думали, что мы не добежим до обновления, но таки добежали.

По сравнению с предыдущим исследованием изменилось следующее:

Посмотреть результаты

+15

@baadzhi 18 янв 2023 в 08:15

Страх и ненависть в переговорке: курим VideoSDK API, Vosk и Python

Простой

13 мин

11K

Python * Программирование * Проектирование API * ВидеоконференцсвязьГолосовые интерфейсы *

Кейс

Сегодня поговорим о кастомных решениях для видеоконференцсвязи (далее — ВКС) с минимальными затратами человеко-часов и финансов на их создание. ~~Я параноик~~ Брать готовый open-source – меня не устраивает, всем известны случаи встраивания bad code в проекты с открытым исходным кодом с целью нанести ущерб пользователям из России. Поэтому за основу берём что-то отечественное с корпоративным уклоном, с открытым API и подходом «без регистрации и смс».

@telecomgod 17 янв 2023 в 07:02

Обзор чат-бота ChatGPT: что это, возможности и примеры использования

4 мин

269K

Блог компании МТТОблачные сервисы * Голосовые интерфейсы * Машинное обучение *

Обзор

Recovery Mode

ChatGPT от OpenAI, запущенный 30 ноября 2022 года, произвел настоящий фурор в IT-сообществе, поразив многих точностью ответов на специальные вопросы. Посмотрим, как можно использовать этого чат-бота, в том числе в сочетании с другими программными продуктами.

Я заинтересовался технологией, чтобы применять её в каких-то своих рабочих задачах и изучил все возможные на сегодня способы работы с ChatGPT и попробовал представить, как это внедрить в коммуникации в бизнесе.

+13

@olleelooo 21 дек 2022 в 14:06

Как и зачем тестировать голосовых и чат-ботов?

8 мин

5.4K

Блог компании Just AIИскусственный интеллектNatural Language Processing * Голосовые интерфейсы *

Туториал

Привет, Хабр! Меня зовут Оля, и я работаю QA-инженером в команде лингвистов Just AI. Для лингвистов-разработчиков каждый чат-бот — это отдельный проект со своими фичами, иногда с собственным характером и всегда — с особым подходом к тестированию. В тестировании ботов, помимо проектной специфики (a.k.a. конкретные требования и «хотелки» заказчика), которую обобщить едва ли возможно, есть еще и неочевидные вещи, связанные со спецификой самого типа бота. В этом материале я постаралась аккумулировать наш опыт запуска голосовых и текстовых ботов в продакшен (десятков ботов!) и собрать рекомендации о том, как их тестировать.

@APPKODE 20 дек 2022 в 10:18

Лабиринты из линий: превращаем сложный сценарий в понятную схему на языке ДРАКОН

7 мин

6.6K

Голосовые интерфейсы *

Технотекст 2022

Сценарии для чат-ботов обычно создаются в виде блок-схем. Это удобно для проектирования — понятно, за какой репликой следует ответ и что происходит дальше. Но чтобы разобраться в схеме, команда тратит десятки часов: при больших сценариях результат выглядит крайне запутанным и похож на лабиринт. Это затягивает разработку, а её стоимость растёт. Проблем становится ещё больше, когда в схеме что-то нужно поменять.

Меня зовут Кирилл Богатов, я дизайнер разговорных продуктов в KODE. Я нашёл способ упрощать сложные схемы при помощи языка ДРАКОН. В статье расскажу о том, как я к нему пришёл, чем он так хорош и как с его помощью мы стали тратить на проектирование почти вдвое меньше времени.

@telecomgod 8 дек 2022 в 05:50

Как за пару шагов персонализировать шаблонные звонки клиентам

5 мин

Блог компании МТТСистемы связи * Облачные сервисы * Голосовые интерфейсы *

Туториал

Приветствую, друзья! В предыдущих статьях мы создавали простые сценарии в интерфейсе конструктора голосовых роботов Voicebox. Сегодня возьмем тему чуть посложнее и рассмотрим пару сценариев с переменными. Один из них будет имитировать работу оператора маркетплейса: бот позвонит покупателю и попросит у него подтвердить или отменить заказ. Второй сценарий будет посвящен нелегкому труду сотрудников медицинской клиники. Облегчим им этот труд: теперь напоминать пациентам о приеме у врача будет бот.

@ADPopko 7 дек 2022 в 10:01

Люди и интерфейсы. Рассказ незрячего тестировщика о том, как сервисы Яндекса становятся доступнее

17 мин

8.5K

Блог компании ЯндексВеб-разработка * Интерфейсы * Голосовые интерфейсы * Accessibility *

Технотекст 2022

Привет, меня зовут Анатолий Попко. Последние 15 лет (или около того) я работаю над тем, чтобы технологии становились доступнее для пользователей с различными ограничениями. Участвовал и продолжаю участвовать в работе разных групп и организаций, которые объясняют разработчикам технологий реальные потребности людей, пишут гайды, стандарты и так далее.

Уже много лет я сотрудничаю с Яндексом, а с прошлого года мы вместе строим единые процессы улучшения доступности в сервисах. Это бесконечный путь, всегда можно сделать лучше — текущее состояние продуктов Яндекса тоже не отражает идеальную картину. Я бы хотел рассказать об этой работе и поделиться примерами, которые можно брать и реализовывать где угодно. Поговорим о мифах, о моей работе тестировщиком цифровой доступности, да и в целом о восприятии окружающего мира.

Читать дальше →

+38

@Kirill-Gorelov 29 ноя 2022 в 08:49

Как организовать роботизированный сбор показаний пациентов

5 мин

1.4K

Блог компании СберЗдоровьеГолосовые интерфейсы * IT-компанииСотовая связьОблачные сервисы *

Я хочу поделиться с вами особенностями внедрения и работы автоматизированного обзвона роботом на примере мониторинга здоровья пациентов, еще расскажу о том, что нужно учесть при выборе провайдера звонков, анализе и мониторинге системы.

Суть работы сервиса дистанционного мониторинга заключается в получении показателей здоровья пациентов при помощи обзвона роботом или устройств, обработке информации, внесении её в электронный дневник здоровья и передаче лечащему врачу. Врач видит все данные в динамике и если замечает отклонения, то связывается с пациентом и консультирует его онлайн, рекомендует обратиться очно или вызвать врача на дом.

На нашем сервисе метрики здоровья собираются разными способами: через веб-версию, носимые устройства, звонки и приложение. Пациент сам выбирает, как ему удобнее вносить показания, но автообзвон всегда назначает врач. Сбор данных через звонок – один из наиболее удобных «продуктов» для пациентов: робот автоматически звонит в назначенные врачом дни, спрашивает о самочувствии и вносит показания в его «дневник здоровья»

Поговорим о провайдере

В нашем проекте нет своей телефонии – мы арендуем ресурсы у двух провайдеров и при необходимости можем переключать провайдера у одного или сразу нескольких пациентов.

Провайдер также должен предоставлять качественные услуги – обработка речи человека в режиме реального времени для нас крайне важна при его выборе. Система сбора и обработки должна уметь выделять существенную информацию при разговоре. Например, могут быть следующие реплики:

@djunka 28 ноя 2022 в 10:03

Умный дом Sber теперь полностью автономный. Из чего он состоит?

8 мин

17K

Блог компании SberDevicesГаджетыУмный домГолосовые интерфейсы *

SberDevices сегодня перезапустили собственную платформу умного дома, отказавшись от сторонних инфраструктурных решений и сделав ее полностью автономной. Также с сегодняшнего дня в продажу поступило первое устройство умного дома Sber нового поколения – самая популярная лампа А60.

В этой статье мы хотим рассказать, как устроена наша платформа и как с её помощью мы выпускаем свои устройства и интегрируем устройства партнёров.

-9

@Nester 23 ноя 2022 в 14:06

Alexa и Echo — на выход. Идут сокращения, бизнес-модель не оправдалась. «Салюту», «Марусе», прочим — приготовиться

2 мин

21K

Big Data * ГаджетыУмный домГолосовые интерфейсы *

Голосовые ассистенты были любимым проектом лично Безоса. Он в них отчаянно верил, тратил любые бюджеты. А компания жгла прилично - в 2018 убыток был $5 млрд, в 2022 уже $10 млрд. Подразделение набрало больше 10 000 человек. Безос выверял каждую рекламную кампанию сам.Но теперь он прекратил следить за проектом. В подразделении - сокращения, уволились даже топ-менеджеры, ветераны.

Умные колонки с голосовым ассистентом были хитом 2018 года. Сейчас в США почти 210 миллионов устройств с голосовыми ассистентами, у Amazon - 71 млн.

Окей, вы поставили их у людей дома, а что с заработком?

+30

174

@darimoon 23 ноя 2022 в 12:51

Как управлять просодией в синтезе речи

7 мин

9.2K

Блог компании Just AIГолосовые интерфейсы * ЗвукИскусственный интеллектМашинное обучение *

Привет, Хабр! Меня зовут Дарима Мылзенова, я инженер-исследователь Just AI.

В компании я работаю над задачами синтеза речи. Возможно, вы слышали, как мы синтезировали голос Кроша из Смешариков. В этой статье я хочу поделиться современными методами управления просодией в синтезе речи. Если вас интересует вопрос о том, как можно сделать синтез более реалистичным, то, надеюсь, вам будет полезен этот материал.

+17

@ilushakr 22 ноя 2022 в 17:22

Поиск не вставая с дивана, или как подружить приложение со Сбер Ассистентом

5 мин

1.3K

Блог компании Газпром-Медиа ХолдингГолосовые интерфейсы * Android *

Туториал

Всем привет ? . Зовут меня Илюша Кр, и сегодня я вам расскажу, как же все-таки попросить ассистента ~~принести чипсов~~ сделать поисковый запрос внутри вашего приложения.

Для начала скажу пару слов о себе: я такой же обычный парень, как и вы, работаю разработчиком под Android в онлайн-кинотеатре PREMIER. Но, когда я взял задачу по внедрению голосового помощника Сбера в приложение, моя жизнь разделилась на «до» и «после». Заинтриговал? Тогда читай дальше!

Жми кнопку и полетели

1 2 3 4 5

7 8 ...

15 16

Голосовые интерфейсы *

Что не так с умными колонками и голосовыми ассистентами?

Как я сделал синтез своего голоса

Как мы делали AEC для воспроизведения звука через HDMI на Станции Макс

Выпускные проекты наших «бауманцев»

Что под капотом «ответов на вопросы» Маруси?

Предоставляем бесплатное облачное распознавание речи ASR

Как создать бота для своей отрасли бизнеса

Как Маруся отвечает на вопросы пользователей обо всём на свете

Обновляем сравнение систем распознавания русского языка

Страх и ненависть в переговорке: курим VideoSDK API, Vosk и Python

Обзор чат-бота ChatGPT: что это, возможности и примеры использования

Как и зачем тестировать голосовых и чат-ботов?

Лабиринты из линий: превращаем сложный сценарий в понятную схему на языке ДРАКОН

Ближайшие события

Как за пару шагов персонализировать шаблонные звонки клиентам

Люди и интерфейсы. Рассказ незрячего тестировщика о том, как сервисы Яндекса становятся доступнее

Как организовать роботизированный сбор показаний пациентов

Умный дом Sber теперь полностью автономный. Из чего он состоит?

Alexa и Echo — на выход. Идут сокращения, бизнес-модель не оправдалась. «Салюту», «Марусе», прочим — приготовиться

Как управлять просодией в синтезе речи

Поиск не вставая с дивана, или как подружить приложение со Сбер Ассистентом

Вклад авторов