Обновить
128K+

Звук

Это «ж-ж-ж» неспроста

232,77
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

После комментариев на Хабре мы развернули тестовую ветку БОЛТУНа: Electron, WinUI 3 или Tauri 2?

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели4.4K

После первой статьи о БОЛТУНЕ мы развернули отдельную тестовую ветку и начали выбирать новый стек интерфейса. С помощью ИИ сравнили Electron, WinUI 3 и Tauri 2, проверили выводы по документации и собрали прототип на Tauri. Рассказываем, почему не переносим звук из C++ в WebView, как устроили границу WebView → Rust → C++, что уже работает, а что ещё предстоит измерить.

Читать эксперимент

Новости

Собеседник замолчал или просто задумался: как мы учили голосового ассистента не перебивать людей

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.1K

«Мой номер заказа... сейчас, секунду...» — и бодрое «Да, я вас понял, минуточку!» прямо в середину фразы.

Все, кто звонил в поддержку за последние пару лет, это слышали. Выглядит как мелкая недоработка, а на деле это одна из самых неприятных задач в голосовом стеке, и решается она заметно хуже, чем кажется со стороны.

Формулируется она так: понять, что человек в трубке закончил говорить, а не взял паузу. Ниже — про то, почему готовые VAD эту задачу не решают в принципе, что мы перебрали, прежде чем взяться за свое, и где у нас до сих пор не получается.

Дисклеймер: работаю в аутсорсинговом контакт-центре, мы несколько лет делаем свой голосовой стек — телефония, распознавание, ассистенты на LLM. Продукт не называю и ссылок не будет, статья про задачу.

Читать далее

Думал, Android пишет двигатель хуже iOS. Передумал. Потом оказалось, что прав, но по своему

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели5.2K

Полторы тысячи записей моторов с телефонов. Виноват был не бренд и не цена телефона, а то, чей DSP отрабатывает запрос браузера.

На iOS та же правка сработала наоборот.

Шоу должно продолжаться. Сценарный пульт для одного шоу

Время на прочтение6 мин
Охват и читатели12K

Лет 10 назад, когда я работал в банке в Сибири, был у нас отдел - малая автоматизация. Делали ПО для местных. Потом отдел расформировали и перешли на централизованное ПО.

Сейчас каждый может стать таким небольшим отделом малой автоматизации. Для себя, для личных нужд или для своих.

ИИ помогает делать проекты, которые раньше ты бы никогда не сделал. Или дорого по времени, или по ресурсам. А сейчас.... Давно уже не испытывал такой личной упоротости в маленькие проекты. Про один я уже писал, теперь расскажу про другой.

Итак, добро пожаловать на шоу!

Читать далее

Голос пропадал каждые три секунды: как пять друзей из Tarkov Arena сделали БОЛТУН

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6.2K

Нас пятеро: друзья и команда по Tarkov Arena. После блокировки Discord и прекращения работы обходного способа мы не нашли подходящую российскую замену и начали делать BOLTUN. В живых тестах голос рвался ровно раз в три секунды, хотя локальная запись была идеальной. Мы меняли буферы, WASAPI, Opus, ADPCM, PCM, UDP и серверный relay. В итоге период вывел нас на неожиданную причину: диагностический лог каждые 50 кадров. Разбираю расследование, собственный формат TVO2 на 80 мс и устройство голосового тракта.

Читать расследование

Как я собрал сайт на 30 000 SEO‑страниц за месяц

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели18K

Я играю на гитаре. Не то чтобы хорошо, но у костра сходит. И каждый раз одна и та же сцена: кто-то просит сыграть конкретную песню, я достаю телефон, открываю сайт с аккордами — и следующие полторы минуты наблюдаю, как на одной палке связи грузится баннер, потом второй баннер, потом видеореклама, потом всплывашка «скачайте наше приложение», и где-то под всем этим — песня. К этому моменту у костра уже поют что-то другое. Без меня.

В какой-то момент я сформулировал, чего хочу: сайт с аккордами, который открывается мгновенно, работает без интернета и ничего мне не продаёт. Такого сайта не нашлось. Зато нашлись подписки на Claude и GPT и спортивный вопрос: может ли один человек, не написав руками почти ни строчки кода, собрать себе идеальный продукт за месяц?

Проверил. Рассказываю:

Читать далее

Suno v5.5 Custom Model

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.7K

В последние недели собрал и протестировал 15 пользовательских 1 моделей (CM). Не претендую на полноту изучения опции, но надеюсь, что кому-то мой опыт сэкономит время. Основной вопрос: как на поведение модели влияют материал для тренировки (DS), стили, Lyrics и параметры.

1 идея витала в воздухе, как только народ услышал генерации очень похожие на известных артистов. В Udio/ Suno требовались танцы с бубном, в Sonauto (ныне Treblo) достаточно было ввести имя в промпт. В конце 2024 г. один проф. певец задал мне вопрос: "Как генерить с моим голосом и манерой?". Сделал его RVC-модель, он: "Тембр точно мой, но манера не везде", а с DS для Suno v3.5: "... похоже, и тембр, и манера. А можно, чтобы вообще как я и чистый звук?" Ответ: "Нужна ваша собственная модель".

Кажется, первыми CM предложили Mureka (Personalized Model): DS из 100+ треков (до 4 мин.), разовый платеж $100-200, тренировка ~3 ч. (сам не пробовал). Zaptrem (основатель Sonauto) на запрос о CM ответил, что не раньше v3. Локальные/ "открытые" инструменты я не смотрел (в своё время помучился с RVC на Google Colab и HuggingFace), но … как-нибудь попробую.

Во всех экспериментах с муз. ИИ меня интересовало 2 момента: а) как это устроено; б) как облагородить свои треки — придать правильное и "живое" звучание. Я не профессионал, но мне не нужно, чтобы ИИ за меня сочинял. Думаю, композитору важно самому отвечать за каждую ноту. Хотя можно и так: "Сгенери в моём стиле, а я выберу".

"Наевшись" вариативности с Persona, Your Voice, да и вообще с генерацией в Suno, я решил тестировать CM сразу на ярком материале. У меня не было и нет планов создавать несуществующие песни знаменитостей 2, но с DS из треков известных певцов поведение CM (похоже/ непохоже) должно быть очевидным для многих. Suno не работает с хитами, но пропускает генерации от Sonauto/ Treblo, т.к. мелодия и текст другие. Треки очень близки к реальным артистам — если не фанат, решишь, что просто не слышал эту песню.

Читать далее

Советский эстрадный усилитель ЭСКО-100

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели19K

Привет, Хабр! Этот стоваттный, а на самом деле 50-ваттный транзисторный усилитель в стильном алюминиевом корпусе, доставшийся мне в обмен на педаль гитарного эффекта, был предметом любви одних звукоинженеров в силу своей ремонтопригодности, и ненависти других, поскольку часто выходил из строя и сжигал громкоговорители, да и звучал так себе.

Как бы то ни было, прибор помогал вокально-инструментальным ансамблям давать концерты, а ещё успешно применялся на дискотеках. Сегодня мы сможем рассмотреть этот памятник инженерной и дизайнерской мысли изнутри и снаружи, а также познакомимся с его схемой.

Читать далее

Tymbal — нейросинтезатор на одном чипе

Уровень сложностиСложный
Время на прочтение24 мин
Охват и читатели7.1K

Инструмент называется Tymbal.

Характер задаёт учитель — обработанный сигнал, на который натаскивается уточнитель. Смените учителя, и характер сменится целиком, а конструкция останется прежней.

Tymbal — орган звукоизвлечения цикады: ребристая мембрана, которая щёлкает при нелинейном выгибании. Маленький аппарат, громкий и богатый обертонами результат, и весь механизм держится на одной нелинейности. У нас нелинейность учителя переносится сетью на детерминированный скелет, и всё это живёт на одном чипе.

Слово к тому же приходит оттуда же, откуда «тембр». Merriam‑Webster выводит tymbal как изменённое от более раннего timbal (литавра), а timbre — от греческого tympanon, барабана: в старофранцузском это ещё барабан, в среднефранцузском — колокол под молоточком, и лишь потом слово стало означать окраску звука. Имя инструмента и слово «тембр» — родня по барабану.

Первый вариант я написал через i, как в литавре. Пришлось переименовывать: у цикады это tymbal, через y.

N6 ниже по тексту — рабочий индекс по имени чипа, он остался в названиях файлов и веток.

Читать далее

Динамики: когда «хорошо» не бывает

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели9.4K

Это четвертая статья серии о том, почему акустика, которая хорошо измеряется, может плохо звучать

В первой статье выяснилось то, что АЧХ суммирует всю поступившую энергию независимо от времени её прихода. Во второй — что помещение добавляет к звуку большое количество отраженных копий и резонансов, с которыми надо научиться дружить. В третьей — что качество воспроизведения низких частот сухие цифры характеристик не отражают.

Первые три статьи рассматривали вопросы, находящиеся за пределами самих динамиков: измерительную методику, влияние комнаты, особенности конструкции корпуса. Все они были решены одна за другой: я переставил мебель, заглушил порт, использовал только действительно работающие цифровые фильтры. Теперь же обсудим ситуацию, когда проблема рождается на этапе создания ещё до выпуска модели на рынок и устранить её впоследствии невозможно.

В моем случае признаки были стабильными и конкретными. Где-то в верхней середине начинался участок, который звенел у меня в ушах, и у этого участка была отчётливо слышимая нижняя граница. Ниже неё звучание оставалось нормальным, однако начиная с определённой ноты появлялись неприятные ощущения, причём всегда на одних и тех же частотах. Из-за этого вместо отдыха от повседневного шума я проводил время, внимательно прислушиваясь к недостаткам воспроизведения. Итогом становились напрасно потраченное время, повышенная усталость и выход из комнаты раздражённым.

В этой статье я хочу рассмотреть конструктивные решения, влияющие на звук, показать, почему эквализация здесь неэффективна, и подсказать как прогнозировать последствия таких решений исходя из общедоступной информации.

Читать далее

PVAD: как научить ИИ слышать нужного человека в шумной комнате

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели7.1K

Представьте переговорную, где одновременно говорят несколько человек, а системе нужно понять, когда говорит целевой спикер, и выделить именно его голос. Задача нетривиальная, но именно её нам и нужно было решить.

Над этим мы с коллегами работали в проекте PVAD (Personal Voice Activity Detection) — технологии для определения того, когда в общем аудиопотоке говорит конкретный человек. Короткий простой обзор на один из кейсов нашей команды. 

Читать далее

Автоухо ставил «поломку» в 71% случаев. Я грешил на дешёвые телефоны, но проблемой оказалась тишина

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.6K

Сервис диагностики двигателей автомобилей по звуку ставил «поломку» в 71% случаев. Я грешил на дешёвые телефоны, но проблемой оказалась тишина

Если строите диагностику на аудио

Auro-3D: как в обычном PCM прячут высотные каналы

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели10K

Я давно интересуюсь звуком, писал обзоры по железу, писал про Dolby Atmos. Меня не оставлял в покое формат Auro 3D, который нам обещает многоканальный звук, а чтобы послушать и услышать, нужно покупать дорогой AVR, который из 5.1\7.1 мог извлечь верха.

Читать далее

Ближайшие события

Fender Player Plus Meteora HH из солнечной Мексики

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели15K

Привет, Хабр! Местный музыкант неожиданно столкнулся со звоном шестой струны на одном из ладов этого роскошного инструмента и обратился ко мне за помощью в решении создавшейся проблемы.

Причина оказалась весьма простой и легко устранимой, зато у нас с вами появилась возможность всесторонне рассмотреть и послушать эту прекрасную электрогитару.

Читать далее

Почему голосовые ИИ‑агенты перебивают людей: замерил на боевом API и починил правилами русского синтаксиса

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.3K

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской речи, и получил цифру, которая меня удивила: из 1275 мс задержки перед ответом 1200 мс — это ожидание секундомера, и только 75 мс — работа самой модели.

Ниже — методика, замеры и решение, которое даёт 316 мс вместо 1200 при двух обрывах вместо тридцати восьми. Всё воспроизводимо, детектор — на правилах, без обучения и без GPU.

Читать далее

Я печатаю медленнее, чем думаю: локальная диктовка на Whisper для Windows, телефона и Telegram

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8.2K

Я диктую постоянно: сообщения, заметки, постановку задач — говорить в разы быстрее, чем печатать, а мысль не успевает остыть. Проблема в том, что удобной диктовки, которая не гонит звук в чужое облако, я не нашёл. Так появился PasteTalk: локальная диктовка для Windows по горячей клавише, а вокруг неё — собственный сервер, приложение для телефона и Telegram-бот.

Отдельным требованием стала мама: из-за слабого зрения печатать на телефоне она почти не может, и телефонная часть проектировалась под самый жёсткий случай — одна кнопка на весь экран, крупный шрифт, ошибки словами. Забегая вперёд: правки «для мамы» сделали приложение удобнее и для всех остальных.

Под катом — архитектура, цифры и четыре бага, каждый из которых молча съедал наговорённый текст.

Как это устроено →

Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки

Уровень сложностиСредний
Время на прочтение60 мин
Охват и читатели6.9K

В марте я советовал Whisper Large v3 для голосовой диктовки и ошибался дважды: в методе (выбирал модель «на ощупь») и в самой модели.

Пересобрал всё по-научному: 23 ASR-модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе, 120+ часов инференса на одной RTX 5070 Ti. Мерил не только WER, но и сохранение английских терминов латиницей и пунктуацию.

Внутри — полный лидерборд, разбор каждого сюрприза, вклад тюнинга и промптов, закрытые модели vs открытые и инструкция, как поставить победителя за 10 минут.

Читать далее

Не самый дешёвый суперстрат Cort G250 Spectrum

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели19K

Привет, Хабр! Знакомому гитаристу очень понравилась одна из моих самодельных электрогитар, и он предложил обменять её на героиню сегодняшнего повествования.

Благодаря этому все мы сможем рассмотреть и послушать прекрасный недорогой инструмент, а у меня появилось выгодное пополнение обменного фонда.

Ещё расскажу, как выравнивать лады.

Эхолокация: микрофон и фазированная решётка из колонок

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели18K

Представьте себе кромешную темноту карстовой пещеры, куда не проникают лучи солнечного света. В таких местах обитают маленькие, но очень интересные существа — летучие мыши. В непроглядной тьме эти ночные хищники уверенно летают, огибая каждый сталактит, и ловят крошечных насекомых для пропитания. Они не видят, но «слышат» окружающий мир с помощью эхолокации.

Я захотел воспроизвести их способность с применением микроконтроллера. Так родился проект — сонар на базе STM32F429. Для его создания я использовал простые доступные компоненты: микрофон, компьютерные колонки, микроконтроллер и ноутбук для отображения результатов. В этой статье я расскажу о том, как устроено моё устройство, какие сложности возникли при реализации, и что в итоге получилось.

Читать далее

Сонар из Музыкальной Колонки

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели17K

В этом тексте я написал про то как упражняться в радиолокации на основе экспериментов в акустическом диапазоне. Я собрал прототип сонара и попробовал определять расстояния до условных целей.

Читать далее
1
23 ...