Обновить
128K+

Звук

Это «ж-ж-ж» неспроста

230,56
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Шоу должно продолжаться. Сценарный пульт для одного шоу

Время на прочтение6 мин
Охват и читатели4.2K

Лет 10 назад, когда я работал в банке в Сибири, был у нас отдел - малая автоматизация. Делали ПО для местных. Потом отдел расформировали и перешли на централизованное ПО.

Сейчас каждый может стать таким небольшим отделом малой автоматизации. Для себя, для личных нужд или для своих.

ИИ помогает делать проекты, которые раньше ты бы никогда не сделал. Или дорого по времени, или по ресурсам. А сейчас.... Давно уже не испытывал такой личной упоротости в маленькие проекты. Про один я уже писал, теперь расскажу про другой.

Итак, добро пожаловать на шоу!

Читать далее

Новости

Голос пропадал каждые три секунды: как пять друзей из Tarkov Arena сделали БОЛТУН

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5K

Нас пятеро: друзья и команда по Tarkov Arena. После блокировки Discord и прекращения работы обходного способа мы не нашли подходящую российскую замену и начали делать BOLTUN. В живых тестах голос рвался ровно раз в три секунды, хотя локальная запись была идеальной. Мы меняли буферы, WASAPI, Opus, ADPCM, PCM, UDP и серверный relay. В итоге период вывел нас на неожиданную причину: диагностический лог каждые 50 кадров. Разбираю расследование, собственный формат TVO2 на 80 мс и устройство голосового тракта.

Читать расследование

Как я собрал сайт на 30 000 SEO‑страниц за месяц

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели17K

Я играю на гитаре. Не то чтобы хорошо, но у костра сходит. И каждый раз одна и та же сцена: кто-то просит сыграть конкретную песню, я достаю телефон, открываю сайт с аккордами — и следующие полторы минуты наблюдаю, как на одной палке связи грузится баннер, потом второй баннер, потом видеореклама, потом всплывашка «скачайте наше приложение», и где-то под всем этим — песня. К этому моменту у костра уже поют что-то другое. Без меня.

В какой-то момент я сформулировал, чего хочу: сайт с аккордами, который открывается мгновенно, работает без интернета и ничего мне не продаёт. Такого сайта не нашлось. Зато нашлись подписки на Claude и GPT и спортивный вопрос: может ли один человек, не написав руками почти ни строчки кода, собрать себе идеальный продукт за месяц?

Проверил. Рассказываю:

Читать далее

Suno v5.5 Custom Model

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.5K

В последние недели собрал и протестировал 15 пользовательских 1 моделей (CM). Не претендую на полноту изучения опции, но надеюсь, что кому-то мой опыт сэкономит время. Основной вопрос: как на поведение модели влияют материал для тренировки (DS), стили, Lyrics и параметры.

1 идея витала в воздухе, как только народ услышал генерации очень похожие на известных артистов. В Udio/ Suno требовались танцы с бубном, в Sonauto (ныне Treblo) достаточно было ввести имя в промпт. В конце 2024 г. один проф. певец задал мне вопрос: "Как генерить с моим голосом и манерой?". Сделал его RVC-модель, он: "Тембр точно мой, но манера не везде", а с DS для Suno v3.5: "... похоже, и тембр, и манера. А можно, чтобы вообще как я и чистый звук?" Ответ: "Нужна ваша собственная модель".

Кажется, первыми CM предложили Mureka (Personalized Model): DS из 100+ треков (до 4 мин.), разовый платеж $100-200, тренировка ~3 ч. (сам не пробовал). Zaptrem (основатель Sonauto) на запрос о CM ответил, что не раньше v3. Локальные/ "открытые" инструменты я не смотрел (в своё время помучился с RVC на Google Colab и HuggingFace), но … как-нибудь попробую.

Во всех экспериментах с муз. ИИ меня интересовало 2 момента: а) как это устроено; б) как облагородить свои треки — придать правильное и "живое" звучание. Я не профессионал, но мне не нужно, чтобы ИИ за меня сочинял. Думаю, композитору важно самому отвечать за каждую ноту. Хотя можно и так: "Сгенери в моём стиле, а я выберу".

"Наевшись" вариативности с Persona, Your Voice, да и вообще с генерацией в Suno, я решил тестировать CM сразу на ярком материале. У меня не было и нет планов создавать несуществующие песни знаменитостей 2, но с DS из треков известных певцов поведение CM (похоже/ непохоже) должно быть очевидным для многих. Suno не работает с хитами, но пропускает генерации от Sonauto/ Treblo, т.к. мелодия и текст другие. Треки очень близки к реальным артистам — если не фанат, решишь, что просто не слышал эту песню.

Читать далее

Советский эстрадный усилитель ЭСКО-100

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели18K

Привет, Хабр! Этот стоваттный, а на самом деле 50-ваттный транзисторный усилитель в стильном алюминиевом корпусе, доставшийся мне в обмен на педаль гитарного эффекта, был предметом любви одних звукоинженеров в силу своей ремонтопригодности, и ненависти других, поскольку часто выходил из строя и сжигал громкоговорители, да и звучал так себе.

Как бы то ни было, прибор помогал вокально-инструментальным ансамблям давать концерты, а ещё успешно применялся на дискотеках. Сегодня мы сможем рассмотреть этот памятник инженерной и дизайнерской мысли изнутри и снаружи, а также познакомимся с его схемой.

Читать далее

Tymbal — нейросинтезатор на одном чипе

Уровень сложностиСложный
Время на прочтение24 мин
Охват и читатели7K

Инструмент называется Tymbal.

Характер задаёт учитель — обработанный сигнал, на который натаскивается уточнитель. Смените учителя, и характер сменится целиком, а конструкция останется прежней.

Tymbal — орган звукоизвлечения цикады: ребристая мембрана, которая щёлкает при нелинейном выгибании. Маленький аппарат, громкий и богатый обертонами результат, и весь механизм держится на одной нелинейности. У нас нелинейность учителя переносится сетью на детерминированный скелет, и всё это живёт на одном чипе.

Слово к тому же приходит оттуда же, откуда «тембр». Merriam‑Webster выводит tymbal как изменённое от более раннего timbal (литавра), а timbre — от греческого tympanon, барабана: в старофранцузском это ещё барабан, в среднефранцузском — колокол под молоточком, и лишь потом слово стало означать окраску звука. Имя инструмента и слово «тембр» — родня по барабану.

Первый вариант я написал через i, как в литавре. Пришлось переименовывать: у цикады это tymbal, через y.

N6 ниже по тексту — рабочий индекс по имени чипа, он остался в названиях файлов и веток.

Читать далее

Динамики: когда «хорошо» не бывает

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели9.1K

Это четвертая статья серии о том, почему акустика, которая хорошо измеряется, может плохо звучать

В первой статье выяснилось то, что АЧХ суммирует всю поступившую энергию независимо от времени её прихода. Во второй — что помещение добавляет к звуку большое количество отраженных копий и резонансов, с которыми надо научиться дружить. В третьей — что качество воспроизведения низких частот сухие цифры характеристик не отражают.

Первые три статьи рассматривали вопросы, находящиеся за пределами самих динамиков: измерительную методику, влияние комнаты, особенности конструкции корпуса. Все они были решены одна за другой: я переставил мебель, заглушил порт, использовал только действительно работающие цифровые фильтры. Теперь же обсудим ситуацию, когда проблема рождается на этапе создания ещё до выпуска модели на рынок и устранить её впоследствии невозможно.

В моем случае признаки были стабильными и конкретными. Где-то в верхней середине начинался участок, который звенел у меня в ушах, и у этого участка была отчётливо слышимая нижняя граница. Ниже неё звучание оставалось нормальным, однако начиная с определённой ноты появлялись неприятные ощущения, причём всегда на одних и тех же частотах. Из-за этого вместо отдыха от повседневного шума я проводил время, внимательно прислушиваясь к недостаткам воспроизведения. Итогом становились напрасно потраченное время, повышенная усталость и выход из комнаты раздражённым.

В этой статье я хочу рассмотреть конструктивные решения, влияющие на звук, показать, почему эквализация здесь неэффективна, и подсказать как прогнозировать последствия таких решений исходя из общедоступной информации.

Читать далее

PVAD: как научить ИИ слышать нужного человека в шумной комнате

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели7.1K

Представьте переговорную, где одновременно говорят несколько человек, а системе нужно понять, когда говорит целевой спикер, и выделить именно его голос. Задача нетривиальная, но именно её нам и нужно было решить.

Над этим мы с коллегами работали в проекте PVAD (Personal Voice Activity Detection) — технологии для определения того, когда в общем аудиопотоке говорит конкретный человек. Короткий простой обзор на один из кейсов нашей команды. 

Читать далее

Автоухо ставил «поломку» в 71% случаев. Я грешил на дешёвые телефоны, но проблемой оказалась тишина

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.5K

Сервис диагностики двигателей автомобилей по звуку ставил «поломку» в 71% случаев. Я грешил на дешёвые телефоны, но проблемой оказалась тишина

Если строите диагностику на аудио

Auro-3D: как в обычном PCM прячут высотные каналы

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9.9K

Я давно интересуюсь звуком, писал обзоры по железу, писал про Dolby Atmos. Меня не оставлял в покое формат Auro 3D, который нам обещает многоканальный звук, а чтобы послушать и услышать, нужно покупать дорогой AVR, который из 5.1\7.1 мог извлечь верха.

Читать далее

Fender Player Plus Meteora HH из солнечной Мексики

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели15K

Привет, Хабр! Местный музыкант неожиданно столкнулся со звоном шестой струны на одном из ладов этого роскошного инструмента и обратился ко мне за помощью в решении создавшейся проблемы.

Причина оказалась весьма простой и легко устранимой, зато у нас с вами появилась возможность всесторонне рассмотреть и послушать эту прекрасную электрогитару.

Читать далее

Почему голосовые ИИ‑агенты перебивают людей: замерил на боевом API и починил правилами русского синтаксиса

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.2K

Все голосовые платформы решают, что человек договорил, по таймеру тишины. Я замерил, во что это выливается на живой русской речи, и получил цифру, которая меня удивила: из 1275 мс задержки перед ответом 1200 мс — это ожидание секундомера, и только 75 мс — работа самой модели.

Ниже — методика, замеры и решение, которое даёт 316 мс вместо 1200 при двух обрывах вместо тридцати восьми. Всё воспроизводимо, детектор — на правилах, без обучения и без GPU.

Читать далее

Я печатаю медленнее, чем думаю: локальная диктовка на Whisper для Windows, телефона и Telegram

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8.1K

Я диктую постоянно: сообщения, заметки, постановку задач — говорить в разы быстрее, чем печатать, а мысль не успевает остыть. Проблема в том, что удобной диктовки, которая не гонит звук в чужое облако, я не нашёл. Так появился PasteTalk: локальная диктовка для Windows по горячей клавише, а вокруг неё — собственный сервер, приложение для телефона и Telegram-бот.

Отдельным требованием стала мама: из-за слабого зрения печатать на телефоне она почти не может, и телефонная часть проектировалась под самый жёсткий случай — одна кнопка на весь экран, крупный шрифт, ошибки словами. Забегая вперёд: правки «для мамы» сделали приложение удобнее и для всех остальных.

Под катом — архитектура, цифры и четыре бага, каждый из которых молча съедал наговорённый текст.

Как это устроено →

Ближайшие события

Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки

Уровень сложностиСредний
Время на прочтение60 мин
Охват и читатели6.9K

В марте я советовал Whisper Large v3 для голосовой диктовки и ошибался дважды: в методе (выбирал модель «на ощупь») и в самой модели.

Пересобрал всё по-научному: 23 ASR-модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе, 120+ часов инференса на одной RTX 5070 Ti. Мерил не только WER, но и сохранение английских терминов латиницей и пунктуацию.

Внутри — полный лидерборд, разбор каждого сюрприза, вклад тюнинга и промптов, закрытые модели vs открытые и инструкция, как поставить победителя за 10 минут.

Читать далее

Не самый дешёвый суперстрат Cort G250 Spectrum

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели19K

Привет, Хабр! Знакомому гитаристу очень понравилась одна из моих самодельных электрогитар, и он предложил обменять её на героиню сегодняшнего повествования.

Благодаря этому все мы сможем рассмотреть и послушать прекрасный недорогой инструмент, а у меня появилось выгодное пополнение обменного фонда.

Ещё расскажу, как выравнивать лады.

Эхолокация: микрофон и фазированная решётка из колонок

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели18K

Представьте себе кромешную темноту карстовой пещеры, куда не проникают лучи солнечного света. В таких местах обитают маленькие, но очень интересные существа — летучие мыши. В непроглядной тьме эти ночные хищники уверенно летают, огибая каждый сталактит, и ловят крошечных насекомых для пропитания. Они не видят, но «слышат» окружающий мир с помощью эхолокации.

Я захотел воспроизвести их способность с применением микроконтроллера. Так родился проект — сонар на базе STM32F429. Для его создания я использовал простые доступные компоненты: микрофон, компьютерные колонки, микроконтроллер и ноутбук для отображения результатов. В этой статье я расскажу о том, как устроено моё устройство, какие сложности возникли при реализации, и что в итоге получилось.

Читать далее

Сонар из Музыкальной Колонки

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели17K

В этом тексте я написал про то как упражняться в радиолокации на основе экспериментов в акустическом диапазоне. Я собрал прототип сонара и попробовал определять расстояния до условных целей.

Читать далее

Как я искала точки роста для «Звука»: догонять рынок или создавать новый?

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели8.5K

После того, как я раскритиковала Яндекс.Музыку, следуя своему принципу "Критикуя - предлагай" я решила накидать идей, куда бы я копала с музыкальным стримингом крупными блоками.

Почему именно Звук? Потому что у меня туда был собес и я думала про него) 

Ещё потому что: 

- Яндекс в последние года активно выпускает фичи ради фичей в своих продуктах, 

- VK активно вызывает негатив насильственной политикой внедрения некачественных продуктов,

- МТС.музыку что-то забросили и там маленькая библиотека. 

Читать далее

Piano — сделал 18 культовых мелодий. C++

Уровень сложностиСредний
Время на прочтение27 мин
Охват и читатели11K

Вот в github:
https://github.com/Divetoxx/Piano

🎹 Основная философия: «Ритмическое дирижирование без ошибок»
Главное новшество этого фортепиано заключается в том, что пользователю никогда не нужно беспокоиться о неправильном воспроизведении нот.
Идеальная высота звука (Гц): Каждая частота и высота звука точно запрограммированы в плотные векторы нот. Математически невозможно сыграть неправильную ноту или допустить ошибку!
Время ваше: Время, интервалы и эмоциональный темп совершенно не ограничены. Нажимая на клавиатуру или мышь, ВЫ динамически создаете ритм и временную структуру. Вы не просто нажимаете на клавиши — вы дирижируете шедевром!

Читать далее

Как я собрал полностью локальную диктовку для русского языка на Mac: GigaAM, Whisper, Qwen и Apple

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели8.4K

VoiceSwitch — открытое menu bar-приложение для Apple Silicon: одна глобальная клавиша запускает запись, GigaAM, Whisper, Qwen или Apple распознают речь локально, Qwen3-4B исправляет или сокращает результат, а приложение вставляет его в активное окно. В статье — архитектура Swift + Python worker, результаты теста четырёх движков на русском и смешанном аудио, ловушка macOS TCC и ссылка на beta.

Читать дальше
1
23 ...