Обновить
128K+

Звук

Это «ж-ж-ж» неспроста

209,11
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Написал локального ИИ-ассистента для зумов: диаризация, граф знаний и ноль облаков

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели4.9K

Собрал ассистента встреч, который работает целиком на моём маке: локальный STT, живая диаризация голосов, мгновенные ответы на вопросы собеседника и самообновляемый граф знаний в Obsidian. Внутри — грабли: ловушка обращений при расстановке имён, 23 «голоса» из-за осколков кластеризации, num_ctx и бюджет RAM в Ollama. Код открыт, Apache 2.0.

Читать далее

Новости

Альбом электроники, написанной реками — как я его выпустила?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.8K

Меня зовут Саша Сойфер — я физик‑океанолог, работала на обоих полюсах, жила на Шпицбергене, писала статьи, делала замеры в тропиках и в северных крошках‑озерах на моторке. В общем, много времени провела в любовном изучении природы.

Параллельно с этим я всю жизнь увлекалась музыкой, и, работая с измерениями рек, вдруг подумала, что будет круто выявить звук гидрологических данных. Почему именно их?

Уровень реки — первичная метрика её «силы», от которой будет зависеть её напор, перенос вещества и так далее. Во‑первых, обычно у уровня рек есть выраженная сезонность, и это яркая точка пересечения с акустикой, так как звук синтезируется через периодические гармоники. При этом важно, что уровень реки меняется сильно и достаточно быстро: помимо четкого годового хода, он реагирует на атмосферные условия. Это легко сложилось для меня в цельную историю: озвучив архивные данные, можно сравнить, как прошёл каждый год, какой тренд в целом в жизни реки и какие краткосрочные события с ней происходили.

Вдобавок, в России обширная сеть гидрологических постов — это даёт простор для построения художественного высказывания.

Уже проговорилась, что из доступных гидрологических параметров для создания звука я выбрала уровень рек. Чтобы не слить данные, я работала не с абсолютными значениями, а относительными и немного их аугментировала — так, что это не оказывает влияния на звук, но не позволяет восстановить точные значения. (; Для проекта я выбрала Енисейский бассейн.

Слушать реки

Как мелодия звонка стала товарным знаком: история Nokia Tune

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели8.3K

В 90-е и начале нулевых производитель телефонов Nokia был самым известным в мире: его модели считались хитами продаж, а мелодия Nokia Tune стала одним из популярных аудиобрендов. В нашей статье — подробнее об этом звуке и о том, как он регистрировался в разных странах мира. Спойлер: не без приключений.

Читать далее

Как я три года пилю свой музыкальный сервер: часть вторая. Архитектура Kalinka и её место среди музыкальных систем

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели12K

Как устроен KalinkaPlayer: модульный бэкенд, нативный аудиоплеер, пайплайн метаданных и мобильное управление в одном проекте.

Изучить архитектуру

Как я три года пилю свой музыкальный сервер: часть первая

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели11K

Описываю настроение словами — и Raspberry Pi находит подходящие треки в моей коллекции, полностью локально, без облака и подписки. Как это устроено внутри.

Читать далее

Обработка звука в реальном времени (или Full Duplex I2S на STM32)

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели7.9K

В этом тексте я написал про то как настроить I2S трансивер работать в полнодуплексном режиме (Full Duplex). Показал как настроить на микроконтроллере STM32F407VG одновременное воспроизведение и запись встречного аудио потока по интерфейсу I2S.

Читать далее

Как звучал 1990-й: разбираем AdLib и синтезатор OPL2 – от одной ноты до виртуальной машины музыки

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели12K

В прошлой статье я разобрал Fire & Forget II – гонку 1990 года – и пересобрал её на C. Но у игры, кроме пикселей, есть звук, и с ним получилась отдельная история: звуковой драйвер тоже переехал в порт целиком, вместе со всеми своими данными. А когда в руках живой музыкальный движок 1990 года – грех не заставить его объяснить, как вообще звучала та эпоха.

Под катом – 28 минут саундтрека игры в настоящем Winamp с окном живых регистров чипа, разбор синтезатора OPL2 по этим регистрам на пяти коротких видео – от одной ноты до взрывов и вертолётов – и виртуальная машина музыки: байткод, интерпретатор и пьеса, которую композитор вырезал из игры.

Читать далее

Я слышу, как модель думает

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели14K

Я часто ловлю тонкий, почти на грани слышимости писк, когда работаю с LLM на своем MacBook Pro. Иногда — когда вроде бы вообще ничего не запускал. Довольно долго подозревал, что профдеформация переросла в галлюцинацию.

Оказалось — нет, это физика.

Читать далее

Экономим $1500 на японской бутиковой педали для электрогитары

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели17K

Привет, Хабр! Меня попросили создать педаль гитарного перегруза, внешний вид и звучание которой должны максимально приблизиться к легендарному японскому овердрайву Barbarossa Gargoyle, выпускаемому в очень малых количествах и продаваемому по высоким ценам.

Музыкантам надо помогать, поскольку они делают нашу жизнь лучше и интереснее. Поэтому мне пришлось отложить в сторону другие дела и заняться новым проектом.

Под катом вас ждёт видео со звучанием, схема моей версии эффекта и подробное описание того, как она работает.

Потребовалось изменить номиналы 3 деталей

Сделали дейтинг с коллаборацией со Spotify без инвестиций

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели9.4K

Доброе утро, фанаты! История длиной в 2 года о том, как придумать дейтинг приложение с выходом на иностранный рынок: получать отказы от Spotify, потерять в последний момент инвестиции — но всё же выпустить приложение!

Читать далее

Как я прошил наушники soundcore, портировал на них кастомную прошивку и DOOM. Часть 1

Время на прочтение5 мин
Охват и читатели24K

Я хотел исполнить свою давнюю мечту — запустить DOOM на собственных наушниках.
В итоге вместе с портом я создал проект для полной модификации их софтверной части. Это первая часть статьи — она рассказывает о создании патчера стоковой прошивки.

Читать далее

Личное облако на Proxmox: как собрать себе музыкальный стриминговый сервис

Уровень сложностиПростой
Время на прочтение22 мин
Охват и читатели14K

В прошлой статье я писал как поднять себе LLM для экспериментов, но сейчас полез чистить «Понравившееся», плейлист на YouTube Music — а часть треков оттуда просто исчезла: где-то удалили клип, где-то канал в бане, где-то правообладатель передумал. Плейлист, который я собирал годами, тихо усыхал, и меня не спросили. Причем у меня есть подписка. Ну и обойдусь, а как, написано в статье.

Читать далее

Про то, как я оцифровал себя без ИИ, чтобы стать видеоблогером

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели15K

История про то, как я сделал себе виртуального аватара для коротких видео — без генерации видео через ИИ.

Задача была простая: превратить свои текстовые заметки в вертикальные ролики, не садиться перед камерой и не тратить день на монтаж каждого выпуска.

В итоге получилась самодельная полуавтоматическая DIY‑система:

— универсальные графические ассеты персонажа
— ручная озвучка моим голосом
— разметка фраз в аудио через Audacity
— текстовый сценарий с управляющими тегами для событий в ролике
— кастомный JSX‑плагин для After Effects

Система берёт сценарий с управляющими тегами, аудиодорожку с голосом и файл разметки, после чего собирает заготовку ролика: аватар, липсинк, мимику, субтитры и слайды.

В статье показываю, как всё устроено, немного логики кода, почему первая версия попала в зловещую долину, что удалось автоматизировать, а что всё ещё приходится доводить руками.

В конце — немного статистики по первым трём роликам, запущенным с нулевых аккаунтов: YouTube, Instagram, TikTok и ВК.

Читать далее

Ближайшие события

Лёгкий кастомный стратокастер из дешёвых комплектующих

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели18K

Привет, Хабр! Древесину корпуса этой электрогитары пытались грызть насекомые. Чтобы такое безобразие не повторилось в дальнейшем, а также для создания позитивного настроения, дека и перо грифа самодельного инструмента были украшены изображениями весёлых птиц на цветущих веточках. Может быть, птицы отпугнут жучков.

Кроме оригинального оформления, зелёный стратокастер может похвастаться двумя яркими синглами и одним жирным хамбакером с автоотсечкой, позволяющей мгновенно получить желаемое классическое звучание одним щелчком стандартного пятипозиционного переключателя.

А самое главное, масса полноразмерного инструмента, на создание которого затрачено менее пятнадцати тысяч рублей, если не считать часы проведённого с удовольствием времени, составляет всего лишь 2 килограмма 430 граммов!

Сегодня мы, наконец, его услышим

Диктофоны и жизнь после жизни

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели12K

Мы занимаемся разработкой и производством диктофонов для безопасности Edic‑mini и аудиобейджей «Свидетель» для улучшения качества работы с клиентами (запись общения с клиентами, далее перевод записи в текст и речевая аналитика).

Читать далее

Теория относительности — это синус. Мнимого угла

Уровень сложностиСложный
Время на прочтение13 мин
Охват и читатели32K

То, что свет нельзя обогнать, сложение скоростей, замедление времени — всё это стоит на обычном школьном синусе, которому угол сделали мнимым. Не метафора и не «похоже» — буквально та же функция. Давайте убедимся в этом сами.

Это финал серии. В первой синус был показан тенью вращающейся стрелки, во второй — каталогом из сорока с лишним мест, где эта тень лежит. А в конце каталога была ремарка, что у синуса есть гиперболический двойник, за которым стоит ещё пол-математики.

В основе всей статьи один ход, и он не мой — ему двести с лишним лет: подставить в синус мнимый угол. Операция законна с тех пор, как Эйлер переписал синус через экспоненту: ряду всё равно, веществен ли аргумент. Этим ходом Лобачевский объяснил свою геометрию, а Минковский — построил пространство-время; мы пройдём тот же путь с выводами. Итак: что такое sin(iθ)?

Путь: ход Эйлеракорень всегокруг и гиперболагеометрия Лобачевскогоэмбеддинги нейросетейотносительностьмалые углычёрная дырабонус: слово «синус»итог

Дойти до света

Комната: незваный гость

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели8.5K

Это вторая статья серии о том, почему акустика, которая хорошо измеряется, может плохо звучать. В первой части мы разобрали АЧХ — главный график индустрии — и его фундаментальное ограничение: измерение суммирует всю энергию в точке, не различая, что пришло вовремя, а что с опозданием или вовсе лишнее. Закончилась та история закономерно для инженера, который поверил, что дело в железе: я купил лучшую акустику, которую мог себе позволить, поставил на то же место — и звук остался плохим. Просто стал другим.

Сегодня — о втором участнике любой стереосистемы. Он не указан в спецификациях, не продаётся в салонах и достаётся вам бесплатно вместе с квартирой.

Читать далее

Диктофон на микроконтроллере (WM8731 + I2S + STM32 + SDIO + FAT16)

Уровень сложностиПростой
Время на прочтение19 мин
Охват и читатели13K

В этом тексте я покажу, как на основе микроконтроллера, аудиокодека и SD карты запрограммировать самый настоящий диктофон.

Перечислены особенности разработки звукозаписывающей аппаратуры и типичные трудности разработки диктофонов.

Читать далее

Два в одном: шумоподавление и дереверберация в реальном времени

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели3.2K

Привет, Хабр! Меня зовут Захар Кондауров. Сегодня я хочу поделиться опытом разработки легковесной real-time модели шумоподавления и дереверберации, над которой я работал в рамках проектов Инженерно-математической школы НИУ ВШЭ и VK под руководством Ивана Бескровного, руководителя команды звуковых технологий VK Видео.

Большинство исследований в speech enhancement часто ограничиваются только шумоподавлением, хотя современные архитектуры потенциально позволяют решать более продвинутые задачи, например, совместное шумоподавление и дереверберацию. Это обусловлено тем, что бенчмарков, ориентированных на шумоподавление, значительно больше, чем на другие искажения аудиосигнала, как и моделей для сравнения. Кроме того, далеко не все решения обучены на full-band аудио с частотой дискретизации 48 кГц, в основном только на 16 кГц — это сильно уменьшает диапазон частот в аудиосигнале.

Модель, которая одновременно подавляет шум и выполняет дереверберацию для full-band аудио, позволит устройствам с ограниченным количеством ресурсов обрабатывать речевой сигнал локально, уменьшая нагрузку на серверы и задержку ответа системы. Зачастую задачи шумоподавления и дереверберации решают последовательно разными нейронными сетями. Универсальная модель уменьшит количество используемой памяти и время обработки сигнала.

Перейдем к эксперименту

Транскрибатор (перевод аудиозаписей в текст) EMT. Простой, бесплатный, конфиденциальный

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели7.2K

Мы уже много лет разрабатываем и производим диктофоны для безопасности Edic-mini, самые маленькие в мире, кстати, по данным Книги Рекордов Гиннесса.

Читать далее
1
23 ...