Обновить
64K+

Звук

Это «ж-ж-ж» неспроста

120,1
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Винтажный электрофон Россия 321 Стерео

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели5.4K

Привет, Хабр! Иногда в обмен на электрогитары и педали эффектов для них мне предлагают неожиданные и, мягко говоря, малоприменимые в современных контекстах, но при этом весьма интересные вещи из времён моего детства.

И я соглашаюсь, поскольку такие изделия являются частицами истории и попадаются всё реже и реже, так как большинство их собратьев давно уже пали жертвами добытчиков металла.

Сегодня мы сможем рассмотреть один из наиболее массовых советских электрофонов, считавшийся также одним из худших, во многом по причине того, что он поставлялся в учебные заведения, куда, согласно общепринятому мнению, шло только самое посредственное.

Читать далее

Новости

Yue Studio: попытка сделать нейромузыку, от которой не мутит (по крайней мере меня)

Время на прочтение4 мин
Охват и читатели4K

Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть примеры было - стало: Static and Gold.

И, да, я знаю что этих студий много, даже само вайбкод название "yue-studio". Отличие этой - попытка сделать антинейросплоп, а не еще одну "морду" для YUE.

Читать далее

Как плеер угадывает тональность трека: 12 чисел и одна корреляция

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели7.9K

Плеер показывает у трека «ми минор», но как он это узнал? Программа не слушает гармонию, как музыкант: она считает, сколько звучит каждой из 12 нот, и ищет гамму, на которую набор похож сильнее всего. Разбираю алгоритм Крумхансл-Шмуклера на реальных треках, показываю, где он путает квинту и родственную тональность, и что тут меняют нейросети.

Читать далее

Трек на 46 минут долго молчал: отдаём перекодированный звук, пока ffmpeg его ещё пишет

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели8.2K

Сервер перекодирует длинный трек в Opus и отдаёт его только целиком. Пока ffmpeg пишет файл, клиент молчит: на 46-минутной записи это 19 секунд тишины. Экономный режим, в котором человек ждёт быстрой загрузки, грузится дольше оригинала. ▎ ▎ Разбираю, как отдавать файл, пока ffmpeg его ещё пишет, и сохранить при этом кеш и один прогон ffmpeg на все запросы. Почему не подошёл пайп, где прячется гонка на последнем чтении, что делать с переименованием на Windows и почему M4A без фрагментации не играет с первых байтов.

Читать далее

Зарубежные нейросети для транскрибации аудио

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели5.3K

Привет, дорогой Хабр!

Итак, наша основная задача такая - быстро забрать буквы из звука и получить внятный текст. Причем вменяемого качества хотелось бы и относительно недорого. Собрали подборку зарубежных сервисов по транскрибации аудио в текст с помощью нейросетей.

Читать далее

Частоту Audio CD выбрала видеокассета: откуда взялись ровно 44 100 Гц

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели18K

Если вы хоть раз экспортировали трек из аудиоредактора, копались в настройках звуковой карты или писали код, который что-нибудь проигрывает, вы видели число 44 100. Оно стоит по умолчанию почти везде, в конфиге его набираешь на автомате, как пин-код от своей карты, и вопросов оно обычно не вызывает, потому что объяснение к нему все помнят еще со времен лабораторных по цифровой обработке сигналов.

Я тоже много лет жила с этим объяснением и считала вопрос закрытым, пока не попробовала пересказать его вслух и не споткнулась на последнем шаге: откуда взялись именно эти сто герц сверху? Почему не ровно 44 000, почему не 45 000, почему не 48 000, как у студийного видео? Спойлер для тех, кто не любит интригу, уже вынесен в заголовок, а остальным предлагаю пройти тот же путь, что прошла я, от учебника через подозрительную арифметику к телевизионной развертке, которая до сих пор сидит в каждом компакт-диске и в огромной части музыки на стримингах.

Читать далее

Обработка цифрового звука фильтрами

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели8.9K

В данном материале в максимально простой форме изложены основы обработки цифрового звука, без подробного погружения в теорию цифровой обработки сигналов. Прилагается готовый код на C++ для расчета цифровых фильтров и собственно обработки звука.

Читать далее

xk6-sip: проверка качества звука в нагрузочных и автоматизированных функциональных тестах VoIP/SIP

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели7.7K

Разберём, как в xk6-sip, расширении нагрузочного инструмента k6 для тестирования VoIP/SIP-звонков, устроена проверка качества звука: запись звонка, оценка того, что услышал абонент, по эталону, и как это работает в функциональных тестах и под нагрузкой.

200 OK означает, что АТС соединила звонок, но не означает, что люди слышат друг друга. Исчерпанные порты медиасервера, ошибки NAT, перепутанные медиапотоки, транскодинг на пределе CPU дают звонок с успешной сигнализацией и тишиной, чужим голосом или хрипом в трубке. SIPp и большинство нагрузочных инструментов для телефонии проверяют сигнализацию, а RTP в лучшем случае считают пакетами. Для контакт-центра такой звонок — потерянный клиент, а в отчёте нагрузочного теста он зелёный.

В функциональных тестах телефонии эту проблему обычно решают эталонами: записывают, что должен услышать абонент в каждом кейсе, и сравнивают с записью звонка в CI. Подход рабочий, но эталон на каждый кейс нужно поддерживать, а под нагрузкой его не запустишь. В xk6-sip то же сравнение живёт прямо в скрипте k6 и работает на тысячах звонков.

В статье:

Читать далее

Локальный анализ звонков без GPU. Что происходит на пути от аудио до резюме

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели7.6K

Я хотел проверить не то, насколько хорошо локальная LLM пишет резюме по красивому тестовому диалогу, а что произойдёт с полным пайплайном на обычном телефонном звонке с музыкой, автоответчиком, перебиваниями и плохим звуком.

Я сделал desktop приложение на Tauri, Rust, React и SQLite. Оно распознаёт речь, разделяет спикеров, анализирует тональность, эмоции и риски, а в конце локальная модель формирует резюме и рекомендации. Всё работает на компьютере, интернет нужен только для скачивания моделей.

В эксперименте я прогнал реальные записи через два распознавателя и сравнил, где именно возникают проблемы на пути от аудио до итогового резюме.

Читать далее

Я написал свой музыкальный плеер со своим стримингом: Android, Windows, Linux и сервер на Rust

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.6K

У меня есть коллекция музыки, которой нет ни в одном стриминге: FLAC, японские альбомы, редкие релизы. Слушать её хотелось так же удобно, как Spotify, с телефона и компьютера, с текстами и итогами года. Готовые решения закрывали задачу по кусочкам, поэтому я написал своё: Nami — плеер для Android, Windows и Linux и собственный сервер на Rust. Внутри: синхронизация между устройствами через одну SQL‑таблицу вместо девяти, караоке‑тексты с выравниванием по словам нейросетью прямо на телефоне, фуригана и ромадзи для японских песен, bit‑perfect‑вывод на USB‑ЦАП и сервер, который занимает 69 МБ памяти.

Читать далее

Синхронизация камер по звуку без хлопушки: что я понял, пока делал плагин для Premiere Pro с нейросетью

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.5K

Я монтажер, не программист. За месяц вместе с нейросетью сделал плагин для Premiere Pro: он синхронизирует камеры с рекордером по звуку, режет паузы и дубли и собирает секвенцию. Историю я уже рассказывал на vc.ru, а здесь будут внутренности: как найти сдвиг между файлами, почему одного порога корреляции мало, как отличить готовый ролик от исходника и почему тесты на каждый релиз оказались важнее любого кода.

Сразу оговорюсь: код писала нейросеть под мою постановку, а я проверял на своих проектах. Поэтому это не статья «смотрите, как красиво». Это статья про задачи, которые пришлось решить, грабли, на которые наступил, и числа, которые пришлось намерить.

Читать далее

Как нейросеть переводит видео. Часть 2: русский длиннее не текстом, а звуком

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.9K

Я делаю speeek, сервис дубляжа видео, один. В первой части был вход конвейера: как звук становится текстом с таймкодами и что Whisper с этим текстом вытворяет. Эта про середину: перевод и укладку перевода в тайминг оригинала.

Середина — самое больное место всего проекта. Распознавание я более-менее победил, синтез покупаю готовый. А вот что делать с русской фразой, которая не лезет в секунды английской, я до сих пор не уверен. В конце будет эксперимент, после которого стало немного понятнее.

Читать далее

Локальный ассистент для зумов, часть 8: модель, ради которой я поменял диаризацию за один вечер

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели8.9K

В третьей части я написал, что не вижу чужой модели, ради которой стоит менять связку. sherpa-onnx на диаризации, свой второй проход поверх, канал собеседников двадцатиминутного звонка размечается минут семь. Жить можно.

23 сентября NVIDIA выложила Nemotron 3 Diarization. Вечером 28-го я включил её в разбор своих созвонов. Тот же канал — три секунды.

Читать далее

Ближайшие события

Оффлайн телесуфлёр поверх Instagram и TikTok: распознавание речи на телефоне, выравнивание по словам

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели9K

Мой телесуфлёр для Android называется Суфлёр. Он распознаёт речь на телефоне и прокручивает текст по голосу поверх Instagram, TikTok или системной камеры. Во время записи видео Android отдаёт микрофон камере, и Суфлёр получает звук параллельно с ней через службу специальных возможностей. Такое исключение описано в разделе 5.4.5 Android CDD. Место в сценарии Суфлёр находит, выравнивая восемь последних распознанных слов по всему тексту. Ещё в статье есть правила, которые понадобились трекеру для английского языка.

Читать далее

Как я выбирал софт для измерения параметров усилителей и почему остановился на Room EQ Wizard

Уровень сложностиСредний
Время на прочтение42 мин
Охват и читатели7.3K

Саму проблему для себя я разрешил ещё несколько лет назад, но очень хочу поделиться со всеми интересующимися тем, в чём состоят различия в программном обеспечении для измерения поведения аудиоустройств, так как я накопил на эту тему довольно много наблюдений.

Даже простое перечисление критериев выбора оказалось связано с погружением в технические детали, которые могут быть полезны тем, кто интересуется аудиоаппаратурой или электроникой.

В этой статье я сознательно ограничусь измерением нелинейных искажений — компонентов, отсутствовавших в исходном сигнале, но появившихся на выходе устройства и зависящих от входного уровня нелинейным образом.

Измерения нелинейных искажений сложно выполнять корректно: они требуют высокой точности трактов, чистых условий и хотя бы минимальной стандартизации методик. Именно поэтому я хотел тщательно во всём разобраться, так как мой текущий инструмент показывал некоторые проблемы, и я не знал в точности почему.

Читать далее

Как Claude Code помог мне сделать звук на мансарде приятным

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.1K

Всем привет. Меня зовут Антон Будон и в целом я занимаюсь маркетингом и обычно использую Claude Code для анализа трафика, настройки рекламных кампаний, SEO и создания лендингов. Дома же подвязал Клода напрямую к телеграму (наверное таких статей уже много) и общаюсь с ним напрямую как с помощником‑напарником по личным делам.

Я не являюсь профессиональным аудиофилом, и не ставлю себя в этой статье как эксперт по звуку либо звучанию, но у меня получилось что‑то что реально изменило восприятие звука и наконец‑то я понял зачем же по‑настоящему нужен эквалайзер.

Дорога к этому была не целенаправленная, а просто личностный интерес. Две недели назад я купил усилитель Technics su‑v505 и колонки Kenwood ls-90, годов 80х. Захотелось наконец‑то заново послушать красивый «старый звук» после всяких Алис и JBL, ну и лет 10 тому назад у меня всё‑таки был длительное время усилитель Marantz и колонки Sonus Faber Concertino, которые мне доставляли огромное удовольствие. Потом полоса жизни, переездов, семья, дети и все всегда уходило на задний план и в этот момент я решил что надо вернуться к прослушиванию музыки на чем‑то более качественном (я бы сказал ностальгическом).

Что имеем. Колонки Kenwood LS-90 1980 года: три полосы, фазоинвертор с портом спереди, 40–20 000 Гц, 8 Ом, чувствительность 91 дБ. Усилитель Technics SU‑V505 1983 года: 60 Вт на 8 Ом, Class A. Всё вместе обошлось примерно в 40 000 ₽ на вторичке.

Читать далее

Почему все отказываются от электрогитар Kuruisi?

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели16K

Привет, Хабр! На любую электрогитару можно установить дорогие звукосниматели, и из этого что-то получится. Если результат не порадует, фирменные датчики останутся в вашем распоряжении. Потребуется только заменить саму гитару.

Благодаря маркетплейсам и прямым поставкам из Китая, хорошие дешёвые звукосниматели сегодня тоже доступны. Есть и ещё более экономный путь — замена магнитов в штатных датчиках инструмента. Пересылка магнитов — та ещё заморочка, но со второй попытки всё получается.

Однако гитарный звукосниматель — это просто подмагниченная катушка индуктивности или несколько таковых. И мы можем изменить параметры такого устройства даже без замены магнитов при помощи копеечных конденсаторов и резисторов. Причём номиналы компонентов для требуемого звучания можно подбирать как душе угодно, не ограничиваясь выбором из нескольких моделей датчиков или разновидностей магнитов.

Сегодня я возьму ультрадешёвый стратокастер Kuruisi и сделаю из него инструмент, пригодный как для комфортного обучения новичка, так и для репетиционно-концертной деятельности практикующего музыканта.

Результаты можно будет услышать на видео

Сонар-управление + Asteroids. Игра на 50 КБ, которой нужен флагманский смартфон

Время на прочтение6 мин
Охват и читатели6.8K

Телефон лежит на столе или в другой руке. Сбоку от него в воздухе ладонь. Двигаешь ладонью — корабль на экране поднимается и опускается. Экрана не касаешься. Камера не нужна: телефон пищит ультразвуком и слушает эхо своим микрофоном.

Играть: sonaroids.app (веб-приложение на iPhone; для Android есть .apk — ссылка на главном экране игры). Код: github.com/neokrasav4ik/sonaroids, MIT.

UPD. Заголовок устарел, и это хорошая новость: на Mi 9 Lite, середнячке 2019 года, играется так же, как на iPhone 16. Помогли широкий зонд (управление примерно вдвое чище) и приложение для Android со своим звуком, правильной громкостью и выбором микрофона. Новые разделы статьи — «Широкий зонд» и «Android: приложение вместо браузера».

Читать далее

Музыка, которая ждёт игрока: превращаем любой mp3 в адаптивный игровой саундтрек

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.3K

Я пять лет вожу настольные ролевые игры как мастер. И пять лет воюю с музыкой.

Знакомая картина: партия торгуется с контрабандистом, напряжение на столе настоящее — и тут трек просто заканчивается. Тишина. Или автоплей подсовывает что-то бодрое из соседнего плейлиста. Магия момента разбита, а я судорожно переключаю вкладки, как будто проваливаю проверку восприятия.

Вторая беда — переходы. Партия вышибает дверь в подземелье, варвар уже кидает инициативу, а я двадцать секунд вожусь с фейдом тавернской темы и поиском боевого трека.

При этом видеоигры решили эту проблему десятилетия назад. В любой RPG музыка города крутится, пока ты в городе, а стоит спуститься в склеп — тема мрачнеет вместе с тобой, точно в долю. Композиторы пишут игровую музыку секциями с loop-точками и маркерами переходов, а движки вроде FMOD и Wwise собирают из этого «музыку, которая реагирует».

Но моя фонотека — это обычные mp3. У них есть начало и конец, и им плевать на мою партию.

Так родился проект: инструмент, который берёт любой трек и заставляет его вести себя как игровой саундтрек. Под катом — вся дорога: от теории музыки и алгоритма Фута из 2000 года до нейросетей 2025-го, от сэмпл-точного планирования в Web Audio до археологии сломанных зависимостей. С честными цифрами, где нейросеть проиграла эвристике.

Читать далее

YuE2 Studio: бесплатная замена Suno на своей видеокарте, и почему я перешел с Python и Gradio на Rust, Tauri и C++

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели14K

Всем привет, любите ли вы генерировать музыку так, как люблю я? Можете не отвечать, скорее всего нет. Но вот с ужесточением правил Suno, генерировать музыку там стало просто бессмысленно (кто не в курсе с сентября, они закрыли скачку треков).

Потому я собрал десктопную студию в стиле Suno для YuE2, новой открытой модели генерации песен от команды M‑A‑P (Multimodal Art Projection). Пишете стиль и текст, получаете полноценную песню с вокалом и аккомпанементом в 48 кГц стерео. Всё считается на вашей видеокарте: без облака, подписок, очередей и без установки Python.

Читать далее
1
23 ...