Обновить
128K+

Звук

Это «ж-ж-ж» неспроста

240,66
Рейтинг
Сначала показывать
Порог рейтинга

Саймон Уиллисон, один из создателей Django и автор Datasette, обратил внимание на необычную фоновую музыку в гавайском ресторане. Музыка показалась разработчику однотипной и безликой, тексты песен в каких-то общих чертах рассказывали про нахождение на пляже. Ловким движением руки Уиллисон запустил приложение Shazam, чтобы найти исполнителя. Сервис не смог установить авторство ни одной песни, чем подтвердил опасения Саймона: это ИИ.

Это не первый Гавайев случай, когда в качестве фоновой музыки играет сгенерированная искусственным интеллектом песня. В апреле этого года сообщалось, что в аэропорту Гонолулу играют 17 сгенерированных ИИ треков на тему островов и авиаперевозок. С пяти утра до полуночи в залах Международного аэропорта имени Дэниела К. Иноуэ звучали песни, в которых машинный вокал рассказывал про сотрудников аэропорта, авиалинии, вулкан Дайамонд-Хед и дух алоха.

Реакция пассажиров и местных жителей варьировалась от смешанной до резко негативной. На Reddit персонал аэропорта жаловался, что музыка раздражает; схожим образом высказывались пассажиры, которым громкость воспроизведения показалась избыточно высокой. Кроме собственно качества критикующие указали, что подобные треки плохо представляют культуру архипелага, хорошо известного своей характерной музыкой. Градус возмущения оказался настолько высок, что гавайские музыканты даже собрали альбом-компиляцию музыки для аэропорта и выставили его на продажу на Bandcamp.

Отдельно в СМИ сообщалось, что затея аэропорта не стоит ничего, денег из казны штата потрачено не было, в то время как подписка на фоновую музыку в среднем обходится в $10,5 тыс. (Как минимум с первой половины прошлого века существуют компании музыки для бизнеса, которые сдают в аренду плейлист и специализированное оборудование для его воспроизведения). С каким сервисом сгенерировали эту музыку, не рассказывается, но легко предположить, что это был стартап Suno. Во всяком случае, даже на бесплатном тарифе Suno возможно генерировать по 10 треков в сутки.

Случай же Уиллисона куда более мелкий, это может быть просто инициатива ресторана. В США нельзя включать какую попало закопирайченную песню в общественном пространстве, не заплатив Американскому обществу композиторов, авторов и издателей и/или другой организации правообладателей. Тем не менее резкого падения показателей у компаний фоновой музыки из-за Suno не наблюдается. К примеру, у Stingray в этом году выручка от этого направления только растёт, хотя у другого представителя индустрии, Soundtrack Technologies, наблюдаются проблемы с доходностью.

Теги:
+5
Комментарии0

Nvidia представила открытый проект Nemotron VoiceChat. Это голосовой ИИ‑агент, способный открывать любые инструменты по команде пользователя в реальном времени:

  • Nemotron говорит с вами без пауз и умеет в эмоции;

  • разрешает вам перебивать себя с задержкой всего 480 мс;

  • умеет вызывать инструменты посреди диалога — поиск в сети, календарь и так далее;

  • поддерживает сложные сценарии использования;

  • обучен на 550 тысячах часов речь;

  • умеет слушать, говорить, прерывать ответы и вызывать инструменты в рамках одного диалога.

Теги:
+5
Комментарии2

NYSTHI VectorMixer

Хочу просто поделиться шикарным модулем для VCV Rack - NYSTHI VectorMixer. Это графический микшер. Можно просто сводить, а можно изменять параметры звука во времени, по любой траектории.

Справа в Keyframe Animator:

  • Можно выбрать одну точку и затем нажать Snap KF!

  • Можно сразу нарисовать весь паттерн вручную, нажав сначала AUTOREC KFs.

  • Для паттерна также можно использовать LFO (X Position, Y position,… ) и т. д.

  • Для воспроизведения нажать RUN, для зацикливания - ещё и LOOP.

  • DELETE ALL KF очищает память.

  • TOT TIME меняет скорость паттерна.

И вот пример моего патча для перкуссии с этим модулем:

Теги:
+3
Комментарии0

Доброго всем!

Я не музыкант, не композитор и не продюсер. Просто люблю музыку :)

С развитием генеративных моделей появилась бездна синтетических треков. На первый взгляд и слух многие из них неотличимы от человеческих, а местами даже лучше одноразовых коммерческих поделок. Но лично у меня от массового нейросетевого звука уже выработалось устойчивое слуховое утомление — слишком стерильно и предсказуемо.

Чтобы отсеять синтетический шум, появилось множество сервисов по распознаванию ИИ-музыки. Насколько я понимаю (возможно, в корне неверно), вся эта детекция основана на поиске в спектрограмме устойчивых паттернов: отпечатков периодических структур, артефактов нейросетевых вокодеров (типа EnCodec) и следов агрессивного сжатия.

Ради прикола я прогнал через довольно строгий детектор (aimusicdetector.online) несколько заведомо «живых» коммерческих треков. Ожидал увидеть чистый результат, но ИИ-артефакты детектировались везде — 15%, 18%, 20%. Ладно, списал на мастеринг.

Но вот попались две жемчужины, которые полностью сломали мне картину мира:

Трек 1: THER_DARK_MOTIVATION — Confessions_in_the_Smoke

Weak / inconclusive evidence Confidence: Medium · Linear model probability: 45%

Трек 2: THER_DARK_MOTIVATION — The_Man_Who_Walked_With_Shadows

Strong codec evidence Confidence: High · Linear model probability: 86% Strong codec evidence detected in the residual spectrum. The fingerprint aligns with the current linear model for AI-music artifacts.

То есть детектор с высокой уверенностью называет живую стоковую музыку нейросетевой генерацией, ссылаясь на «совпадение с линейной моделью артефактов ИИ».

Уважаемое сообщество, хочу спросить:

  1. Как это можно объяснить с точки зрения DSP и аудио-форензики? Это баг конкретной модели, или современные детекторы действительно путают артефакты brickwall-лимитеров / MP3-кодирования с нейросетевыми вокодерами?

  2. Можно ли хоть в какой-то степени верить таким сервисам в 2026 году, или они уже сейчас дают слишком много ложноположительных срабатываний на профессионально сведённой музыке?

  3. Есть ли среди читателей те, кто сталкивался с подобным в работе (A&R, саунд-дизайн, модерация контента)? Как вы верифицируете происхождение треков, когда автоматика врёт?

Буду благодарен за любые мысли, ссылки на исследования или личный опыт. Заранее спасибо! 🙏

Теги:
Всего голосов 3: ↑3 и ↓0+5
Комментарии3

Во время презентации WWDC спикеры часто произносили фразу активации Siri, но голосовой помощник у зрителей не срабатывал. Такого эффекта добились, вырезав из аудио частоты 3-6 кГц именно на обращениях к Siri. Вырезанные фрагменты хорошо видны на спектрограмме.

Теги:
Всего голосов 3: ↑3 и ↓0+5
Комментарии0

Включаем пространственный звук в Discord. Подробное руководство, как включить новую опцию. С ней все участники канала будут звучать так, будто они сидят в одной комнате:

  • Качаем тестовый бранч Canary — отсюда.

  • Качаем мод Vencord, чтобы разблокировать функцию — здесь.

  • В аддонах включаем опцию «Experiments».

  • Переходим в инструменты разработчика (иконка инструментов в правом верхнем углу).

  • Вверху жмем на маленькую стрелочку и в поиске вводим Spatial Audio.

  • Заходим в войс и наслаждаемся.

Теги:
Рейтинг0
Комментарии0

Запилили TG-бота для склейки голосовух - https://t.me/voicemixbot

👍 Зачем.

  1. Сложно наговорить длинную 3-минутную мысль за раз красиво. Вместо этого, ясно произнеси отдельные фразы по 5 сек друг за другом, продумав каждую.

  2. Мысль приходит только на улице во время прогулки и с собой только телега, монтировать дома никто не будет, а итоговая цельная голосовуха с красивой мыслью нужна уже сейчас чтобы кому-то переслать.

  3. Хочешь записать инновационный трек из склейки пердежа, скрипа двери и крика бомжей в метро, но прямо сейчас без инвестиций в монтаж и продюсирование.

🧰 Как пользоваться.

  1. Заходим в @voicemixbot - ему уйдёт команда start.

  2. Шлем голосовухи друг за другом. После каждой видим ADD N, где N - её порядковый номер (начиная с нуля). Это значит, голосовой кусок вставился в ряд. Не говори следующую голосовуху, пока не получил ADD.

  3. Удалить последнюю голосовуху - pop. Когда понял, что последней голосовухе нужен новый дубль. Вернёт SIZE N, где N - новое общее число эпизодов в проекте.

  4. Всё сказал: пишем makeили go. Получаем цельный файл. Забыл что-то сказать - докидываем голосовух в конец и снова make .

  5. Пишем clear если надо начать новый файл.

💎 Команды.

  • clear - забыть всё, начать новый проект

  • info - статус текущего проекта

  • make - склеить текущий проект (цепь голосовух) в один файл

  • name TEXT - указать название TEXT для вашей итоговой записи

  • pop - удалить последнюю голосовуху из стека

  • amp 1 или amp 0 - включить или выключить автоусиление тихой речи.

  • bitrate N - установить битрейт, где N - между 2000 и 50000
    23000 - достаточно для прилично звучащей речи

  • mk N MESSAGE - поставить текстовую метку MESSAGE перед куском номер N. Нумерация с нуля. N - это тот номер, который фигурирует в ответе "ADD"

  • fade N, N - число миллисекунд: длительность плавного перехода между фразами.

Метки.

00:00 - Приветствие
00:21 - Музыка
00:31 - Новости
01:04 - О погоде

Чтобы получить такую таблицу временных меток под записью, отправляй нужный текст перед той голосовухой, на начало которой этот текст должен ссылаться. Текстом считается любой текст, которого нет в таблице команд. Если вы хотели поставить метку перед уже отправленной голосовухой, но забыли это сделать, то используйте команду mk N (см выше).

🔌 Технические детали.

Кодируем речь кодеком OPUS, он прекрасно звучит даже на битрейте 24k, где mp3 бы уже умер. "/" в начале команды не важен. /pop и pop работают одинаково. Цепь голосовух мы называем "проект". У каждого проекта есть уникальное случайное служебное имя вида d7_uaUcUXc0. Помнить его не надо. Команда clear создаёт новый проект с новым именем, забывая предыдущий навсегда. Лимит кусков в проекте - 200, но лучше не рисковать. make 13 минутного файла будет работать 3 минуты. Написано на голимом C++20, libopus, libogg, epoll.

⌛ Лимиты.

  1. Одна голосовуха - не более 60 секунд.

  2. Число голосовух в проекте - 200 штук.

  3. Получается суммарно более 2 часов на один файл, но стало страшно. В будущем возможно порежем лимит результирующего файла чем-то на уровне 10 минут.

🔒Безопасность и надёжность.

clear удаляет голосовухи с сервера бота. Бекапов нет. ФС сервера - в ramdisk. Наговорил, скомпилил - забери себе, не растягивай проект на неделю. Сервер не стабилен, падает раз в неделю с переналивом всей OS с нуля. У админа доступ ко всем голосовухам (как у админы телеграм к личкам), но чаще падает сервер с данными, чем админу охота покопаться. Если придёт майор с бутылкой - всех сдадим, но рамдиск (может быть уже нечего). Метаданные о пользователях не собираем, спамить не будем - даже БД нет. Точнее, есть, но в рамдиске. Если сервер не отвечает, то он либо сдох и ему скоро автоматически нальют образ по вотчдогу, либо занят компиляцией чьего-то проекта - отправь команду info и подожди. Устраивать DoS и хакерство с отправкой гиговых видосов и фоток не надо: бот даже не начнёт качать. В целом, наверное вы можете его положить, но мы просто пнём сервак и он забудет всё плохое в жизни, рамдиск же.

https://t.me/voicemixbot в общем.

Теги:
Всего голосов 7: ↑1 и ↓6-5
Комментарии7

Микрофоны ДЭМШ-1А, которыми оснащался скафандр первого космонавта Юрия Гагарина, были разработаны на тульском предприятии «Октава» (позже Особое конструкторское бюро «Октава»). Речь идет о дифференциальном электромагнитном малогабаритном шумостойком микрофоне ДЭМШ-1А. Именно эта модель, а точнее два таких микрофона — основной и резервный — были встроены в скафандр «СК-1» первого космонавта. Они являлись частью гарнитуры шлема и работали в составе бортовой аппаратуры связи «Заря». 

Юрий Гагарин с Сергеем Королёвым перед полетом. В шлеме скафандра виден встроенный микрофон ДЭМШ-1А. Кадр снят 12 апреля 1961 года. Фото: Минобороны РФ
Юрий Гагарин с Сергеем Королёвым перед полетом. В шлеме скафандра виден встроенный микрофон ДЭМШ-1А. Кадр снят 12 апреля 1961 года. Фото: Минобороны РФ
Теги:
Всего голосов 3: ↑3 и ↓0+4
Комментарии2

Представлен открытый генератор речи OmniVoice, который может создавать аудио на более чем 600 языках. Решение клонирует любые голоса без цензуры. Достаточно короткой записи на 5-10 секунд. Скорость модели в 40 раз быстрее, чем генерация в реальном времени. Можно настроить любые параметры аудио: пол, возраст, шёпот. Есть онлайн-демо, сама модель на HuggingFace,

Теги:
Всего голосов 4: ↑4 и ↓0+8
Комментарии1

Представлен открытый мультиплатформенный проект Snowify. Это аналог Spotify в виде музыкального плеера с кодом на JavaScript без рекламы и без регистрации. Музыка стримится с YouTube Music. Все функции Spotify на месте: списки треков, текст песен, плейлисты с рекомендациями и даже синхронизация с облаком. При этом в интерфейсе нет ничего лишнего, что отвлекало бы от музыки. Проект поддерживает кастомные плагины.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии2

Сделал тут небольшое приложение для прослушивания музыки из сине белой соцсети

• бесплатно 
• без рекламы
• с офлайн режимом
• не нужно скачивать

Актуально больше всего для ios, так для андроидов есть всякие vkX, но при этом моё приложение не требует авторизации 

Написано на $mol

P.S. Закрепите на рабочем столе как веб приложение

P.P.S Если актуально и нужны новые функции, сделаю за небольшой Донати

накидал за 1 вечер, пишу пост в тот же день
накидал за 1 вечер, пишу пост в тот же день
Теги:
Всего голосов 3: ↑1 и ↓2-1
Комментарии0

Краткая история развития ЭВМ - от механических счётов до современных LLM в рифму за две минуты!

Теги:
Всего голосов 5: ↑1 и ↓4-3
Комментарии0

Изучаем гитару, басс, пианино и музыкальную теорию дома. В сети собрали все нужные сайты с теорией и практикой:

Теги:
Рейтинг0
Комментарии0

Ближайшие события

Вышел открытый проект Voicebox — локальная нейросеть‑клонер, по сути бесплатная альтернатива ElevenLabs. Это буквально «голосовой фотошоп» без ограничений и подписок. Работает просто: загрузили короткий кусок аудио — получили голос.

  • Клонирует голос по короткому аудио.

  • Генерирует речь из текста любым клоном.

  • Собирает разговоры/подкасты из нескольких голосов.

  • Записывает и расшифровывает аудио.

  • Все работает локально. Все проекты и озвучки хранятся на ПК. Дальше можно озвучивать тексты, видео, презентации, мемы или делать диалоги из нескольких голосов.

Теги:
Всего голосов 5: ↑5 и ↓0+5
Комментарии0

Представлена открытая бесплатная ИИ-студия для работы с голосом MimikaStudio.

Проект умеет:

  • клонировать голос по трём секундам;

  • генерировать речь;

  • создавать аудиокниги и озвучивать текст;

  • поддерживает 23 языка, включая русский;

  • работает на ПК с требованием 8 ГБ ОЗУ;

  • работает на macOS, Windows и в веб-версии;

  • есть локальные модели.

Теги:
Всего голосов 2: ↑2 и ↓0+2
Комментарии1

Два проекта, с которыми можно выучить нотную грамоту и начать играть на музыкальных инструментах:

  • Muted — музыкальная теория. Гаммы, интервалы, кварто‑квинтовый круг, лады, тональность и остальная нотная грамота. Авторы объясняют материал максимально подробно и чётко, любые звуки можно прослушать и запомнить.

  • Musicca — прокачиваем музыкальный слух и отрабатываем теорию, которую получили с Muted. Ставим аккорды, учимся попадать в ритм, читаем ноты и даже учим сольфеджио.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Открытый проект ebook2audiobook превращает любую электронную книгу в полноценную аудиокнигу. Работает просто: закидываете epub, pdf или даже обычный txt и на выходе получаете готовый аудиофайл с главами, нормальной озвучкой и метаданными. Подойдёт, если не любите читать глазами, но хотите слушать книги в дороге или на тренировке. Работает локально на ПК и поддерживает множество языков и даже умеет клонировать голос. Можно озвучить книгу своим голосом или профессиональным диктором. Идеально для студентов, тех кто учит языки, или просто хочет слушать свои книги офлайн без подписок и облаков.

Теги:
Всего голосов 4: ↑4 и ↓0+5
Комментарии0

Представлен бесплатный открытый проект HeartMuLa, который генерирует музыку на уровне платных ИИ-студий. Это полноценная музыкальная «студия всё в одном»: можно создавать треки по описанию, делать песни в стиле любимых артистов и работать с готовым аудио.

Что умеет HeartMuLa:

  • пишет тексты песен через встроенный чат-бот;

  • генерирует треки с вокалом и текстом длиннее 4 минут;

  • можно загрузить любой аудиофайл, и ИИ перенесёт его вайб и стиль в новый трек;

  • работает даже на слабом железе: локальная версия требует всего ~3 ГБ видеопамяти;

  • простой и понятный интерфейс. Фактически: бесплатный аналог Suno, но без подписок, ограничений и облака;

  • можно ставить локально и делать музыку прямо на своём ПК.

Теги:
Всего голосов 4: ↑2 и ↓2+2
Комментарии6

Nvidia представила нейронку PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models, которая умеет разговаривать как реальный человек: без пауз, без остановок, без подхалимства и клишированных фраз. Можно вести диалог, перебивать друг друга, исправлять ИИ-собеседника, перестраивать общение. ИИ делает смысловые паузы, варьирует интонацию, использует междометия и даже «угукает», чтобы показать активное слушание. Подстраивается под речь и ситуацию за один промпт.

Проект на GitHub. Ссылка на Hugging Face.

Теги:
Всего голосов 2: ↑2 и ↓0+2
Комментарии0