Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 284,39
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Треть новых релизов на Яндекс Музыке – ИИ. Теперь точно

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели25K

Прошло полтора месяца с публикации моей статьи «Я выяснил, что Яндекс Музыка на треть состоит из нейрослопа». Всё это время я продолжал исследовать тему определения ИИ в музыке. Итогом изысканий стал алгоритм, позволяющий определять сгенерированные треки с точностью, близкой к 100%.

Кроме того, я проанализировал релизы в Яндекс Музыке за первое полугодие 2026 года и выяснил, что 37% всех новых релизов имеют признаки ИИ-музыки. А если учитывать только релизы с лайками, то количество нейромузыки достигает 50%.

В этой статье я подробно расскажу, как работает алгоритм детекта ИИ-музыки, почему для него не требуется GPU, а также покажу аналитику по Яндекс Музыке.

Читать далее

Сегментация опухолей головного мозга на МРТ-снимках с акцентом на точность границы

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Один из самых важных параметров на МРТ снимках — это граница опухоли. Именно эта граница определяет, какие структуры головного мозга были затронуты опухолью, и позволяет оценить степень поражения соседних областей и тканей. Благодаря качественному определению контура можно точнее спрогнозировать лечение, поэтому нельзя недооценивать важность определения границ.

Стандартные модели сегментации хорошо решают задачу выделения объектов, U-Net стала фундаментом в медицинской нише. Но не всегда достаточно просто выделить границу области: маска может давать хорошее покрытие, быть близкой к целевой, однако иметь неадекватный контур — слишком сглаженный или, наоборот, рваный. Функции потерь покажут низкий loss, но на самом деле этот один пиксель, который в реальности переносится в миллиметры распространения, определяет будущее человека.

BISCUIT-Net стремится решить именно эту проблему. Работая как стандартный U-Net, он добавляет легковесное внимание на контур. Модель буквально делает набросок, после чего аккуратно выстраивает границу. Философия модели: «граница это не побочный эффект, а цель».

Ознакомиться

Пузырь ИИ лопнул? Бизнес отказывается от ChatGPT, а Microsoft пытается спасти положение софтом: ML-дайджест

Время на прочтение13 мин
Охват и читатели26K

В июне этот экономический тупик стал главным драйвером изменений в индустрии. Компании перестали гнаться за брендами вроде OpenAI и начали массово переходить на китайские модели, а это уже холодный расчет.

Но, согласитесь, экономия на API — это лишь верхушка айсберга. Нужно смотреть на весь ИИ-стек сверху вниз. В этом дайджесте мы разберем три главных инфраструктурных сдвига июня.

Читать далее

GPU vs vGPU: что выбирать для быстрого запуска AI-сценариев и контроля над данными

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели6.8K

Привет, Хабр. Меня зовут Дмитрий Сергеев. Я менеджер продукта «виртуальные серверы» (GPU) в компании VK Tech.

Одна из ключевых проблем внедрения нейросетей в бизнес — отсутствие подготовленной ИТ-инфраструктуры. Почти всегда приходится разбираться, какая из тысяч моделей подойдет для задачи и будет учитывать специфику и процессы бизнеса. Часто это становится дорогим занятием без предсказуемого результата.

В этой статье я на примере сервисов VK Cloud разберу, в каких сценариях востребованы физические GPU, а также где и как их можно эффективно заменить с помощью vGPU, чтобы оптимизировать бюджет и сэкономить на аренде полного объема ресурсов.

Читать далее

Умеют ли трансформеры водить машину

Время на прочтение17 мин
Охват и читатели15K

Трансформеры уже умеют писать код, генерировать тексты и рисовать картины. Но могут ли они управлять автономным автомобилем в реальных городских условиях, среди людей и других машин?

Меня зовут Максим, я руковожу службой поведения и предсказания движения в Автономном транспорте Яндекса. Отвечаю за задачу Motion Planning — ту часть системы, которая решает, как именно должен двигаться автомобиль в следующие секунды. В этой статье я расскажу, как мы используем архитектуры на основе трансформеров в планировании движения и почему это сильно отличается от привычных задач генеративных моделей.

Мы пройдём путь от первых ML‑экспериментов до регулярных испытаний на реальных машинах. Разберём, чем Open Loop отличается от Closed Loop, почему качество предсказаний не определяет качество вождения и почему безопасность для нас важнее любой архитектуры.

Читать далее

Аудио-токенизатор KVAE-Audio от Сбера

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели13K

Привет, Хабр. Мы уже показывали токенизаторы для изображений и видео, рассказывали про обновление видеомоделей KVAE-2.0, а теперь закрываем третью модальность — публикуем KVAE-Audio, непрерывный полнодиапазонный (48 кГц) токенизатор для звука. По результатам тестов наш VAE (вариационный автоэнкодер, Variational Autoencoder) показывает лучшее качество генераций в задаче text-to-audio (генерирование звука по текстовому описанию) в общем домене, при этом не отставая в качестве реконструкций от моделей конкурентов, и имея заметно меньше параметров и каналов в латентном представлении. Код, инференс — в открытом доступе под лицензией MIT, веса на HF.

Читать далее

Как одна операция из линейной алгебры захватила мир ИИ

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели19K

В 2017 году в мире нейросетей произошел почти незаметный переворот. Без громких презентаций и человекоподобных роботов исследователи из Google опубликовали статью с очень скромным названием — Attention is All You Need. Но именно после нее индустрия ИИ фактически разделилась на «до» и «после».

Сегодня на трансформерах работают ChatGPT, Claude, Gemini, Midjourney и почти весь современный генеративный ИИ. И самое странное в этой истории — фундаментом революции стала одна из самых простых операций линейной алгебры: скалярное произведение векторов.

Не новая архитектура памяти.
Не сложная логика вывода.
Не биологически правдоподобная модель мозга.

А обычное перемножение чисел с последующим сложением.

Но чтобы понять, почему именно эта операция оказалась настолько мощной, нужно сначала вспомнить, в какую стену уперлись нейросети старого поколения.

Читать далее

Все демонические насельники ИИ… по старшинству

Время на прочтение28 мин
Охват и читатели13K

Гоблины, призраки, монстры, богини: фантастические твари и где они обитают.

В конце апреля OpenAI опубликовала у себя в блоге пост, в котором объяснила, почему модели OpenAI то и дело говорят о гоблинах. А также о гремлинах.

Получился интересный документ, как минимум, частично касающийся той работы, которой мы вместе с Мюрреем Шанаханом и Гамильтоном Моррином занимались на протяжении нескольких месяцев. Теперь, в зависимости от того, с кем именно мы беседуем, я могу сказать, что этот проект был призван помочь разобраться в глубинной психологии больших языковых моделей (БЯМ) и о том, как она влияет на коммуникацию нейронок с пользователями. Но другому собеседнику я мог бы сказать, что наша работа скорее сближалась с демонологией.   

Читать далее

ML для больших компаний: от DevBox до платформы на тысячу пользователей

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели9.4K

Привет, Хабр! Меня зовут Антон Алексеев, я MLOps-инженер в Авито

В статье рассказываю, как мы строим ML-платформу на базе Kubeflow. От первых DevBox-решений мы пришли к набору небольших юнит-платформ, которые разные команды развивали под свои бизнес-задачи и связывали между собой. Со временем возникла задача объединить эти решения в единую платформу. Поделюсь, как мы это делали, с какими проблемами столкнулись и как их решили. И немного о том, как должны выглядеть агентские платформы, когда за управление инфраструктурой отвечают агенты. 

Статья будет полезна не только тем, кто разрабатывает и использует платформы в больших компаниях, но и тем, кто работает на DevBox-машинах или небольших платформах для юнит-команд от 10 до 100 человек.

Читать далее

Как правильно выбрать эмбеддинг для проекта

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели13K

Эмбеддинги (иначе говоря, векторные представления) — это способ представления абстрактных данных в виде набора чисел (в виде векторов, как вы могли уже понять), близкие значения которых связаны семантически и математически и с которыми может работать модель искусственного интеллекта.

Разберемся какие модели лучше других подходят для кодирования слов. Параллельно с этим разберём принципы, на которые нужно опираться при выборе эмбеддинг-модели, пощупаем русские BERT-модели и внесём ясность про системные требования, контекстное окно и размер батча.

Читать далее

Как мы ускоряли диффузионный декодер TTS

Время на прочтение11 мин
Охват и читатели9.9K

В пайплайне перевода видео в Яндекс Браузере скорость работы в синтезе речи долго оставалась узким местом: одно видео — это сотни фраз, каждая генерируется отдельно, и любая сэкономленная миллисекунда становится заметной в масштабах сервиса. 

Внутри TTS работает каскад из трёх компонентов: языковая модель предсказывает аудиотокены по тексту, диффузионный декодер восстанавливает мел‑спектрограмму из латентов, а вокодер превращает её в звуковую волну. Долгое время самой тяжёлой была языковая модель, но после её оптимизации на первый план вышел декодер латентов — его forward pass запускается на каждом шаге семплинга диффузии, а шагов — десятки. Именно его мы и взялись ускорять.

Читать далее

Зачем Meta* уничтожает свой отдел разработки?

Время на прочтение20 мин
Охват и читатели10K

В течение двух десятков лет в компании Meta* существовал уникальный высокопроизводительный отдел разработки; всё закончилось в апреле этого года. На протяжении первых двух десятков лет работы компании в ней исповедовалась культура «двигайся быстро и ломай ненужное», в начале 2020-х сменившаяся на «двигайся быстро со стабильной инфраструктурой». Знакомые мне разработчики из этой компании говорили мне, что им представляли всё необходимое для качественной работы с упором на приносимую пользу, а интересы бизнеса находили баланс с надёжной разработкой.

Но за последние несколько недель всё поменялось: руководство начало исполнять подробные планы по разрушению проверенной успешной культуры разработки максимально жестоким и эффективным образом.

Недавно я уже говорил о том, насколько тяжела ситуация для разработчиков в одной из самых престижных компаний Кремниевой долины. В этой статье мы обсудим произошедшее и попытаемся понять, на чём же основывалось руководство, превратившее отдел разработки ПО из центра принесения прибыли, которым он служил с 2004 года до недавнего времени, в презираемый центр генерации затрат, в который он превратился всего за несколько недель.

Читать далее

Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели16K

Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. 

Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.

Читать далее

Ближайшие события

Потратил полгода на обучение своей ии с нуля, вот что вышло

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели9.2K

Последние полгода я обучал свою небольшую нейросеть с нуля на одной rtx 4060. Сжег кучу времени, перебрал кучу данных и в итоге дошел до версии 2.1 — это крошечная LLM всего на 260 млн параметров.

Зачем вообще было это делать? Мне просто стало интересно, можно ли научить такую микроскопическую нейронку (а более большую я обучить и не мог) хоть какой‑то логике.

Почитать, чему научилась

Исследование Selectel: каждая четвертая российская компания использует ИИ в облаке

Время на прочтение3 мин
Охват и читатели8.6K

Привет, Хабр! Совместно с аналитическим агентством Apple Hills Digital мы провели исследование трендов облачного потребления в корпоративном секторе России. Полученные данные показывают, как компании используют облачные технологии для внедрения решений на базе искусственного интеллекта.

Исследование проходило в два этапа. В первом провели 27 глубинных интервью с ИТ-директорами и руководителями крупных компаний. Во втором — онлайн-анкетирование 419 компаний из различных отраслей экономики. Участие приняли руководители и специалисты — лица, отвечающие за принятие решений об IT-инфраструктуре и облачных сервисах.

Читать далее

OCC-RAG: компактные модели, которые отвечают только по источникам

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели16K

Привет, Хабр! На связи команда Optimal Cognitive Core (OCC) из AIRI. Развитие языковых моделей в последние годы определяется масштабом: каждое новое поколение вмещает в веса всё больше знаний о мире. Но огромная доля практических задач выигрывает тогда, когда модель демонстрирует не свою энциклопедичность, а способность рассуждать и анализировать предоставленный контекст. Из этого наблюдения и выросло OCC — наше семейство компактных языковых моделей (SLM), которые имеют сильные когнитивные способности, не обладая при этом большим багажом «вызубренной» информации.

В этой статье расскажем о первой модели нашего семейства, OCC‑RAG, которая оптимизирована под задачу контекстного Q&A. Мы выложили два чекпойнта, OCC‑RAG-0.6B и OCC‑RAG-1.7B (плюс ONNX‑ и GGUF‑сборки). При размере 0.6 и 1.7 млрд. параметров, соответственно, они отвечают на равных или лучше моделей общего назначения, которые в 2–6 раз больше, а по верности контексту показывают лучший результат среди моделей до 32B. Внутри — как устроена модель, как мы её обучили и что в итоге получилось.

Читать далее

Внешняя память для LLM: как RAG дает моделям доступ к новым знаниям

Время на прочтение12 мин
Охват и читатели13K

Интеграция языковых моделей в реальные бизнес-процессы редко проходит без сюрпризов. В тепличных условиях тестов языковая модель кажется надежным экспертом, но стоит задать ей вопрос о свежей новости или документации компании, как она с невозмутимым видом сгенерирует ложный ответ. Переобучать модель при каждом изменении базы данных — долго, дорого и архитектурно нецелесообразно, а довериться имеющимся способностям LLM было бы слишком рисковано.

Закономерным ответом на эту проблему стал RAG (Retrieval-Augmented Generation) — подход, который дает LLM поисковик по актуальной внешней базе и «заставляет» опираться только на выданный контекст. В этой статье разберем по шагам, как устроен этот механизм, за счет чего минимизируются галлюцинации и где RAG все же дает слабину.

Читать далее

Vibecode по дешевке — домашний сервер с Qwen Code за 25к, который не отключит Anthropic

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели69K

Я начинающий инженер: учусь, работаю, пишу код. Подсел на Claude — и быстро уткнулся в лимиты: полчаса работы, и могучие руки превращаются в лапки. А пока писал эту статью, Anthropic вообще взял и отключил Fable 5 — для всех разом. Сегодня доступ есть, завтра кто-то наверху решил — и ты ни с чем.

Поэтому я собрал собственный сервер с локальной LLM. Серверная Tesla V100 с Авито, переходник, водянка, открытая рама вместо корпуса — всё про 25 тысяч за базу (и ~35 со всеми доп. картами). Внутри крутится Qwen3.6-35B и пишет код со скоростью до 85 токенов в секунду.

В статье — честно и с цифрами: какое железо и почём, замеры скорости, как llama.cpp раскидывает одну модель сразу по нескольким видеокартам, и живые примеры того, что она умеет — от генерации кода до разбора чужого на прочность. Никакого облака и подписок: всё работает дома, рядом с кроватью, и его никто не отключит сверху.

Посмотреть. что собрал

Сказ о том, как нейросеть занялась reward hacking прямо у меня на кухне

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели18K

Я хотел просто пожарить кесадилью. В холодильнике лежали зеленые оливки (солено-кислые), сулугуни и фарш, а на полке консервированная кукуруза. И вот стою я над сковородкой и думаю: а оливки с кукурузой вообще сочетаются? А сулугуни не пересолит блюдо вместе с оливками? Сколько чего вообще класть?

В любой другой ситуации я бы загуглил рецепт. Но не тут-то было, я же великий комбинатор оптимизатор, и у меня в голове сразу всплыло: «это же задача оптимизации». Тем же вечером у меня был ноутбук с обученной нейросетью вместо ужина. Рассказываю, как дошел до жизни такой, и как из этого, внезапно, получился реально вкусный рецепт.

Читать далее

Как я пытался создать шедевр в Qwen, Luma и Pika, и что из этого вышло

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели13K

Помните, как полтора-два года назад в коротких видео стали появляться видео сомнительного качества, которые можно с легкостью пометить как сгенерированные? С тех пор их количество заметно упало. 

Мы решили провести эксперимент и выяснить, действительно ли некачественные видео, созданные нейросетями, исчезли, или люди научились делать настолько хорошие ролики, что мы уже перестали определять, кто есть кто. В этой статье попробуем сгенерировать такие видео (или еще качественнее).

Читать далее