Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 127,97
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Титановые белила, Геринг и ядерные испытания: как физика ловит подделки картин

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели1.7K

Я создал сайт, в котором указаны удивительные факты о разных произведениях искусства. artatlas.site. Сайт идеально подходит для того, чтобы втянуть человека со стороны в мир искусства.

Вот одна из удивительных историй человека, который был не признан, но хотел доказать всему миру, что он чего-то стоит. Движимый больше обидой он создавал и продавал поддельные картины. Таким образом и разбогател. Никто не верил, что он сам смог создать такие качественные подделки, но он доказал всему миру и превратился в народного героя.

Читать далее

Новости

Как Google научил крошечную модель понимать текст, картинки, видео и звук: разбираем EmbeddingGemma 2

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели3.5K

6 октября 2026 года Google DeepMind выпустила EmbeddingGemma 2 — открытую модель эмбеддингов, которая превращает в векторы текст, код, изображения, видео и аудио. Все они попадают в одно общее 768-мерное пространство, поэтому их можно сравнивать между собой, например искать видео по текстовому запросу.

Главная особенность модели — размер. По данным Google, на Pixel 11 Pro текстовая часть занимает около 191 МБ оперативной памяти, а полная мультимодальная версия — около 567 МБ. Поэтому такой поиск можно запускать прямо на устройстве, а не отправлять данные на сервер.

В этой статье мы разберём, как устроена модель, за счёт чего она такая компактная, как с ней работать и о каких граблях лучше узнать заранее.

Читать далее

Odyssey-3: мировая модель, которая учит роботов физике по видео

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели2.9K

Попробуйте объяснить ребёнку, почему кружка, столкнутая со стола, разбивается. Вы вряд ли начнёте с закона всемирного тяготения. Ребёнок увидит сотни падающих предметов, и в его голове сам собой сложился образ: вещи падают, твёрдое о твёрдое бьётся, жидкость растекается. Физику он «впитал» из наблюдений, а не из учебника.

А теперь представьте, что так же можно научить нейросеть. Не показывать ей тысячи часов одной и той же задачи, а дать посмотреть огромное количество видео, чтобы она сама поняла, как устроен мир. А потом прикрутить к ней руки, колёса или пропеллеры и объяснить, что от неё хотят, буквально за несколько десятков часов данных.

Именно на это делает ставку компания Odyssey. 15 сентября 2026 года она рассказала про Odyssey-3, а 8 октября открыла для всех research preview. В этой статье мы разберём, что это за модель, как её обучали, откуда берутся рекордные цифры и где заканчиваются факты и начинается маркетинг.

Читать далее

Нейросеть по рецепту: вычисляем веса вместо хранения матриц

Уровень сложностиСредний
Время на прочтение35 мин
Охват и читатели2.4K

Веса нейросети — это очень много циферок в очень больших матрицах. А что, если вместо них хранить небольшой рецепт, по которому нужные веса можно вычислить? Такие подходы уже есть: от маленькой сети, которая генерирует другую сеть, до формул и настоящих фракталов. Разберёмся, что из этого работает и чем приходится платить за компактность. Посмотрим, как далеко LLM находится от участи первого Doom - быть запущенной на каждом чайнике.

Читать далее

Как Google Play сделал публикацию бесплатного приложения настоящим испытанием

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели4.6K

Привет, Хабр!

Если вы читали мои прошлые статьи, то знаете Гига Писаря: зажимаешь кнопку, говоришь, отпускаешь, и текст появляется там, где стоит курсор. Речь распознаёт модель GigaAM от Сбера прямо на телефоне, без интернета и без облака.

До сих пор Android-версию можно было поставить только файлом с сайта. Работает, но неудобно: телефон пугает «неизвестным приложением», а для специальных возможностей приходится лезть в «ограниченные настройки».

Поэтому я решил выложить Писарь в Google Play, но там есть нюанс и мне потребуется ваша помощь

Читать далее

Хотел выбрать булочную по отзывам, а написал анализатор аномалий с embeddings и графами

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели5.9K

После переезда я искал булочную на Яндекс Картах и наткнулся на отзыв, начинающийся с фразы «да вот хороший вариант ответа».

Из этого вырос ReviewScope, инструмент для поиска аномалий, повторяющихся текстов и необычных закономерностей в отзывах.

Расскажу, как устроены embeddings, графы совпадений и взвешенный рейтинг, какие ошибки пришлось исправлять и что показала проверка на 21 тысяче настоящих отзывов.

Читать далее

Локальный ассистент для зумов, часть 10: NLI — три места, куда я его примерял, и два, откуда ушёл

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5.5K

Бюджет на квартал согласован и бюджет на квартал не согласован. Для эмбеддингов это почти одна фраза: слова те же, частица не в векторе весит мало. Для встречи это значит, что решили обратное.

Вот из-за таких пар в Чароите живёт NLI-модель. Ниже — где она работает третий месяц, где я её снял и почему, и во что это обошлось.

Читать далее

Хотел обучить нейросеть без backprop, а получил k‑means

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.7K

Хотел проверить, как далеко можно зайти, если учить скрытый слой нейросети вообще без backprop, только локальными хеббовскими правилами. Спойлер: правило в итоге свелось к обычному k‑means, а backprop оно не обогнало ни по точности, ни при малом числе меток, ни по забыванию. Рассказываю, как сеть убивала собственные нейроны, как эволюция правил обманывала саму себя и где ошибался я сам.

Читать далее

Устроил маленьким моделям проектный институт: слабой деление на разделы дало вчетверо, рой пять пунктов

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.6K

Я тепломеханик, начальник отдела в проектной организации, в проектировании четырнадцать лет. Программистом не был ни дня, с нейросетями вожусь меньше года. Весной взялся вырастить из слабых локальных моделей рой, который окажется умнее самой сильной из них. Рой не поумнел. Зато по дороге я разложил шесть маленьких моделей по схеме, по которой работает любой проектный институт, и замерил, что из этой схемы держит нагрузку. Держит одно деление на разделы, и слабой модели оно дает больше, чем сильной.

Читать далее

Длинные нарды глазами нейросети: как движок выбирает ход и где ошибаются люди

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели5.5K

Как программа выбирает ход в длинных нардах, почему правило головы и запрет глухого забора — испытание для генератора ходов, и что нейросеть нашла в 170 тысячах ходов живых игроков. Главные потери — в начале партии и в размере поражения: марсах и коксах. Плюс четыре задачи из реальных партий — попробуйте решить их сами.

Читать далее

Обучаем LLM по клику: платформа распределённого обучения на HGX

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели10K

Привет, Хабр! Меня зовут Павел, я старший разработчик ML-платформы в Авито и последние полтора года занимаюсь MLOps. 

На прошедшей Kuber Conf я выступал с докладом про нашу платформу распределённого обучения, а теперь решил сделать на его основе статью для вас. Если вам комфортнее воспринимать такие доклады в формате видео — держите.

Под катом — о становлении нашей ML-платформы, распределённых вычислениях, реализации инфраструктуры и других полезных вещах. И главное — что это нам дало и чем может быть полезно вам.

ML-платформа Авито. Как всё начиналось

В те времена, когда в Авито работало не так много дата-сайентистов, они использовали разнородные инструменты. Главным из них был так называемый DevBox — выделенная машина, на которую специалист заходил по SSH, делал свои дата-сайентистские дела, обучал модели, собирал датасеты и прочее. Время шло, число спецов росло (равно как и отделов), и мы не придумали ничего лучше, как добавить ко всему этому ещё и LLM. У неё была своя специфика в плане инструментария, и в целом жизнь она не сильно облегчила.

Так началась эволюция нашего пути — от обычного доступа к машинам по SSH, когда коллеги полностью блокировали их и выполняли задачи вручную, до нашей полноценной cloud-native-платформы, которую мы назвали Aviflow.

Читать далее

Быстрее пантеры: как студенческий проект Летней школы AIRI стал самым быстрым решением соревнования FLARE 2026

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.4K

Представьте себе задачу: найти опухоль на КТ‑снимке любого органа — печени, почки, поджелудочной, легкого, лимфоузла. Снимок может прийти из любой больницы в мире. На все про все — 60 секунд и 4 ГБ видеопамяти. А еще половина снимков в реальной жизни — от здоровых людей, и на них модель должна сказать: «ничего нет». 

Именно такие условия поставили перед участниками организаторы первой задачи на соревновании FLARE 2026, итоги которого были недавно подведены в рамках конференции MICCAI в Страсбурге. Наша модель под названием PANTHER оказалась лучшей по скорости среди всех конкурентов. 

Далее рассказываем, как проект с Летней школы AIRI превратился в участие в престижном международном соревновании, почему половина датасета оказалась лучше целого, зачем мы снова позвали на работу «вышибалу» и как впихнуть ансамбль из пяти нейросетей в 11 секунд на снимок.

Читать далее

Полтора месяца ускорял MoE на GTX 1660 SUPER: выиграл штатный флаг llama.cpp

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели8.3K

Я тепломеханик, начальник отдела в проектной организации, не программист. С августа ковыряю форк llama.cpp: хочу, чтобы большие MoE‑модели нормально шли на обычном домашнем ящике, где видеокарта на 6 ГБ, 24 ГБ памяти и SATA‑диск. Полигоном была gpt‑oss-20b. Итог пока обидный: выиграл штатный флаг ‑fit, на длинном запросе он в 2,44 раза быстрее привычного ‑ngl 99, а мои ускорения поверх него не дали ничего. Зато по дороге я собрал неплохую коллекцию способов, которыми замер скорости врет, и пару настроек, которые пригодятся любому владельцу небольшой видеокарты.

Читать далее

Ближайшие события

RAG по 11 000 файлов: почему семантический поиск не находит по артикулу

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.2K

11 000 файлов техдокументации, больше 100 менеджеров по продажам и бот, который уверенно называл числа из паспорта соседнего станка. Разбираю, почему плотные векторы промахиваются по артикулам, и что в итоге сработало.

Читать далее

Как делят GPU в докладах KubeCon Japan 2026 и у нас в Авито

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели5.4K

Привет, Хабр! Меня зовут Антон Алексеев, я ML Ops-инженер в Авито. 

В конце июля мы с коллегами съездили в Иокогаму на KubeCon + CloudNativeCon Japan 2026. Ко второму дню я заметил, что слайды выступающих повторяются: спектр изоляции тенантов, квоты, bin packing, «GPU дорогие — давайте делить». Мы решаем в Авито ту же задачу, поэтому я разберу шесть докладов про GPU и LLM-инференс и расскажу, что из этого мы уже пробовали или собираемся попробовать. А в конце будет немного про саму Японию.

Читать далее

Как мы сделали простой офлайн‑разметчик для YOLO и COCO с семантической и panoptic‑сегментацией

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.6K

В настоящий момент я работаю над проектом по детекции дефектов дорожно‑транспортной инфраструктуры. Находимся на самом начальном этапе, подбираем модели для детекции.

Мы начинали работы с моделями детекции — как‑то по инерции с предыдущего проекта. Но этого опыта и знаний (а также обученных ранее моделей) оказалось недостаточно для решения поставленных задач. Тогда мы обратились к сегментационным моделям. И сразу возник вопрос об адекватном инструменте для разметки данных.

Если вы обучали свою модель детекции или сегментации, то знаете: самое долгое — не обучение, а разметка. Готовые инструменты делятся на две группы. Серверные (CVAT, Label Studio) умеют всё, но их нужно разворачивать и поддерживать. Эти инструменты замечательны, но очень непростые в освоении и затратные с аппаратной точки зрения.

Существующие простые десктопные вроде labelImg ставятся за минуту и очень удобные в освоении, но не обладают нужным функционалом — умеют в основном размечать прямоугольники (bbox). И стало понятно, что нам нужна была середина: программа, которая запускается на ноутбуке без сервера и делает разметку bbox и полигональную разметку.

Сделали простую программку, которая делала то, что надо. Но дальше — больше: сначала понадобились повёрнутые рамки (OBB), потом маски, затем многопользовательский режим, а под конец — семантическая и panoptic‑сегментация. И всё это нужно было выгружать в форматы, которые без доработки едят YOLO, Detectron2 и Mask2Former. Так появился YOLO Annotator. Код открыт (GPL-3.0), ниже — что он умеет и как устроен изнутри.

Читать далее

Своя модель решений на русском за вечер аренды GPU: что она умеет, сколько стоит и где проигрывает

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели6.1K

Немалую долю задач в бизнесе, где применим ИИ можно свести к выбору варианта ответа на тот или иной вопрос, например, куда направить обращение, кто согласует заявку, срочная ли жалоба. Я дообучил открытую модель на 4 млрд параметров на русских задачах за несколько сотен рублей аренды видеокарты и честно сравнил её с YandexGPT, GigaChat и открытыми аналогами, в том числе на задачах, которых не видела ни одна модель. На своих задачах 84,5% точности и почти две трети потока на автоматике при 95% правильных решений, на чужих верхняя группа, но не лидер. Плюс грабли, на которые стоит не наступать, и метрики, которые стоит требовать от подрядчика. Модель и код открыты.

Читать далее

Вайбкодим плагины для open‑source видеоредактора

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели6.3K

В этой статье будет инструкция, как создавать плагины для open-source видеоредактора Wunjo Make самостоятельно или через Claude Code, Codex, Cursor. Для этого в репозитории я добавил код сборщика и умения для облачных языковых моделей. Плагины могут работать с локальными нейронными сетями или через API, а также управляться через MCP.

Читать далее

Как мы проверяем, какие данные остаются в тексте после маскировки перед LLM

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.9K

После маскировки ФИО в тексте может остаться номер, по которому человека найдут в открытом реестре. На восьми искусственных примерах проверим остатки по заранее заданному списку и посмотрим, что меняется при отключении нормализации и распознавания имен.

Читать далее

Anthropic запретила обижать Claude, а я матерюсь в каждом втором сообщении. Пришлось сделать Punto Switcher для промптов

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.3K

Всем привет! 8 октября Anthropic обновила правила пользования своими моделями. Среди прочего там появился пункт, который меня обеспокоил: систематическая бессмысленная жестокость к моделям теперь под запретом. Я как раз писал об этом новость и поймал себя на мысли, что я буду первым, кого забанят.

Потому что я матерюсь на Claude Code. Много. Когда агент в который раз бодро рапортует «готово», а ничего не готово, слова я не подбираю. У меня даже есть скилл Prompt Warrior, который по логам считает, как я общаюсь с агентом. Посчитал: мат почти в каждом втором сообщении. А теперь пришла пора не только считать, но и менять. Менять текст, автоматически, а не свои привычки, конечно же.

Читать далее
1
23 ...