Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 152,49
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Локальный ассистент для зумов, часть 10: NLI — три места, куда я его примерял, и два, откуда ушёл

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели755

Бюджет на квартал согласован и бюджет на квартал не согласован. Для эмбеддингов это почти одна фраза: слова те же, частица не в векторе весит мало. Для встречи это значит, что решили обратное.

Вот из-за таких пар в Чароите живёт NLI-модель. Ниже — где она работает третий месяц, где я её снял и почему, и во что это обошлось.

Читать далее

Новости

Хотел обучить нейросеть без backprop, а получил k‑means

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели2.5K

Хотел проверить, как далеко можно зайти, если учить скрытый слой нейросети вообще без backprop, только локальными хеббовскими правилами. Спойлер: правило в итоге свелось к обычному k‑means, а backprop оно не обогнало ни по точности, ни при малом числе меток, ни по забыванию. Рассказываю, как сеть убивала собственные нейроны, как эволюция правил обманывала саму себя и где ошибался я сам.

Читать далее

Устроил маленьким моделям проектный институт: слабой деление на разделы дало вчетверо, рой пять пунктов

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели4K

Я тепломеханик, начальник отдела в проектной организации, в проектировании четырнадцать лет. Программистом не был ни дня, с нейросетями вожусь меньше года. Весной взялся вырастить из слабых локальных моделей рой, который окажется умнее самой сильной из них. Рой не поумнел. Зато по дороге я разложил шесть маленьких моделей по схеме, по которой работает любой проектный институт, и замерил, что из этой схемы держит нагрузку. Держит одно деление на разделы, и слабой модели оно дает больше, чем сильной.

Читать далее

Длинные нарды глазами нейросети: как движок выбирает ход и где ошибаются люди

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели3.9K

Как программа выбирает ход в длинных нардах, почему правило головы и запрет глухого забора — испытание для генератора ходов, и что нейросеть нашла в 170 тысячах ходов живых игроков. Главные потери — в начале партии и в размере поражения: марсах и коксах. Плюс четыре задачи из реальных партий — попробуйте решить их сами.

Читать далее

Open Source – высшая форма человеческой деятельности

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели4.9K

Честно признаюсь: я всегда боялся Open Source. Знал, что за этим феноменом стоит нечто сверхчеловеческое и экзистенциальное. Меня всегда пугало, когда люди цинично забирали чужие открытые наработки в свои закрытые коммерческие продукты, игнорируя лицензии и посмеиваясь над наивностью авторов. И дело не в том что это плохо – я чувствовал, что это не может закончиться ничем. Просто не думал, что окажется настолько серьезно…

Читать далее

Обучаем LLM по клику: платформа распределённого обучения на HGX

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели9.8K

Привет, Хабр! Меня зовут Павел, я старший разработчик ML-платформы в Авито и последние полтора года занимаюсь MLOps. 

На прошедшей Kuber Conf я выступал с докладом про нашу платформу распределённого обучения, а теперь решил сделать на его основе статью для вас. Если вам комфортнее воспринимать такие доклады в формате видео — держите.

Под катом — о становлении нашей ML-платформы, распределённых вычислениях, реализации инфраструктуры и других полезных вещах. И главное — что это нам дало и чем может быть полезно вам.

ML-платформа Авито. Как всё начиналось

В те времена, когда в Авито работало не так много дата-сайентистов, они использовали разнородные инструменты. Главным из них был так называемый DevBox — выделенная машина, на которую специалист заходил по SSH, делал свои дата-сайентистские дела, обучал модели, собирал датасеты и прочее. Время шло, число спецов росло (равно как и отделов), и мы не придумали ничего лучше, как добавить ко всему этому ещё и LLM. У неё была своя специфика в плане инструментария, и в целом жизнь она не сильно облегчила.

Так началась эволюция нашего пути — от обычного доступа к машинам по SSH, когда коллеги полностью блокировали их и выполняли задачи вручную, до нашей полноценной cloud-native-платформы, которую мы назвали Aviflow.

Читать далее

Быстрее пантеры: как студенческий проект Летней школы AIRI стал самым быстрым решением соревнования FLARE 2026

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.2K

Представьте себе задачу: найти опухоль на КТ‑снимке любого органа — печени, почки, поджелудочной, легкого, лимфоузла. Снимок может прийти из любой больницы в мире. На все про все — 60 секунд и 4 ГБ видеопамяти. А еще половина снимков в реальной жизни — от здоровых людей, и на них модель должна сказать: «ничего нет». 

Именно такие условия поставили перед участниками организаторы первой задачи на соревновании FLARE 2026, итоги которого были недавно подведены в рамках конференции MICCAI в Страсбурге. Наша модель под названием PANTHER оказалась лучшей по скорости среди всех конкурентов. 

Далее рассказываем, как проект с Летней школы AIRI превратился в участие в престижном международном соревновании, почему половина датасета оказалась лучше целого, зачем мы снова позвали на работу «вышибалу» и как впихнуть ансамбль из пяти нейросетей в 11 секунд на снимок.

Читать далее

Полтора месяца ускорял MoE на GTX 1660 SUPER: выиграл штатный флаг llama.cpp

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.8K

Я тепломеханик, начальник отдела в проектной организации, не программист. С августа ковыряю форк llama.cpp: хочу, чтобы большие MoE‑модели нормально шли на обычном домашнем ящике, где видеокарта на 6 ГБ, 24 ГБ памяти и SATA‑диск. Полигоном была gpt‑oss-20b. Итог пока обидный: выиграл штатный флаг ‑fit, на длинном запросе он в 2,44 раза быстрее привычного ‑ngl 99, а мои ускорения поверх него не дали ничего. Зато по дороге я собрал неплохую коллекцию способов, которыми замер скорости врет, и пару настроек, которые пригодятся любому владельцу небольшой видеокарты.

Читать далее

RAG по 11 000 файлов: почему семантический поиск не находит по артикулу

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели5.7K

11 000 файлов техдокументации, больше 100 менеджеров по продажам и бот, который уверенно называл числа из паспорта соседнего станка. Разбираю, почему плотные векторы промахиваются по артикулам, и что в итоге сработало.

Читать далее

Как делят GPU в докладах KubeCon Japan 2026 и у нас в Авито

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели5.3K

Привет, Хабр! Меня зовут Антон Алексеев, я ML Ops-инженер в Авито. 

В конце июля мы с коллегами съездили в Иокогаму на KubeCon + CloudNativeCon Japan 2026. Ко второму дню я заметил, что слайды выступающих повторяются: спектр изоляции тенантов, квоты, bin packing, «GPU дорогие — давайте делить». Мы решаем в Авито ту же задачу, поэтому я разберу шесть докладов про GPU и LLM-инференс и расскажу, что из этого мы уже пробовали или собираемся попробовать. А в конце будет немного про саму Японию.

Читать далее

Как мы сделали простой офлайн‑разметчик для YOLO и COCO с семантической и panoptic‑сегментацией

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.4K

В настоящий момент я работаю над проектом по детекции дефектов дорожно‑транспортной инфраструктуры. Находимся на самом начальном этапе, подбираем модели для детекции.

Мы начинали работы с моделями детекции — как‑то по инерции с предыдущего проекта. Но этого опыта и знаний (а также обученных ранее моделей) оказалось недостаточно для решения поставленных задач. Тогда мы обратились к сегментационным моделям. И сразу возник вопрос об адекватном инструменте для разметки данных.

Если вы обучали свою модель детекции или сегментации, то знаете: самое долгое — не обучение, а разметка. Готовые инструменты делятся на две группы. Серверные (CVAT, Label Studio) умеют всё, но их нужно разворачивать и поддерживать. Эти инструменты замечательны, но очень непростые в освоении и затратные с аппаратной точки зрения.

Существующие простые десктопные вроде labelImg ставятся за минуту и очень удобные в освоении, но не обладают нужным функционалом — умеют в основном размечать прямоугольники (bbox). И стало понятно, что нам нужна была середина: программа, которая запускается на ноутбуке без сервера и делает разметку bbox и полигональную разметку.

Сделали простую программку, которая делала то, что надо. Но дальше — больше: сначала понадобились повёрнутые рамки (OBB), потом маски, затем многопользовательский режим, а под конец — семантическая и panoptic‑сегментация. И всё это нужно было выгружать в форматы, которые без доработки едят YOLO, Detectron2 и Mask2Former. Так появился YOLO Annotator. Код открыт (GPL-3.0), ниже — что он умеет и как устроен изнутри.

Читать далее

Своя модель решений на русском за вечер аренды GPU: что она умеет, сколько стоит и где проигрывает

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели5.9K

Немалую долю задач в бизнесе, где применим ИИ можно свести к выбору варианта ответа на тот или иной вопрос, например, куда направить обращение, кто согласует заявку, срочная ли жалоба. Я дообучил открытую модель на 4 млрд параметров на русских задачах за несколько сотен рублей аренды видеокарты и честно сравнил её с YandexGPT, GigaChat и открытыми аналогами, в том числе на задачах, которых не видела ни одна модель. На своих задачах 84,5% точности и почти две трети потока на автоматике при 95% правильных решений, на чужих верхняя группа, но не лидер. Плюс грабли, на которые стоит не наступать, и метрики, которые стоит требовать от подрядчика. Модель и код открыты.

Читать далее

Вайбкодим плагины для open‑source видеоредактора

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели6.2K

В этой статье будет инструкция, как создавать плагины для open-source видеоредактора Wunjo Make самостоятельно или через Claude Code, Codex, Cursor. Для этого в репозитории я добавил код сборщика и умения для облачных языковых моделей. Плагины могут работать с локальными нейронными сетями или через API, а также управляться через MCP.

Читать далее

Ближайшие события

Как мы проверяем, какие данные остаются в тексте после маскировки перед LLM

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.8K

После маскировки ФИО в тексте может остаться номер, по которому человека найдут в открытом реестре. На восьми искусственных примерах проверим остатки по заранее заданному списку и посмотрим, что меняется при отключении нормализации и распознавания имен.

Читать далее

Anthropic запретила обижать Claude, а я матерюсь в каждом втором сообщении. Пришлось сделать Punto Switcher для промптов

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.1K

Всем привет! 8 октября Anthropic обновила правила пользования своими моделями. Среди прочего там появился пункт, который меня обеспокоил: систематическая бессмысленная жестокость к моделям теперь под запретом. Я как раз писал об этом новость и поймал себя на мысли, что я буду первым, кого забанят.

Потому что я матерюсь на Claude Code. Много. Когда агент в который раз бодро рапортует «готово», а ничего не готово, слова я не подбираю. У меня даже есть скилл Prompt Warrior, который по логам считает, как я общаюсь с агентом. Посчитал: мат почти в каждом втором сообщении. А теперь пришла пора не только считать, но и менять. Менять текст, автоматически, а не свои привычки, конечно же.

Читать далее

Черная дыра искусственного интеллекта: почему инфраструктура стала главным барьером развития отрасли?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели10K

Всем привет! На связи снова Кирилл и сегодня хотелось бы поделиться интересными новостями и предостеречь будущих адептов ИИ... Искусственный интеллект перестает быть исключительно задачей разработки моделей. Сегодня ключевые ограничения постепенно смещаются в сторону вычислительной инфраструктуры: GPU‑кластеров, дата‑центров, механизмов закупок оборудования, нормативного регулирования и технологической независимости. Куда мы движемся? А какие пути движения вообще есть? И что нам предстоит в конце концов? Об этом всем расскажу в этой статье — завариваем чай/кофе и проваливаемся на интересное чтиво.

Читать далее

Куда делись 4 секунды: разбираем автоинструментацию в APM

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели11K

Вместо введения

Когда приложение состоит из одного процесса и нескольких десятков методов, найти причину медленной работы относительно просто: можно включить профилировщик, посмотреть логи и найти проблемный участок кода.

В распределённой системе всё меняется.

Один пользовательский запрос может пройти через API Gateway, несколько микросервисов, очередь сообщений, базу данных и внешний API. При этом каждый компонент может находиться на отдельном сервере или контейнере.

Если такой запрос выполняется 4 секунды, возникает вполне практический вопрос:

Где именно были потрачены эти 4 секунды?

На сети? На базе данных? На блокировке потока? На выполнении конкретного метода? На внешнем сервисе?

Именно для ответа на этот вопрос в APM используются трассировка (distributed tracing) и инструментация приложений.

Один из наиболее интересных подходов — автоматическая инструментация, при которой разработчику не требуется вручную добавлять tracing‑код в каждый сервис.

Разберём, как это работает на уровне архитектуры и что происходит внутри приложения.

Читать далее

Усредняющие сети: как ускорить 8-битные сети почти без потери точности

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели9K

Чтобы распознать документ на смартфоне, мало хорошо обучить нейросеть читать текст. Нужно ещё добиться, чтобы она делала это быстро на процессоре самого устройства. При разработке Smart Document Engine, системы распознавания и анализа документов, мы решаем именно такие задачи: обработка должна выполняться локально, а вычислительные ресурсы ограничены. Поэтому для нас поиск более экономных способов вычисления нейронных сетей — вполне практическая задача.

Один из привычных способов ускорить нейросеть — квантование. Переход от вычислений с плавающей запятой к 8-битным целым числам позволяет получить более быструю модель с близкой точностью. Можно пойти дальше: ранее мы предложили 4.6-битные сети, сравнимые по скорости с 4-битными, но заметно превосходящие их по точности. Однако уменьшение разрядности — не единственное, что можно изменить в нейросетевых вычислениях. Что, если оставить веса и входные данные 8-битными, а пересмотреть способ накопления результатов умножения?

В этой статье мы расскажем об алгоритме, который вместо точного суммирования использует последовательное усреднение по дереву. Такой подход позволяет дольше сохранять промежуточные результаты в 16-битном формате и эффективнее использовать SIMD-регистры. В наших экспериментах на ARM NEON это позволило сократить время матричного умножения. Разберёмся, какой погрешностью приходится платить за ускорение, как она влияет на точность нейросетей и что удаётся восстановить дообучением.

Читать далее

FRIDA Decisions: быстро думать на русском

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели12K

FRIDA Decisions — открытая модель быстрого мышления для русского языка. Она выбирает вариант из списка, ставит оценку по шкале, отвечает «да» или «нет» и ранжирует кандидатов за один проход энкодера, без генерации текста и за десятки миллисекунд на RTX 5060 Ti. Её можно поставить везде, где сейчас LLM работает классификатором или судьёй: маршрутизация обращений, модерация, разметка данных, ранжирование для RAG. На нашем бенчмарке razvilka модель набирает 0,893 — наравне с коммерческим API TypeSafe Jev (0,897) и с LLM Qwen3.5-35B-A3B, которая в 40 раз больше.

Читать далее

MWS AI Vision Bench: что изменилось за год и зачем мы добавляем антифрод

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели9.8K

Год назад мы выложили в открытый доступ MWS AI Vision Bench — бенчмарк для оценки мультимодальных моделей на русскоязычных документах. За это время мультимодальные модели существенно шагнули вперед, метрики в VQA начали упираться в потолок, а мы добавили в бенчмарк задачу, которой критически не хватало — Anti-fraud.

Под катом расскажу, как изменился бенчмарк и почему с антифродом все оказалось сложнее, чем мы думали…

Читать далее
1
23 ...