Обновить
Сначала показывать
Порог рейтинга
Уровень сложности

Мои впечатления о WAIC 2026: роботы, AI for Science и китайский взгляд на будущее ИИ

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.1K

Привет, Хабр! Меня зовут Алена, я занимаюсь исследованиями в области искусственного интеллекта и геномики в AIRI. В июле мне удалось побывать на World Artificial Intelligence Conference 2026 в Шанхае — одной из крупнейших мировых площадок, объединяющих научные исследования, индустриальные разработки и самые разные практические применения ИИ. Поездка оставила множество впечатлений, которым хочу с вами поделиться.

Читать далее

Новости

ICML 2026: большая конференция глазами исследователя генеративных моделей

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.1K

Привет, Хабр! Меня зовут Арсений Иванов, в AIRI в команде «Вычислительный интеллект» я занимаюсь генеративными моделями на основе диффузионных процессов, а также являюсь студентом университетов Сколтеха и ВШЭ. В июле я побывал на ICML 2026, где в том числе представлял две работы на конференции. 

Для меня это была первая очная конференция уровня A*, поэтому поездка была одновременно важной научной возможностью и совершенно новым опытом. Она получилась очень насыщенной и по науке, и по нетворкингу. Сейчас, когда эмоции уже улеглись и мысли устаканились, захотелось поделиться своими впечатлениями и размышлениями о увиденном.

Читать далее

XSIM: как мы переизобрели сплаттинг для симуляции сенсоров беспилотных авто

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6K

Привет, Хабр! Меня зовут Дмитрий Сенюшкин, на связи AIRI и команда «Автономное зрение». Наша научная группа активно интересуется темой беспилотных автомобилей и сегодня хотелось бы рассказать об одной из наших последний наработок в области симуляции для тестирования и обучения алгоритмов. 

В этой области важную роль играет не только объём обучающих данных, но и их разнообразие. Эту проблему можно решить с помощью синтетики, которую производят реалистичные дорожные симуляторы. Мы пошли по этому пути и создали XSIM — новую технологию, для которой пришлось пересмотреть традиционные пайплайны представления объектов. Мы представили XSIM на недавно прошедшей IJCAI 2026, здесь же я перескажу суть нашей работы.

Читать далее

Лето в стиле Light Academia. Как прошла школа по искусственному интеллекту «Лето с AIRI» 2026

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели8.5K

Всем привет! Меня зовут Заруцкий Семён, я выпускник и новоприбывший аспирант физического факультета МГУ. Изначально я занимался экспериментальными квантовыми технологиями, со временем появилась необходимость моделировать физические процессы на компьютере, а следом в мою жизнь вошли прикладные ML‑проекты. Пришло всё к тому, что недавно мне посчастливилось принять участие в летней школе по искусственному интеллекту «Лето с AIRI» 2026, которую Институт провёл в Первом университетском лицее им. Н.И. Лобачевского в Усть‑Лабинске совместно с Фондом «Вольное дело». 

О том, как прошла школа и что интересного успело произойти, я расскажу в этой статье. Делать это я буду не один, мне поможет Настя Золотарева, сотрудник Института ИИ МФТИ, биофизик по образованию и моя коллега по школе. Мы оба прошли через это увлекательное и полное депривации сна приключение, а теперь хотим поделиться им с вами. Если вкратце, это был интенсив на грани возможностей, но в потрясающе тёплой атмосфере. 

А теперь с самого начала.

Читать далее

Кронекером по Фишеру: как при сжатии LLM учесть кривизну второго порядка и не умереть

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели7.8K

Привет Хабр! На связи Вика Чекалина из команды «Мультимодальный ИИ» AIRI. Сегодня мы поговорим о том, как выкручиваться, когда вычислительных ресурсов мало и для деплоя необходимо сжать LLM, но так, чтобы потеря в качестве была минимальной. Логично, что нужно использовать дополнительную информацию — например, матрицу Фишера (FIM), которая содержит в себе информацию о важности и взаимодействии параметров модели. 

Но FIM реальных LLM слоев просто огромные, и работать с ними напрямую вычислительно тяжело или просто невозможно. Люди придумывают различные упрощения: например, можно отталкиваться от предположения, что матрица Фишера диагональна — это сильно сокращает объём памяти, однако корреляция между различными параметрами слоя теряется навсегда. Мы решили не идти на такие компромиссы и придумали метод, который быстро и легко позволяет параметризировать полную недиагональную матрицу Фишера без потери информации о корреляции.

Читать далее

Диффузионные языковые модели: как устроены, что в них работает, а что вызывает вопросы

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели8.2K

Привет, Хабр. На связи команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI и «Генеративная поэзия» SberAI. Мы занимаемся альтернативными архитектурами языковых моделей — тем, что могло бы работать вместо привычной генерации токен за токеном слева направо.

Одно из таких направлений — диффузионные языковые модели (dLLM). Диффузионные языковые модели, в отличие от обычных LLM, генерируют текст параллельно, несколько токенов за раз. Теоретически это даёт кратное ускорение. Также они не ограничены генерацией справа от контекста и могут заполнять произвольные пропуски в поданном на вход тексте.

Мы много работали с dLLM, перепробовали кучу моделей, набив на них шишек, и даже предложили свои. В результате накопилось большое понимания того, какие подходы действительно работают, а какие вызывают много вопросов касательно их воспроизводимости. Обо всём об этом рассказываем в обзоре ниже.

Читать далее

Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он написал себя сам

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели29K

Я долго думал, как мог бы выглядеть идеальный универсальный агент. Такой Jarvis из «Железного человека». И довольно быстро понял: фиг я смогу такого сделать. Зато можно попробовать дать агенту возможность придумать и построить себя самого в автономном цикле эволюции.

Так появился Уроборос: кривой косой агентный луп на чистом Python с доступом к git, правом переписывать свой рантайм, безопасным рестартом на новой версии и откатом к прошлой, если всё сломалось. Я поселил первую версию в Google Colab, чтобы он не убил мне комп самоэволюцией (сервера Google не жалко, у них хорошая изоляция), дал бюджет и автономность, и понеслось.

С тех пор прошло несколько месяцев. Когда я последний раз рассказывал про него публично, это был ещё милый desktop‑агент, который рисовал котиков, зависал на ютюбе и менял обои. Сейчас на Terminal‑Bench 2.1, CL‑Bench и OSWorld у него SOTA результаты, а на GAIA и SWE‑Pro получается паритет с Claude Code и Codex. Сам бы я такой харнесс не придумал, а вот автономная эволюция и куча сожжённых денег на токены — да.

В этом посте: цифры и воспроизводимость, несколько неловких историй из аудита трейсов, коротко про архитектуру, и почему я теперь почти всё делаю через него.

Читать далее

Uni-Bond: как двухнедельный проект на летней школе AIRI дошёл до статьи на воркшопе ICML 2026

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.3K

Всем привет! Меня зовут Степан Павленко, я аспирант и стажер‑исследователь в Лаборатории теоретических основ моделей искусственного интеллекта на ФКН ВШЭ. Прошлым летом я поехал на летнюю школу AIRI в Томском государственном университете, где помимо лекций нужно было выполнять проекты. Наша команда выбрала проект на стыке генеративного моделирования и химии: научиться предсказывать SMILES‑строку молекулы прямо по 3D‑координатам атомов. 

За две недели изначально грандиозная идея «LLM генерирует SMILES с нуля» превратилась в куда более реалистичную задачу — предсказание графа химических связей. Рабочий прототип был готов уже на защите, а ещё через полгода вечерних созвонов и экспериментов он вырос в Uni‑Bond — модель, которая обходит предыдущий SOTA (YuelBond) по точности восстановления графа связей примерно в 20 раз по частоте ошибок в exact match. В июле 2026-го работа была принята на воркшоп Graph Foundation Models при ICML 2026 в Сеуле.

Дальше — личная история про путь, который мы прошли, вместе со всеми его трудностями. Хочется верить, что она сможет вдохновить кого‑нибудь другого.

Читать далее

В один эмбеддинг можно впихнуть больше тысячи токенов, но что с этим не так?

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели7.4K

Хабр, привет! Меня зовут Дмитрий Тарасов, я исследователь в лаборатории FusionBrain AIRI. Мы недавно свозили нашу свежую работу — “Progressive Cramming: Reliable Token Compression and What It Reveals” —на ICML 2026, и здесь я хочу рассказать, о чём она.

Начнём с почти магического факта. Год назад в замечательной работе “Cramming 1568 Tokens into a Single Vector and Back Again” моего коллеги по AIRI Юры Куратова и его команды было показано, что в один‑единственный входной эмбеддинг замороженной LLM можно «упаковать» до 1568 токенов текста так, что модель потом слово в слово его восстанавливает. Полторы тысячи токенов — это несколько абзацев — в одном векторе размерности несколько тысяч, невероятная плотность памяти. Разбор этой статьи уже был на хабре.

У нас этот результат вызвал не только восторг, но и подозрение. Одно дело — восстановить текст, и совсем другое — понимать его. Что, если «идеальная» реконструкция на самом деле не хранит смысл? В нашей статье мы:

– покажем, что стандартный протокол token cramming скрывает катастрофические провалы, и предложим более честную процедуру — progressive cramming;

– исследуем траектории оптимизации сжатых последовательностей;

– и, самое интересное, покажем, что идеальная реконструкция не сохраняет способность модели рассуждать — а причина этого сидит в первых слоях трансформера.

Поехали.

Читать далее

SINN: как превзойти спектральные методы при решении многомерных уравнений в частных производных

Уровень сложностиСложный
Время на прочтение7 мин
Охват и читатели11K

Привет, Хабр. Меня зовут Тянчи Ю, я работаю младшим научным сотрудником в группе «Вычислительный интеллект» AIRI и учусь на четвёртом году аспирантуры Сколтеха. Мои научные интересы включают научное машинное обучение и численный анализ, а также применение этих инструментов к задачам вычислительной математики.

Думаю, никому из читателей не нужно объяснять, почему уравнения в частных производных столь важны. Их приходится постоянно решать для моделирования физических, инженерных и финансовых систем — причём быстро и с высокой точностью. Однако с ростом размерности задачи вычислительная стоимость классических численных методов стремительно увеличивается.

Спектральные методы обеспечивают исключительно высокую точность в задачах малой размерности. Методы на основе нейронных сетей, напротив, лучше подходят для многомерных задач, но часто уступают с точки зрения точности и эффективности. В 2024 году мы предложили подход, объединяющий преимущества этих двух направлений: спектрально‑информированную нейронную сеть (Spectral Informed Neural Network, SINN). С тех пор нам удалось его усовершенствовать.

Недавно на конференции ICML 2026 мы представили статью, посвящённую новому методу (она, к слову, получила там Spotlight). Здесь же я хотел бы кратко рассказать, что именно мы сделали.

Читать далее

От пульта до полотенца — учим робота искать всё, что угодно

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели6.5K

Привет, Хабр! Меня зовут Татьяна Земскова, я аспирантка МФТИ и научный сотрудник команды Embodied Agents лаборатории Cognitive AI Systems AIRI. Областью моих научных интересов является компьютерное зрение для робототехники. Я изучаю, в частности, то, каким образом робот может использовать различные модальности (текст, изображения, сегментационные маски объектов) для лучшего понимания сцены и навигации. 

Желаемыми свойствами современных навигационных систем является их универсальность, минимальность сенсорного сетапа и быстрота принятия решений на борту робота. Сегодня мы поговорим о том, как мы вместе с коллегами (Алексеем Староверовым, Дмитрием Юдиным и Александром Пановым) смогли создать и обучить лёгкую (130М) трансформерную модель, способную доезжать до любых категорий объектов, заданных текстом. Полученный метод описан в свежей работе OVSegDT: Segmenting Transformer for Open‑Vocabulary Object Goal Navigation.

На веб‑странице проекта можно найти ссылку на открытый исходный код с инструкциями по запуску и ссылкой на предварительно обученные веса модели. Это позволяет как воспроизвести наши эксперименты, так и попробовать запустить модель самостоятельно на собственных данных в симуляторе или на реальном роботе. В этом посте мы обсудим основные особенности модели и то, как мы пришли к этому методу.

Читать далее

ИИ в химии: история участия в хакатоне и рефлексия после

Уровень сложностиСредний
Время на прочтение24 мин
Охват и читатели8.3K

Всем привет! Меня зовут Константин Ушенин, я — ведущий научный сотрудник в AIRI, занимаюсь приложениями искусственного интеллекта в химии и фармакологии. В конце марта 2026 года мы с коллегами выиграли суточный хакатон от Сбера, ИТМО и СПБ ГБУ Молодёжного пространства «ПРОСТО» по созданию ИИ‑ассистента для планирования синтеза в лаборатории органической химии. Мероприятие прошло три месяца назад, однако мы завершили рефлексию результата только сейчас и решили сделать полный разбор.

В этом посте вы узнаете про этапы нашей подготовки, выработку победной стратегии, решение проблем, возникавших по ходу соревнований, и наш подход к подготовке финальной презентации. В конце проведен анализ наших правильных и неправильных решений, а также дана оценка того, как реальное продуктовое решение должно отличаться от созданного на хакатоне.

Но технологический ИИ‑стек на службе у химии — это не самое главное, о чём я хотел бы рассказать. Ключевую роль в нашей победе сыграла организация команды, распределение ролей и стрессоустойчивость всех её членов. Путь к первому месту оказался полным разных испытаний: начиная от неудобного стола и заканчивая хакерской атакой на наше решение за полчаса до защиты. 

В общем, получилось довольно остросюжетно, приятного чтения!

Читать далее

У роботов очень короткая память. Можно ли это исправить?

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели7.3K

Хабр, привет! Меня зовут Егор Черепанов. Я аспирант Центра когнитивного моделирования МФТИ и младший научный сотрудник команды «Воплощенные агенты» лаборатории когнитивных систем искусственного интеллекта AIRI. Я занимаюсь памятью у роботов и RL‑агентов, и сегодня хочу рассказать об одной из наших работ — архитектуре ELMUR, которую мы представляли в апреле на ICLR 2026.

Память у современного робота сегодня — это почти всегда контекст трансформера Vision‑Language‑Action модели, поскольку последние уже прочно закрепились как стандарт в этой области. Проблема в том, что механизм внимания имеет квадратичную сложность по длине последовательности, а значит долгосрочная память для робота будет обходиться слишком дорого, если пытаться наивно увеличивать размер контекста. 

Новая архитектура призвана решить эту проблему. О том, что у нас получилось, читайте в статье ниже.

Читать далее

Ближайшие события

OCC-RAG: компактные модели, которые отвечают только по источникам

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели16K

Привет, Хабр! На связи команда Optimal Cognitive Core (OCC) из AIRI. Развитие языковых моделей в последние годы определяется масштабом: каждое новое поколение вмещает в веса всё больше знаний о мире. Но огромная доля практических задач выигрывает тогда, когда модель демонстрирует не свою энциклопедичность, а способность рассуждать и анализировать предоставленный контекст. Из этого наблюдения и выросло OCC — наше семейство компактных языковых моделей (SLM), которые имеют сильные когнитивные способности, не обладая при этом большим багажом «вызубренной» информации.

В этой статье расскажем о первой модели нашего семейства, OCC‑RAG, которая оптимизирована под задачу контекстного Q&A. Мы выложили два чекпойнта, OCC‑RAG-0.6B и OCC‑RAG-1.7B (плюс ONNX‑ и GGUF‑сборки). При размере 0.6 и 1.7 млрд. параметров, соответственно, они отвечают на равных или лучше моделей общего назначения, которые в 2–6 раз больше, а по верности контексту показывают лучший результат среди моделей до 32B. Внутри — как устроена модель, как мы её обучили и что в итоге получилось.

Читать далее

Репортаж с ICRA 2026 из Вены

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6.7K

Привет, Хабр! На связи снова Александр Панов, директор лаборатории когнитивных систем искусственного интеллекта AIRI и Центра когнитивного моделирования в Институте искусственного интеллекта МФТИ. 

Как и в прошлые разы, я хочу поделиться с вами впечатлениями от конференции, в которой мне и моим коллегам по научной группе довелось принять активное участие. На этот раз речь пойдёт о крупнейшем научном событии в робототехнике — конференции ICRA 2026, проходившей с 1 по 5 июня в дождливой, но гостеприимной Вене. 

Внутри много выжимок из статей и докладов, фото, а также видео с традиционного робопарада!

Читать далее

TUN3D: трехмерное понимание сцен по видео с вашего телефона

Уровень сложностиСложный
Время на прочтение5 мин
Охват и читатели7.4K

Привет, Хабр! Меня зовут Максим Колодяжный, и я занимаюсь исследованиями на стыке 3D‑детекции и реконструкции сцен в команде «Пространственный интеллект» AIRI. 

Представьте: вы сняли на обычный смартфон несколько видео комнаты «с руки», загрузили их в софт, а на выходе получили не только 3D‑коробки вокруг всех стульев/столов/кроватей, но и точную 3D‑модель стен, пола и потолка. При этом система не просит у вас данные с датчика глубины (LiDAR) и даже не требует точных данных о положении камеры в каждый момент времени. 

Звучит как магия, не так ли? Однако, именно эту задачу и решает TUN3D — наш новый метод, который стал state‑of‑the‑art решением в комплексном понимании помещений, разработанный вместе с коллегами из Института ИИ МГУ, ВШЭ и Института механики. Статью с описанием метода приняли на престижную международную конференцию по робототехнике ICRA 2026! 

Хотел бы подробнее рассказать здесь о том, как устроен новый метод.

Читать далее

MARL-GPT: на пути к созданию универсальной модели для многоагентных сред

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.8K

Привет, Хабр!

Задача многоагентного обучения с подкреплением (MARL) возникает всякий раз, когда несколько агентов взаимодействуют в одной среде, чтобы совместными усилиями решить общую задачу. Например, это могут быть футболисты, юниты в StarCraft или просто множество роботов, которым нужно дойти до своих целей в одном лабиринте. Очень часто агенты внутри сред не могут общаться и полагаются только на свои наблюдения. А вот что именно агенты наблюдают и как именно могут действовать — зависит и от среды, и даже от конкретного задания внутри неё.

В существующих работах по MARL модель, как правило, обучается под одну среду, и чтобы обучить её на новой среде, архитектуру нужно адаптировать. Мы же поставили перед собой грандиозную цель — создать единую модель (foundation model), которая сможет действовать в разных средах, переносить кооперативные стратегии между ними и легко адаптироваться к новым неизвестным заданиям. Но до этого ещё далеко, и начать нужно с более простого шага, а именно создать модель с единой архитектурой, которая не требует переделки под каждую среду и может обучаться на нескольких средах одновременно.

С вами Мария Нестерова из команды «RL агенты» Лаборатории когнитивных систем искусственного интеллекта AIRI. Мы с коллегами создали метод MARL‑GPT — единую модель, которая обучается на датасетах из трёх разных сред. Центральная идея — обрабатывать наблюдение агента как последовательность и использовать для этого архитектуру трансформер. Модель мы впервые представили на воркшопе WoMAPF'26 (Workshop on Multi‑Agent Path Finding, AAAI 2026), а расширенная версия статьи прошла отбор на AAMAS 2026.

Ниже краткий рассказ о проблеме, как мы её решали и много гифок.

Читать далее

Speech-to-LaTeX: распознавание математических выражений и предложений в LaTeX

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.5K

Представьте семинар у физиков или математиков. Идёт автоматическая запись лекции, а затем распознавание речи в аккуратный текст. В большинстве мест современные ASR-системы справятся неплохо. Но значительная часть такой записи будет состоять из фраз вроде «интеграл от икс в квадрате до бесконечности», «сумма по i от единицы до n» или «производная по t от функции f».

Формально голос может быть распознан правильно. В расшифровке даже могут появляться отдельные символы вроде +, π или x. Но если человек произносит длинную формулу, результат почти всегда превращается в линейную фразу, читать которую физически больно. Хочется другого: чтобы система сразу понимала, где обычный текст, где математическое выражение, и выдавала не «один делить на икс плюс два», а корректный LaTeX-код, например, \frac{1}{x+2} или \frac{1}{x}+2, в зависимости от смысла.

Эта задача называется Speech-to-LaTeX или S2L: преобразование озвученных математических выражений и предложений в формальную LaTeX-запись. В отличие от обычного speech-to-text, здесь нужно распознать не только слова, но и структуру: дроби, индексы, степени, пределы, суммы, интегралы, скобки, вложенные выражения и границы формул.

Например, фраза «два делить на пи» в обычной расшифровке может остаться как «2 делить на π». Но в LaTeX она должна стать \frac{2}{\pi}. Именно такой формат нужен для статей, учебников, конспектов, Overleaf и других LaTeX-редакторов.

Несмотря на прогресс в automatic speech recognition (ASR), задача прямого преобразования озвученной математики в LaTeX долго оставалась почти неразработанной. Более того, нормальных открытых датасетов с человеческими аудиозаписями для такой задачи практически не было. В нашей работе мы попытались закрыть этот пробел: собрали открытый двуязычный датасет и сравнили несколько подходов к Speech-to-LaTeX. В статье, которую мы представили на ICLR 2026, описан датасет из более чем 66 тысяч человеческих аудиозаписей и 571 тысячи синтетических аудиозаписей на английском и русском языках. 

Читать далее

О чём говорили на ICLR 2026? Репортаж AIRI о поездке на конференцию в Рио

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели8.6K

Конференции в науке об ИИ очень любят и ждут. Подача работы на какое‑либо мероприятие из верхушки рейтинга CORE обычно престижнее, чем подача её же в журнал первого квартиля. В «большую тройку» главных конференций года принято включать NeurIPS, ICML и ICLR. Последняя обычно проходит раньше двух других — в этом году она прошла в конце апреля в Рио‑де‑Жанейро.

Мы посетили ICLR 2026 вместе с коллегами из AIRI и рассказываем, чем запомнилась нашим исследователям эта командировка.

Читать далее

Рисуем с помощью закона Кулона. Как сделать генеративную модель на основе электростатики

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели7.4K

Привет, Хабр! Меня зовут Александр Колесов, я исследователь группы «Основы генеративного ИИ» AIRI. У себя в команде мы активно исследуем то, как устроена работа генеративных моделей, ищем новые методы, экспериментируем. Недавно мы обратили внимание на то, что те пути, которые проходят представления данных в диффузионных моделях, очень похожи на пучки силовых линий электрического поля. 

Это не только красивая метафора — мы предложили метод Electrostatic Field Matching (EFM), который позволять извлечь из такой аналогии пользу. Статью с подробным описанием мы недавно свозили на ICLR 2026, там все подробности, теоремы и эксперименты. Здесь же хотелось кратко пересказать основную идею и показать её реализацию на простых примерах.

Читать далее