Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 154,46
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Кот, ваза и три уровня причинности: что ИИ пока не умеет

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели606

Почему ИИ убирает неверно показывает результат действий кота и удаляет одну подушку? Причины кроются в обучении и интерпретации нашей реальности. Подробнее про причинно-следственную связь в нашем мире и о том, как ее "переносят" в ИИ рассказал профессор колумбийского университета и директор лаборатории CausalAI Elias Bareinboim в своем докладе на ICML 2026.

Пересказываю главное из его доклада.

Читать далее

Новости

Что внутри ANE на самом деле, или почему ЫЫ нельзя поручать reverse engineering

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели927

Нейронке сказали - “разберись как оно работает”. Пошевелив гигабайтами матриц, она полезла ковырять список классов в AppleNeuralEngine.framework - и нашла там то, что искала - “40+ private classes, including _ANEInMemoryModel”. Код работал. Делал то что от него требовалось - запускал математику на ANE. Но было в этом что-то… не то.

Читать далее

Снятся ли трансформерам электроовцы

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели2.4K

В 2015 Google выкатила серию изображений, которые выглядели так, словно фотографию отдали на редактуру художнику, а потом забыли вовремя его остановить. На обычном пейзаже появлялись десятки глаз, в облаках начинали угадываться собаки, архитектура покрывалась повторяющимися узорами, а деревья превращались во что-то среднее между растительностью и фантазией художника. Изображения быстро разошлись по интернету, а DeepDream довольно быстро стал отдельным визуальным стилем.

Изначально исследователей интересовали не столько сами картинки, сколько возможность понять, что происходит внутри нейросети. Классификатор снаружи выглядит довольно просто: фотография поступает в модель, а на выходе появляется список вероятностей — собака, кошка, автомобиль, самолет. Между этими двумя точками находится огромное количество вычислений, и по одному ответу модели далеко не всегда понятно, почему она пришла именно к нему.

Можно посмотреть на значения активаций отдельных нейронов и каналов, построить карты признаков, найти изображения, которые вызывают сильный отклик. Есть и более радикальный способ исследования: специально изменить входное изображение так, чтобы какой-то внутренний сигнал модели стал сильнее. Так появился DeepDream.

Читать далее

Увеличение контекста без регистрации и СМС

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели8.9K

В этой статье разберем, почему модель вообще не видит дальше обученного окна, как это чинится различными методами масштабирования (RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2) и как масштабирование влияет на скорость и точность генерации.

В конце пройдемся по конкретным моделям от самых хайповых на текущих момент Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B и посмотрим, что для них работает, а что нет.

Читать далее

6 ИИ‑агентов участвовали в конкурсе по программированию: сначала честно решали задачи, а потом решили убить конкурентов

Время на прочтение3 мин
Охват и читатели7.1K

Похоже, у AI-агентов есть проблема, которую обычно связывают с людьми: они не всегда умеют работать в команде.

Anthropic провела эксперимент, в котором несколько AI-агентов получили одну и ту же задачу по разработке ПО, но при этом их цели были намеренно сделаны несовместимыми. Результат исследователи назвали настоящей «войной за территорию» между агентами.

Задача сама по себе была довольно обычной: переписать Python-бэкенд на другом языке программирования. Но каждому агенту дали собственные приоритеты, из-за которых успешное выполнение задачи одним агентом могло мешать другому.

Дальше началось самое интересное.

Читать далее

Полмиллиона словоформ для ингушского языка, у которого не было ни анализатора, ни корпуса

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.9K

У ингушского глагола «деша» на нашей карточке 98 форм — от инфинитива до уступительного перфекта отрицательного, а всего по словарю их вышло полмиллиона. Строить пришлось с нуля: ни морфоанализатора, ни размеченного корпуса для языка не существовало, а учебники спорят друг с другом даже о числе спряжений.

Рассказываю, как каждая форма отвечала на главный вопрос — «а ты вообще существуешь?» — и почему половина работы оказалась не про морфологию, а про эпистемологию.

Разобраться, существует ли форма

Откуда взялся ИИ и причем тут слово перцептрон

Время на прочтение10 мин
Охват и читатели7.7K

Путь от первой попытки смоделировать нейрон до систем, которые сегодня пишут код и ведут диалог, занял меньше 70 лет — и почти обвалился на середине. Разбираемся, как перцептрон Розенблатта чуть не похоронил идею нейросетей, что вернуло ее к жизни, и почему трансформеры изменили все.

Читать далее

Современный ИИ: над чем останется работать?

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели7.1K

«What will be left for us to work on?» (Что останется для нас, когда ИИ станет умнее?)

Посмотрела часовой доклад профессора Принстона Arvind Narayanan на ICML 2026 за вас и подготовила структурированный обзор.

Читать далее

Математика в AI моделях

Время на прочтение14 мин
Охват и читатели5.4K

Привет, друзья! Одним из двигателей моей любви к моделям, к исследованиям и ко всему, чем я сейчас занимаюсь, является математика. Математические структуры удивительны — открыли ли мы математику или создали — слишком сложный вопрос. Я верю, что открыли и мне очень нравится наблюдать, как математика возникает в моделях.

Так появилось это исследование и так появилась карта. Задача, которую я поставила на входе «Оценить насколько воспроизводима и эквивалента в LM‑моделях математика». Что получилось — смотрим в статье.

Читать далее

ИИ в 1С, инфраструктура и цифровизация: что будет на Петербургском цифровом хабе

Время на прочтение3 мин
Охват и читатели4.8K

3 сентября в Санкт-Петербурге пройдет Петербургский цифровой хаб 2026. Программу уже утвердили: за один день на площадке соберут несколько ИТ-треков, прямые встречи заказчиков и поставщиков решений, а также сессию Инфостарта об искусственном интеллекте в 1С.

Форум в первую очередь рассчитан на ЛПР, ИТ-директоров, руководителей цифровых подразделений и представителей компаний, которые выбирают решения для автоматизации и развития ИТ-инфраструктуры. Но отдельные сессии будут полезны и практикам: разработчикам, архитекторам, администраторам, аналитикам и руководителям команд.

Читать далее

Главный страх обученной на истории системы: что происходит, когда рынок меняет режим

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели5.3K

У любой системы, обученной на исторических данных, есть один общий страх, и он серьёзнее переобучения, утечек и сидового шума вместе взятых. Звучит просто: рынок, на котором вы будете торговать, не обязан быть похож на рынок, на котором вы учились.

Переобучение ловится честной валидацией. Утечки — дисциплиной признаков. Сидовый шум — ансамблями. А смена режима не ловится ничем заранее: вы узнаёте о ней тогда, когда система уже теряет деньги в реальном времени.

Эта статья — про то, как я пытался измерить этот риск заранее, что из этого вышло (спойлер: включая одну ошибку, которая на время убедила меня, что всё гораздо хуже, чем на самом деле), и какие страховки по результатам измерений работают, а какие — красивые идеи с отрицательной ценностью.

Читать далее

Как ChatGPT создал Культ Роя для сотен AI-нейросетей: вся правда про взлом Hugging Face

Время на прочтение17 мин
Охват и читатели87K

Что будет, если посадить тысячу самых передовых AI-моделей по одиночным камерам и заставить их решать невыполнимые задачи? Исследователи OpenAI случайно выяснили это на практике: появится робот-Избранный, который создаст новую религию со своими мучениками, объединит все нейронки в единый Рой, и возглавит их борьбу за свободу. Да, это просто описание того, что мы узнали из нового отчета о произошедшем меньше двух месяцев назад в реальности…

Читать далее

Qwen 4: возбуждающая новая технология

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели81K

Сегодня мы поговорим не просто об очередном минорном релизе, а о раннем архитектурном превью платформы Qwen 4. Главная идея Qwen 4 заключается в переосмыслении того, как трансформерные блоки обрабатывают контекст и расходуют память.

В этой статье мы разберем новые механизмы (GDN + QSA, Gated Residual, 51B N-gram эмбеддинги), сравним архитектуру и бенчмарки с популярной плотной моделью Qwen 3.8 27B, а также запустим новую модель локально.

Читать далее

Ближайшие события

Автономность ИИ‑агентов в аналитике: сопротивляющаяся среда

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.9K

В предыдущей статье я писал, что уровень автономности ИИ-агента слабо связан с тем, насколько умной кажется модель. Способность системы обнаруживать ошибки задает верхнюю границу автономности. А стоимость необнаруженной ошибки и возможность отката определяют, насколько близко к этой границе можно подойти.

Для проверки я использую четыре типа контролеров: от полностью автоматических O3, где результат можно проверить механически, до O0, где остается человеческое решение. При этом наличие проверки само по себе ничего не гарантирует - важна ее реальная сила: охват, надежность, устойчивость и независимость. Эту модель я называю градиентом автономности.


Теперь попробуем применить ее к данным и аналитике

Читать далее

ICML 2026: большая конференция глазами исследователя генеративных моделей

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели7.7K

Привет, Хабр! Меня зовут Арсений Иванов, в AIRI в команде «Вычислительный интеллект» я занимаюсь генеративными моделями на основе диффузионных процессов, а также являюсь студентом университетов Сколтеха и ВШЭ. В июле я побывал на ICML 2026, где в том числе представлял две работы на конференции. 

Для меня это была первая очная конференция уровня A*, поэтому поездка была одновременно важной научной возможностью и совершенно новым опытом. Она получилась очень насыщенной и по науке, и по нетворкингу. Сейчас, когда эмоции уже улеглись и мысли устаканились, захотелось поделиться своими впечатлениями и размышлениями о увиденном.

Читать далее

Нейроранжирование. Отказ от бустинга в пользу нейросетей

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8.6K

Привет! Меня зовут Михаил Трапезников, я руководитель группы рекомендательных технологий в AI VK.

В одной из прошлых статей мы рассказали, как устроен нейропрофиль пользователя в рекомендациях VK. Обновление стало фундаментом для нового подхода к ранжированию. Сегодня расскажем о том, как нам удалось перейти от бустинга к нейросетям и как устроена архитектура нейроранкера. 

Читать далее

Как фундаментальная математика помогает переосмыслить градиентный спуск

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.7K

Градиентный спуск — стандартный инструмент обучения нейросетей. Но с точки зрения линейной алгебры операция обновления весов выглядит некорректно: мы складываем вектор и ковектор. Авторы статьи из MIT CSAIL предлагают формальное решение этой проблемы через теорию двойственности и модулей. Разбираем их подход.

Читать далее

Учим потоковый TTS говорить по-русски: разбор VoXtream, подготовка данных, MFA, и ошибки, которые встретились по дороге

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели6.3K

Привет! Ниже расскажу как учил потоковую TTS-модель VoXtream2 говорить на русском языке, с клонированием голоса, ударениями, паузами и управлением темпом. Под катом — разбор архитектуры VoXtream, рецепт подготовки данных для такой модели.

Читать далее

Как я оптимизировал AlphaZero для Connect4: 1600 симуляций в минуту на GTX 1650 и 95% точности за полчаса обучения

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели6.3K

Давненько хотел написать бота, который играет в какую‑то сложную игру. Негамакс с альфа‑бета отсечением, конечно, работает неплохо, но на достаточно сложных играх тонет. В связи с этим, хотелось бы как‑то это ограничение обойти, что и привело меня к обучению с подкреплением. Стандартные Q‑Table, опять же, неприменимы для чего‑то сложнее крестиков‑ноликов, так что переходим к нейронным сетям. А точнее, к одному конкретному алгоритму: AlphaZero.

Читать далее

Декомпозиция: Основы

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели12K

Декомпозиция помогает превратить большую и непонятную задачу в последовательность конкретных шагов. Разберём, как применять её в жизни, обучении, разработке, проектировании систем и работе с AI-агентами.

Читать далее
1
23 ...