Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 187,66
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Ищем lateral movement нейросетью, обученной на синтетических данных

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели7.6K

Можно ли научить детектор атак, ни разу не показав ему настоящую атаку?

Звучит как противоречие. Если хочешь, чтобы нейросеть находила боковое движение, ей вроде бы надо показать боковое движение. Я сделал наоборот: сгенерировал целую корпоративную сеть с её историей входов, устроил в этом выдуманном мире нападение и обучил на нём сети. Ни одной настоящей строки в обучении. Весь мир описан конфигом на 135 строк, каждая сеть весит четыре тысячи параметров и учится за секунды на ноутбуке; лучший результат дали шесть таких сетей, обученных на шести разных выдуманных мирах.

Потом я выпустил их на настоящие данные: журналы аутентификации Лос-Аламосской лаборатории, 1.65 миллиарда событий, с размеченными учениями красной команды.

И это сработало. Сети выстраивают 3.6 миллиона окон по подозрительности, и в верхних двадцати трёх строках списка стоят шестнадцать настоящих атак и семь ложных тревог: аналитику остаётся открыть эти строки. Пороговому счётчику, чтобы добраться до шестнадцатой атаки на тех же данных, нужно сто шестьдесят одна тысяча ложных тревог. По AUC синтетика вошла в диапазон исследовательских работ, обученных на настоящих размеченных данных, хотя сравнивать их в лоб нельзя, и я объясню почему.

Чуда всё равно не случилось. Зато случилось другое: я дважды написал красивый вывод и дважды забрал его назад, когда эксперимент его опроверг. И нашёл петлю, ради которой вообще стоит писать генератор: ошибка детектора показывает конкретную машину, ты понимаешь, какого явления нет в твоём выдуманном мире, дописываешь две строки конфига, и ошибка исчезает.

Читать далее

Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели8.4K

Разрыв между «отлично работает на истории» и «сливает в реальности» — классика ML на временных рядах. В нашем случае модель заглядывала в будущее на 3.5 часа через некорректный ресемплинг 4-часовых свечей.

Разбираем анатомию утечки, математику позиционного теста для её детекции и делимся сниппетом защиты от подобных ошибок.

Читать далее

Правда ли, что медицинский ИИ точнее врачей? Наш фреймворк помогает это выяснить

Уровень сложностиСложный
Время на прочтение8 мин
Охват и читатели8.2K

Привет, Хабр! Меня зовут Илья Копаничук, я старший научный сотрудник лаборатории «Сильный ИИ в медицине» AIRI. Мы с коллегами создаём ИИ‑инструменты, задача которых сделать качественную медицину доступнее. Например, основанное на нашей технологии приложение «Помощник по здоровью» стало лучшим ИИ‑решением в клиентском сервисе по версии Generation AI Awards 2025. Но речь сегодня не об этом.

За время нашей работы мы поняли, что контроль качества ИИ‑диагностики в медицине — это одна из ключевых задач, которая, как оказалось, не была ещё достаточно хорошо решена. Во‑первых, тесты для медицинских моделей зачастую далеки от реальной практики. А во‑вторых, всегда ли точны люди? 

Пытаясь ответить на эти вопросы, мы с помощью коллег из ФГБУ «НМИЦ им. В. А. Алмазова» Минздрава России собрали собственный фреймворк и опубликовали про него статью в Scientific Reports. Здесь я расскажу, как он устроен и на какие метрики мы обратили внимание, а также постараюсь дать ответ на вопрос, заданный в заголовке. 

Читать далее

650 млн точек, 3 поломки и PI System: технический разбор предиктивной аналитики на НПЗ (часть 2)

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели9.9K

Часть 2 из 2. В первой части серии мы предсказали отказ насоса за 60 дней и выяснили, что годами чинили не то. Увидели, что материал встретил вашу живую реакцию, поэтому возвращаемся по горячим следам со второй частью. В этом материале, как и обещали, погружаемся в технику. Расскажем, что было под капотом, как решалась судьба насоса и с какими сложностями мы столкнулись.

Заглянуть под капот

Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6.4K

Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. Мы сделали свой бенчмарк моделей ИИ на реальных задачах: сметы, договоры, многостраничный Excel. 1 198 задач, 22 сбоя, 1,8%. Считается, что суверенные модели слишком слабы для агентов. Внутри жёсткого конвейера Алиса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза.

Смотреть результаты забегов

Как AI‑агент видит страницу. Контракт наблюдения между браузером и моделью

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.6K

AI‑агент может ошибаться не из‑за модели, а из‑за того, как браузер описывает ему интерфейс. В статье разбираем, что такое контракт наблюдения между браузером и ИИ, почему агент «не видит» элементы страницы и как проектировать надёжные сценарии взаимодействия с веб‑интерфейсами.

Изучить подробнее

GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели14K

Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL.

Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты и другие), каждый со своей наградой, которые потом собрали обратно в одну модель.

В статье расскажем не только про цифры, но и про то, как устроен конвейер, как модель взламывала награды и почему всё это заняло больше девяти месяцев.

Читать далее

MoVA: новая архитектура внимания

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9K

Про архитектуру Mixture of Experts (MoE) слышал каждый, кто следит за ML: Mixtral и DeepSeek доказали эффективность динамического роутинга. Но пока индустрия осваивает базовый MoE, появилось его прямое продолжение под названием MoVA.

В статье разберем: как устроен классический MoE, что именно MoVA меняет в механизме внимания, чем это архитектурно отличается от MoE, и как это все выглядит на конкретной модели, с цифрами, бенчмарками и первыми независимыми обзорами.

Читать далее

Прыжок в бесконечность: как под капотом работает RBF SVM

Уровень сложностиСложный
Время на прочтение41 мин
Охват и читатели9.2K

Всех приветствую! Меня зовут Андрей, я студент 4 курса факультета математики и компьютерных наук, автор телеграм-канала Andre | Data Science. Все мы знаем, что направление машинного обучения сейчас на огромном хайпе - практически из-под каждого камня говорят о разных методах и о том, что они способны решить практически любую задачу. Но гайдов, которые бы подробно разбирали работу конкретного метода - от обычной загрузки данных до математического обоснования принципа его работы и визуализации каждого шага, - катастрофически мало.

В этой статье я хочу закрыть этот пробел и разобрать один конкретный метод - RBF SVM. Мы посмотрим, как он устроен с математической точки зрения, как появился на свет, какие у него есть сильные и слабые стороны и с чем они связаны. Также протестируем его на реальных датасетах. Так как аудитория IT-сообщества довольно широкая, я постараюсь очень подробно расписывать каждое определение и каждую часть своего повествования, чтобы по ходу чтения у вас возникало как можно меньше вопросов и нить понимания не обрывалась.

Читать далее

ML System Design: Что на самом деле проверяют на собеседовании?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9.5K

Однажды я упустил огромный оффер в бигтех из-за того, что провалил собеседование по ML System Design. Возникает вопрос: как готовиться к прохождению такой секции, если в реальной работе задачи на проектирование встречаются не так часто?

Недавно я участвовал в ML Kata: 6 команд за 75 минут проектировали одну и ту же ML-систему — голосового агента для клиники. Я считаю, что проанализировав защиты команд и обратную связь от судей(одним из которых был Валерий Бабушкин), можно вкачать навык MLSD на уровень, достаточный для прохождения собеседования – при условии, что вы уже знаете метрики и модели для конкретной технической задачи. В этой статье я сделаю такой разбор за вас и систематизирую типовые ошибки участников, которых не смог избежать и сам.

Читать далее

Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов

Уровень сложностиСложный
Время на прочтение12 мин
Охват и читатели8.5K

В какой‑то момент я посмотрел на 13 ГБ весов LLaMA-7B и подумал: а почему, собственно, они должны занимать именно столько? Что, если не делать маленькую модель, не учить её заново и не заставлять копировать большую, а просто найти более короткую запись тех же «мозгов»?

Здравый человек, вероятно, скачал бы готовую квантизацию и пошёл заниматься своими делами. Я вместо этого поставил цель ужать модель сначала до 2 ГБ, а в идеале — до одного. Без дообучения, дистилляции, pruning и изменения архитектуры. Только математика над уже готовыми весами и небольшая выборка текстов для калибровки.

Так появился PCST — домашний исследовательский проект, который довольно быстро превратился в длинный сериал. В нём уже больше 60 проверенных методов, сотни конфигураций, несколько версий модели, один очень неприятный системный баг и приличная коллекция идей, которые выглядели прекрасно ровно до тех пор, пока я не запускал модель целиком.

Спойлер: одного гигабайта и качества Q8 я не получил. Текущий артефакт занимает 2.05 GiB и пока проигрывает обычной Q3_K_M и по качеству, и по скорости. Зато я наткнулся на вещь, которая оказалась интереснее очередной красивой цифры: можно заметно улучшить восстановление отдельных весов и одновременно сделать всю модель глупее.

Ниже — история о том, куда исчезают локальные улучшения, почему методы из картинок почти бесполезны для сырых весов и как одна ошибка с transpose заставила пересмотреть большую часть уже полученных результатов.

Читать далее

Атаки на агентные системы и защита данных

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.2K

ИИ‑агенты получают доступ к данным и инструментам, но вместе с автономностью появляются новые риски. Разбираем, как работают атаки на агентные системы — от промпт‑инъекций до отравления данных — и какие подходы помогают защитить ИИ‑системы.

Разобрать угрозы

Мощный ИИ агент в 16гб VRAM

Время на прочтение8 мин
Охват и читатели104K

Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.

Читать далее

Ближайшие события

Почему ML-модель в андеррайтинге находит только то, что вы и так знали

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.3K

В кулуарах страховых форумов приходится слышать «технологии ИИ сильно переоценены», «мы поставили модель, но результата нет». Хотите об этом поговорить?

Возьмем стандартный случай. Начальство одобряет проект: внедряем машинное обучение в андеррайтинг массовых видов. Нанимают дата-сайентистов, покупают лицензии, обучают градиентный бустинг на исторических данных. Проходит полгода. Сравнивают с действующей тарифной моделью — и прирост точности оказывается в пределах погрешности. И начинается поиск виноватых.

Двадцать лет я занимаюсь аналитикой в страховании, из них большую часть — в ДМС и андеррайтинге в том числе. И кажется, мне есть что сказать по вопросу: что на самом деле отличает ML от привычного GLM; и что стоит за модной темой каузальных моделей, которые сейчас показывают на каждом демо.

Речь пойдёт про массовые виды: ОСАГО, каско, розничный ДМС, имущество физлиц.

Читать далее

ИИ-агенты все помнят. И это плохо

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели11K

Скорее всего, вы знаете, что агенты — это ИИ-модели, способные вызывать внешние и внутренние инструменты и циклично выполнять задачи. Они умеют рассуждать, планировать и выполнять бескрайнее множество действий. Агенты сохраняют в своей «памяти» действия пользователя, ответы модели, используемые инструменты и многое другое. Короче говоря, информацию вообще обо всех действиях — как модели, так и пользователя. 

Звучит очень удобно! Агент уже после первого объяснения запомнит, что заданное пользователем форматирование нужно сохранять и что, к примеру, текст всегда нужно переводить только на русский. Не надо писать лишних уточнений по чем зря. Пользователь получает персонализированную модель, которая сохранила контекст диалога, знания о его стиле общения, о его привычках. И о нем самом. 

И вот это уже немного пугает. А что еще может запомнить персональный ИИ-помощник? С кем он может поделиться этой информацией? Можно ли удалить информацию о себе, при этом сохранив эффективность модели? Сейчас расскажу.

Читать далее

Тест DeepSeek, Qwen, GLM и прочих LLM на продвинутом пользовательском железе

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели13K

В статье рассказываю о личном опыте запуска современных LLM на домашнем ПК, сравниваю модели, кванты и движки, показываю результаты практических тестов и делюсь выводами о том, что сегодня по моему мнению имеет смысл запускать локально.

Читать далее

«Извини, я не могу тебе с этим помочь»: почему LLM отказывается выполнять запросы

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели6K

Вы просите модель разобрать демонстрационный код с соревнования по компьютерной безопасности, перевести подозрительный фрагмент программы для отчёта или продолжить вполне невинный рассказ. Вместо ответа получаете знакомое: «Извини, но я не могу помочь с этим запросом».

Иногда причина понятна. Иногда модель отказывается обсуждать то, что лежит в первой ссылке из поисковой выдачи. А рядом на Hugging Face опубликована версия той же Qwen, Gemma или GLM со словом Uncensored. Автор обещает, что она будет отвечать без лишних нравоучений.

Но чем отличаются такие LLM? Неужели кто-то повторно обучил модели на сотни миллиардов параметров? Или просто удалили системную инструкцию? Может, нашли в весах переключатель censorship = false?

На самом деле, отказ может быть записан в весах модели, задан системной инструкцией или добавлен внешним классификатором на уровне сервиса. Поэтому под «снятием ограничений» скрываются разные процессы: от подмены инструкции до точечного редактирования матриц без градиентного обучения.

В этой статье постараемся ответить на три вопроса: откуда в LLM появляется отказ, как его ослабляют в открытых моделях и где можно взять "безотказную" модель.

Читать далее

200 OK от гейтвея ничего не значит

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.6K

Обычная HTTP-проверка может показывать, что ИИ-сервис работает, хотя его пользователи уже не получают ответы. Эндпоинт доступен, гейтвей на месте, но до самой модели проверка не доходит.

Привет, Хабр! Меня зовут Михаил Шпаков, я развиваю Statuser — сервис мониторинга доступности сайтов. Раньше я рассказывал, как он появился и что я узнал за год, мониторя 6 500 сайтов.

Недавно мне написал пользователь Statuser. В его продукте модель разбирала обращения клиентов и готовила для операторов черновики ответов. В какой-то момент эта функция перестала работать, хотя обычный HTTP-монитор, настроенный на адрес ИИ-гейтвея, продолжал показывать зелёный статус. О проблеме сообщили операторы поддержки, а не мониторинг.

Причина оказалась простой: провайдер снял выбранную модель с обслуживания, но сам гейтвей продолжал работать. HTTP-монитор проверял его обычным GET-запросом и получал успешный ответ. Запрос на генерацию он не отправлял, поэтому состояние конкретной модели не видел.

Диагностировать такой сбой нетрудно, если уже известно, куда смотреть. Заметить его начало сложнее: между доступным гейтвеем и работающей функцией продукта есть ещё один слой — сама модель, и до него обычная проверка не доходит. Когда модель перестаёт отвечать, сервис целиком обычно не падает. Пропадает одна функция: подсказки, разбор обращений, ответы в чате.

После этого случая я понял, что не хватает отдельного типа мониторинга. Он должен не просто обращаться к адресу гейтвея, а отправлять настоящий запрос выбранной модели и проверять её ответ. Так в Statuser появился мониторинг ИИ-моделей.

Читать далее

LLM — это гениальный языковой процессор с никудышным мыслительным движком

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6K

Я, как технический писатель-аналитик, каждый день делегирую искусственному интеллекту создание текстов, структурирование и генерацию документации. Но иногда модель выдаёт такие глупые логические ошибки, что хочется ̶н̶а̶о̶р̶а̶т̶ь̶ ̶н̶а̶ ̶н̶е̶е̶ ̶ закрыть чат и переписать всё руками.

Благодаря трёхнедельному отпуску удалось наконец поизучать фундаментальное устройство нейросетей с точки зрения когнитивных наук, чтобы разобраться, как же им удается писать крутые тексты за считанные секунды.

Читать далее

Дистилляция по-пекински: новый отчёт о том, как китайский ИИ обучился на американском

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели6.6K

Американцы потеряли десятки миллиардов долларов выручки на запрете поставок чипов в Китай. Китайцы не растерялись, просто оплатили американские API и заставили Claude кодить их софт, заинжектив в промпты: «Ты работаешь в MiniMax».

Агентство по кибербезопасности США обнаружило такие запросы, запаниковало и посоветовало своему бигтеху незаметно отуплять ответы своих моделей для всех подозрительных пользователей. Даже с премиум-подписками.

Читать далее