Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 190,34
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам

Время на прочтение7 мин
Охват и читатели4.5K

Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам

Manticore Search 29.9.0 добавляет chunked и multi-vector auto-embeddings, ограничение входа для embedding-моделей, UTF-8 идентификаторы, mmap-доступ к columnar-атрибутам по умолчанию, а также исправления для hybrid search, KNN, bulk ingestion и группировки.

Читать далее

Новости

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели5.2K

Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.

Читать далее

Как использовать фреймворк Perseus для решения задач

Уровень сложностиСредний
Время на прочтение37 мин
Охват и читатели4.1K

Привет! Я Аня Никифорова, ML-разработчик по направлению рекомендательных систем в Т-Банке. Этим летом на Turbo ML Conf 2026 мы представили фреймворк Perseus. Он подходит для работы с гетерогенными последовательностями событий пользователей, хорошо масштабируется под различные задачи и из коробки поддерживает кросс-доменные сценарии. 

Фреймворк может показаться сложным, поэтому мы решили поделиться подробным туториалом, где по шагам рассказываем, как использовать Perseus для своих задач. Посмотрим, как с помощью Perseus реализовать кандидатогенерацию, ранжирование, классификацию и регрессию поверх истории действий пользователей в сервисах: как подготовить данные, какие команды вызвать и как оценить результат. На примере кандидатогенерации подробно рассмотрим, как добавлять в модель дополнительные фичи, обогащать ее событиями и как настраивать модель, меняя лишь пару строк в конфиге.

Читать далее

Галлюцинации VLM в zero-shot детекции: ложные тревоги о дыме и решение на уровне промпта

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели4.6K

Как я попробовала решить задачу детекции огня и дыма без обучения, zero-shot детекцией на VLM. О том, как изначально всё работало на видео с настоящим дымом, а на заведомо чистых улицах модель нашла «дым» на 70 % моих данных: рисовала боксы на машинах, знаках и светофорах, иногда с confidence 0% и текстовым пояснением, что дыма нет. В статье описала, почему одношаговый bbox-формат провоцирует ложные детекции, какие стандартные приёмы промпт-инжиниринга не помогли и какое изменение промпта снизило долю ложных тревог с 70 % кадров до нуля при recall выше 80%.

Читать далее

Kubernetes без границ: Managed Kubernetes как вычислительный центр для ИИ

Время на прочтение7 мин
Охват и читатели5.7K

Эволюция искусственного интеллекта дошла до стадии, когда загрузка весов нейросети из открытого репозитория сводится к нескольким кликам, тогда как внедрение алгоритма в продуктовый контур оборачивается многомесячным квестом. Отчасти подобный разрыв объясняется тем, что традиционная инфраструктура недостаточно гибкая и адаптивная для работы в условиях, где каждая минута простоя конвертируется в упущенную выгоду. Именно это противоречие стало катализатором перехода на принципиально новые платформы.

Меня зовут Александр Прохоров. Я эксперт команды разработки Developer Productivity в VK Cloud. В статье расскажу, почему классическая инфраструктура тормозила развитие ИИ-проектов и какой подход к управлению вычислительными ресурсами стал ответом на эти вызовы.

Читать далее

Открываем претрейн Alice AI Search: как устроена модель быстрых ответов Алисы на Поиске

Время на прочтение14 мин
Охват и читатели11K

Быстрый ответ Алисы AI — это самый массовый генеративный продукт Яндекса и первое соприкосновение с Алисой для пользователей Поиска. 

Даже в час пиковой нагрузки пользователь должен получить лаконичный ответ за считаные секунды. Для этого мы, команда Alice AI Search, адаптируем весь пайплайн быстрых ответов — от собственного претрейна с кастомной архитектурой до онлайн‑rl‑обучения на поведенческие сигналы пользователей.

В статье разберём, как устроен генеративный ответ в Поиске, и расскажем про основные улучшения июньского релиза: как мы ускорили ответы за счёт коротких инфоконтекстов, зачем совместили Encoder‑Decoder с разреженной MoE‑архитектурой и как обучение на реальных пользовательских сигналах повлияло на качество и использование продукта.

Кроме того, мы выложили в открытый доступ обученную с нуля модель Alice AI‑T5-35B‑A0.6B Base с тем ограничением, что внешним пользователям доступен инференс через Hugging Face Transformers, а оптимизированный production‑инференс пока доступен только внутри Яндекса.

Читать далее

7 дней новостей ИИ (05.09.26…11.09.26): пока вы спали, вышло ещё три модели

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.3K

Неделя выдалась такая, что впору сериал снимать с открытым финалом. Модели штампуют быстрее, чем успеваешь придумывать им имена, лидерборды переворачиваются за завтраком, а где-то в недрах OpenAI десять тысяч автономных агентов молча уселись решать задачу, за которую математики бьются с прошлого века (и, кажется, решили).

Что же произошло на этой неделе?

Читать далее

Ищем lateral movement нейросетью, обученной на синтетических данных

Уровень сложностиСредний
Время на прочтение41 мин
Охват и читатели6.5K

Можно ли научить детектор атак, ни разу не показав ему настоящую атаку?

Звучит как противоречие. Если хочешь, чтобы нейросеть находила боковое движение, ей вроде бы надо показать боковое движение. Я сделал наоборот: сгенерировал целую корпоративную сеть с её историей входов, устроил в этом выдуманном мире нападение и обучил на нём сети. Ни одной настоящей строки в обучении. Весь мир описан конфигом на 135 строк, каждая сеть весит четыре тысячи параметров и учится за секунды на ноутбуке; лучший результат дали шесть таких сетей, обученных на шести разных выдуманных мирах.

Потом я выпустил их на настоящие данные: журналы аутентификации Лос-Аламосской лаборатории, 1.65 миллиарда событий, с размеченными учениями красной команды.

И это сработало. Сети выстраивают 3.6 миллиона окон по подозрительности, и в верхних двадцати трёх строках списка стоят шестнадцать настоящих атак и семь ложных тревог: аналитику остаётся открыть эти строки. Пороговому счётчику, чтобы добраться до шестнадцатой атаки на тех же данных, нужно сто шестьдесят одна тысяча ложных тревог. По AUC синтетика вошла в диапазон исследовательских работ, обученных на настоящих размеченных данных, хотя сравнивать их в лоб нельзя, и я объясню почему.

Чуда всё равно не случилось. Зато случилось другое: я дважды написал красивый вывод и дважды забрал его назад, когда эксперимент его опроверг. И нашёл петлю, ради которой вообще стоит писать генератор: ошибка детектора показывает конкретную машину, ты понимаешь, какого явления нет в твоём выдуманном мире, дописываешь две строки конфига, и ошибка исчезает.

Читать далее

Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7.6K

Разрыв между «отлично работает на истории» и «сливает в реальности» — классика ML на временных рядах. В нашем случае модель заглядывала в будущее на 3.5 часа через некорректный ресемплинг 4-часовых свечей.

Разбираем анатомию утечки, математику позиционного теста для её детекции и делимся сниппетом защиты от подобных ошибок.

Читать далее

Правда ли, что медицинский ИИ точнее врачей? Наш фреймворк помогает это выяснить

Уровень сложностиСложный
Время на прочтение8 мин
Охват и читатели7.3K

Привет, Хабр! Меня зовут Илья Копаничук, я старший научный сотрудник лаборатории «Сильный ИИ в медицине» AIRI. Мы с коллегами создаём ИИ‑инструменты, задача которых сделать качественную медицину доступнее. Например, основанное на нашей технологии приложение «Помощник по здоровью» стало лучшим ИИ‑решением в клиентском сервисе по версии Generation AI Awards 2025. Но речь сегодня не об этом.

За время нашей работы мы поняли, что контроль качества ИИ‑диагностики в медицине — это одна из ключевых задач, которая, как оказалось, не была ещё достаточно хорошо решена. Во‑первых, тесты для медицинских моделей зачастую далеки от реальной практики. А во‑вторых, всегда ли точны люди? 

Пытаясь ответить на эти вопросы, мы с помощью коллег из ФГБУ «НМИЦ им. В. А. Алмазова» Минздрава России собрали собственный фреймворк и опубликовали про него статью в Scientific Reports. Здесь я расскажу, как он устроен и на какие метрики мы обратили внимание, а также постараюсь дать ответ на вопрос, заданный в заголовке. 

Читать далее

650 млн точек, 3 поломки и PI System: технический разбор предиктивной аналитики на НПЗ (часть 2)

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели8.6K

Часть 2 из 2. В первой части серии мы предсказали отказ насоса за 60 дней и выяснили, что годами чинили не то. Увидели, что материал встретил вашу живую реакцию, поэтому возвращаемся по горячим следам со второй частью. В этом материале, как и обещали, погружаемся в технику. Расскажем, что было под капотом, как решалась судьба насоса и с какими сложностями мы столкнулись.

Заглянуть под капот

Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5.8K

Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. Мы сделали свой бенчмарк моделей ИИ на реальных задачах: сметы, договоры, многостраничный Excel. 1 198 задач, 22 сбоя, 1,8%. Считается, что суверенные модели слишком слабы для агентов. Внутри жёсткого конвейера Алиса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза.

Смотреть результаты забегов

Как AI‑агент видит страницу. Контракт наблюдения между браузером и моделью

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.2K

AI‑агент может ошибаться не из‑за модели, а из‑за того, как браузер описывает ему интерфейс. В статье разбираем, что такое контракт наблюдения между браузером и ИИ, почему агент «не видит» элементы страницы и как проектировать надёжные сценарии взаимодействия с веб‑интерфейсами.

Изучить подробнее

Ближайшие события

GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели11K

Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL.

Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты и другие), каждый со своей наградой, которые потом собрали обратно в одну модель.

В статье расскажем не только про цифры, но и про то, как устроен конвейер, как модель взламывала награды и почему всё это заняло больше девяти месяцев.

Читать далее

MoVA: новая архитектура внимания

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.4K

Про архитектуру Mixture of Experts (MoE) слышал каждый, кто следит за ML: Mixtral и DeepSeek доказали эффективность динамического роутинга. Но пока индустрия осваивает базовый MoE, появилось его прямое продолжение под названием MoVA.

В статье разберем: как устроен классический MoE, что именно MoVA меняет в механизме внимания, чем это архитектурно отличается от MoE, и как это все выглядит на конкретной модели, с цифрами, бенчмарками и первыми независимыми обзорами.

Читать далее

Прыжок в бесконечность: как под капотом работает RBF SVM

Уровень сложностиСложный
Время на прочтение41 мин
Охват и читатели8.7K

Всех приветствую! Меня зовут Андрей, я студент 4 курса факультета математики и компьютерных наук, автор телеграм-канала Andre | Data Science. Все мы знаем, что направление машинного обучения сейчас на огромном хайпе - практически из-под каждого камня говорят о разных методах и о том, что они способны решить практически любую задачу. Но гайдов, которые бы подробно разбирали работу конкретного метода - от обычной загрузки данных до математического обоснования принципа его работы и визуализации каждого шага, - катастрофически мало.

В этой статье я хочу закрыть этот пробел и разобрать один конкретный метод - RBF SVM. Мы посмотрим, как он устроен с математической точки зрения, как появился на свет, какие у него есть сильные и слабые стороны и с чем они связаны. Также протестируем его на реальных датасетах. Так как аудитория IT-сообщества довольно широкая, я постараюсь очень подробно расписывать каждое определение и каждую часть своего повествования, чтобы по ходу чтения у вас возникало как можно меньше вопросов и нить понимания не обрывалась.

Читать далее

ML System Design: Что на самом деле проверяют на собеседовании?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели9K

Однажды я упустил огромный оффер в бигтех из-за того, что провалил собеседование по ML System Design. Возникает вопрос: как готовиться к прохождению такой секции, если в реальной работе задачи на проектирование встречаются не так часто?

Недавно я участвовал в ML Kata: 6 команд за 75 минут проектировали одну и ту же ML-систему — голосового агента для клиники. Я считаю, что проанализировав защиты команд и обратную связь от судей(одним из которых был Валерий Бабушкин), можно вкачать навык MLSD на уровень, достаточный для прохождения собеседования – при условии, что вы уже знаете метрики и модели для конкретной технической задачи. В этой статье я сделаю такой разбор за вас и систематизирую типовые ошибки участников, которых не смог избежать и сам.

Читать далее

Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов

Уровень сложностиСложный
Время на прочтение12 мин
Охват и читатели8.2K

В какой‑то момент я посмотрел на 13 ГБ весов LLaMA-7B и подумал: а почему, собственно, они должны занимать именно столько? Что, если не делать маленькую модель, не учить её заново и не заставлять копировать большую, а просто найти более короткую запись тех же «мозгов»?

Здравый человек, вероятно, скачал бы готовую квантизацию и пошёл заниматься своими делами. Я вместо этого поставил цель ужать модель сначала до 2 ГБ, а в идеале — до одного. Без дообучения, дистилляции, pruning и изменения архитектуры. Только математика над уже готовыми весами и небольшая выборка текстов для калибровки.

Так появился PCST — домашний исследовательский проект, который довольно быстро превратился в длинный сериал. В нём уже больше 60 проверенных методов, сотни конфигураций, несколько версий модели, один очень неприятный системный баг и приличная коллекция идей, которые выглядели прекрасно ровно до тех пор, пока я не запускал модель целиком.

Спойлер: одного гигабайта и качества Q8 я не получил. Текущий артефакт занимает 2.05 GiB и пока проигрывает обычной Q3_K_M и по качеству, и по скорости. Зато я наткнулся на вещь, которая оказалась интереснее очередной красивой цифры: можно заметно улучшить восстановление отдельных весов и одновременно сделать всю модель глупее.

Ниже — история о том, куда исчезают локальные улучшения, почему методы из картинок почти бесполезны для сырых весов и как одна ошибка с transpose заставила пересмотреть большую часть уже полученных результатов.

Читать далее

Атаки на агентные системы и защита данных

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.8K

ИИ‑агенты получают доступ к данным и инструментам, но вместе с автономностью появляются новые риски. Разбираем, как работают атаки на агентные системы — от промпт‑инъекций до отравления данных — и какие подходы помогают защитить ИИ‑системы.

Разобрать угрозы

Мощный ИИ агент в 16гб VRAM

Время на прочтение8 мин
Охват и читатели99K

Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.

Читать далее
1
23 ...