Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 263,2
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

650 млн точек, 3 поломки и PI System: технический разбор предиктивной аналитики на НПЗ (часть 2)

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели611

Часть 2 из 2. В первой части серии мы предсказали отказ насоса за 60 дней и выяснили, что годами чинили не то. Увидели, что материал встретил вашу живую реакцию, поэтому возвращаемся по горячим следам со второй частью. В этом материале, как и обещали, погружаемся в технику. Расскажем, что было под капотом, как решалась судьба насоса и с какими сложностями мы столкнулись.

Заглянуть под капот

Новости

Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели3.5K

Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. Мы сделали свой бенчмарк моделей ИИ на реальных задачах: сметы, договоры, многостраничный Excel. 1 198 задач, 22 сбоя, 1,8%. Считается, что суверенные модели слишком слабы для агентов. Внутри жёсткого конвейера Алиса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза.

Смотреть результаты забегов

Как AI‑агент видит страницу. Контракт наблюдения между браузером и моделью

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели3.4K

AI‑агент может ошибаться не из‑за модели, а из‑за того, как браузер описывает ему интерфейс. В статье разбираем, что такое контракт наблюдения между браузером и ИИ, почему агент «не видит» элементы страницы и как проектировать надёжные сценарии взаимодействия с веб‑интерфейсами.

Изучить подробнее

Индустрия ИИ надела на себя наручники добровольно. Проверим, настоящие ли они

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели3.2K

Первого сентября OpenAI опубликовала документ под названием «Path to Astra: critical capabilities and frontier safeguards». Я открыла его между делом, за чаем, примерно с тем же интересом, с каким читают уведомления об обновлении пользовательского соглашения.

Через сорок минут чай остыл, а я сидела с открытыми в соседних вкладках августовскими публикациями той же компании и пыталась понять, когда именно все успело поменяться.

Формально в документе написано следующее. Astra, следующая крупная модель OpenAI, признана достигшей уровня Critical по кибербезопасности в рамках внутренней системы оценки рисков компании. Первая модель в истории OpenAI с такой классификацией. Релиз задержан, защита усилена. И еще одна строчка, которую в новостях пересказывали реже всего: Astra стала первой моделью, прошедшей формальную предрелизную проверку по кибербезопасности со стороны правительства США.

Вот на этой строчке я и застряла. Потому, что его никто не заставлял этого делать. И компанию никто не заставлял его звать.

Через два дня модель вышла. Президент OpenAI Грег Брокман закрыл брифинг словами «Welcome to the AGI era», и почти вся пресса вынесла в заголовки именно их. Про предрелизную проверку не написал почти никто.

Читать далее

GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели6K

Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL.

Главное, что изменилось в обучении: после SFT модель целиком прошла через online RL. Не один домен и не одна финальная стадия, а шесть отдельных экспертов (математика, код, агенты и другие), каждый со своей наградой, которые потом собрали обратно в одну модель.

В статье расскажем не только про цифры, но и про то, как устроен конвейер, как модель взламывала награды и почему всё это заняло больше девяти месяцев.

Читать далее

MoVA: новая архитектура внимания

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели7.3K

Про архитектуру Mixture of Experts (MoE) слышал каждый, кто следит за ML: Mixtral и DeepSeek доказали эффективность динамического роутинга. Но пока индустрия осваивает базовый MoE, появилось его прямое продолжение под названием MoVA.

В статье разберем: как устроен классический MoE, что именно MoVA меняет в механизме внимания, чем это архитектурно отличается от MoE, и как это все выглядит на конкретной модели, с цифрами, бенчмарками и первыми независимыми обзорами.

Читать далее

Прыжок в бесконечность: как под капотом работает RBF SVM

Уровень сложностиСложный
Время на прочтение41 мин
Охват и читатели7.7K

Всех приветствую! Меня зовут Андрей, я студент 4 курса факультета математики и компьютерных наук, автор телеграм-канала Andre | Data Science. Все мы знаем, что направление машинного обучения сейчас на огромном хайпе - практически из-под каждого камня говорят о разных методах и о том, что они способны решить практически любую задачу. Но гайдов, которые бы подробно разбирали работу конкретного метода - от обычной загрузки данных до математического обоснования принципа его работы и визуализации каждого шага, - катастрофически мало.

В этой статье я хочу закрыть этот пробел и разобрать один конкретный метод - RBF SVM. Мы посмотрим, как он устроен с математической точки зрения, как появился на свет, какие у него есть сильные и слабые стороны и с чем они связаны. Также протестируем его на реальных датасетах. Так как аудитория IT-сообщества довольно широкая, я постараюсь очень подробно расписывать каждое определение и каждую часть своего повествования, чтобы по ходу чтения у вас возникало как можно меньше вопросов и нить понимания не обрывалась.

Читать далее

ML System Design: Что на самом деле проверяют на собеседовании?

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8.2K

Однажды я упустил огромный оффер в бигтех из-за того, что провалил собеседование по ML System Design. Возникает вопрос: как готовиться к прохождению такой секции, если в реальной работе задачи на проектирование встречаются не так часто?

Недавно я участвовал в ML Kata: 6 команд за 75 минут проектировали одну и ту же ML-систему — голосового агента для клиники. Я считаю, что проанализировав защиты команд и обратную связь от судей(одним из которых был Валерий Бабушкин), можно вкачать навык MLSD на уровень, достаточный для прохождения собеседования – при условии, что вы уже знаете метрики и модели для конкретной технической задачи. В этой статье я сделаю такой разбор за вас и систематизирую типовые ошибки участников, которых не смог избежать и сам.

Читать далее

Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов

Уровень сложностиСложный
Время на прочтение12 мин
Охват и читатели7.7K

В какой‑то момент я посмотрел на 13 ГБ весов LLaMA-7B и подумал: а почему, собственно, они должны занимать именно столько? Что, если не делать маленькую модель, не учить её заново и не заставлять копировать большую, а просто найти более короткую запись тех же «мозгов»?

Здравый человек, вероятно, скачал бы готовую квантизацию и пошёл заниматься своими делами. Я вместо этого поставил цель ужать модель сначала до 2 ГБ, а в идеале — до одного. Без дообучения, дистилляции, pruning и изменения архитектуры. Только математика над уже готовыми весами и небольшая выборка текстов для калибровки.

Так появился PCST — домашний исследовательский проект, который довольно быстро превратился в длинный сериал. В нём уже больше 60 проверенных методов, сотни конфигураций, несколько версий модели, один очень неприятный системный баг и приличная коллекция идей, которые выглядели прекрасно ровно до тех пор, пока я не запускал модель целиком.

Спойлер: одного гигабайта и качества Q8 я не получил. Текущий артефакт занимает 2.05 GiB и пока проигрывает обычной Q3_K_M и по качеству, и по скорости. Зато я наткнулся на вещь, которая оказалась интереснее очередной красивой цифры: можно заметно улучшить восстановление отдельных весов и одновременно сделать всю модель глупее.

Ниже — история о том, куда исчезают локальные улучшения, почему методы из картинок почти бесполезны для сырых весов и как одна ошибка с transpose заставила пересмотреть большую часть уже полученных результатов.

Читать далее

Атаки на агентные системы и защита данных

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.3K

ИИ‑агенты получают доступ к данным и инструментам, но вместе с автономностью появляются новые риски. Разбираем, как работают атаки на агентные системы — от промпт‑инъекций до отравления данных — и какие подходы помогают защитить ИИ‑системы.

Разобрать угрозы

Мощный ИИ агент в 16гб VRAM

Время на прочтение8 мин
Охват и читатели62K

Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.

Читать далее

Почему ML-модель в андеррайтинге находит только то, что вы и так знали

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели5.7K

В кулуарах страховых форумов приходится слышать «технологии ИИ сильно переоценены», «мы поставили модель, но результата нет». Хотите об этом поговорить?

Возьмем стандартный случай. Начальство одобряет проект: внедряем машинное обучение в андеррайтинг массовых видов. Нанимают дата-сайентистов, покупают лицензии, обучают градиентный бустинг на исторических данных. Проходит полгода. Сравнивают с действующей тарифной моделью — и прирост точности оказывается в пределах погрешности. И начинается поиск виноватых.

Двадцать лет я занимаюсь аналитикой в страховании, из них большую часть — в ДМС и андеррайтинге в том числе. И кажется, мне есть что сказать по вопросу: что на самом деле отличает ML от привычного GLM; и что стоит за модной темой каузальных моделей, которые сейчас показывают на каждом демо.

Речь пойдёт про массовые виды: ОСАГО, каско, розничный ДМС, имущество физлиц.

Читать далее

ИИ-агенты все помнят. И это плохо

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели9K

Скорее всего, вы знаете, что агенты — это ИИ-модели, способные вызывать внешние и внутренние инструменты и циклично выполнять задачи. Они умеют рассуждать, планировать и выполнять бескрайнее множество действий. Агенты сохраняют в своей «памяти» действия пользователя, ответы модели, используемые инструменты и многое другое. Короче говоря, информацию вообще обо всех действиях — как модели, так и пользователя. 

Звучит очень удобно! Агент уже после первого объяснения запомнит, что заданное пользователем форматирование нужно сохранять и что, к примеру, текст всегда нужно переводить только на русский. Не надо писать лишних уточнений по чем зря. Пользователь получает персонализированную модель, которая сохранила контекст диалога, знания о его стиле общения, о его привычках. И о нем самом. 

И вот это уже немного пугает. А что еще может запомнить персональный ИИ-помощник? С кем он может поделиться этой информацией? Можно ли удалить информацию о себе, при этом сохранив эффективность модели? Сейчас расскажу.

Читать далее

Ближайшие события

Тест DeepSeek, Qwen, GLM и прочих LLM на продвинутом пользовательском железе

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели10K

В статье рассказываю о личном опыте запуска современных LLM на домашнем ПК, сравниваю модели, кванты и движки, показываю результаты практических тестов и делюсь выводами о том, что сегодня по моему мнению имеет смысл запускать локально.

Читать далее

«Извини, я не могу тебе с этим помочь»: почему LLM отказывается выполнять запросы

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели5.1K

Вы просите модель разобрать демонстрационный код с соревнования по компьютерной безопасности, перевести подозрительный фрагмент программы для отчёта или продолжить вполне невинный рассказ. Вместо ответа получаете знакомое: «Извини, но я не могу помочь с этим запросом».

Иногда причина понятна. Иногда модель отказывается обсуждать то, что лежит в первой ссылке из поисковой выдачи. А рядом на Hugging Face опубликована версия той же Qwen, Gemma или GLM со словом Uncensored. Автор обещает, что она будет отвечать без лишних нравоучений.

Но чем отличаются такие LLM? Неужели кто-то повторно обучил модели на сотни миллиардов параметров? Или просто удалили системную инструкцию? Может, нашли в весах переключатель censorship = false?

На самом деле, отказ может быть записан в весах модели, задан системной инструкцией или добавлен внешним классификатором на уровне сервиса. Поэтому под «снятием ограничений» скрываются разные процессы: от подмены инструкции до точечного редактирования матриц без градиентного обучения.

В этой статье постараемся ответить на три вопроса: откуда в LLM появляется отказ, как его ослабляют в открытых моделях и где можно взять "безотказную" модель.

Читать далее

200 OK от гейтвея ничего не значит

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели7.3K

Обычная HTTP-проверка может показывать, что ИИ-сервис работает, хотя его пользователи уже не получают ответы. Эндпоинт доступен, гейтвей на месте, но до самой модели проверка не доходит.

Привет, Хабр! Меня зовут Михаил Шпаков, я развиваю Statuser — сервис мониторинга доступности сайтов. Раньше я рассказывал, как он появился и что я узнал за год, мониторя 6 500 сайтов.

Недавно мне написал пользователь Statuser. В его продукте модель разбирала обращения клиентов и готовила для операторов черновики ответов. В какой-то момент эта функция перестала работать, хотя обычный HTTP-монитор, настроенный на адрес ИИ-гейтвея, продолжал показывать зелёный статус. О проблеме сообщили операторы поддержки, а не мониторинг.

Причина оказалась простой: провайдер снял выбранную модель с обслуживания, но сам гейтвей продолжал работать. HTTP-монитор проверял его обычным GET-запросом и получал успешный ответ. Запрос на генерацию он не отправлял, поэтому состояние конкретной модели не видел.

Диагностировать такой сбой нетрудно, если уже известно, куда смотреть. Заметить его начало сложнее: между доступным гейтвеем и работающей функцией продукта есть ещё один слой — сама модель, и до него обычная проверка не доходит. Когда модель перестаёт отвечать, сервис целиком обычно не падает. Пропадает одна функция: подсказки, разбор обращений, ответы в чате.

После этого случая я понял, что не хватает отдельного типа мониторинга. Он должен не просто обращаться к адресу гейтвея, а отправлять настоящий запрос выбранной модели и проверять её ответ. Так в Statuser появился мониторинг ИИ-моделей.

Читать далее

LLM — это гениальный языковой процессор с никудышным мыслительным движком

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели5.5K

Я, как технический писатель-аналитик, каждый день делегирую искусственному интеллекту создание текстов, структурирование и генерацию документации. Но иногда модель выдаёт такие глупые логические ошибки, что хочется ̶н̶а̶о̶р̶а̶т̶ь̶ ̶н̶а̶ ̶н̶е̶е̶ ̶ закрыть чат и переписать всё руками.

Благодаря трёхнедельному отпуску удалось наконец поизучать фундаментальное устройство нейросетей с точки зрения когнитивных наук, чтобы разобраться, как же им удается писать крутые тексты за считанные секунды.

Читать далее

Дистилляция по-пекински: новый отчёт о том, как китайский ИИ обучился на американском

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели5.9K

Американцы потеряли десятки миллиардов долларов выручки на запрете поставок чипов в Китай. Китайцы не растерялись, просто оплатили американские API и заставили Claude кодить их софт, заинжектив в промпты: «Ты работаешь в MiniMax».

Агентство по кибербезопасности США обнаружило такие запросы, запаниковало и посоветовало своему бигтеху незаметно отуплять ответы своих моделей для всех подозрительных пользователей. Даже с премиум-подписками.

Читать далее

Почему оплата за токены — не лучшая модель монетизации для AI-стартапа

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели5.2K

Привет! Меня зовут Саша Журавлев. Я венчурный инвестор и основатель фонда Mento vc. Мы инвестируем в технологические компании на стадиях Seed / Series A в США, а в своем телеграм-канале рассказываю, как вижу рынок и принимаю инвестиционные решения.

Прайс в AI-продукте можно устанавливать по-разному: по числу обращений к модели или по количеству выполненных задач (например подготовленных отчетов, проверенных договоров или готовых изменений в коде). От выбора зависит экономика стартапа: если цена привязана к токенам, клиент фактически оплачивает расходы на работу LLM. Но важны-то для клиента в первую очередь не токены или вычисления, а то, какая задача была решена.

Нашел интересную статью a16z с разбором трех подходов к монетизации AI-продуктов: оплаты за токены, кредитов за выполненные задачи и оплаты за результат.

В статье рассказывают, в каких случаях какой вариант подходит, а еще как сделать расходы понятными для клиента и при этом сохранить маржинальность.

Для инвесторов: помогает понять, создает ли стартап собственную ценность и насколько устойчивой останется его экономика при изменении стоимости моделей.

Перевели с командой и адаптировали текст для вас. Приятного прочтения!

Читать далее

Два года, один человек, 66 контейнеров: как я построил AI‑платформу на железе под столом

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6.6K

Привет, Хабр. 26 августа 2024 года я получил у BotFather первый токен и написал кривой телеграм‑бот с одной моделью — обычная история «хочу ChatGPT без танцев с бубном, сделаю себе сам». Бот был честно плохой: одна модель, никакого контекста, падал от длинных сообщений. Но он работал, им начали пользоваться дети и знакомые, и я решил «немного доделать».

«Немного доделать» продолжается второй год. Сейчас это платформа с веб‑приложением, шестью каналами доставки (Telegram, VK, MAX, Discord, веб и — для уведомлений и результатов долгих задач — email), биллингом, голосовым агентом и RAG по документам. А под ней — 66 контейнеров на двух нодах, BGP‑маршрутизация, собственный CI, хелпдеск и GPU‑нода с локальными моделями. Всё на железе, которое стоит под столом и потребляло меньше, чем игровая приставка, — до недавнего появления второй ноды с 3090; теперь приставка нервно курит. Эта статья — про то, во что превращается домашняя инфраструктура, когда backend‑разработчик два года не может остановиться.

Пишу это по двум причинам. Во‑первых, когда я начинал, мне отчаянно не хватало такой статьи — целостной картины, как это выглядит, когда селф‑хостишь ВСЁ. Во‑вторых, я почти наверняка делаю что‑то не так, и комментарии Хабра — самый быстрый способ об этом узнать. Не стесняйтесь.

Читать далее
1
23 ...