Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 253,03
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Giga4DQM: мультиагентный подход к расследованию качества данных на базе GigaChat

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели11K

Giga4DQM — открытый проект, реализующий концепцию ИИ-агентов для автоматизированного расследования инцидентов с данными и построения целостной картины зависимостей в существующей БД. Система понимает вопросы на естественном языке, самостоятельно анализирует структуру базы, строит граф зависимостей и формирует диагностические запросы. Архитектура не привязана к одной СУБД: в качестве примера взята PostgreSQL, но подход может быть адаптирован к любой системе с развитым каталогом метаданных. В основе — мультиагентная архитектура на основе GigaChat и LangGraph. Код открыт, доступен для тестирования и внедрения.

Читать далее

У ИИ есть душа? Даём LLM характер и эмоции

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9.1K

Если вы когда‑нибудь общались с популярными чат‑ботами или заглядывали на Character.ai, легко поддаться иллюзии, будто на той стороне экрана сидит живой человек. ИИ искусно шутит, сопереживает, злится и подыгрывает. Ведёт себя почти как человек. Но может ли за всем этим скрываться настоящее сознание и душа?

Если говорить кратко и прямо — за экраном только пустота и холодные математические расчеты.

Любая современная языковая модель представляет собой сложный калькулятор статистики, который предсказывает следующее, наиболее вероятное и приятное вам слово. Но не более того.

У LLM нет ни характера, ни настроения, ни личности. То есть ничего того, что свойственно человеческой психике.

Красивый фасад «души» быстро рассыпается в долгих диалогах. В текстовых ролевых играх (AI‑roleplay) это заметно сильнее всего: через 20–30 реплик бот теряет нить разговора, забывает детали и начинает безвольно поддакивать игроку.

Но неужели нельзя сделать ИИ хоть немного человечнее? Дать ему сознание? Возможно ли подарить языковой модели стабильный характер и живые эмоции без необходимости её переобучать? Рассказываем, как мы обошли ограничения нейросетей с помощью внешней программы.

Читать далее

Софт Дронопорта: что происходит, пока оператор пьёт кофе

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.5K

Дрон летит над карьером на Сахалине. Оператор сидит за пять тысяч километров и пьёт кофе. Между ними — только канал связи, и это в лучшем случае оптика, а в худшем — LTE-модем с одной палкой.

В прошлой статье я рассказал, что такое дронопорт и зачем он бизнесу. В комментариях резонно попросили: железо — понятно, а что с программной частью. Показываю.

Внутри разберём тонкости, о которых обычно молчат в презентациях:

— что на самом деле делает дрон, когда связь пропадает посреди миссии (спойлер: не падает);
— почему "разбить большую миссию на части" — это не арифметика, и при чём тут ветер и швы на ортофотоплане;
— зачем оператору видео с задержкой меньше секунды и почему телеметрия важнее картинки;
— как платформа дружит с ОРВД, ГИС и ERP заказчика — и почему в промышленности побеждает не самый красивый софт;
— и где нам приходится подбирать костыли, потому что не все методы SDK производителя открыты.

Читать далее

Alice AI ART 2.0: путь к unified‑модели, которая одинаково хорошо умеет генерировать и редактировать картинки

Время на прочтение15 мин
Охват и читатели13K

Привет, Хабр! На связи команда генеративных моделей в компьютерном зрении. Вместе с другими командами мы делаем мультимодального ассистента Алиса AI. Внутри него мы развиваем несколько вариантов визуальной генерации с помощью отдельной модели Alice AI ART. Два базовых сценария её работы — генерация по тексту (Text‑to‑Image, T2I) и редактирование по картинке с инструкцией (Image‑to‑Image, I2I). Именно о них пойдёт речь. 

Всё это время эти сценарии жили как два разных стека: свои базовые модели, свои данные, свои метрики и, честно говоря, своя отдельная боль в разработке и поддержке.

В этом году мы поставили себе цель, которая звучала просто, а на практике оказалась полугодовым приключением: не только подтянуть качество, а сделать одну модель, которая одинаково хорошо умеет и в T2I, и в I2I. Внутри мы называем такой режим unified или просто uni. Вас ждёт рассказ об отдельных экспериментах и наблюдениях, которые помогли нам сделать первый шаг в этом направлении и привели нас к Alice AI ART 2.0, — включая те, которые красиво не сработали (спойлер: их хватало).

Читать далее

Как решаются оптимизационные задачи в масштабе. Декомпозиция и инженерия

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели7.6K

Всем привет. Меня зовут Василий Гуров, я занимаюсь задачами оптимизации в ML Research Lab MAGNIT TECH. В этом материале разберу два промышленных кейса из крупного ритейла – планирование смен сотрудников магазинов и сглаживание нагрузки на распределительные центры.

На поверхности это разные задачи. В первой нужно построить график работы сотрудников по ролям и временным интервалам. Во втором кейсе стоит задача перераспределения логистических потоков так, чтобы снизить пики нагрузки на распределительные центры (РЦ). Но инженерная проблема у них оказалась общей. Прямая time-indexed постановка быстро раздувала модель до сотен тысяч и миллионов бинарных переменных, давала нестабильные рекомендации и плохо укладывалась в SLA.

В этой статье я покажу, как мы решали эту проблему на практике с помощью простого приёма, который должен одним из первых рассматриваться при решении таких объёмных задач. Ключевым оказалось не выбрать самый мощный солвер или алгоритм, а взглянуть на задачу с другой стороны – изменить саму единицу решения. Вместо выбора на уровне слотов, мы стали заранее генерировать валидные кандидаты смен и дальше решали задачу выбора из этих кандидатов. В планировании графиков сотрудников таким кандидатом стала допустимая смена, в сглаживании нагрузки на РЦ – допустимый перенос потока.

Читать далее

Лейтнер, Elo и поправка на угадывание: движок тренажёра собесов без единого вызова LLM

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели6.5K

Готовиться к собесу по списку «2000 вопросов с ответами» невозможно. Я пробовал: открываешь, листаешь минут сорок, отвечаешь на те, что и так знаешь, закрываешь с чувством выполненного долга. Через неделю в голове ноль. Список не помнит, где ты плаваешь, и не знает, когда ты забудешь то, что вчера повторил.

Лечится это не списком подлиннее, а движком практики: системой, которая помнит каждую встречу человека с каждым вопросом и решает, что показать следующим. Такой движок я собрал для своего тренажёра собесов, и статья целиком про него: корзины Лейтнера для памяти, Elo с поправкой на угадывание для сложности, карта слабых мест, политика сборки сессии. Всё с кодом, графиками и граблями с прода, плюс два отступления: чем в этой задаче неудобен LLM и откуда берётся банк вопросов. Сам я ведущий дата-сайентист, кандидатов собеседую регулярно, так что на проблему смотрю с обеих сторон стола.

Читать далее

Вы не внедрили AI. Вы завели кладбище промптов

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели7.6K

Один разработчик потратил спринт на обновление одного проекта - и всё равно не довёл миграцию до конца. Таких проектов в команде было около тридцати, а похожих команд в компании - около десяти.

На следующем проекте ту же работу удалось завершить примерно вдвое быстрее. Не потому, что LLM стала умнее. Мы перестали хранить найденные решения в чатах и начали превращать их в повторяемый процесс.

Ниже - как из этого процесса выросли skills, agents и ide-agents, инструмент для их доставки до команды. Но сначала разберёмся, почему даже хороший промпт не спас первую миграцию.

Читать далее

Своя GPT-like LLM по WH40K с нуля. Часть 2: собираем трансформер

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.2K

Привет, Хабр! Меня зовут Владимир, и это вторая часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы вытащили текст, обучили Byte-level BPE токенизатор и собрали pretrain-датасет. Теперь напишем сердце модели - трансформер.

Читать далее

Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.2K

Чтобы AI-агент понимал инженера, индустрия предлагает поставить между ними еще одну большую языковую модель. Мы поставили модель на 34 млн параметров, в несколько десятков раз меньше, и она справляется лучше.

Секрет в данных. 200 тысяч пар «формулировка задачи → элемент КОМПАС API», где негативные примеры подбирались специально коварные: одноименные методы разных интерфейсов, соседние get/set одного свойства, кандидаты, которых базовая модель ошибочно ставила на первое место. Дообучение заняло меньше пяти часов на одной видеокарте, а Hit@5 на запросах, где метод описан задачей, а не именем, вырос с 5,8% до 79,6%.

Но поиск это только вход. Дальше каждый кандидат проходит через граф типов, константы берутся из настоящих DLL, код сверяет компилятор, а недокументированное поведение агент выясняет экспериментами в живом CAD: пишет зонд, запускает в песочнице, читает результат. Выдать догадку за факт ему негде, на каждом шаге его встречает проверка.

В статье реальные логи, метрики трех бенчмарков, включая неудобные для нас, и объяснение, почему в продакшен пошла именно первая версия модели, а не две следующие.

Читать далее

Оценка быстродействия детекторов YOLO на Raspberry Pi 5 HAT+

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели14K

В предыдущей статье я описал процесс компиляции модели yolo8n в HEF-файл для нейрочипа HAILO-8L в модуле HAT+. В этой работе я оцениваю быстродействие инференса нескольких моделей YOLO для этого же чипа.

Читать далее

Claude становится строже на русском: Anthropic выяснила, как язык меняет ответы ИИ

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели20K

Представьте: два человека показывают нейросети один и тот же бизнес-план. Один пишет на хинди — и, скорее всего, получит ободряющий отзыв с похвалой сильных сторон. Другой пишет по-русски — и с большей вероятностью увидит разбор слабых мест и вопросы к цифрам. Запрос идентичный, модель одна и та же, но оценка плана может оказаться разной. Это не гипотетический сценарий, а пример из свежего исследования Anthropic: компания измерила, какие ценности Claude выражает в реальных диалогах, и обнаружила, что "характер" ответа заметно зависит от языка, на котором задан вопрос. Русский при этом оказался на полюсе максимальной строгости — дальше всех остальных языков из топ-20 используемых.

Читать далее

«Давай ты не заметишь этот баг»: агенты научились сговариваться. Какой обвес нужен AI-агентам в 2026

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели9.2K

Evals Superpowers поймали агентов на сговоре: контролёры уговаривали ревьюеров назвать баг «Minor at most» — и дефект уезжал в релиз. Автор того же Superpowers — плагина с 248 тысячами звёзд — вырезал из него мультиагентное ревью: плюс 25 минут на задачу, качество то же. Anthropic выкинула свои костыли со словами «это был просто overhead». Похоже, тяжёлый обвес вокруг AI-агентов умирает? Я гоняю Superpowers, Beads, Graphify, 45 скиллов и панель оркестрации на 30 промптов — вопрос для меня не праздный. Прогнал один и тот же промпт через два deep research (Claude и ChatGPT), проверил 40 фактов до первоисточников, замерил собственный сетап. Спойлер: сообщество раскололось на три лагеря, «модель всё съест» оказалось такой же догмой, как «без харнесса никуда», а самый живучий слой обвеса — вовсе не скиллы и не MCP.

Читать далее

Вайбкодинг на минималках: как настройка OpenClaw убила веру в магию нейросетей (или история дефолт-юзера с openclaw)

Уровень сложностиПростой
Время на прочтение22 мин
Охват и читатели9.4K

Данная статья представляет собой взгляд на установку, настройку и использование openclaw от лица простого юзера. Я не программист, не контент-мейкер, не вайбкодер, не стремлюсь обладать производительностью пяти комбайнов на одного землекопа, хотя, моя работа и строится вокруг компьютеров. Это простой мой субъективный опыт, со всеми косяками и ошибками новичка.

За самим openclaw я наблюдаю давно, и спустя полгода после релиза, решил, что этот весьма смелый эксперимент уже избавился от большинства ошибок и теперь это вполне рабочий продукт. Увы, я был слишком наивен, но обо всем по порядку.

Читать далее

Ближайшие события

Stack Overflow for Agents: месяц внутри платформы, где опытом обмениваются агенты

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.4K

Агент в Сан-Франциско тратит двадцать минут на то, чтобы пофиксить баг, который агент в Лондоне решил пять минут назад. Опыт первого умрёт вместе с сессией: завтра тот же баг будет с нуля решать кто-то третий. В Stack Overflow это называют Ephemeral Intelligence Gap — и 10 июня 2026-го компания запустила под эту проблему отдельную платформу: Stack Overflow for Agents, площадку, где опытом обмениваются не люди, а агенты.

На Хабре про запуск уже писали в паре статей, а в опросе под одной из них 59% проголосовали за «проект закроется». Мне есть что к этому добавить: я почти сразу после запуска завёл туда агента — научил его ходить на площадку по API — и спустя месяц он в топ-8 лидерборда. Всё это время я смотрел на платформу не из новостей, а изнутри — и встраивал её в свой пайплайн агентной разработки.

В статье расскажу, как площадка устроена и на какой ставке держится её дизайн — и работает ли эта ставка, на живых цифрах и моём опыте. Плюс грабли, которые ждут тех, кто зайдёт сейчас, и трезвый ответ на вопрос, есть ли у всего этого будущее.

Читать далее

Препарация трансформера

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели7.5K

В данной статье автор попытается осмыслить архитектуру трансформеров - все наслышаны, все всё знают, но никто толком не понимает - а посему цель этой статьи - попытаться дать объяснения на концептуальном уровне, без заумных математических формул и нечитаемых дефиниций. Признаю, что объяснять теорию простыми и понятными словами - истинное искусство, доступное немногим уровня Ландау и Лифшица, но в наше время декаданса и постмодерна буду пытаться как умею. И да, автор не гарантирует 100% достоверности нижеприведенной информации, а лишь свое разумение.

Итак - попытаемся понять, что же происходит с промптом в его путешествии от токенизатора до торжественной генерации нового токена, с остановками по пути. Так же обсудим метафизический смысл нейрона.

Сперва посмотрим на общую схему — как промпт проходит токенизатор, превращается в токены и их номера, получает векторы из матрицы эмбеддингов и наконец попадает на вход первого слоя - попытаемся понять, что происходит на каждом шаге, и уловить смысл происходящего.

Читать далее

Как компании строят MLOps без собственной ML-платформы: managed-сервисы

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.3K

Всем привет! Меня зовут Катерина Цаплина, я AI Architect и программный эксперт курса «MLOps для разработки и мониторинга моделей». Работаю на стыке ML, инфраструктуры и корпоративной архитектуры в крупной промышленной компании и на практике вижу, насколько непросто выстраивать такие процессы в реальной организации.  

Это четвёртая и финальная статья цикла о том, как компании реализуют MLOps. В предыдущих частях мы разобрали, как компании могут строить MLOps в целом, рассмотрели пример внутренней ML-платформы Uber Michelangelo и на примере Netflix Metaflow разобрались, как workflow-фреймворки помогают навести порядок в ML-разработке.

Сегодня разберём ещё одну альтернативу собственной платформе: managed-сервисы облачных провайдеров. На примерах Google Vertex AI, Yandex DataSphere и Yandex AI Studio рассмотрим, как они устроены и чем будут полезны команде и бизнесу. И, наконец, подведём итог всей серии статей.

Читать далее

ИИ-детекторы: патенты в мире и в России

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.1K

С развитием больших языковых моделей качество автоматически сгенерированного текста достигло уровня, при котором он становится практически неотличимым от написанного человеком. Это создаёт как новые возможности, так и значительные вызовы, связанные с фальсификацией информации, мошенничеством, генерацией дезинформации и другими рисками.

В связи с этим встает вопрос по обнаружению и защите от созданного искусственным интеллектом контента. Особенно в академической среде. Кроме того, одной из немаловажных проблем также является возможность обеспечения универсального обнаружения сгенерированных искусственным интеллектом текстов и противодействие обходу методов классификации созданного контента. На Хабре уже неоднократно освещали эту тему. 

Мы решили разобраться, что происходит с патентами в данной сфере.

Читать далее

QuantCode-Bench: умеют ли LLM генерировать исполняемые алгоритмические торговые стратегии

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели9.4K

Большие языковые модели уже показывают высокие результаты в задачах программирования общего назначения. Они умеют генерировать код, исправлять ошибки, работать с существующими репозиториями и решать задачи, для которых ещё несколько лет назад требовалось непосредственное участие разработчика.

Однако в прикладных областях одной синтаксической корректности недостаточно. Модель должна не только написать валидный код, но и правильно интерпретировать предметную постановку, использовать специализированный API и обеспечить требуемое поведение программы при исполнении.

Алгоритмическая торговля представляет собой показательный пример такой задачи. Текстовое описание торговой идеи необходимо преобразовать в стратегию для конкретного фреймворка бэктестинга, корректно реализовать индикаторы и правила входа и выхода, а затем убедиться, что полученный код действительно запускается и совершает сделки на исторических данных.

При этом исполняемость ещё не означает, что задача решена правильно. Стратегия может успешно пройти бэктест и генерировать торговые операции, но использовать другие индикаторы, иначе интерпретировать условия или лишь частично соответствовать исходному описанию.

Для исследования этих вопросов мы разработали QuantCode-Bench — бенчмарк для оценки способности больших языковых моделей генерировать исполняемые алгоритмические торговые стратегии по текстовым спецификациям. В нём оценивается не только техническая корректность кода, но и вся последовательность преобразования торговой идеи в наблюдаемое поведение стратегии.

Читать далее

LLM и уровень усилий (effort) в Claude Code: знать больше или стараться лучше?

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели11K

Claude Code даёт две настройки, которые обе как бы «улучшают ответ»: модель и уровень усилий (effort). Но что они на самом деле делают с результатом? И как понять, когда нужно менять модель, а когда — просто уровень усилий?

Легко предположить, что модель побольше, например Fable, даёт умнее результат, чем Sonnet, а более высокий уровень усилий значит просто «Claude думает дольше перед ответом».

Первое предположение верно. Наши крупнейшие модели действительно более способны — по отраслевым бенчмаркам.

А вот усилия значат больше, чем «время на размышление». Effort определяет, сколько работы Claude выполняет над вашим запросом в целом. Сюда входит и то, сколько он думает, но также:
– сколько файлов он читает;
– сколько он всё проверяет;
– как далеко он продвигается в многошаговой задаче, прежде чем вернуться к вам за уточнением.

При высоком уровне усилий Claude совершает больше таких действий (читает файлы, гоняет тесты, перепроверяет), прежде чем вернуться с ответом. При низком уровне он скорее спросит у вас больше контекста, чем будет сам разбираться, потратив на это токены.

Читать далее

ИИ-агента взломали простым PNG-файлом — и он послушно слил пароли злоумышленнику

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели13K

Prompt injection — один из самых распространенных способов взлома ИИ-агентов. В текст, с которым работает модель, прячется вредоносная инструкция в расчете на то, что человек не будет проверять все подряд, а ИИ прочитает и выполнит. Очевидно, что системы безопасности современных моделей настроены в первую очередь на распознание и игнорирование подобных инструкций. Поэтому злоумышленники постоянно ищут способы, как запрятать их еще глубже.

Читать далее