Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 226,39
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Есть ли у ИИ клиническое мышление — или он просто удачно угадывает

Время на прочтение6 мин
Охват и читатели14K

Если вы обратитесь к врачу, например, с болью в груди, он не сможет прямо с порога назвать ваш диагноз. Сначала выслушает, задаст вопросы, составит список возможных вариантов и назначит анализы, чтобы поэтапно их проверить. Нейросетям же на ответ нужно несколько секунд, они звучат убедительно и почти всегда попадают в цель. Появляется соблазн — открыть ChatGPT и быстро выяснить, чем лучше лечиться. 

В 2026 году вышло несколько исследований, где ученые попытались разобраться, что стоит за этой уверенностью языковых моделей, и насколько можно доверять таким ответам. 

Читать дальше

Выбираем лучшую нейросеть для видео 2026

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели16K

Привет Хабр!

В прошлых годах видео от нейросети было заметна по характерным огрехам. По плывущим лицам, лишним пальцам и кривому движению. Как дела обстоят в середине 2026-го? 

Мы взяли пять топовых генераторов видео — Veo 3.1, Kling v3 Omni, Sora 2 Pro, LTX-2.3 Pro и Grok Imagine Video 1.5 — и прогнали их через 7 одинаковых сценариев. Одинаковые промпты, одинаковые настройки, равные условия. От средневекового рыцаря до жонглёра, кота-паникёра и Уилла Смита, уминающего спагетти. 

Погнали.

Читать далее

Переиспользуем Python-функции между проектами — без переписывания и передеплоя

Время на прочтение6 мин
Охват и читатели14K

У меня есть функция. Крошечная - десяток строк, которые приводят суммы из платёжек к нормальному виду: "1 234,50 ₽" превращают в 1234.5. Ничего гениального. Но я писал её, кажется, раз пять. В парсере банковских выписок, в импортёре заказов, в отчёте для бухгалтерии, в скрипте, который потом выкинул, и ещё где-то, о чём уже забыл.

И каждый раз - чуть по-другому. Где-то забыл про неразрывный пробел. Где-то евро вместо рубля. В одном месте нашёл баг с минусом у отрицательных сумм и починил - а в остальных четырёх копиях он так и остался, потому что кто вообще помнит, где ещё живёт этот код.

Если что-то из этого знакомо - думаю, дальше будет полезно. Это первая из нескольких статей про splime - инструмент, который вырос ровно из этой задачи: переиспользовать код между проектами, не копируя его. Начну с общей картины: что это, зачем и как выглядит в работе.

Читать далее

Слишком просто, чтобы быть правдой? GPT-5.6 выдал доказательство 50-летней математической гипотезы

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели32K

10 июля, на следующий день после публичного запуска GPT-5.6 Sol Ultra, OpenAI заявила, что ее флагманская модель нашла доказательство гипотезы о двойном покрытии циклами — одной из самых известных открытых задач теории графов, стоявшей около полувека. По словам сотрудника OpenAI Итана Найта, модель справилась меньше чем за час, задействовав 64 параллельных сабагента. Сразу стоит отметить, что пока доказательство только проходит проверку математиками — и на данном этапе больше интересен подход, который OpenAI применила при решении задачи.

Читать далее

Mamba: архитектура, которая шла убивать трансформеры

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели17K

В декабре 2023 по ML-тусовке прокатилась волна заголовков в духе «трансформерам конец». Поводом стала статья двух исследователей — Альберта Гу и Три Дао — со скучным названием: «Mamba: моделирование линейно-временных последовательностей с использованием селективных пространств состояний». Внутри была архитектура, в которой не было механизма внимания, того самого attention, на котором держится весь современный тир-лист нейронок. И при этом она работала на длинных текстах в несколько раз быстрее трансформера, при меньшем расходе памяти.

Прошло уже много времени, так что не будет спойлером сказать, что свой трон трансформеры не потеряли. Но история на этом не закончилась, и развязка интереснее, чем «очередной хайп-трейн не взлетел». 

Читать далее

Энтузиаст запустил GLM-5.2 на ноутбуке с 25 ГБ RAM: без дистилляции, но на скорости от 0,05 токена в секунду

Время на прочтение3 мин
Охват и читатели22K

Разработчик-одиночка под ником JustVugg представил Colibri — движок, который запускает открытую модель GLM-5.2 с 744 миллиардами параметров на обычном компьютере с 25 ГБ оперативной памяти. Для сравнения, даже 2-битный квант моделей этого семейства требует порядка 220 ГБ памяти. На момент написания текста проект собрал более двух тысяч звезд на GitHub.

Читать далее

1002 хендоффа за 60 дней: как я собрал шину координации для 12 Claude-агентов

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели13K

Шестьдесят дней назад я держал всю координацию своего SaaS в голове. Двенадцать вкладок Claude Code, в каждой своя роль: тимлид, аналитик, тестировщик, медиабайер. Я переключался между ними и был единственным местом, где эти вкладки узнавали друг о друге.

Сейчас в очереди 1002 задачи, из них 954 закрыты. Медиана от постановки до закрытия составляет 47 минут. Вся координация умещается в 600 строк Python на стандартной библиотеке и один markdown-файл.

Статья про то, как устроена координация. Не про то, что я попробовал модный инструмент, и без советов «промптите лучше».Три подхода, которые не сработали. Один, который сработал. Отказ, стоивший мне двух рабочих окон. И метрики, которые я не приукрашивал.

Кода в открытом доступе нет, это внутренний инструмент, а не библиотека. Но механизмы я показываю снипетами, их хватит, чтобы собрать своё.

Читать далее

Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Современный поиск по видеоконтенту — это высоконагруженная система, требующая молниеносной реакции и безупречной релевантности. Сервис VK Видео оперирует колоссальной базой в 500 миллионов видеороликов и ежедневно обрабатывает около 10 миллионов запросов пользователей. При времени ответа в 0,5 секунды и нагрузке в 1800 RPS алгоритмам необходимо моментально находить именно тот контент, который ожидает увидеть зритель. Однако развитие алгоритмов ранжирования невозможно без качественных данных, на которых они обучаются. 

Традиционный подход с использованием ручной разметки асессорами долгое время оставался индустриальным стандартом, но на масштабах сотен тысяч видео он неизбежно становится бутылочным горлышком продуктовой разработки.

Меня зовут Владислав Чернышев, я руководитель группы качества поиска по видео в AI VK. В этой статье подробно расскажу про путь перехода от классической ручной разметки к гибридной VLM-системе, разберу ошибки и инфраструктурные барьеры, которые пришлось преодолеть для кратного ускорения процессов подготовки обучающих датасетов и офлайн-оценки качества поиска.

Переходим к VLM-системе

Походка за двадцать минут и миллион рублей: что RL сделал с двуногими роботами и во что упёрся их «мозг»

Уровень сложностиСредний
Время на прочтение23 мин
Охват и читатели8K

За один 2026 год двуногие роботы успели пробежать полумарафон быстрее человеческого рекорда, довести публику до того, что CEO пришлось резать роботу ногу ножницами прямо на сцене, и провалить задачу «пройтись ровно» на презентации за миллионы долларов. Разбираю с первоисточниками, почему походка стала дешёвой инженерией — 20 минут на одной видеокарте, — а «живой» робот упирается в ватты, переполняющийся контекст и отсутствие непрерывного обучения.

Читать далее

Ускоряем обработку изображений в OpenCV на RISC-V: алгоритмическая, низкоуровневая и компиляторная оптимизация

Уровень сложностиСложный
Время на прочтение7 мин
Охват и читатели8.7K

Привет, Хабр! Меня зовут Роман Кузьмин, я занимаюсь развитием фреймворков искусственного интеллекта в YADRO. В этой статье я расскажу о работе по оптимизации алгоритма компьютерного зрения — детекторе углов, основанном на глобальных и локальных свойствах кривизны, который реализован с помощью библиотеки OpenCV под архитектуру RISC-V. 

С коллегами из НГТУ им. Р. Е. Алексеева мы добились лучшей эффективности алгоритма за счет подхода, включающего алгоритмические оптимизации и ручную векторизацию с использованием RVV. Я подробно опишу, что и где мы изменили, а в конце статьи оценю прогресс с помощью тестов на плате Lichee Pi 4a.

Читать далее

Контекстная инженерия: что это такое, как работать с контекстом и почему за это начали платить

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели11K

Вы собрали диалоговую систему — агента с RAG, инструментами и памятью. На коротких диалогах всё работает: модель выбирает нужный инструмент и достаёт данные. Но через несколько десятков итераций агент уже путает инструменты, тянет в ответ старые вызовы и опирается на ошибку, которая раньше попала в контекст.

Новый промпт не всегда решает проблему: важно управлять тем, какая информация попадает к модели перед каждым следующим шагом. Это и называют контекстной инженерией.

Разбираемся, чем она отличается от промпт-инжиниринга, RAG и MCP, почему агент начинает ошибаться и какие приёмы помогают собрать контекст так, чтобы модель не путалась в длинных сценариях.

Показать на коде →

От legacy до промышленной платформы: инженерная эволюция OSA в «Магнит»

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели8.8K

Как мы провели проект через четыре «эпохи» — от ручных запусков на Windows‑планировщике до Spark + k8s на масштабе сети

Привет, Хабр! Меня зовут Имиль Валиуллин, я тимлид команды разработки платформы OSA. В предыдущих статьях цикла On Shelf Availability (OSA) уже разбирали с разных сторон: что такое OSA как продукт, как устроен алгоритм детекции аномалий и весь конвейер генерации сигналов — эвристики, ML‑модели, фильтры, обратная связь, A/B и оценка эффекта (ссылки на предыдущие статьи: 1, 2, 3). В этой статье мы раскрываем следующий слой — инженерный. Потому что всё перечисленное было бы невозможно без большой работы под капотом: данных, транспорта, оркестрации, SLA, мониторинга, качества данных, обратной связи, API и доставки сигналов в торговые точки. Многие забывают, что даже самая крутая ML‑модель — это только верхушка айсберга. Результат появляется только тогда, когда под ней есть надёжный фундамент: чистые данные, стабильный транспорт и бесперебойная доставка. Как говорится, garbage in — garbage out, и наоборот: качественный фундамент позволяет получить качественный результат.

Главная мысль, которую мы хотим донести: алгоритмы сами по себе не создают эффект. Эффект появляется только тогда, когда вокруг них построена инженерная система, которая каждый день стабильно считает, доставляет, проверяет и масштабирует результат. 

Показать это мы хотим через эволюцию продукта — от legacy и ручных запусков до промышленной платформы, работающей на масштабе сети. С точки зрения пользователя это всё тот же продукт — сигналы на торговых точках (ТТ), помощь сотрудникам магазина, рост доступности товара. Но под капотом OSA прошёл несколько серьёзных инженерных перерождений, которые мы для удобства назвали «эпохами»: каменный век, бронзовый, железный и индустриальная эпоха. 

Читать далее

Конец «структурного одиночества»: зачем ритейлу мультиагентные ИИ-платформы

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.1K

Категорийный менеджер крупной торговой сети ежедневно принимает десятки решений, влияющих на миллионы рублей маржи. У него есть дашборды, витрины данных и отчеты, но в момент сложного выбора он остается один на один с ситуацией... 

Привет! Меня зовут Алексей, бизнес-архитектор в GlowByte. Больше 15 лет работаю в бизнесе, более 7 лет – в сфере ИТ. Разрабатываю концепцию мультиагентной ИИ-платформы для крупных торговых сетей. Сегодня в статье разбираю основы новой эпохи автоматизации в ритейле: почему обилия разрозненных данных больше недостаточно и как переход к мультиагентным ИИ-системам (ИИ-напарникам) меняет правила игры на рынке федерального ритейла. Итак, поехали!

Читать далее

Ближайшие события

Как оценить библиотеку для ИИ-агентов без слепой проверки финального ответа

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели6.3K

ИИ-агент может вернуть правильную строку и при этом пройти к ней самым дорогим маршрутом: читать лишний код, угадывать API, падать на ошибках и заново собирать решение. Для разработчика библиотеки это уже не косметическая проблема, а новый слой качества инструмента. На примере transformers разбираемся, как устроить стенд оценки, который смотрит на путь агента: трейсы, токены, время, ошибки и поведенческие маркеры.

Читать далее

From Wizard to Warlock: магия в D&D как метафора эпохи LLM

Время на прочтение4 мин
Охват и читатели6.4K

Привет, я Саша Овчинников, старший специалист по тестированию в Контуре. 👋 Последние несколько лет я активно пользуюсь LLM для достижения своих личных целей. Но, пожалуй, самым интересным опытом для меня стало даже не использование LLM в собственных проектах: я начал показывать эти инструменты другим людям.

Читать далее

Чек-лист тестирования поисковой системы: от engine sanity до RAG и графов знаний

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели4.8K

Чек-лист для тестирования поисковых и RAG-систем — от базовой работоспособности поискового движка до качества генерации, агентных сценариев и поведения на неполных данных. Шесть уровней проверок, сводная таблица с инструментами для каждого уровня и глоссарий из 50+ терминов. Проверку стоит организовывать по порядку, нет смысла гонять RAG-метрики, если система не проходит Уровень 0, то проблема может быть в том, что поиск не находит документ из-за опечатки в запросе, а не в качестве генерации.

Читать далее

FINESSE-Bench: как мы обновили финансовый бенчмарк для LLM

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели4.6K

В Лаборатории искусственного интеллекта «Финама» мы изучаем и развиваем применение ИИ в финансовом домене: от бенчмаркинга LLM до прикладных сценариев в трейдинге, аналитике и управлении рисками. В предыдущей статье мы рассказывали о первой версии нашего набора бенчмарков для оценки финансовых знаний моделей. С тех пор проект вырос, получил отдельную страницу FINESSE-Bench и заметно изменился — и по объёму, и по качеству, и по строгости методологии.

Почему нам вообще важна эта тема? Потому что в финансах недостаточно проверить модель на нескольких популярных открытых QA-бенчмарках и сделать вывод, что она «хорошо понимает домен». На практике мы постоянно видим, что сильные результаты на привычных публичных наборах данных далеко не всегда переносятся на более прикладные, экзаменационные или ориентированные на трейдинг задачи.

По этой причине мы продолжаем развивать FINESSE-Bench как набор бенчмарков, который позволяет оценивать не только среднюю точность модели, но и то, как она ведёт себя при росте сложности, как переносит качество между разными типами задач и насколько уверенно работает в специализированных финансовых сценариях.

В этой статье мы хотим показать, как проект изменился после первой публикации. Мы обновили часть данных и исправили проблемные вопросы в CFA-like Level 1, добавили новый набор данных по техническому анализу — CFTe-like Level 1, расширили пул моделей, усилили расчёт метрик за счёт бутстрап-оценки и аккуратного агрегирования результатов по группам бенчмарков, а также отдельно посмотрели на различающую способность и насыщение самих наборов вопросов.

Читать далее

Жизнь после RAG: MCP, логи и автоматический анализ тикетов Jira

Время на прочтение14 мин
Охват и читатели6.9K

Привет, Хабр! Меня зовут Илья Парамошин, я ведущий инженер в МТС Web Services. В прошлый раз я рассказывал об архитектуре RAG-помощника для технической поддержки: индексации Confluence и Jira, гибридном поиске, генерации ответов с цитатами и оценке качества поиска. А недавно мы опубликовали продолжение — о том, как построили ИИ-агента для анализа тикетов.

После внедрения RAG инженеры стали быстрее находить инструкции и регламенты, однако расследование инцидентов требовало также работы с логами, базами данных и Jira. Мы не стали переписывать RAG, а начали развивать его как платформу вокруг трех задач: единый интерфейс, доступ к эксплуатационным данным и автоматизация анализа тикетов. Поиск остался ядром, но вокруг появились сервисы для интерактивного и фонового использования. Теперь подробнее разберем архитектуру, причины, по которым вынесли компоненты, и путь тикета от создания до комментария.

Читать дальше

Создание харнесса для код-агентов под enterprise-фреймворк на Java

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6K

Вайб-кодинг, или AI-assisted development, отлично работает на уровне прототипа: агент получает текстовое ТЗ и быстро собирает первый рабочий вариант. Но в корпоративной разработке этого мало.

Проблема начинается там, где нужно не просто написать код, а собрать полноценное корпоративное приложение. В Джеймикс между «экран открылся» и «система действительно работает как надо» лежит пропасть.

В какой-то момент мы задались вопросом: можно ли научить ИИ-агента проходить этот путь самостоятельно? Можно, если собрать вокруг него харнесс (англ. harness). Именно о нем статья.

В Джеймикс мы строим этот мост как инженерный харнесс: набор скиллов, инструментов и проверок, который помогает довести работающий прототип до реально работающей системы. Для его строительства мы используем агентную платформу KodaCode (далее — Koda) в собственной разработке на Джеймикс и регулярно гоняем ее на бенчмарках. Если оценивать по делу, Jmix-задачи агент решает уверенно. Разброс от сессии к сессии есть, мы видим его в собственных прогонах, и строгие pass/fail-бенчмарки его даже преувеличивают. Поэтому ставка не на идеального агента: обвязка и контроль не дают этому разбросу попасть в ваш продакшен. Это SKILLS.md под Джеймикс, преднастроенные инструменты и проверки на выходе. 

Ниже разберем шесть составляющих такого харнесса. Мы собрали их в KodaCode для Jmix-проектов: пакет навыков, преднастроенные инструменты и проверки на выходе. Это можно собрать самостоятельно, но на практике такой путь занимает месяцы проб и ошибок.

Читать далее

Своя GPT-like LLM по WH40K с нуля. Часть 1: токенизируем Империум

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели7.4K

Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. Для погружение во вселенную я решил обучить LLM на лоре Warhammer40K. И чтобы было интереснее, код этой LLM я решил написать сам, на голом pytorch (ну почти).

Данная статья - первая в цикле статей по созданию и обучению GPT-like LLM с нуля. В них я постараюсь рассказать, как работают Decoder-only модели, как обучить небольшую LLM, сколько это заняло у меня времени.

Читать далее