Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 248,44
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как научить ИИ понимать графики: разбираем новый набор данных ChartNet от MIT

Время на прочтение7 мин
Охват и читатели12K

Привет, Хабр! Меня зовут Павел, я ML-инженер и исследователь в области ИИ. Недавно наткнулся на исследование, посвященное проблеме понимания графиков визуально-языковыми моделями (Vision-Language Model, VLM), и решил подробнее разобраться в этой теме.

В наши дни большое количество научных, деловых и политических данных представляется в формате графиков, однако современные VLM решают задачу их анализа лишь частично. Одна из главных причин этого — отсутствие масштабных и разнообразных наборов данных для обучения и тестирования.

Исследователи из MIT и IBM Research предложили оригинальное решение — ChartNet, мультимодальный датасет для обучения моделей анализу и интерпретации графиков. Разберемся, как он устроен и насколько эффективен.

Читать далее

Каким будет AI Engineer через 2 года? Мы обновили магистратуру, вот почему это было неизбежно

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели8.6K

Привет, меня зовут Дмитрий Ботов. Я руковожу AI Talent Hub, магистратурой по искусственному интеллекту в ИТМО, которую мы четыре года назад создавали как гибкую проектную среду без единой траектории для всех.

За это время рынок изменился быстрее, чем образовательные стандарты и названия профессий. ML Engineer долго был нашей главной ставкой, но сегодня компаниям всё чаще нужны специалисты, которые умеют не только работать с моделями, но и встраивать ИИ в продукты, процессы и бизнес.

В статье расскажу, что происходит с привычными ролями, какие профессии выходят на первый план, что на это влияет и почему мы уже сейчас обновили карту ролей в магистратуре, чтобы готовить магистрантов к рынку 2028 года.

Читать далее

Почему «чем проще, тем лучше» не работает на ИИ-классификаторе

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7K

Обучил multi-label классификатор на 15 классов для модерации Discord-сообщества, получил micro F1 = 0.9358 — цифра, с которой можно закрывать задачу и не разбираться дальше. Но стоило посмотреть на precision и recall по каждому классу отдельно, как выяснилось: recall на TOXIC — около 0.78, а для части редких меток test split вообще не подтверждает качество — положительных примеров там почти нет. Разбираю на реальных цифрах и коде: почему агрегированная метрика такое скрывает, как считать вес классов через pos_weight при сильном дисбалансе, почему checkpoint стоит выбирать по macro F1, а не по training loss, и где принцип «чем проще — тем лучше» перестаёт работать при оценке качества классификатора.

Подробнее

Коробка с нейросетями: готовая ИИ-инфраструктура, которая просто работает

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели9.7K

Привет, Хабр! В день, когда весь мир в очередной раз обсуждает «умные» ассистенты, генеративные сети и спорит, заменит ли ИИ разработчиков, хочется немного сместить фокус. Генеративные модели — это вершина айсберга, но весь его вес держится на менее заметном, куда более приземленном ИИ: на системах, которые ежедневно переваривают терабайты данных, считают сложные модели и обслуживают высокопроизводительные вычисления. Меня зовут Вячеслав Дегтярев, я руковожу развитием продуктовых решений в К2 НейроТех, и в этой статье мы как раз поговорим об этой «инженерной» стороне искусственного интеллекта — инфраструктуре и платформах, без которых никакой модный LLM или ассистент в IDE просто не взлетит в проде.

16 июля, во Всемирный день ИИ, особенно заметен разрыв между хайпом и реальностью: с одной стороны — обещания «магии» генеративного ИИ, с другой — очередной упавший инстанс с CUDA-конфликтом и рабочий день, потраченный на согласование доступа к GPU-серверу. Поэтому я предлагаю поговорить о критически важном уровне ИИ — готовой инфраструктуре для ML, которая просто работает и позволяет командам дата-сайентистов запускать эксперименты, а не заниматься администрированием. Ниже — о том, как мы подошли к задачам ИИ и высокопроизводительных вычислений через ПАК‑ML и как организована современная зрелая инфраструктура для внедрения технологий искусственного интеллекта в enterprise-мире.  

Читать далее

Сильнейший открытый ИИ из США обучали с помощью китайской модели. Стартап Мурати представил Inkling

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели15K

Thinking Machines Lab — стартап бывшего технического директора OpenAI Миры Мурати — представил свою первую модель Inkling, к которой компания шла почти полтора года. Inkling — мультимодальная модель с архитектурой "смесь экспертов" (MoE) на 975 млрд параметров, из которых на каждый токен активны 41 млрд. Она работает с текстом, изображениями и аудио, поддерживает контекст до 1 млн токенов и рассуждающий режим. Главное отличие от флагманов OpenAI, Anthropic и Google — открытые веса. Модель уже лежит на Hugging Face, и любой может скачать ее и дообучить под себя.

Читать далее

Персонализация без Big Data: как мы ранжируем новости в Telegram с помощью pgvector и пяти сигналов

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели11K

У меня накопилось 23 Telegram-канала.

Не потому что я специально их коллекционировал. Просто со временем подписывался на новые. В какой-то момент понял, что читаю всего несколько процентов того, что приходит. Остальное просто пролистываю в поисках чего-то интересного.

Проблема здесь простая. Telegram показывает посты только по времени публикации. Самые новые всегда наверху. Неважно, интересна тебе тема или нет. Никакой персонализации нет. Есть только хронология.

Из-за этого появился CleanNews — бот, который собирает посты из ваших Telegram-каналов и формирует персональную подборку.

В этой статье я покажу, как работает его рекомендательный движок. В основе — пять независимых сигналов, pgvector и контрастный вектор. И всё это без огромного обучающего датасета на миллионы записей.

Читать далее

ИИ Qwen3.6-27B запустили на смартфоне: 1 бит на вес и 90% интеллекта оригинала

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели15K

Стартап PrismML представил Bonsai 27B — сжатые версии открытой модели Qwen3.6-27B, младшая из которых стала первой нейросетью такого класса, которая помещается в память смартфона. Веса выложены на Hugging Face под лицензией Apache 2.0, а в демонстрациях PrismML модель работает прямо на iPhone 17 Pro Max — рассуждает, вызывает инструменты и разбирает скриншоты без единого обращения к облаку.

Читать далее

Почему Tesla никогда* не сделает настоящий полноценный надежный реальный автопилот

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели8.3K

Традиционные методы обработки изображений и видео, включая уже раритетные капсульные сети и модные видео‑трансформеры (их ждет та же участь), достигли своего потолка и для решения не самых сложных задач требуют огромных ресурсов. А есть задачи посложнее.

Не самая сложная задача – это Content ID YouTube, на разработку которой компания потратила минимум  $100 млн и 10 лет. Задачу, которую должна решать система: сравнивать видео с видео и ловить пиратский контент автоматически.

Content ID – реально сложная, и по-своему выдающаяся система, про которую до сих пор известно довольно мало. Но даже она, при всех затратах и при всех усилиях лучших инженерных умов, остановилась примерно на половине пути. Хотя казалось бы: нужно всего-то сравнивать все видео с друг с другом. 

Что уж говорить про системы так называемого автопилота, которые тоже работают с видео – но в гораздо более сложной и разнообразной среде. Несмотря на все громкие обещания Илона Маска уважаемого, воз и ныне там.

Разберем на примерах YouTube и Tesla, почему все компании, пытающиеся работать с видео и с компьютерным зрением, шагают по бесконечному тупику, и как наши методы TAPe нашей пока что малоизвестной научно-исследовательской лаборатории щелчком пальца (за которым стоят годы RnD) решают задачи бессильных в данном случае мегакорпораций.

Распознать знание

LLM-wiki против RAG: Оцениваем и сравниваем

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели9.9K

Про LLM-wiki здесь уже было несколько хороших статей (1, 2 и 3), поэтому подробно останавливаться на идее Andrej Karpathy не буду. В двух словах: вместо RAG-ретривера - wiki-агент, вместо чанков из сырых документов - связанные концепт-страницы, вместо обновления - перекомпиляция и поиск «битых» ссылок.

Насколько LLM-wiki лучше, или может быть хуже чем RAG, пусть даже простейший, с обычным векторным поиском? И как их можно сравнивать? Кажется, общепринятой методики оценки ещё не сложилось. Тем не менее я попробовал, и получил неожиданные результаты. Об этом и расскажу, а ещё о методике оценки, о wiki-агенте для тестов, о том что получилось, что - нет, и даже сколько это стоило.

Читать далее

Наём без испытательного срока: как AI-агенты получили должности и влияют на рынок труда

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели9.8K

У AI-агентов уже есть профессии: юрисконсульт, ведущий специалист по внешним коммуникациям, директор контроля работы AI. Это настоящие должности — с обязанностями и зоной ответственности. У некоторых даже с собственной придуманной биографией.

Все три (и еще несколько сотен похожих) произошли из одного и того же места. В октябре 2025-го Anthropic выпустила штуковину под названием skill: папка с инструкциями, которую модель открывает сама, когда задача из промпта совпадает с описанием внутри самого скила.

В переводе на русский — должностная инструкция в текстовом файле, в переводе на айтишный — мастер-промпт. 

Но интересен здесь не только сам формат. Вокруг таких папок уже строится корпоративная инфраструктура: агентам назначают роли, выдают доступы и подключают их к рабочим системам. Крупные компании тратят деньги на внедрение, консультанты зарабатывают на настройке, а при появлении нового плагина падают акции всех компаний в целой отрасли.

В этом материале поговорим о том, зачем вообще одевать папку с инструкциями в костюм сотрудника, кому приносит деньги такая конструкция и как она влияет на бизнес и рынок труда.

Читать далее

Обучаем ИИ видеть то, чего он никогда не видел

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели13K

Задача обнаружения объектов на изображении не нова, подходов к её решению существует масса. Вероятно, самым популярным и известным среди них будет YOLO. Появившись в 2015 году, эта серия систем по сей день используется, когда хочется сделать детекцию быстро, без долгих экспериментов с архитектурой.

Однако, какой бы ни была архитектура, все их объединяет одна и та же проблема — данные. Для полноценного обучения нужны сотни и тысячи изображений, с разных ракурсов, в разных условиях. Если цель — академический проект, обнаружение машин или колосков пшеницы, то найти датасет не составляет проблем. Но что, если датасета нет и/или его невозможно собрать в принципе в нужном объеме? Скажем, редкий дефект в производстве, истребитель новой конструкции? Ждать, пока накопится много брака, или надеяться на утечку чертежей?

Мы провели пару экспериментов с моделью YOLO для проверки гипотезы: как далеко можно уехать, используя исключительно синтетические данные?

Ознакомиться

Как развернуть модель для генерации видео LTX-2 на сервере

Время на прочтение7 мин
Охват и читатели14K

Хотите научиться генерировать видео по тексту или аудио, но не знаете, как это сделать? Wan2.2 отлично работает в ComfyIU, но интеграция в собственные проекты затруднительна. К счастью, есть альтернатива: LTX-2 можно легко запустить без дополнительной обвязки.

В этой статье рассмотрим, как запустить модель LTX-2 на своем облачном сервере.

Читать далее

Перенёс ByteTrack на GPU и ускорил мульти-камерный трекинг в 6 раз

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.2K

GPU-версия ByteTrack, где математика всех камер считается общими батчами: один вызов на все потоки вместо трекера-на-камеру. На 16 потоках это ускоряет трекинг в 6 раз (104 → 17 мс/кадр на RTX 4090). А за первой, «наивной» версией пряталось всего 1.2x — почему, показали три антипаттерна PyTorch, на которых легко застрять и вне трекинга: GPU-вызовы в цикле, заливка кадров на 1.6 ГБ/с вместо 25, и FP16, который тихо съедал по 300 мс на кадре. Все цифры воспроизводимы, есть сравнение с NVIDIA DeepStream и открытый код.

Читать далее

Ближайшие события

Как GPT-5.6 Sol обошла математиков в задаче о длине пути градиентного спуска

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели14K

12 июля флагманская GPT-5.6 Sol Pro после восьми часов размышлений побила лучший человеческий результат в задаче о длине пути градиентного спуска — и оформила его полноценной статьей на 14 страниц с доказательствами, таблицей констант и скриптом для их проверки. Прежний рекорд — оценка 2.29^n — принадлежал людям, но о нем мало кто знал: он так и не был опубликован. Историю двухлетнего противостояния людей и моделей исследователь OpenAI Себастьен Бубек рассказал в треде 10 июля, а уже через два дня объявил о падении рекорда.

Читать далее

Как я добавил LLM в чат друзей, и приказал ей отыгрывать терминатора (и открыл портал в мультивселенную безумия)

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели18K

Забавная история про то, как я решил разбавить актив в своем чате для друзей, добавив самого настоящего Т-800, который мог бы свободно общаться с участниками, не потратив копейки денег на API - чисто бесплатные модели с OpenRouter. Впрочем, впоследствий была попробована и локальная модель.

Подтвердить базу

Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели18K

Об открытых языковых моделях написано много — и почти все статьи посвящены знакомству, в лучшем случае — «медовому месяцу» использования. Бенчмарки, рейтинги «лучших моделей года», полевые тесты на одной задаче, руководства. Гораздо реже говорят, что происходит потом: как ведет себя модель спустя месяцы непрерывной работы, где и почему начинает сбоить, что ломается под нагрузкой и какие инженерные решения постепенно вытесняют первоначальные представления о том, «как надо». 

В WB-Tech мы занимаемся тем, что разворачиваем и сопровождаем открытые модели и агентные системы в собственной инфраструктуре — для внутренних задач и для заказчиков. Это классификация и обогащение входящих заявок, обработка документов, диалоговые системы с вызовом инструментов и другие сценарии, где LLM становятся частью бизнес-процесса, явно выходя за рамки демонстрационных возможностей модели. 

Большинство наших клиентов приходят к локальному развертыванию не из любопытства, а из практической необходимости. Для одних вынос данных во внешний API запрещен требованиями безопасности, другим, экономика облачных моделей перестает нравиться на больших объемах. Поэтому вопрос «зачем держать модель у себя» оставим за скобками: конфиденциальность данных, предсказуемая стоимость при объемах и независимость от чужого API уже давно стали аксиомой в пользу самостоятельного хостинга для целого ряда задач.

Интереснее другое: что меняется после того, как модель начинает жить в продакшене, когда выясняется, что большая часть инженерной работы связана вовсе не с выбором LLM и приходится заново принимать решения об инференсе, промптах, агентной оркестрации, структуре ответов, управлении контекстом, параметрах генерации и даже хранении самих весов модели. 

Читать далее

120 выдуманных ссылок против 8: что агентный поиск делает с галлюцинациями LLM на строительных нормах

Время на прочтение13 мин
Охват и читатели7.8K

Один контрольный эксперимент — и один красивый ложный вывод, который мы чуть не опубликовали

После прошлой статьи о том, почему нормативные документы пришлось превратить в граф, а не просто загрузить их в векторную базу, нас несколько раз спросили одно и то же:

«А если взять GPT или другую топовую модель — неужели она действительно не сможет ответить на вопросы по СП и ГОСТ?»

А недавно тот же аргумент прозвучал в куда более жёсткой форме — на очной защите нашего проекта перед экспертами одной государственной грантовой программы по ИИ. Тезис звучал так: сервис для работы с нормативкой от маленькой команды обречён, потому что крупнейшие компании вкладывают в свои модели несопоставимо больше, — и поддерживать нишевую разработку на этом фоне нет смысла.

Аргумент понятен и звучит убедительно. Спорить с ним словами бесполезно — нужны данные. Так что считайте это исследование нашим развёрнутым ответом. Ниже — 3000 слепых оценок того, что фронтир-модели умеют на строительных нормах «из коробки», и что меняется, если поверх той же самой модели поставить доменный агентный поисковый контур.

Только не ждите вывода «наша система лучше всех LLM вообще» — его не будет. Мы показываем другое: там, где ответ обязан быть проверяемым по нормативному корпусу, агентный контур резко снижает число неподтверждённых ссылок — на одном и том же генераторе.

Заодно расскажем, как мы сами едва не попались — на методике, а не на моделях.

Читать далее

Веб-портфолио с управлением жестами через камеру: полевой дневник

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.7K

Я продуктовый дизайнер. И мне захотелось поэкспериментировать: можно ли уже сейчас сделать полноценное управление сайтом с помощью жестов. Да и ИИшки уже стали достаточно мощными. Так родился этот эксперимент. Для контента взял свое портфолио.

Получилось вот что. Страница встречает полем из частиц. Разрешаешь камеру, и частицы собираются в твоё объёмное отражение. Разделы висят вокруг силуэта и открываются рукой: наводишь палец, пункт заполняется и раскрывается. Текст листается щипком, фотографии берутся в кулак и растягиваются двумя руками. Дизайн при этом намеренно тихий: монохром, костяная типографика на чёрном, единственный цвет живёт внутри 3D-формы. Вся выразительность отдана взаимодействию.

Дальше — грабли по порядку наступания.

Читать далее

Giga4DQM: мультиагентный подход к расследованию качества данных на базе GigaChat

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели11K

Giga4DQM — открытый проект, реализующий концепцию ИИ-агентов для автоматизированного расследования инцидентов с данными и построения целостной картины зависимостей в существующей БД. Система понимает вопросы на естественном языке, самостоятельно анализирует структуру базы, строит граф зависимостей и формирует диагностические запросы. Архитектура не привязана к одной СУБД: в качестве примера взята PostgreSQL, но подход может быть адаптирован к любой системе с развитым каталогом метаданных. В основе — мультиагентная архитектура на основе GigaChat и LangGraph. Код открыт, доступен для тестирования и внедрения.

Читать далее

У ИИ есть душа? Даём LLM характер и эмоции

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9.1K

Если вы когда‑нибудь общались с популярными чат‑ботами или заглядывали на Character.ai, легко поддаться иллюзии, будто на той стороне экрана сидит живой человек. ИИ искусно шутит, сопереживает, злится и подыгрывает. Ведёт себя почти как человек. Но может ли за всем этим скрываться настоящее сознание и душа?

Если говорить кратко и прямо — за экраном только пустота и холодные математические расчеты.

Любая современная языковая модель представляет собой сложный калькулятор статистики, который предсказывает следующее, наиболее вероятное и приятное вам слово. Но не более того.

У LLM нет ни характера, ни настроения, ни личности. То есть ничего того, что свойственно человеческой психике.

Красивый фасад «души» быстро рассыпается в долгих диалогах. В текстовых ролевых играх (AI‑roleplay) это заметно сильнее всего: через 20–30 реплик бот теряет нить разговора, забывает детали и начинает безвольно поддакивать игроку.

Но неужели нельзя сделать ИИ хоть немного человечнее? Дать ему сознание? Возможно ли подарить языковой модели стабильный характер и живые эмоции без необходимости её переобучать? Рассказываем, как мы обошли ограничения нейросетей с помощью внешней программы.

Читать далее