Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 279,17
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

ИАД x Сайбокс

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.2K

Если нет времени читать всё, то вкратце: в октябре 2025 года отрасль OCR‑моделей для распознавания бухгалтерских документов пережила настоящий взрыв качества их работы. Благодаря этому нам удалось увеличить точность и производительность наших моделей в продуктах ИАД и Сайбокс:

- Сократили длительность обработки счёта с 3–4 минут до 30 секунд с помощью замены тяжёлой Qwen2.5-VL-72B на оптимизированную nanonets‑ocr2-3b.

- На 70% уменьшили объём проверок вручную, что особенно полезно для инструмента по сравнению документов (модель перестала добавлять мусор, не выдумывает числа и не искажает структуру).

- Повысили пропускную способность в 5 раз на том же оборудовании. Сейчас модель весит меньше, и больше ресурсов остаётся на поточную обработку.

- Таблицы теперь распознаются как HTML — за 1 секунду. Раньше приходилось гонять результат OCR через вторую LLM‑модель, чтобы распарсить таблицы.

Если интересно, как мы к этому пришли и какую пользу от проведённого нашей командой исследования получили наши продукты, то заходите.

Статья состоит из двух частей: первая про бизнес, вторая про технические подробности реализации и исследования.

Читать далее

Президент OpenAI попросил ChatGPT проверить свой сайт. Модель нашла 13 дыр за 15 минут

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.6K

Президент и сооснователь OpenAI Грег Брокман попросил ChatGPT проверить безопасность собственного сайта — и получил список из 13 проблем за четверть часа. Сайт при этом самый скучный из возможных: статичная страница на AWS, спрятанная за Cloudflare, ломать там на первый взгляд нечего. Модель (публичная GPT-5.6 Sol, никаких внутренних сборок) нашла, что для домена не настроена защита от подделки писем — любой мог рассылать почту от имени Брокмана; что в коде страницы висит древняя версия JS-библиотеки jQuery с известными уязвимостями; и что трафик между Cloudflare и сервером на AWS ходит по обычному нешифрованному HTTP.

Читать далее

Квантизация LLM: как запихнуть 70B модель в свою видюху

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели5.5K

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.

Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

Материал будет полезен как мимо проходящим ИИ-любопытствующим, так и ML-инженерам и специалистам по инференсу LLM, которые хотят запускать большие модели на ограниченном железе. Покажу, как все это гонять на практике и с кодом.

Читать далее

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

Уровень сложностиСредний
Время на прочтение25 мин
Охват и читатели5.8K

Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски?

Мы решили проверить — и быстро выяснили, что ответ сложнее, чем кажется. Штатная система понимала только китайский, Whisper ошибался на коротких командах, LLM добавляла задержку, а динамик съедал начало фразы после паузы. «Беги» превращалось в «begin», а «встань» — в «Таня».

Рассказываем, как нам удалось построить свой собственный модульный русскоязычный стек, разделить команды и диалог, ускорить синтез речи, и добиться реакции за доли секунды. С архитектурой, тестами и новыми нерешёнными задачами. Полный гайд как заставить робота ростом 173 см и весом 75 кг слушать вас и понимать!

Читать гайд

От LLM-портала до фабрики внутренних агентов: как в Авито строят корпоративного ассистента «Виталик»

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели8K

По данным McKinsey, к концу 2025 года 71% компаний пробовали интегрировать искусственный интеллект как минимум в один из бизнес-процессов. Звучит мощно, но по отчётам MIT из всех пилотов в реальный продакшн переезжают около 5%.

Разрыв между демо и реальностью заключается в том, что продакшн-готовое решение должно отвечать на сложные вопросы: 

- как из множества разносторонних источников выбрать ту информацию, которая приведёт к успешному выполнению процесса?

- как обогатить языковую модель инструментами, при помощи которых она может довести процесс до конца?

- как оценить качество траектории, по которой движется модель, пока решает задачу?

Мы нашли ответы на эти вопросы с помощью системы, которая постепенно превращает внутренние знания и процессы Авито в корпоративных агентов. Расскажу про неё подробнее.

Привет! Меня зовут Никита, я старший DS-инженер в Авито. В этой статье расскажу, как мы строили «Виталика» — нашу корпоративную экосистему ИИ-агентов. Отвечу на три главных вопроса: как процесс становится агентом, как сделать систему production-ready и куда развивать её дальше.

Статья будет полезна ML-инженерам, AI-архитекторам и техническим лидам, которые строят агентные системы на базе LLM в корпоративной среде.

Читать далее

Как продвигать твиты в X: разбираем рекомендательный алгоритм Twitter

Уровень сложностиСредний
Время на прочтение19 мин
Охват и читатели9.8K

13 августа сайт X опубликовал значительно обновлённую версию исходного кода рекомендательной ленты. В репозитории под лицензией Apache 2.0 выложили код модели Phoenix, реальные значения основных коэффициентов ранжирования, механизмы отбора кандидатов, фильтрации видимости, поддержки новых авторов и обеспечения разнообразия ленты.

Заметная доля пользователей X предпочитает называть сайт микроблогов по старинке — Twitter. Другая неискоренимая вредная привычка — чтение алгоритмической ленты. Чтобы увеличить охват микроблога, было бы неплохо хотя бы в общих чертах разобраться, как работает рекомендательный алгоритм, а затем рассмотреть все основные коэффициенты. Этим в данной статье мы и займёмся.

Читать далее

Anthropic публикует системные промпты Claude. Разбираем, как они менялись от Haiku 3 до Opus 5

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели19K

Что Claude получает ещё до первого сообщения пользователя, зачем модели отдельные инструкции по работе с инструментами и длинными задачами и какие идеи из system prompts можно использовать в собственных AI-ассистентах.

Когда мы отправляем Claude первый запрос, для пользователя диалог только начинается.

Для модели нет.

До пользовательского сообщения Claude уже получает системную инструкцию, которая задаёт контекст работы: кто модель, какая сейчас дата, как оформлять ответы, как работать с доступными инструментами, что делать с неопределённостью и какие ограничения учитывать.

Anthropic публикует такие инструкции в официальной документации в разделе System Prompts. Причём там сохранена история изменений: от Claude Haiku 3 и Opus 3 до Fable 5 и Opus 5.

Получается довольно интересный датасет для тех, кто работает с LLM не только через обычный чат.

Можно посмотреть, как за два года изменился подход Anthropic к системным промптам и что компания считает действительно важным объяснить модели до того, как пользователь вообще сформулировал задачу.

И некоторые выводы вполне применимы к собственным AI-агентам.

Читать далее

Что спрятано в 2500 слоях: как по весам нейросети восстановили MD5

Уровень сложностиСложный
Время на прочтение11 мин
Охват и читатели13K

Что делать, если нейросеть из 2500 слоёв выглядит как чёрный ящик, а привычные методы анализа не помогают? В статье разбираем, как по весам и структуре модели удалось восстановить скрытую программу, распознать MD5 и дойти до ответа через механистическую интерпретируемость, SAT и несколько тупиковых гипотез.

Читать разбор

Зачем компаниям строить собственный AI и как это делать?

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели7.8K

Привет! Меня зовут Саша Журавлев. Я венчурный инвестор и основатель фонда Mento VC. Мы инвестируем в технологические компании на стадиях Seed / Series A в США, а в своем телеграм-канале рассказываю, как вижу рынок и принимаю инвестиционные решения.

Читать далее

Как управлять reasoning effort в LLM

Уровень сложностиСложный
Время на прочтение23 мин
Охват и читатели5.4K

Как современные LLM получают разные настройки reasoning effort: системные промпты, SFT, RLVR, штрафы за длину, reasoning budgets и on-policy-дистилляция. Разбираем DeepSeek V4, Nemotron 3 Ultra, Kimi K2.5 и K3, GLM-5, Qwen3 и Inkling.

Читать далее

AI R&D DAY: два трека об исследованиях и продуктизации ИИ

Время на прочтение3 мин
Охват и читатели5.6K

Привет, Хабр!

17 сентября 2026 года в Москве и онлайн пройдет AI R&D DAY. Это конференция для исследователей, ML‑инженеров, AI‑архитекторов, руководителей R&D‑команд и специалистов, которые превращают экспериментальные разработки в работающие продукты.

Один из фокусов конференции — NextGenAI, проект команды R&D SberAI, посвященный технологиям следующего поколения. Команда поделится результатами исследований, расскажет о развиваемых продуктах и представит технологические направления, над которыми работает сейчас.

В программе 22 доклада на двух сценах, панельная дискуссия, постерная сессия и выставка. Участие бесплатное.

Читать далее

Deep Agents: open source-обвязка на LangGraph

Уровень сложностиСредний
Время на прочтение22 мин
Охват и читатели9.1K

Привет, на связи команда GigaChain! Мы занимаемся агентными системами и развиваем набор open source-решений для подключения агентов к GigaChat API.

LangChain развивается с 2022 года и выросла в одну из самых популярных экосистем для агентов: у основной библиотеки более 140 тысяч звёзд на GitHub. Благодаря LangGraph — движку, который исполняет агента как граф с состоянием, — с её помощью собирают и простые цепочки вызовов, и сложные автономные агенты, ведущие задачу на сотни шагов. Поверх этого стека команда LangChain выпустила Deep Agents — готовую агентную обвязку (agent harness): рабочую среду с файловой системой, оболочкой, планировщиком, субагентами и памятью, в которую остаётся лишь поместить модель.

Сегодня мы подробно разберём эту обвязку: из чего она состоит и как собрать на ней агента, работающего на GigaChat.

Читать далее

Кронекером по Фишеру: как при сжатии LLM учесть кривизну второго порядка и не умереть

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели7.4K

Привет Хабр! На связи Вика Чекалина из команды «Мультимодальный ИИ» AIRI. Сегодня мы поговорим о том, как выкручиваться, когда вычислительных ресурсов мало и для деплоя необходимо сжать LLM, но так, чтобы потеря в качестве была минимальной. Логично, что нужно использовать дополнительную информацию — например, матрицу Фишера (FIM), которая содержит в себе информацию о важности и взаимодействии параметров модели. 

Но FIM реальных LLM слоев просто огромные, и работать с ними напрямую вычислительно тяжело или просто невозможно. Люди придумывают различные упрощения: например, можно отталкиваться от предположения, что матрица Фишера диагональна — это сильно сокращает объём памяти, однако корреляция между различными параметрами слоя теряется навсегда. Мы решили не идти на такие компромиссы и придумали метод, который быстро и легко позволяет параметризировать полную недиагональную матрицу Фишера без потери информации о корреляции.

Читать далее

Ближайшие события

[1/8] Fill-in-the-Middle: как модель дописывает код в середине файла

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.6K

Небольшая заметка про Fill-in-the-Middle - способ обучения моделей, который позволяет предсказывать не следующий токен, а код между уже существующими фрагментами. Разберём основную идею (формат PREFIX–SUFFIX–MIDDLE) и посмотрим простой пример его применения для предсказания кода.

Читать заметку

Внутри Anthropic работает Model 2 — сильнее всего, что можно купить. Компания оставила её себе

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.2K

14 августа Anthropic опубликовала второй Risk Report — 186 страниц о том, насколько опасны ее собственные модели. В разделе с будничным названием «Заметки о невыпущенных моделях» компания между делом сообщила: внутри работает модель под кодовым именем Model 2. Она сильнее Claude Mythos 5 — самой мощной модели, к которой Anthropic вообще кого‑либо подпускает; ею пишут код и генерируют данные; выпускать ее не планируют. Axios подал эту строчку как главную новость отчета. Но если дочитать документ, новость там другая — и куда менее уютная.

Читать далее

Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели7.9K

Обучение LLM — это в первую очередь инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или другим расписанием обучения и получать повторяемый внутри команды результат. В этом материале — рассказ команды обучения и инференса моделей RWB о том, как мы с нуля, без загрузки pretrained-весов, обучили текстовую модель на основе гибридной архитектуры Qwen3.5-2B-Base и какие выводы сделали по пути — от сборки датасетов до чтения графиков онлайн-оценки.

Читать далее

Loop Engineering: почему цикл легко собрать и трудно остановить

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели6K

Попробуйте бытовой фокус: вместо того чтобы скинуть кодинг-агенту задачу напрямую, попросите его сначала написать промпт под неё, а потом скормите этот промпт ему же. Часто выходит лучше вашей формулировки.

Но это всего два хода. Цикл начинается там, где система повторяет такое сама: хранит состояние, выбирает следующий шаг, проверяет результат внешним критерием и останавливается по условию или бюджету.

Слоган "хватит промптить кодинг-агентов, проектируйте циклы" собрал миллионы просмотров и оброс гайдами "как печатать альфу 24/7". Я полез смотреть, что там под мемом, и за пару месяцев собрал поверх своей обвязки собственный цикл. Переписывал столько раз, что перестал считать.

Читать далее

Вики из 48 часов видео: конвейер, который не даёт LLM выдумывать

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели7.2K

У меня было 48 часов видеозаписей учебного курса и простая мысль: пересматривать это я не буду никогда. Сырой транскрипт немногим лучше — болото на сотни страниц. Я собрал конвейер, который превратил записи в Obsidian-вики: 47 связанных статей, и каждое утверждение в любой из них — в двух кликах от места в записи, где это было сказано.

Читать далее

ИИ в эксплуатации (AIOps): разбор алертов и автоматизация инцидентов

Уровень сложностиСредний
Время на прочтение20 мин
Охват и читатели13K

В марте 2025 года Gartner сделал то, чего индустрия ждала несколько лет: официально переименовал категорию AIOps в Event Intelligence Solutions. Причина — ИИ-хайп, из-за которого слово «AIOps» превратилось в бессмыслицу: вендоры называли искусственным интеллектом всё подряд, ИТ-директора разочаровались, а инженеры получили ещё один слой непредсказуемой автоматики.

Но потребность никуда не делась. Когда в три часа ночи падает коммутатор, а мониторинг за пару минут высыпает три сотни алертов во все каналы, вам не до «глобальных ИИ-стратегий» — нужен инструмент, который прямо сейчас отделит сигнал от шума и покажет, куда прикладывать руки.

Разбираем реальные, а не маркетинговые возможности ML и LLM в эксплуатации: что уже работает, где границы и с чего начать на своём стеке без дорогих платформ.

Разобрать без хайпа →

Пул‑реквестов от ИИ стало вчетверо больше за полгода. Кто их читает?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели12K

Представьте мейнтейнера open-source-проекта, который утром смотрит на очередь пул-реквестов — присланных на проверку предложений изменить код. Их вдвое больше, чем месяц назад, и заметная часть подписана агентами: Claude Code, Codex, Cursor. Это не гипербола: по данным The Information, число пул-реквестов от ИИ-агентов на GitHub выросло примерно с 4 млн в месяц в сентябре 2025 года до более чем 17 млн в марте 2026-го — вчетверо за полгода. Каждый из них кто-то должен прочитать, собрать, прогнать через тесты и решить, вливать ли в основную ветку. Вопрос: кто именно.

Читать далее