Обновить
512K+

Машинное обучение *

Основа искусственного интеллекта

1 302,86
Рейтинг
Сначала показывать
Порог рейтинга

Исследовательская организация METR опубликовала подробный анализ, который ставит под сомнение реальную эффективность ИИ‑агентов в программировании. Исследователи проверили, насколько результаты одного из главных отраслевых бенчмарков SWE‑bench Verified соответствуют практике разработки с участием живых мейнтейнеров open source‑проектов. Выяснилось, что около половины решений, которые автоматическая система оценки считает успешными, в реальности не были бы приняты в основной код.

В исследовании METR участвовали четыре действующих мейнтейнера трёх популярных репозиториев: scikit‑learn, Sphinx и pytest. Они провели ручной код‑ревью 296 pull‑request, созданных ИИ‑моделями. Среди протестированных систем были Claude 3.5 Sonnet, Claude 3.7 Sonnet, Claude 4 Opus, Claude 4.5 Sonnet и GPT-5.

Разрыв между результатами автоматических тестов и реальным код-ревью: модели ИИ демонстрируют заметно более высокие показатели успешности в бенчмарке SWE-bench, чем при проверке опытными разработчиками, что указывает на переоценку их практической эффективности. Источник: METR.
Разрыв между результатами автоматических тестов и реальным код-ревью: модели ИИ демонстрируют заметно более высокие показатели успешности в бенчмарке SWE-bench, чем при проверке опытными разработчиками, что указывает на переоценку их практической эффективности. Источник: METR.

Рецензенты не знали, написан ли код человеком или машиной. В результате оказалось, что в реальной разработке такие решения принимаются значительно реже: уровень одобрения оказался примерно на 24 процентных пункта ниже, чем показывали автоматические тесты SWE‑bench. Даже если учитывать, что сами человеческие решения при повторной проверке одобрялись только в 68% случаев, разница между оценками алгоритма и мнением разработчиков все равно осталась статистически значимой.

Разработчики классифицировали причины отклонения решений на три основные категории. Первая — низкое качество кода, включая несоблюдение стандартов проекта и избыточную сложность. Вторая — нарушения существующей логики системы, когда исправление одной ошибки приводило к поломке других частей кода. Третья — базовые функциональные ошибки: значительная доля решений формально проходила тесты, но фактически не устраняла исходную проблему.

Исследование METR также выявило различия между моделями: переход от Claude 3.5 к Claude 3.7 сопровождался ростом общего числа «успешных» решений, но увеличением случаев функциональных дефектов, тогда как более поздние версии Anthropic улучшали прежде всего качество кода. GPT-5 в среднем демонстрировал более слабые результаты по этому критерию.

Дополнительный анализ METR показал, что результаты тестов могут создавать неверное впечатление о том, насколько хорошо ИИ работает в реальных задачах. По автоматическим данным Claude 4.5 Sonnet достигает 50% уровня успеха на задачах, сопоставимых с 50 минутами работы разработчика. Однако оценки мейнтейнеров снизили этот показатель примерно до восьми минут. Это означает, что лабораторные метрики могут завышать реальную эффективность ИИ‑агентов в несколько раз.

В команде METR указывают, что исследование не доказывает фундаментального потолка возможностей современных моделей. В эксперименте ИИ‑системы получали только одну попытку решения задачи, тогда как в реальной разработке код дорабатывается итеративно после замечаний.

Теги:
Всего голосов 1: ↑1 и ↓0+1
Комментарии1

📣 Всем привет! На связи Михаил, аналитик платформы с искусственным интеллектом. Продолжаю серию постов про автоматизацию в пищевой промышленности.

В прошлой части я писал, зачем автоматизация нужна пищевому производству. Теперь разберу, какие системы для этого используют и чем они отличаются ⤵️

На пищевом предприятии автоматизация обычно выстраивается по уровням. На нижнем уровне — оборудование и датчики, выше — системы управления процессом, ещё выше — системы управления производством и ресурсами предприятия.

Чаще всего используются четыре основных уровня:

  1. АСУ ТП. Это базовый уровень автоматизации, который управляет конкретными технологическими операциями: дозированием, смешиванием, нагревом, охлаждением, пастеризацией, розливом. Здесь система в реальном времени следит за температурой, давлением, уровнем, расходом и другими параметрами и регулирует процесс по заданным алгоритмам. АСУ ТП отвечает за то, чтобы линия физически работала в нужном режиме.

  2. SCADA. SCADA-система работает над технологическим уровнем. Она собирает данные с оборудования, визуализирует их, архивирует, формирует отчёты и сигнализирует об отклонениях. Если АСУ ТП управляет процессом, то SCADA помогает этот процесс видеть и контролировать. Для производства это важно, потому что оператор или диспетчер получает общую картину по линии или цеху и может быстрее реагировать на сбои.

  3. MES. MES — это уровень управления производством между цехом и управленческими системами. Такие системы помогают планировать загрузку оборудования, отслеживать выполнение заданий, контролировать выпуск партий, фиксировать простои и обеспечивать прослеживаемость продукции. Для пищевой промышленности это особенно важно: если возникает проблема, MES помогает быстро понять, из какого сырья выпущена партия, на каком участке она производилась и где возникло отклонение.

  4. ERP. ERP — это уже уровень управления ресурсами предприятия. Такие системы отвечают за закупки, складской учёт, финансы, логистику, производственное планирование и заказы. ERP не управляет оборудованием напрямую, но определяет, что, в каком объёме и в какие сроки должно быть произведено.

    АСУ ТП управляет процессом, SCADA показывает, что происходит на линии, MES управляет производством, ERP управляет ресурсами и бизнесом.На практике эти системы работают в связке: одни управляют процессом, другие собирают данные, третьи помогают планировать и контролировать выпуск.

Но во многих случаях этого уже недостаточно. Классические системы хорошо видят параметры процесса, но не замечают визуальные проблемы: дефекты упаковки, смещение этикетки, заторы на линии, просыпание сырья или нарушения со стороны персонала.

Поэтому всё чаще их дополняют видеоаналитикой и компьютерным зрением — там, где нужен не только контроль параметров, но и контроль того, что происходит на производстве.

В следующем посте разберу, где именно видеоаналитика даёт эффект на пищевом производстве и какие задачи она закрывает на линиях фасовки, упаковки и контроля качества.

Теги:
Рейтинг0
Комментарии0

📣 Всем привет! На связи Михаил, аналитик платформы с искусственным интеллектом.

Начинаю серию постов про автоматизацию в пищевой промышленности. Тема большая, поэтому разберу её по частям. В первой части — зачем автоматизация нужна пищевому производству ⤵️

У пищевой промышленности жёсткие условия: высокая доля сырья в себестоимости, короткие сроки хранения, строгие санитарные требования и высокая чувствительность к любым сбоям в процессе.

Поэтому даже небольшие отклонения быстро превращаются в потери. Недовес, перевес, перелив, ошибка в температурном режиме, простой линии, нарушение маркировки или поздняя отбраковка напрямую влияют на выпуск и себестоимость.

Автоматизация здесь — это инструмент производственного контроля. Она обычно закрывает такие задачи:

▫️ Контроль технологических параметров

Температура, давление, время выдержки, дозирование, скорость линии, вес продукции — это базовые вещи, от которых зависит стабильность процесса и качество партии.

▫️ Снижение сырьевых потерь

На пищевом производстве потери часто возникают не из-за одной большой аварии, а из-за постоянных мелких отклонений: переливов, неточного дозирования, брака на упаковке, повторных перенастроек линии.

▫️ Прослеживаемость партии

Важно понимать, из какого сырья произведена конкретная партия, на каком оборудовании она выпускалась, какие были параметры процесса и куда эта партия ушла дальше.

▫️ Контроль фасовки, упаковки и маркировки

Именно на финальных участках часто проявляются проблемы, которые потом приводят к возвратам, списаниям или претензиям со стороны ритейла.

▫️ Снижение зависимости от ручного труда

На участках фасовки, сортировки, укладки и паллетирования автоматизация нужна, чтобы уменьшить влияние человеческого фактора и стабилизировать процесс.

▫️ Быстрая реакция на отклонения

Чем раньше система фиксирует сбой, тем меньше вероятность, что проблема затронет всю партию или приведёт к остановке участка.

Автоматизация в пищевой промышленности нужна для трёх вещей: держать процесс под контролем, снижать потери и вовремя замечать отклонения.

В следующем посте разберу, какие системы для этого используют на производстве и чем отличаются автоматизированные системы управления технологическими процессами, SCADA, MES и ERP.

Теги:
Всего голосов 1: ↑0 и ↓1-1
Комментарии0

rules отдельно, skills отдельно: система правил для ИИ-агентов в Claude Code

Возвращаюсь к своему опыту работы с Claude Code. Там за неделю накопилось несколько интересных решений в работе контентными агентами. Например, добавил устойчивость к ошибкам WebSearch и начал сохранять результаты проверок для дообучения. Но сначала надо вам рассказать про правила.

Почему rules, если есть уже привычные skills? Разница между этими сущностями принципиальная:

➡️ rules — это «как оформлять» (ограничения, чеклисты, формат),
➡️ skills — «что знать» (предметная экспертиза, справочники, методологии).

Rules загружаются автоматически через симлинки. Skills вызываются по запросу, когда агенту нужна глубокая экспертиза.

Но всё равно же не очень понятно, зачем такое разделение, да?

Правила не засоряют контекстное окно. Файлы из .claude/rules/ загружаются в системный промт автоматически — агент соблюдает правила, не тратя токены на их обсуждение. Skills, наоборот, подгружаются только когда нужны. Справочник на 200 терминов не висит в контексте постоянно — он появляется в момент, когда автору пора писать, и не мешает исследователю или фактчекеру.

Когда агентов больше одного, правила написания текстов неизбежно дублируются. Обновил термин в одном месте — забыл в трёх других. Решение: вынести все правила в единую директорию rules/ и раздавать агентам через симлинки в .claude/rules/

При этом сами правила делятся на два уровня:

➡️ Общие (rules/common/) загружаются в каждого агента: терминология, стиль, грамматика, протокол работы субагентов.
➡️ Доменные (rules/{domain}/) добавляют специфику формата: у SEO-статьи свои требования к структуре, у пресс-релиза — свои, у лендинга — свои.

Доменные папки могут содержать файлы с теми же именами, что и в common/. Это не дубли, а дельты — дополнения и уточнения общих правил для конкретного формата. Агент загружает оба файла и применяет оба набора ограничений.

Результат: один файл правил — один источник правды. Изменил правило в rules/common/ — оно обновилось у всех агентов. Новый агент подключается за минуту: создал .claude/rules/, добавил симлинки — готово.

Как это работает в оркестрации

В модульной системе с субагентами разделение rules и skills становится особенно важным. Типичный пайплайн:

1️⃣ Оркестратор собирает параметры задачи через wizard.
2️⃣ Субагент-исследователь загружает свои rules (протокол работы, устойчивость к ошибкам поиска), ищет данные, возвращает структурированный конспект.
3️⃣ Субагент-автор загружает свои rules (доменные стандарты формата + общие правила качества) и skill (экспертная специализация), пишет текст по конспекту.
4️⃣ Субагент-проверщик загружает свои rules (требования к фактам и качеству), проверяет текст независимо.

Каждый субагент получает только нужные данные (чистый контекст) и только свои правила. Исследователь не знает правил оформления — они ему не нужны. Автор не знает, как проверять факты — это задача следующего субагента. Фактчекер не знает, как писать — он только проверяет. Такое разделение позволяет держать контекст каждого субагента компактным и сфокусированным.

Больше такого в моём канале.

Теги:
Рейтинг0
Комментарии0

Ускоряем разработку в разы: специалист по ИИ собрал пять репозиториев для Claude Code, чтобы автоматизировать большинство задач в рутине программиста:

  • Superbase CLI управление миграцией БД на PostgreSQL, генерирует типы из схемы БД, создаёт аутентифицированные HTTP-запросы.

  • Skill Creator — позволяет создавать агентные скиллы без лишних заморочек, постоянно улучшаете и оттачиваете навыки Claude для конкретных задач.

  • Get shit done — создаёт легковесную систему разработки с контекстным инжинирингом и поддерживает Claude Code, OpenCode, Gemini CLI, Codex, Copilot, и Antigravity.

  • Notebooklm-py — обеспечивает программный доступ к фичам NotebookLM, который очень хорошо будет смотреться с агентами Claude Code, Codex, и OpenClaw.

  • Obsidian.md — аналог NotebookLM со схожим функционалом, который работает в России и в него можно интегрировать Claude, чтобы получить мощный ворфлоу.

Теги:
Рейтинг0
Комментарии0

Hugging Face опубликовал ежегодный отчёт о состоянии моделей ИИ с открытым исходным кодом. Что там интересного:

💡 За 2025 год китайские модели составили 41% всех загрузок на платформе — Китай вышел на первое место по ежемесячным скачиваниям. Это прямое следствие эффекта DeepSeek: Baidu перешёл с нуля релизов на HF в 2024-м к более чем 100 в 2025-м, ByteDance и Tencent увеличили количество релизов в восемь-девять раз.

💡 Доля индустрии в разработке open source AI упала с 70% до 37%. Доля независимых разработчиков выросли с 17% до 39% загрузок. Но большинство из них не создают модели, они их переупаковывают.

💡 У Alibaba больше производных моделей, чем у Google и ещё одной компании вместе взятых. Если считать все модели Qwen, то их более 200000. Но, кажется, за этим стоит конкретный стратегический выбор Пекина: открыть модели, чтобы занять инфраструктурный слой.

💡 Маленькие модели скачиваются и разворачиваются значительно чаще крупных из-за стоимости, задержек и железа. Средняя медиана скачиваемой модели — 406 млн параметров.

💡 Среднее время интереса к модели — 6 недель — пожалуй, самая честная цифра в отчёте. Open source AI живёт циклами хайпа, а не долгосрочным использованием. Большинство релизов забывают раньше, чем успевают протестировать в проде.

💡 Датасеты по робототехнике выросли с 1145 до 26 991 за год и стали крупнейшей категорией датасетов на платформе, обогнав генерацию текста. Это направление стоит отслеживать отдельно, но это не прорыв в физическом ИИ. Это академические лаборатории, которые наконец-то начали публиковать данные там, где их увидят.

Полный отчёт

Мой канал Инженер Контекста

Теги:
Всего голосов 4: ↑4 и ↓0+7
Комментарии0

Коротко о системах антиплагиата: британский профессор проверил свою научную работу, написанную 45 лет назад. Оказалось, что она… на 77% «сгенерирована нейросетями».

Теги:
Всего голосов 8: ↑7 и ↓1+8
Комментарии4

Представлен открытый проект Claude Code Game Studios. Это игровая ИИ-студия на базе нейросетей, которые умеет создавать различные проекты от простых бродилок до прорывного экшена:

  • 48 нейросетей, которые могут работать без остановки. Это не устающий отдел геймдева прямо на локальном ПК;

  • среди ИИ есть: креативный директор, технический директор, продюсер, QA, нарративный директор, левел-дизайнер и другие ИИ-системы;

  • нейросети до мельчайших деталей знают актуальные движки: Godot 4, Unity и Unreal Engine 5. Они напишут на них игру и запустят с тестами;

  • ИИ-системы сами проверяют работу: коммиты, комментарии, задачи и итоги спринтов, а также все важные нововведения и ревью;

  • все действия нейросети согласовывают с пользователем как с гендиректором: с полным отчётом, предложениями и планом. Да, команда автономна, но задаёт вектор именно пользователь;

  • авторы проекта также добавили 28 шаблонов документов: по геймдизайну, архитектуре проекта, экономике, фракциям, UX и так далее.

Теги:
Всего голосов 4: ↑4 и ↓0+6
Комментарии1

Представлен открытый проект ClawRouter, который максимально эффективно позволяет расходовать токены ИИ-моделей, анализируя задачи и подбирая нейросети, чтобы пользователи не переплачивали за лишний расход ИИ-мощностей:

  • анализирует запрос и оценивает его по 14 пунктам: сложность, комплексность, длина промпта и другие параметры.

  • подбирает эффективную модель из 40+ сервисов.

  • результат прилетает за секунды.

  • работает полностью локально.

  • итог: сложные задачи летят в более мощные нейронки с большим лимитом, а легкие забирает малышня.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Представлен открытый учебный проект OpenMAIC (Open Multi-Agent Interactive Classroom). Это нейроуниверситет, который может помочь за несколько занятий выучить материал на 100 страниц (демо в браузере):

  • работает как полноценная лекция + практика — есть ИИ-преподаватель и ИИ-студенты.

  • на заданную тему ИИ её разжёвывает, а потом закрепляет практикой и самыми каверзными вопросами.

  • можете слушать и фиксировать, а можете принять участие — голосом или текстом.

  • задали вопрос — получили ответ.

  • всё максимально удобно — лекции с озвучками, лазерной указкой и тестами.

  • ИИ-преподаватель разберёт все ошибки в понимании материала.

  • практика — прямо в браузере идёт имитация задач и физических экспериментов.

Теги:
Всего голосов 2: ↑2 и ↓0+4
Комментарии0

Собираем локальную агентную AI-систему

Если хочется не просто «чатик с нейронкой», а локального AI агента, который умеет ходить в инструменты (файлы и т. п.) и выполнять твои задачи, то вот статья, которую реально можно повторить руками: «От чат-бота к AI агенту: собираем локальную систему на LibreChat, Langflow и MCP». Это подробнейший мануал с пятью уровнями сложности!

В этой статье покажем, как собрать связку из трёх ключевых компонентов:

  1. LibreChat — UI для работы с LLM

  2. Langflow — low-code платформа и визуальный редактор

  3. MCP — стандарт для подключения инструментов

Структура статьи «по нарастающей»: можно остановиться на любом уровне — от простого локального чата до кастомизируемого агента.

Если вам интересны вызовы защиты ML-систем от современных атак и вы хотите развиваться в MLSecOps, присоединяйтесь к нашей команде, мы в поисках специалиста по защите искусственного интеллекта. Откликайтесь на вакансию по ссылке.

Теги:
Всего голосов 3: ↑3 и ↓0+3
Комментарии1

Как развивается и куда движется «русское техно»? Обсудим на ИТ-вечере 26 марта 😎

Поговорим про особенности инженерной культуры в больших ИТ-компаниях, практики внедрения ИИ в разработку, автоматизацию код-ревью и использование LLM без ущерба для безопасности. В программе эксперты из МТС Web Services, СберТех, red_mad_robot и Авито.

Будет интересно бэкенд- и ML-разработчикам, которые строят современные российские ИТ-системы, а также всем, кто интересуется ИИ-практиками в разработке. Участников ждут актуальные кейсы, дискуссии, активности от MWS GPT, нетворкинг и атмосфера техно-вечеринки с ИИ-треками.

📅 Когда: 26 марта (четверг) в 18:00 по мск

📍 Где: офлайн в парке Сокольники в Москве + онлайн 

Успевай записаться — количество участников ограничено.

👉 Зарегистрироваться

Теги:
Всего голосов 1: ↑0 и ↓1-1
Комментарии0

Ближайшие события

Представлен открытый проект Awesome OpenClaw — тщательно подобранный список замечательных ресурсов по OpenClaw — не все, но только лучшие.

Ранее был представлен открытый и бесплатный фундаментальный курс по OpenClaw, включая весь материал на русском языке с полным описанием процессов установки, настройки, использования и полноценной кастомизации ИИ‑бота под свои задачи.

Теги:
Всего голосов 2: ↑2 и ↓0+2
Комментарии0

Разработчик Роман Гущин (Roman Gushchin) из команды мейнтейнеров ядра Linux в Google объявил о доступности новой ИИ-системы Sashiko для проверки кода с помощью искусственного интеллекта. Внутри Google она уже используется для выявления проблем, и теперь она доступна публично и охватывает все сообщения, отправленные в список рассылки ядра Linux. Гущин пояснил, что Sashiko смогла обнаружить около 53% ошибок на основе неотфильтрованного набора из 1000 недавних проблем ядра Linux с меткой «Исправления:».

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Разобрал репозиторий gstack от Гэрри Тана, CEO Y Combinator. Про критику от комьюнити писать не буду. Это в точности тот же спор который идёт вокруг любого репозитория с конфигами агентов. «Это просто промпты» — технически верно. Но ценность не в промптах, а в ролевой модели и порядке вызовов. Точнее всего описать репу так: структура инженерной организации как принцип проектирования, а не один агент на всё.

Что это такое, собственно:

gstack превращает Claude Code в виртуальную инженерную команду которой ты реально управляешь: CEO который переосмысливает продукт, инженерный менеджер который фиксирует архитектуру, дизайнер который ловит ИИ-шлак, параноидальный ревьюер который находит баги в продакшне, QA-лид который открывает настоящий браузер и кликает по приложению, и релиз-инженер который шипит PR. Тринадцать специалистов, все как слэш-команды, всё в Markdown, MIT-лицензия.

Ключевое отличие от других репозиториев: здесь не просто субагенты под задачи, а роли с разными когнитивными режимами. Один агент не делает всё сразу.

Что применимо для контентных агентов

Гэрри Тан не сделал одного агента «напиши код». Он разделил процесс на роли с разными углами зрения: стратег, исполнитель, ревьюер, контролёр качества. Для контентных агентов это, чисто теоретически, можно интерпретировать так:

  • /plan-content по образцу /plan-ceo-review — переосмысляет тему перед написанием. Не «напиши статью про Kubernetes», а «какой угол здесь самый сильный, что аудитория хочет узнать, какой тезис будет неожиданным». Стратегический режим перед исполнением.

  • /review-editorial по образцу /review — находит нарушения редполитики которые проходят поверхностную проверку но выглядят плохо при публикации. Автофиксит запрещённые слова, показывает спорные утверждения без источников.

  • /qa-content по образцу /qa — проверяет финальный текст по чеклисту: факты атрибутированы, голос соответствует, структура соблюдена, нет клише, длина правильная для формата. Фиксит и перепроверяет.

  • /ship-content по образцу /ship — финальный прогон перед публикацией: проверка всех пунктов, генерация превью для разных платформ, архивирование в базу опубликованных материалов.

  • /retro-content по образцу /retro — еженедельный отчёт: сколько материалов вышло, какие форматы, какие темы, что залипло, что нет.

У меня система выстроена по-другому — агенты под задачи, субагенты с чистым контекстом, правила и скиллы — но тем интереснее смотреть на другие варианты архитектур.

P.S.: Редко выхожу с таким на Хабре, больше про агенты для контента в канале.

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Представлен открытый проект AutoResearchClaw. Это доработанная под исследования версия агента OpenClaw, которая:

  • детально анализирует идею пользователя и выдаёт готовый PDF‑документ с исследованием гипотезы;

  • агент сам пишет код и все формулы, а также запускает тесты, исправляет ошибки;

  • почти не имеет галлюцинаций;

  • вся работа бота проходит 4-этапный процесс верификации по научным базам;

  • умеет работать с LaTeX, чтобы создавать понятные и эффективные графики;

  • сам агент бесплатный — нужен только API.

Теги:
Всего голосов 4: ↑3 и ↓1+6
Комментарии0

Для Claude представлен модуль антиплагиата Stop Slop, который убирает из текста все маркеры ИИ. Проект вырезает шаблонные фразы, лишний пафос и делает текст более живым. Можно использовать как в Claude Code, так и в веб‑версии, просто добавив SKILL.md в проект.

Теги:
Всего голосов 2: ↑1 и ↓10
Комментарии1

ИИ-помощник для анализа требований

В работе техпресейла значительная часть времени уходит на анализ требований клиентов — они часто приходят в виде больших опросников, которые нужно внимательно разобрать и прокомментировать.

Когда таких документов много и нужна оперативность, ручная обработка начинает замедлять работу команды. С этим регулярно сталкивалась команда техпресейла Naumen. Поэтому Настя и Даша, системные аналитики команды, решили попробовать автоматизировать часть процесса и внедрили ИИ-помощника для анализа требований.

Рассказываем, как они собирали данные, какие подходы пробовали и как в итоге пришли к решению на базе RAG.

1️⃣ Чем занимается техпресейл

Техпресейл — это мост между продуктом и продажей. Мы проводим технические демонстрации, обсуждаем требования клиента и помогаем понять, подходит ли продукт под его задачи.

Чаще всего работа техпресейла с клиентом начинается с опросника — Excel-документа с требованиями.

2️⃣ Почему Excel-файл оказался неудобным для анализа требований

Типичный опросник — это таблица с тремя колонками:

  • требование клиента

  • какой продукт соответствует

  • комментарии

Иногда требований десятки или сотни — нужно внимательно прочитать, найти контекст в прошлых кейсах, вручную проверить формулировки и ссылки на источники. Даже опытный специалист тратит на такой документ около часа.

Когда таких задач много и у них срочные дедлайны, возрастает нагрузка на команду и появляются риски задержек. Поэтому мы решили автоматизировать процесс.

3️⃣ С чего мы начали автоматизацию

Сначала нужно было собрать данные. Поэтому первым шагом мы:

  1. Собрали все опросники за год в единый массив.

  2. Привели их к единому формату.

  3. Классифицировали требования.

  4. Проверили и почистили данные от дублей и неточностей.

В итоге получился датасет примерно из 2 000 требований, который стал основой нашей базы для тестирования ИИ-помощника.

4️⃣ Почему классические модели не сработали

Первой идеей было использовать классические методы анализа текста. Мы пробовали TF-IDF, Bag-of-Words и стандартные модели классификации.

Но столкнулись с двумя проблемами:

  • низкое качество классификации

  • дисбаланс данных

Большинство требований продукт действительно покрывал, поэтому модель быстро «научилась» отвечать одинаково. Стало понятно, что нужен другой подход.

5️⃣ Как мы пришли к RAG-подходу

Мы перешли к векторному поиску и трансформерам. Идея была в том, чтобы по новому требованию находить в базе знаний похожие требования и использовать их как контекст.

Получился умный поиск по нашим прошлым ответам. Но этого все равно было недостаточно: нужно было не только находить похожие требования, но и генерировать комментарий.

Так мы пришли к подходу RAG (Retrieval-Augmented Generation) — LLM сначала находит факты в базе знаний, а уже потом формирует ответ.

6️⃣ Как работает наш ассистент

Сервис работает в Telegram-боте и поддерживает два сценария.

Вопрос в чате — пользователь задает вопрос, бот ищет информацию в базе знаний и формирует ответ.

Загрузка Excel-файла — пользователь загружает файл с требованиями, после чего сервис проходит по каждой строке и автоматически заполняет:

  • соответствие (да / нет / не знаю)

  • комментарий с объяснением соответствия

7️⃣ Из чего состоит база знаний

Мы используем два источника:

  • документацию по продуктам Naumen

  • структурированные опросники из прошлых проектов

Документы разбиваются на небольшие смысловые фрагменты, для каждого фрагмента вычисляются эмбеддинги, после чего они сохраняются в векторной базе. Когда приходит новый запрос, система находит самые релевантные фрагменты и использует их как контекст для ответа.

8️⃣ Какие есть ограничения у ассистента

ИИ-ассистент помогает быстрее разбирать требования, но полностью заменить аналитика он пока не может.

Например, иногда клиенты присылают требования, которых еще нет в базе знаний. В таких случаях бот отвечает «не знаю», и требование разбирает специалист.

Также иногда встречается типичная проблема LLM — галлюцинации. Поэтому финальную проверку ответа все равно делает системный аналитик.

Теги:
Рейтинг0
Комментарии0

Anthropic представила исследование, которое показывает, что влияние ИИ на рынок труда пока значительно ниже его теоретического потенциала. В статье представлена новая метрика под названием observed exposure («наблюдаемое воздействие»). Она сравнивает теоретические возможности языковых моделей с реальными данными их использования, в данном случае на основе разговоров пользователей с чат-ботом Claude. Для анализа были объединены данные базы профессий O*NET, оценки того, какие задачи теоретически могут ускоряться с помощью ИИ, а также статистика фактического использования Claude в рабочих сценариях.

Результаты показали значительный разрыв между потенциалом и практикой. По оценкам исследователей, языковые модели теоретически способны ускорить выполнение 94% задач в компьютерных и математических профессиях. Однако на практике ИИ применяется лишь примерно в 33% таких задач. Большинство возможностей технологий остаётся нереализованным из-за ограничений самих моделей, юридических требований, необходимости человеческого контроля или сложной интеграции с профессиональными системами.

Сравнение теоретической способности языковых моделей автоматизировать задачи в различных профессиональных категориях (синий) и фактического уровня их использования на практике по данным взаимодействий с моделью Claude (красный). Источник: Anthropic.
Сравнение теоретической способности языковых моделей автоматизировать задачи в различных профессиональных категориях (синий) и фактического уровня их использования на практике по данным взаимодействий с моделью Claude (красный). Источник: Anthropic.

Исследование также выявило, какие профессии сейчас наиболее подвержены влиянию ИИ. На первом месте оказались программисты — около 75% их задач могут выполняться или ускоряться с помощью моделей. Далее следуют специалисты службы поддержки, операторы ввода данных и аналитики. В то же время примерно 30% работников практически не затронуты использованием ИИ: среди них повара, бармены, спасатели, механики и другие профессии, связанные с физическим трудом.

Теги:
Всего голосов 4: ↑3 и ↓1+4
Комментарии1