Комментарии 2
Понравилась концепция: фактически это постоянно обновляемая база знаний и поиска для агента, но не поиск только по коду проекта и по быстро устаревающему Confluence.
Я правильно понимаю логику, что 2000 строк вместо 300 не считаются провалом модели, зато 40 ответов аналитикам в неделю без данных об их точности считаются успехом проекта?
Агент выдал плохой код, после чего команда перестала пускать его в прод. Это похоже на обоснованное недоверие, а не на управленческий провал. Почему в этом случае «модель ни при чём»?
С аналитиками тот же вопрос. Сколько ответов оказались правильными с первого раза, сколько пришлось перепроверять вручную или уточнять у разработчиков и сколько содержали ошибки? Пока видно только, что инструментом пользуются. Работает ли он надёжно, из статьи непонятно.

Наш ИИ-агент не закрыл ни одной боевой задачи. И это лучшее, что с ним случилось