Обновить

Наш ИИ-агент не закрыл ни одной боевой задачи. И это лучшее, что с ним случилось

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.2K
Всего голосов 4: ↑3 и ↓1+3
Комментарии2

Комментарии 2

Понравилась концепция: фактически это постоянно обновляемая база знаний и поиска для агента, но не поиск только по коду проекта и по быстро устаревающему Confluence.

Я правильно понимаю логику, что 2000 строк вместо 300 не считаются провалом модели, зато 40 ответов аналитикам в неделю без данных об их точности считаются успехом проекта?

Агент выдал плохой код, после чего команда перестала пускать его в прод. Это похоже на обоснованное недоверие, а не на управленческий провал. Почему в этом случае «модель ни при чём»?

С аналитиками тот же вопрос. Сколько ответов оказались правильными с первого раза, сколько пришлось перепроверять вручную или уточнять у разработчиков и сколько содержали ошибки? Пока видно только, что инструментом пользуются. Работает ли он надёжно, из статьи непонятно.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации