Pull to refresh

Comments 2

Веду ровно такой формат — соло плюс агенты на нескольких продуктах — и по опыту главный ограничитель из вашей четвёрки это цена ошибки, но с неожиданной стороны. Код агенты пишут нормально, узкое место — верификация: агент может сделать работу и отчитаться невнятно, а может красиво отчитаться о несделанном. Пока я не научился проверять результат по следу в мире (запись в БД, факт публикации на площадке, зелёный смоук на проде), а не по рапорту агента, ловил и дубли действий, и молчаливые провалы. По сути вся «система поддержки» из четвёртого пункта у меня свелась к слою независимых проверок — на него ушло едва ли не больше усилий, чем на сами фичи. Поэтому с выводом «считать не людей, а ограничения» согласен целиком: соло-формат выживает только там, где ошибка откатывается бэкапом за минуту.

ну да, и мы идем в итоге смотреть на "обвес" вокруг агента и бесконечную отладку + evals :)

Sign up to leave a comment.

Articles