Обновить

Loop Engineering: почему цикл легко собрать и трудно остановить

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели5.5K
Всего голосов 1: ↑1 и ↓0+3
Комментарии3

Комментарии 3

Самая частая причина разноса цикла, которую я ловила на своих прогонах, — вовсе не reward hacking, а куда скучнее: оракул падал по инфраструктуре, таймаут CI или флапающий тест, цикл честно читал это как «не получилось» и уходил на новый круг с тем же исходом. Помогло развести три состояния вместо двух: «критерий не выполнен», «критерий не проверен» и «выполнен», и тратить лимит попыток только на первое, а на второе делать backoff. У вашего «Менеджера» статус «не доказано» — это про какой из двух случаев: когда проверка отработала и не нашла артефакта, или когда сама проверка не смогла отработать?

Там два уровня, и в статье я их схлопнул. У конкретной проверки FAIL означает "отработала, артефакта нет", а NOT_PROVEN — "саму проверку или её доказательство нельзя считать надёжными". Но итог всей задачи в обоих случаях будет NOT_PROVEN: поставить COMPLETE Менеджер не может. Новый смысловой круг тратится на FAIL, а сбой проверки уходит в отдельное восстановление инфраструктуры; при неопределённом запуске повтор вообще запрещён до сверки.

Старый добрый оркестратор, только теперь с модным названием. А с учётом стоимости токенов и всей возни с проверками не факт, что такой цикл вообще всегда выгоднее одного нормально настроенного агента.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации