Комментарии 23
Как идея звучит прикольно, на практике мне кажется, это будет бесконечный процесс "дообучения" (редактирования скиллов с новыми правками) агента не пропускать своих же косяков, который в последствии обернется, тем что, что-то он всё равно забудет, но не хочу судить не попробовав.
Сейчас все деградации ui, я стараюсь ловить голден тестами, а все что касается бизнес логики проверяется либо вручную либо интеграционными тестами, написанные с помощью этих же агентов...
Час гонять модель по одной форме конечно сильно 😄
У меня самый частый косяк раньше был иллюзия корректности тестов. Я сама по натуре не тестировщик, а разработчик, и тесты пишутся с помощью claude. Ну и собственно когда все тесты зелёные, это не всегда значит, что тесты корректны и вообще не значит что они реально что-то проверили...
Первые месяцы - да, ощущение бесконечного дообучения, потом кривая сходится: у меня с двух-трех пропусков за прогон дошло до одного-двух в месяц. Насчет "забудет": скилл - не память, а файл, который агент перечитывает каждый прогон; забыть можно то, что в голове). Голден-тесты хороши, но они про пиксели - баг из демо они пропустят, UI-то идентичен, а мусор в payload. А "иллюзия корректности тестов": под неё в паке test-review, он ловит тесты без ассертов и оракулы вида "кнопка активна".
Пардон за оффтопик, но...
В конце — честный список того, где это всё не работает.
У меня одного уже red flag на слово "честный"? Каждый раз как его вижу, это либо брехня, либо слоп.
Проверить легко, в конце статьи раздел, где я сам перечисляю, что тут дорого, что вырезано и где агент все еще может ошибиться. Если после него ощущение брехни останется - пишите)
red flag на слово "честный"
Аналогично коробит. А тут их аж целых 6 штук. Для меня это признак того, что Автор сильно не заморачивался над текстом.
А вот «абсолютно» из уст политиков уже давно признак того, что то, что с этим словом сказано, нужно воспринимать ровно наоборот.
Не могу поставить плюс, поэтому пишу. ИИшницы обожают слово "честный".
Да, ровно так) ничего нового я не изобретал, это обычная дисциплина ручного QA, просто записанная так, чтобы агент мог ее выполнять. Ваш случай с Next.js узнаваемый, агент замеряет сразу после появления блока и попадает в окно гидратации. У меня вылечилось повторным замером через expect().toPass(), а скриншот - только после того, как страница устаканилась.
40-60 минут на одну форму конечно ощутимо. а не пробовал разбивать чеклист на приоритеты, чтобы был режим "смоук за 10 минут" и полный прогон отдельно? или на практике смоук от агента бесполезен?
Разбиваю, да. Глубина в скилле это параметр, есть риск-приоритизация и smoke-подмножество (критичные пути + сабмит с проверкой payload), такое агент пробегает минут за 10-15. Полный дотошный прогон это отдельный режим, для регресса. Но в то же время smoke от агента не бесполезен и грубые поломки обычно ловит. Но главное, что дает дисциплина именно смоуку - агент обязан перечислить в отчете, что не проверял. Смоук зеленый - это "критичное ок, остальное not tested", а не "все работает")
Правила можно обойти, хуки обойти нельзя. Можно еще повысить качество, если добавить PreToolUse hook на вызов gh pr create (и еще на хост гитхаба добавить триггер), который заставит его выполнять дополнительные проверки, если они еще не были пройдены.
И вообще, в claude best practices советы, которые действительно хорошо работают. "Give Claude a way to verify its work " оттуда как раз.
Клод постоянно даже на правила из memory забивает, а про CLAUDE.md/AGENTS.md обычно вспоминает только если ему напомнить. И это при том, что правил не очень много.
Пренебрежение правил требует расследования. Нейронки не пренебрегают правилами просто так.
Если правил не очень много и все равно забивает обычно такие проблемы:
1. Правила из memory - слабый слой, это фоновые заметки, а не инструкции. Рабочие правила лучше держать в CLAUDE.md/AGENTS.md.
2. Формулировка. Пожелания ("будь внимательнее", "не забывай про X") исполняются плохо, работает проверяемое действие с привязкой к какому-то моменту. Например, "перед коммитом прогони X", "каждый вердикт - со ссылкой на артефакт".
3. Длина сессии. В забитом контексте тонут даже три правила, /clear между задачами заметно меняет поведение и помогает. Критичное дока советует усиливать через IMPORTANT/YOU MUST - тоже обычно работает. А для "должно быть всегда и без исключений" - хуки.
Да уж, у меня он постоянно перезаписывает память одними и теми же правилами, когда напоминаешь ему.
Очень полезная информация для выстраивания автоматических тестов в процессе агентной разработки.
Бред. Если фрейморк не позволяет тестировать "нормально" то это плохой фрейморк
Playwrite вообще костыль лютый. Без него можно спокойно тестировать всё тоже самое
Единственное условие - писать веб на $mol

Я запретил Claude говорить «всё работает» без пруфов. Это изменило всё