Если правил не очень много и все равно забивает обычно такие проблемы: 1. Правила из memory - слабый слой, это фоновые заметки, а не инструкции. Рабочие правила лучше держать в CLAUDE.md/AGENTS.md. 2. Формулировка. Пожелания ("будь внимательнее", "не забывай про X") исполняются плохо, работает проверяемое действие с привязкой к какому-то моменту. Например, "перед коммитом прогони X", "каждый вердикт - со ссылкой на артефакт". 3. Длина сессии. В забитом контексте тонут даже три правила, /clear между задачами заметно меняет поведение и помогает. Критичное дока советует усиливать через IMPORTANT/YOU MUST - тоже обычно работает. А для "должно быть всегда и без исключений" - хуки.
Да, все так. Разделяю их так: хук гейтит точки типа pre-commit ("прогон был? артефакты есть?"), а правила работают там, куда хук не повесишь - на куче микрорешений внутри прогона: лезть ли в payload, что писать в отчет. Комбинация - это то, куда хочу прийти)
Разбиваю, да. Глубина в скилле это параметр, есть риск-приоритизация и smoke-подмножество (критичные пути + сабмит с проверкой payload), такое агент пробегает минут за 10-15. Полный дотошный прогон это отдельный режим, для регресса. Но в то же время smoke от агента не бесполезен и грубые поломки обычно ловит. Но главное, что дает дисциплина именно смоуку - агент обязан перечислить в отчете, что не проверял. Смоук зеленый - это "критичное ок, остальное not tested", а не "все работает")
Проверить легко, в конце статьи раздел, где я сам перечисляю, что тут дорого, что вырезано и где агент все еще может ошибиться. Если после него ощущение брехни останется - пишите)
Да, ровно так) ничего нового я не изобретал, это обычная дисциплина ручного QA, просто записанная так, чтобы агент мог ее выполнять. Ваш случай с Next.js узнаваемый, агент замеряет сразу после появления блока и попадает в окно гидратации. У меня вылечилось повторным замером через expect().toPass(), а скриншот - только после того, как страница устаканилась.
Первые месяцы - да, ощущение бесконечного дообучения, потом кривая сходится: у меня с двух-трех пропусков за прогон дошло до одного-двух в месяц. Насчет "забудет": скилл - не память, а файл, который агент перечитывает каждый прогон; забыть можно то, что в голове). Голден-тесты хороши, но они про пиксели - баг из демо они пропустят, UI-то идентичен, а мусор в payload. А "иллюзия корректности тестов": под неё в паке test-review, он ловит тесты без ассертов и оракулы вида "кнопка активна".
Информация
В рейтинге
473-й
Откуда
Россия
Зарегистрирован
Активность
Специализация
Инженер по автоматизации тестирования, Инженер по обеспечению качества
Если правил не очень много и все равно забивает обычно такие проблемы:
1. Правила из memory - слабый слой, это фоновые заметки, а не инструкции. Рабочие правила лучше держать в CLAUDE.md/AGENTS.md.
2. Формулировка. Пожелания ("будь внимательнее", "не забывай про X") исполняются плохо, работает проверяемое действие с привязкой к какому-то моменту. Например, "перед коммитом прогони X", "каждый вердикт - со ссылкой на артефакт".
3. Длина сессии. В забитом контексте тонут даже три правила, /clear между задачами заметно меняет поведение и помогает. Критичное дока советует усиливать через IMPORTANT/YOU MUST - тоже обычно работает. А для "должно быть всегда и без исключений" - хуки.
Рутины хватает в любом веб-проекте) Поэтому ее и удалось отдать агенту
Да, все так. Разделяю их так: хук гейтит точки типа pre-commit ("прогон был? артефакты есть?"), а правила работают там, куда хук не повесишь - на куче микрорешений внутри прогона: лезть ли в payload, что писать в отчет. Комбинация - это то, куда хочу прийти)
Разбиваю, да. Глубина в скилле это параметр, есть риск-приоритизация и smoke-подмножество (критичные пути + сабмит с проверкой payload), такое агент пробегает минут за 10-15. Полный дотошный прогон это отдельный режим, для регресса. Но в то же время smoke от агента не бесполезен и грубые поломки обычно ловит. Но главное, что дает дисциплина именно смоуку - агент обязан перечислить в отчете, что не проверял. Смоук зеленый - это "критичное ок, остальное not tested", а не "все работает")
Проверить легко, в конце статьи раздел, где я сам перечисляю, что тут дорого, что вырезано и где агент все еще может ошибиться. Если после него ощущение брехни останется - пишите)
Да, ровно так) ничего нового я не изобретал, это обычная дисциплина ручного QA, просто записанная так, чтобы агент мог ее выполнять. Ваш случай с Next.js узнаваемый, агент замеряет сразу после появления блока и попадает в окно гидратации. У меня вылечилось повторным замером через expect().toPass(), а скриншот - только после того, как страница устаканилась.
Первые месяцы - да, ощущение бесконечного дообучения, потом кривая сходится: у меня с двух-трех пропусков за прогон дошло до одного-двух в месяц. Насчет "забудет": скилл - не память, а файл, который агент перечитывает каждый прогон; забыть можно то, что в голове). Голден-тесты хороши, но они про пиксели - баг из демо они пропустят, UI-то идентичен, а мусор в payload. А "иллюзия корректности тестов": под неё в паке test-review, он ловит тесты без ассертов и оракулы вида "кнопка активна".