Pull to refresh

Comments 7

Есть дока, требования, есть тесткейсы и соответ баги. Человек уже не способен прогнать ручной тест по плану или написать автомейшин? В чем тут сравнение? Произвольный сайт без документации и требований?

Сайт не произвольный, обычные рабочие задачи с ТЗ и макетами. Тест-кейсы тоже есть, агент их сам пишет по ТЗ и по ним же прогоняет.

Способен ли человек - такой вопрос не стоял, я и руками прогоняю, и автотесты пишу, в статье мои собственные часы и есть. Мерил я другое: сколько часов и находок вышло у каждого за одни и те же 11 недель. Человек при этом остался нужен - все 6 пропусков агента нашел я.

Из 77 багов были криты/блокеры или хотя бы мажоры?

Или все найденные баги попадают в глубокий бэклог, где о них потом забывают навсегда.

Спрашиваю в контексте того, что клод действительно много чего подсвечивает, но большая часть даже не оформляется в задачи.

Блокеров не было, с высоким приоритетом один - фильтр не находил ни одного подходящего объекта. Остальное мажоры и миноры: вёрстка, расхождения с макетом, пара функциональных.

В бэклог не уезжают: находки приходят во время тестирования задачи, до релиза, и чинятся там же. Разреза по severity в цифрах статьи нет, системно не записывал.

Спасибо за редкий разбор, где вы посчитали финальные вердикты, пропуски и человеческое время, а не просто число кандидатов. В комментарии вы уточнили, что агент сам пишет тест-кейсы по ТЗ и затем сам их выполняет. Если одна и та же модель участвует в проектировании теста и оценке результата, она может одинаково неверно понять требование на обоих этапах. Пробовали ли вы добавить скрытый набор заранее внесённых реалистичных дефектов или мутаций, который агент не видел при создании тест-кейсов? Тогда к воронке кандидатов добавилась бы чувствительность самого тестового контура: какие известные дефекты он обнаруживает, а какие классы даже не формулирует.

Спасибо) У меня это разнесено: тест-кейсы пишет отдельный скилл, ОР в них берутся из ТЗ и макетов. Всё неоднозначное на этом этапе уходит вопросами, ТК правятся по ответам. Прогоняет другой скилл, а в больших прогонах субагенты, которые ТК не писали и берут шаги и ОР дословно из TMS.

Скрытый набор мутаций не пробовал, а идея хорошая) одинаковую ошибку ТК и реализации мой замер действительно не видит

У нас в команде похожая картина, только агенты проверяют не код, а тексты: три синтетических читателя ставят оценки по анкете. На одной статье совпадение с вердиктом человека провалилось: агенты пропустили текст с минимальной оценкой, а мы забраковали его целиком. Треть объёма ушла в разбор чужой методики, и статья получилась не про то, ради чего мы её делали. Анкета измеряет исполнение, промах по теме она не видит.

Зато на фактических проверках агенты сильнее наших автоматических проверок: за три прохода нашли число, которого нет в исходных данных, и пример, который доказывал обратное своему тезису.

Sign up to leave a comment.

Articles