Для такого сравнения не хватает числа повторов. Одна лучшая генерация показывает потолок модели, но не её стабильность. Было бы полезно сравнить долю удачных дублей и стоимость одного пригодного результата.
очень круто, можно еще фиксировать настройки и стоимость каждой попытки. После нескольких генераций уже сложно вспомнить, какой промпт, качество и длительность реально дали нормальный результат.
Да, с LLM классический баг-репорт быстро разваливается. Без сохранения промпта, контекста, версии модели и ожидаемого критерия качества потом сложно даже повторить проблему, не то что нормально её исправить.
Спасибо, хороший разбор. Для себя вынес простую мысль: агенту лучше ограничивать не только промптом, но и реальными правами.
Если он не должен трогать файлы, сеть или отправку данных, то этих действий у него просто не должно быть в инструментах. Было бы интересно увидеть отдельный чек-лист минимальных прав для таких систем.
Хороший разбор. особенно близко про критерии остановки, когда агент должен не сам продолжать, а вернуть задачу человеку. А обычно это задается через список запретов или отдельным шагом проверки перед самим действием?
Для такого сравнения не хватает числа повторов. Одна лучшая генерация показывает потолок модели, но не её стабильность. Было бы полезно сравнить долю удачных дублей и стоимость одного пригодного результата.
очень круто, можно еще фиксировать настройки и стоимость каждой попытки. После нескольких генераций уже сложно вспомнить, какой промпт, качество и длительность реально дали нормальный результат.
Да, с LLM классический баг-репорт быстро разваливается. Без сохранения промпта, контекста, версии модели и ожидаемого критерия качества потом сложно даже повторить проблему, не то что нормально её исправить.
Хорошая мысль, что оценивать надо не модель, а всю систему. Без evals под реальные сценарии легко принять красивое демо за рабочий продукт.
Спасибо, хороший разбор. Для себя вынес простую мысль: агенту лучше ограничивать не только промптом, но и реальными правами.
Если он не должен трогать файлы, сеть или отправку данных, то этих действий у него просто не должно быть в инструментах. Было бы интересно увидеть отдельный чек-лист минимальных прав для таких систем.
Хороший разбор. особенно близко про критерии остановки, когда агент должен не сам продолжать, а вернуть задачу человеку. А обычно это задается через список запретов или отдельным шагом проверки перед самим действием?