Обновить
1
Вадим@vadisun

Пользователь

Отправить сообщение

Для такого сравнения не хватает числа повторов. Одна лучшая генерация показывает потолок модели, но не её стабильность. Было бы полезно сравнить долю удачных дублей и стоимость одного пригодного результата.

очень круто, можно еще фиксировать настройки и стоимость каждой попытки. После нескольких генераций уже сложно вспомнить, какой промпт, качество и длительность реально дали нормальный результат.

Да, с LLM классический баг-репорт быстро разваливается. Без сохранения промпта, контекста, версии модели и ожидаемого критерия качества потом сложно даже повторить проблему, не то что нормально её исправить.

Хорошая мысль, что оценивать надо не модель, а всю систему. Без evals под реальные сценарии легко принять красивое демо за рабочий продукт.

Спасибо, хороший разбор. Для себя вынес простую мысль: агенту лучше ограничивать не только промптом, но и реальными правами.

Если он не должен трогать файлы, сеть или отправку данных, то этих действий у него просто не должно быть в инструментах. Было бы интересно увидеть отдельный чек-лист минимальных прав для таких систем.

Хороший разбор. особенно близко про критерии остановки, когда агент должен не сам продолжать, а вернуть задачу человеку. А обычно это задается через список запретов или отдельным шагом проверки перед самим действием?

Информация

В рейтинге
6 071-й
Зарегистрирован
Активность

Специализация

Менеджер проекта, Менеджер продукта
Средний
Управление проектами
Ведение переговоров
HTML
Adobe Photoshop
SQL
Python
REST
Базы данных
ООП