Комментарии 4
Воспроизводимость здесь хромает по своей природе: у языковой модели нет фиксированного состояния, и на то же задание завтра она ответит иначе.
Хмм ну вы хотя бы промт который дали моделям выложите дословный, так можно было бы попробовать посмотреть результаты на других моделях и другом агентском окружении, и проверить итоговый результат, если вы правы то сценарий поломки будет у всех примерно одинаковый.
(задумчиво) Вот чем хорошо общение с ИИ - нейронку учишься определять по первому предложению. И дальше читать уже не хочется. Потому что ответы нейронок, хотя и содержат иногда дельные факты, всё-таки чаще напоминают старый студенческий мем "с точки зрения банальной эрудиции..." (и далее по тексту).
Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Определитель повадок: пять способов, которыми разговор с LLM имитирует доказательство