Комментарии 5
Воспроизводимость здесь хромает по своей природе: у языковой модели нет фиксированного состояния, и на то же задание завтра она ответит иначе.
Хмм ну вы хотя бы промт который дали моделям выложите дословный, так можно было бы попробовать посмотреть результаты на других моделях и другом агентском окружении, и проверить итоговый результат, если вы правы то сценарий поломки будет у всех примерно одинаковый.
(задумчиво) Вот чем хорошо общение с ИИ - нейронку учишься определять по первому предложению. И дальше читать уже не хочется. Потому что ответы нейронок, хотя и содержат иногда дельные факты, всё-таки чаще напоминают старый студенческий мем "с точки зрения банальной эрудиции..." (и далее по тексту).
Про 6 пункт не поместившийся в таблице. На мой взгляд - это песня...
Сам имею 3К+ диалогов, в не пар вопрос-ответ. Напмсано с помощью LLM это просто сегодняшняя реальность, как гравитация и воздух.
И да транс- мета- транс-мета- мета-транс, мета-мета- и прочие анализы никто не отменял.

Определитель повадок: пять способов, которыми разговор с LLM имитирует доказательство