Обновить

Кто на самом деле сломал вашего ИИ-агента: модель или обвязка?

Уровень сложностиСредний
Время на прочтение23 мин
Охват и читатели7.6K
Рейтинг0
Комментарии3

Комментарии 3

Зачем высирать столько нейрослопа?

Можно поконкретнее?

Пересчитала ансамбль судей в абсолютных числах: одиночный GPT-5.5 дает 0.80 на всех 40 примерах, это 32 верные метки; трое из четырех — 0.83 при покрытии 90%, то есть около 30, а единогласие — 0.96 при 68%, уже 26. Точность растет, а верно размеченных случаев становится меньше, причем воздержание приходится ровно на спорную атрибуцию. Отдельно смущает, что E1-E40 — те же проработанные примеры, на которых таксономию и собирали, а судьям выдали и определения, и первоисточник: 0.76 тогда меряет воспроизводимость разметки, а не перенос на незнакомые отказы. В статье есть прогон судей на примерах, не участвовавших в построении каталога?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации