Обновить

Комментарии 2

Самое ценное здесь, на мой взгляд, не итоговая таблица моделей, а отдельные оси «верно», «подтверждено источником» и «честно отказалась», плюс сохранение провалов.

Но один прогон на комбинацию всё ещё смешивает качество конфигурации с дисперсией. После первичного отсева я бы повторил именно граничные и дорогие ошибки: ловушки, пустой поиск и ситуации, где модель должна отказаться от записи.

Тогда можно сравнивать не только средний pass rate, но и вероятность хотя бы одного опасного провала на серию. Иначе результат 24/24 может оказаться просто удачным одиночным прогоном.

Да, это мысль хорошая. Правда, Клод уже все, а вот Deepseek можно дальше погонять.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации