Обновить

Результаты исследования подчеркивают как потенциал, так и ограничения использования больших языковых моделей (LLMs) для автоматизированной оценки эссе. LLM, несмотря на высокую степень согласования с оценками людей по языковым критериям, склонны завышать итоговые оценки. Модели GPT-4, o1 и Mixtral в среднем выставляют более высокие баллы, чем человеческие эксперты.

Закрытые модели, особенно o1, демонстрируют большую надежность при повторных запусках и более сильную корреляцию с человеческими оценками по сравнению с открытыми моделями, такими как LLaMA 3 и Mixtral. Модель o1 показала высокую корреляцию в восьми из десяти категорий оценки, особенно тесно совпадая с человеческими суждениями по языковым аспектам.

https://arxiv.org/pdf/2411.16337

Теги:
Рейтинг0
Комментарии0
ЕЖЕДНЕВНЫЙ ХАБР | 12 АВГ 2026
Охват29K

Мир, рассчитанный на рост, заканчивается

Некоторые графики объясняют происходящее лучше, чем десяток книг с прогнозами. Вот, например.

Это структура демографической нагрузки в Европе с 1950 года. В 1950-м на сто человек трудоспособного возраста приходился 41 ребёнок и 12 пожилых. В 2023-м - 24 ребёнка и 31 пожилой. Сама нагрузка почти не сдвинулась: 53 иждивенца тогда, 55 сейчас. Перевернулась её структура.

Раньше большинство тех, кого содержало работающее общество, только собирались войти в экономику. Теперь всё большая доля иждивенцев из неё, наоборот, выходит. За этим сдвигом проявляется смена модели, на которой держится почти всё, что мы считаем устройством нормальной жизни.

Мир, рассчитанный на рост, заканчивается

Публикации