Обновить

Результаты исследования подчеркивают как потенциал, так и ограничения использования больших языковых моделей (LLMs) для автоматизированной оценки эссе. LLM, несмотря на высокую степень согласования с оценками людей по языковым критериям, склонны завышать итоговые оценки. Модели GPT-4, o1 и Mixtral в среднем выставляют более высокие баллы, чем человеческие эксперты.

Закрытые модели, особенно o1, демонстрируют большую надежность при повторных запусках и более сильную корреляцию с человеческими оценками по сравнению с открытыми моделями, такими как LLaMA 3 и Mixtral. Модель o1 показала высокую корреляцию в восьми из десяти категорий оценки, особенно тесно совпадая с человеческими суждениями по языковым аспектам.

https://arxiv.org/pdf/2411.16337

Теги:
Рейтинг0
Комментарии0

Трамп перемирил AI-техбро, а также новый бюджет РФ на 2027: главное за неделю

Самые интересные новости финансов и технологий в России и мире за две недели: Флорида пытается через суд притормозить OpenAI, из РФ запретили вывозить много налички, Китай включил экспортный контроль за своими AI-спецами, Anthropic подали заявку на IPO, OpenAI запустил агентов-точечек, но отложил новую GPT-6.1 Astra из-за проблем с безопасностью, а Google тоже не спешит выпускать Gemini 4 Argon.

Трамп перемирил AI-техбро, а также новый бюджет РФ на 2027: главное за неделю

Публикации