Comments 5
@NikitaMartynov Привет! Отличная статья.
1) Подскажите, почему тестировали именно Claude 3.5 Sonnet ?
2) Давали ли вы контекст, если нет то почему, моделям для понимания роли (экспертная ситуация) что они находятся в России или где то еще ?
Привет!
1) Модели для тестирования выбрали по позиции на аренах и мере; + в спорных случаях учитывали опыт взаимодействия разработчиков с моделями, когда, например, модель по ощущениям ведёт себя очень хорошо для русского языка, и её очень хотелось бы потестировать; если вопрос адресован версии модели, то выбор моделей происходил в ноябре 2024 года, а на тот момент выбранные LLM представляли собой последние версии соответствующих семейств, надеюсь ответил.
2) Нет, конкретно информацию про географическую точку мы не давали. Во-первых, из соображения того, что русским языком могут пользоваться не только в России, во-вторых, хотелось посмотреть, насколько модель без указания конкретных реалий, в которых она находится, будет делать ремарки и осознавать в полной мере тот факт, что она по идее точно не знает своё окружение, а соответственно, ей бы надо это в ответе учитывать, особенно в рекомендациях.
В среднем у экспертов уходило 40 минут для разметки одного ответа по всем критериям. Суммарное время разметки датасета POLLUX составило 24 447 человеко-часов — с учётом всех оценок и переразметок.
Секундочку! Вы потратили на это 14 человеко-лет??? Нет ли тут ошибки, и кто оплатил это?
Добрый день, вроде бы только около трёх лет, если просто переводить часы в года; плюс можно посмотреть в приложении L статьи (ссылка в шапке поста), что на разметке критериев у нас трудилось где-то 93 человека, то есть вот эти три года - это делает один человек, а если это делают 100 человек параллельно по 8 часов в день, то это уже около месяца работы; с учётом того, что не все эксперты работали в параллель и не все были заняты по 8 часов в день, работа заняла, конечно, не 1 месяц, но вполне себе адекватный срок. На шаг по сбору такого штата экспертов пошли, чтобы покрыть все компетенции, которые требовались для разработки датасета, и тем самым обеспечить соответствующее высокое качество, ну и развитие области как следствие.
POLLUX: оценка генеративных способностей моделей для русского языка