Comments 13
Исследование интересное, но как же в глаза бросается нейроночность текста... Обрывистый стиль Claude нейронок сразу узнается.
Сравнивал на 928 позициях из технических спецификаций госзакупок
Давайте проведем эксперимент, выложите пожалуйста их списком куда-нибудь вместе с сылкой на используемый ОКТРУ, а я сделаю независимую проверку и напишу о результатах здесь или в отдельной статье.
https://github.com/redflags-ai/oktru2-techspec-928 — 928 позиций техспецификаций госзакупок с кодами ОКТРУ и 30-ю кандидатами из ретрива, справочник ОКТРУ там же для удобства, ну или можно официальный скачать тут: https://www.ksm.kz/ru/info/oktru/
"Английский как основной язык модели. На русских описаниях товаров она сработала лучше всех, но это один домен и один язык." А как решали вопрос с казахским языком? В доках Qwen казахский язык в списке рабочих языков.
латенси на позицию.
Анбеливибл)
Также можно брать для обычной LLM max_tokens по минимальному разнообразию вариантов выбора (вероятно 1 раз у вас 30 позиций подаются на вход), брать логиты и считать софтмакс по ограниченному словарю. Получится примерно тот же Jev-подобный вывод, но на той же модели которую вы уже используете в проде, с примерно той же экономией на decode и kv-cache, что еще и позволит увеличить количество одновременныз воркеров если вы это делаете на своем железе.
Тест Jev в качестве реранкера против LLM на классификации товаров по справочнику из 78 тысяч кодов