Pull to refresh

Comments 7

Звезду в Carmo за опенсорс)

Делал ровно то же самое, получил ускорение на llm классификаторе на gemma 4 e4b в 3.5 раза (input 500-700 токенов/output 150-200 (в generative варианте)) на vllm.

Я бы на месте автора провел тест согласованность выборов модели на одной задаче в генеративном и логит варианте.

Также бы проверил как влияет перестановка вариантов местами в промпте (мой опыт 22% изменений ответов, при смене порядка выдачи вариантов модели на той же e4b). ChatGPT объясняет это instructed обучением, и тяготением к первому выбору, но я пока не осмысливал и не проверял.

Jev - это llm пустили под нож, чтобы ускорить работу и удешевить токены. А вы в своем примере используете обычную llm, обернутую в python код. Т.е. никакой речи об экономии или быстрой работе нет и быть не может. Тогда в чем посыл вашей статьи?

Тут большая фундаментальная ошибка. Логиты это совсем другие вероятности, это совсем не вероятность классификации, это просто показывает уверенность модели при генерации последовательности токенов (условно, что одна буква должна следовать за другой).

Для этого делают софтмакс, словарь токенов надо ограничить вариантами выбора, считая все остальное в -бесконечность. Получается нормированное распределение по вариантам ответа. Т.е. сама задача выбора одного (единственного) токена в ограниченном словаре вариантов ответов и делает вероятность предсказания следующего токена распределением по вариантам ответа.

Чуваки вы угараете это обычная интент задача распознавания запроса, ее через парсер даже можно решить, она будет просто в 1 секунду ответ давать. Я получается этого Jev еще в 2024 сделал. Ну и отлично.

>Загрузим модель

>Qwen3-0.6B

Смешная шутка. Осталось это только на VDS развернуть.

Sign up to leave a comment.

Articles