Список кандидатов растет быстрее, чем я успеваю их прогонять. Julia-1 - любопытный случай: 144 млн, mmBERT и все локально. На фоне Laya у нее есть шанс выглядеть заметно лучше.
Спасибо! С таким темпом общая таблица устареет раньше, чем допишется. Kev, Jeff и Julia-1 - первые кандидаты. Наборы и код открыты, так что продолжить можно без переделки - https://github.com/stemirkhan/jev-laya-benchmarks
В рабочих проектах Jev пока не использую, потому что он проприетарный. Присматриваюсь к открытым аналогам, например Laya. Экспериментально пробовал связку Jev + LLM на лидах. Jev распределяет их по группам, а если сомневается, подключается большая LLM. Дальше лиды обрабатывают LLM-агенты. Возможно, напишу об этом отдельно. Не всегда нужен ответ за доли секунды, а вот длинная история переписки может не поместиться в контекст Jev.
Спасибо! Для статьи я подготовил 50 синтетических комментариев и перевёл их на английский, а не использовал готовый публичный бенчмарк. В тесте заметил, что "похвала" и "обратная связь" пересекаются по смыслу. Уточнил категории и заново прогнал все модели на тех же комментариях. Новую выборку после этого не делал, на реальных данных пока не проверял.
Спасибо за наводку! По описанию Google, DiffusionGemma генерирует текст блоками, обрабатывая несколько позиций параллельно. Интересно проверить, какой выигрыш это даст именно здесь, где ответ - одна категория или короткий JSON. Высокая скорость генерации текста ещё не говорит, сколько займёт весь такой запрос. Поэтому сравнение действительно имеет смысл.
Список кандидатов растет быстрее, чем я успеваю их прогонять. Julia-1 - любопытный случай: 144 млн, mmBERT и все локально. На фоне Laya у нее есть шанс выглядеть заметно лучше.
Спасибо! С таким темпом общая таблица устареет раньше, чем допишется. Kev, Jeff и Julia-1 - первые кандидаты. Наборы и код открыты, так что продолжить можно без переделки - https://github.com/stemirkhan/jev-laya-benchmarks
В рабочих проектах Jev пока не использую, потому что он проприетарный. Присматриваюсь к открытым аналогам, например Laya. Экспериментально пробовал связку Jev + LLM на лидах. Jev распределяет их по группам, а если сомневается, подключается большая LLM. Дальше лиды обрабатывают LLM-агенты. Возможно, напишу об этом отдельно. Не всегда нужен ответ за доли секунды, а вот длинная история переписки может не поместиться в контекст Jev.
Спасибо! Для статьи я подготовил 50 синтетических комментариев и перевёл их на английский, а не использовал готовый публичный бенчмарк. В тесте заметил, что "похвала" и "обратная связь" пересекаются по смыслу. Уточнил категории и заново прогнал все модели на тех же комментариях. Новую выборку после этого не делал, на реальных данных пока не проверял.
Да, с маленькой Gemma тоже стоит сравнить. Спасибо за идею!
Спасибо за наводку! По описанию Google, DiffusionGemma генерирует текст блоками, обрабатывая несколько позиций параллельно. Интересно проверить, какой выигрыш это даст именно здесь, где ответ - одна категория или короткий JSON. Высокая скорость генерации текста ещё не говорит, сколько займёт весь такой запрос. Поэтому сравнение действительно имеет смысл.