Pull to refresh
8K+
3
Софья Кузьмина@photonchikk

User

3
Rating
8
Subscribers
Send message

спасибо, замечание точное. прогнали оба варианта на пяти сплитах (разный seed - своя подвыборка 60k и свое разбиение) плюс отдельно бинарный вариант без нейтрали

разброс на 3 класса (macro-F1):
• TF-IDF 1-2-gram: 0.668 ± 0.005
• rubert-tiny2 взвешенный: 0.682 ± 0.009
• парная разница по сплитам: +0.015 ± 0.010, положительная на всех пяти ([+0.003, +0.009, +0.021, +0.027, +0.013])

Вы правы. собственный разброс каждой модели уже больше тех 0.004 из статьи, так что на одном seed объявлять разницу шумом было, с моей стороны, некорректно. при этом попарно на одном сплите трансформер стабильно впереди, но немного, около полутора пунктов macro-F1. так что конечно не «вровень», а «маленький, но устойчивый перевес». формулировку в тексте поправлю

без нейтрали (бинарно негатив/позитив, seed 42): TF-IDF 0.869, rubert-tiny2 0.904, разница +0.035. паритет не держится, трансформер отрывается заметнее. похоже, нейтраль стягивала числа вместе, а не создавала разницу

что не поменялось - цена: даже +0.035 стоят ~170× по времени обучения и ~40× по инференсу на CPU. поэтому вывод немного переформулирую. замер разброса добавлю в статью отдельным апдейтом, спасибо за дельный разбор!

На мой взгляд, результат вполне ожидаемый. Qwen3-Embedding-0.6B - младшая модель линейки, а BGE-M3 остается сильным универсальным эмбеддером своего класса. Поэтому на обычном retrieval-сценарии без дополнительной адаптации большого выигрыша от перехода на Qwen ждать не стоит

Из практики внедрения RAG-систем я бы ещё отметила, что сильная сторона decoder-based эмбеддеров часто не столько в качестве retrieval из коробки, сколько в гибкости. они хорошо работают в сценариях, где используются инструкции для разных задач или планируется доменная адаптация через LoRA/файнтюн

Если же задача сводится к классическому retrieval без инструкций и без дополнительного обучения, то зрелые encoder-based модели вроде BGE-M3 нередко остаются очень конкурентными как по качеству, так и по требованиям к ресурсам

По производительности наблюдение тоже совпадает с моим опытом: decoder-based модели обычно тяжелее в инференсе. Если длинный контекст и дополнительные возможности модели не используются, то практический выигрыш от перехода может оказаться минимальным

Спасибо, что поделились опытом!

jina-embeddings-v2-base-de действительно остается сильным вариантом для немецкого корпуса

Если в будущем появятся английские или другие языки, можно посмотреть в сторону jina-embeddings-v3. Она изначально мультиязычная и обычно дает больше гибкости для кросс-язычного поиска и смешанных корпусов

Как и всегда с эмбеддингами, финальное решение лучше принимать после сравнения на своем датасете - разница между моделями сильно зависит от конкретной задачи

Information

Rating
1,585-th
Location
Москва, Москва и Московская обл., Россия
Registered
Activity

Specialization

Ученый по данным, ML разработчик
Ведущий