В современных MoE нет жесткой специализации по доменам. Скорее модель учится так, чтобы равномерно загружать экспертов при обучении (иначе возникает дисбаланс, портящий эффективность обучения и качество). Но мы старались учить модель на различных данных, включая научные и не исключая научнопопулярные тексты. Так что успехов вам в том, чтобы пробовать модель для своих задач
Попробуй добавить
transformers[sentencepiece]==5.16.1при установке трансформерсВ современных MoE нет жесткой специализации по доменам. Скорее модель учится так, чтобы равномерно загружать экспертов при обучении (иначе возникает дисбаланс, портящий эффективность обучения и качество). Но мы старались учить модель на различных данных, включая научные и не исключая научнопопулярные тексты. Так что успехов вам в том, чтобы пробовать модель для своих задач
В карте модели также есть небольшой пример дообучения, и полезный абзац про формат https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Про MoE слышали что-то? Рекомендую ознакомиться
В образе, приложенном на hf для запуска используется ветка с нашим патчем в vllm. В ближайшее время откроем pull request.
Нет же такой модели https://huggingface.co/collections/Qwen/qwen38