Обновить
1
Антон@trueanton1read⁠-⁠only

Пользователь

Отправить сообщение

Учим небольшую LLM с нуля: гибридное внимание, XSA, доменные бленды и загадки роста онлайн-бенчмарков

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели7.9K

Обучение LLM — это в первую очередь инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или другим расписанием обучения и получать повторяемый внутри команды результат. В этом материале — рассказ команды обучения и инференса моделей RWB о том, как мы с нуля, без загрузки pretrained-весов, обучили текстовую модель на основе гибридной архитектуры Qwen3.5-2B-Base и какие выводы сделали по пути — от сборки датасетов до чтения графиков онлайн-оценки.

Читать далее

Информация

В рейтинге
Не участвует
Зарегистрирован
Активность

Специализация

ML разработчик
Ведущий