Comments 26
Все не любят нейрослоп, но для данной статьи он был бы спасением:)) Вы ненавидите запятые? Попросите ИИ проставить знаки препинания, вернуть потерянные буквы и поправить орфографию.
Для этого и Word 6.0 хватило бы, не надо ИИ.
А вот практическую часть ждём - пусть аффтырь напугает нас тестами! )))
=============================================================
PS: 29 июля 2026 года автору 14 лет.
ПРЕДУПРЖДЕНИЕ : Автору 14 лет
А 8 апреля 2025 года ему было 11 лет.

В этом вашем IT год за 3 идет, как в полярных войсках? Срочно запретить IT!!! :)))
В реальности мне 13 день рождение 17 мая просто я увеличиваю возраст чтобы люди не думали что я малолетка
В инете возраст так-то вообще значения не имеет, и более того...
...«В интернете никто не знает, что ты кот» (с) ;)
Я как 40 летний преподаватель и человек который занимается наукой скажу:
Все кто тыкает пальцем на возраст при проведении исследований - шли по дальше
Занимайся дальнейшими исследованиями
Не забывай что у тебя юность и побей крапиву палкой
Извините, в следубщей статье буду более старательно ставить запятые сам заметил что получилось таксебе
для получения 77.20% - на сколько дольше модель стала думать?
Чтобы добавить больше ума, нам нужно добавить больше слоев, но тогда будет больше вычислений. Из-за ограниченных возможностей моей видеокарты я физически не смог поставить больше слоев дообучением.
Дообучение не добавляет слои. Оно обновляет веса на уже имеющихся слоях - все или только части слоев.
Конечно, можно дообучать и с добавлением новых слоев. Но это скорее частный случай.
Вообще крутая штука, но до сих пор не могу понять, как она работает, поэтому спросите ИИ-чат-бота, он вам поможет, а я перейду далее.
Идёт коррекция: с каждой последующей итераций цикла получаются меньшие величины
GSM8K Benchmark Results (N=500)
Непонятно на каких данных дообучалась модель. Если на данных этого бенчмарка, тогда такой результат неудивителен - модель просто "узнала" тестовые данные. А этого нельзя делать, модель не должна видеть тестовые данные. Иначе она их "запомнит" вместо понимания закономерностей.
Необходимо отделять тренировочные данные от тестовых.
DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M
Вы тренировали дистиллированную модель. Это по-умолчанию делает задачу по дообучению бессмысленной. Дистиллированные модели не обучают.
Дистиллированные модели получают посредством "передачи знаний" от старшей большой модели к меньшей модели. От учителя ученику. При этом передача происходит с минимальной потерей знаний.
Но дистиллированные модели нельзя дообучать. Их размер слишком маленький, и они не могут самостоятельно получить тот же уровень знаний, что они унаследовали от "учителя". Дообучение неизбежно приведёт к деградации и падению эффективности.
Хочешь признания и реального интереса к своей идее? Сделай тоже самое с qwen 27b/32b и vllm, эту связку используют в работе многие компании для локального инференса по документации. Если на этой связке получишь прирост, то тебя будут ждать в кремниевой долине
Я правильно понимаю, что ты ничего не дообучал, а просто в претрене зациклил некоторые слои? Почему именно эти? Вообще сам уже давно хочу рекурентный трансформер сделать, но железа нет :( только я дообучать хочу еще, просто претрена не хватит точно. Но направление у вас явно верное, очень интересно, если даже без дообучения уже есть приросты! Надо еще как-то поэкспериментировать с выбором слоев, мб добавить какой-нибудь маленький слой промежуточный, той же лорой его обучить. Но железа надо много для хороших метрик в любом случае, это меня и останавливает до сих пор. Вам удачи, жду вторую часть!
Нет не претрен прямо во время запуска модели инференса я выбирал по своей чуйке если честно мне показалось что важнее всего гдето серединка там вся умность и так просто протестировал разные варианты сейчас тестирую на 32b и она думает как 70b вобщем позже опубликую статью об этом
https://github.com/mudler/apex-quant а вот тут ребята считают что в модели можно сжать середину, оставив края менее квантоваными.
А здесь не то же самое происходит, когда модель "рассуждает" или когда сказали улучшить ответ? Только более быстро за счёт пропуска нескольких слоев
Как я смог запустить 32b модель и сделать ее умнее в два раза на 3050