Pull to refresh

Comments 26

Все не любят нейрослоп, но для данной статьи он был бы спасением:)) Вы ненавидите запятые? Попросите ИИ проставить знаки препинания, вернуть потерянные буквы и поправить орфографию.

Для этого и Word 6.0 хватило бы, не надо ИИ.

А вот практическую часть ждём - пусть аффтырь напугает нас тестами! )))

=============================================================

PS: 29 июля 2026 года автору 14 лет.

ПРЕДУПРЖДЕНИЕ : Автору 14 лет 

А 8 апреля 2025 года ему было 11 лет.

В этом вашем IT год за 3 идет, как в полярных войсках? Срочно запретить IT!!! :)))

В реальности мне 13 день рождение 17 мая просто я увеличиваю возраст чтобы люди не думали что я малолетка

В инете возраст так-то вообще значения не имеет, и более того...

...«В интернете никто не знает, что ты кот» (с) ;)

Я как 40 летний преподаватель и человек который занимается наукой скажу:

  1. Все кто тыкает пальцем на возраст при проведении исследований - шли по дальше

  2. Занимайся дальнейшими исследованиями

  3. Не забывай что у тебя юность и побей крапиву палкой

Извините, в следубщей статье буду более старательно ставить запятые сам заметил что получилось таксебе

Лучше уже эту отредактировать через Word. Я так просто её не смог читать:-(
Да и ошибки типа "в следубщей ", как выше, объясняются просто тем, что текст даже не прочитан автором после печати, а не банальной плохой грамотностью. Не очень такой подход вежлив по отношению к читателям.

для получения 77.20% - на сколько дольше модель стала думать?

на 10% быстрее довольно странный результат но это правда вы можете сами скачать и проверить я сам в шоке

Чтобы добавить больше ума, нам нужно добавить больше слоев, но тогда будет больше вычислений. Из-за ограниченных возможностей моей видеокарты я физически не смог поставить больше слоев дообучением.

Дообучение не добавляет слои. Оно обновляет веса на уже имеющихся слоях - все или только части слоев.

Конечно, можно дообучать и с добавлением новых слоев. Но это скорее частный случай.

Да, спасибо что поправили наверное правильно было сказать что чтобы сделать умнее надо брать большую модель.

Вообще крутая штука, но до сих пор не могу понять, как она работает, поэтому спросите ИИ-чат-бота, он вам поможет, а я перейду далее.

Идёт коррекция: с каждой последующей итераций цикла получаются меньшие величины

GSM8K Benchmark Results (N=500)

Непонятно на каких данных дообучалась модель. Если на данных этого бенчмарка, тогда такой результат неудивителен - модель просто "узнала" тестовые данные. А этого нельзя делать, модель не должна видеть тестовые данные. Иначе она их "запомнит" вместо понимания закономерностей.

Необходимо отделять тренировочные данные от тестовых.

Это одинкаовая модель суть была в том что модель прогоняет это у себя в голове

DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M

Вы тренировали дистиллированную модель. Это по-умолчанию делает задачу по дообучению бессмысленной. Дистиллированные модели не обучают.

Дистиллированные модели получают посредством "передачи знаний" от старшей большой модели к меньшей модели. От учителя ученику. При этом передача происходит с минимальной потерей знаний.

Но дистиллированные модели нельзя дообучать. Их размер слишком маленький, и они не могут самостоятельно получить тот же уровень знаний, что они унаследовали от "учителя". Дообучение неизбежно приведёт к деградации и падению эффективности.

В статье не было ничего про обучение моделей пожалуйста перечитайте статью

Ведь форк llama.cpp это движок по запуску моделей

Хочешь признания и реального интереса к своей идее? Сделай тоже самое с qwen 27b/32b и vllm, эту связку используют в работе многие компании для локального инференса по документации. Если на этой связке получишь прирост, то тебя будут ждать в кремниевой долине

Вторая статья уже в процессе и прирост есть в ущерб скорости но ущерб всего 10% при этом агент смог сделать намного больше чем базовый

Подписался, буду ждать с нетерпением

Я правильно понимаю, что ты ничего не дообучал, а просто в претрене зациклил некоторые слои? Почему именно эти? Вообще сам уже давно хочу рекурентный трансформер сделать, но железа нет :( только я дообучать хочу еще, просто претрена не хватит точно. Но направление у вас явно верное, очень интересно, если даже без дообучения уже есть приросты! Надо еще как-то поэкспериментировать с выбором слоев, мб добавить какой-нибудь маленький слой промежуточный, той же лорой его обучить. Но железа надо много для хороших метрик в любом случае, это меня и останавливает до сих пор. Вам удачи, жду вторую часть!

Нет не претрен прямо во время запуска модели инференса я выбирал по своей чуйке если честно мне показалось что важнее всего гдето серединка там вся умность и так просто протестировал разные варианты сейчас тестирую на 32b и она думает как 70b вобщем позже опубликую статью об этом

А здесь не то же самое происходит, когда модель "рассуждает" или когда сказали улучшить ответ? Только более быстро за счёт пропуска нескольких слоев

Нет не тоже самое это скрытые рассуждения для каждого токена это не может сравниться с текстовыми рассуждениями

Sign up to leave a comment.

Articles