Обновить
5
Alexey@Weron2

АСУТП

9
Подписчики
Отправить сообщение

Надеюсь 35b moe тоже будет

Просто ctrl+c ctrl+v реально как будто глупо, а для живого человека даже обидно когда повторяют дважды одно и тоже. Но вот повторить другими словами задачу чтобы активировать близкие нейроны - это уже как будто имеет смысл. Впрочем это для селовека. Для думающих моделей тоже избыточно если изначально задача описана максимально понятно без домыслов.

Повторение другими словами и примеры - это уже больше человеческий фактор - точно сказал все что хотел, учел все нюансы. Опять же в отличие от человека нейронка редко переспросит если не уазать отдельно.

Такие мысли вслух) за статью спасибо, полезно

Как считается общий балл? Опус вроде как во всех тестах сильнее всех, и только один тест завалил (и то неиполностью) Что может говорить о том что этот тест прошел как-то неправильно

Я уже присылал вам в чат запрос что по программированию было ровно то же самое в вашем рейтинге (на сайте) что 4b модель обгоняла 35b современную. Такие нестыковки не внушают доверия...

Хорошие статьи, интересно читать. Спасибо!

Было бы интересно еще в кодинге что-то. Вроде есть stackoverflow датасеты на русском. Но тут посетила мысль, что такие маленькие модели вряд ли на что-то способны серьезное, тот же терсис на html.. как я думаю проблема в том что если говорить о вайбеодинге - то модель должна хорошо понимать русский язык чтобы понимать задачу и кроме прочего иметь много знаний и по программированию. Сможет ли все это уместиться в миллиард параметров вот вопрос...

Хлрошая работа!

Мне иногда раздражает ограничения яндекса - чем вызваны непонятно. Почему не дать людям больше свободы чтобы можно было быстро делать свои автоматизации

И еще не совсем в тему но тоже по ограничениям яндекса - из всех современных ии, только у алисы стоят ограничения по токенам и никогда не дописывает код - тупо обрывается на середине слова в середине кода)

В общем яндекс любит вводить искусстевнные ограниячения и я не могу понять зачем они так делают...

Хм, гугл подсказывает что крупнейший поставщик гелия это США - вроде они никуда с рынка не уходили и хотят наоборот больше продавать вводя санкции и пошлины...

Есть еще бесплатные kimi и stepfun. Сделайте тоже). + В карму)

Я тестирую на другом промпте и у меня алиса тоже не дописывает код. Гигачат хуже китайских, но хоть условно играбельно.

Я не знаю, у меня ощущение что те старые модели были даже немного глупее. Тут прям очень достойные ответы учитывая что дома все делалось.

Хм. И все-таки какая цена, просто чтобы самому не искать?

Хотел еще добавить что у меня на 3070 8 гб gemma4 до 30 т/с выдает. Часть соответственно тоже ложится на озу, проц довольно мощный, может поэтому быстрее чем у вас... И обратил внимание что если разогнать озу то и токенов больше (что логично)

И еще кое-что. Рекомендую все же llamacpp. Я могу скинуть свои параметры запуска, если интересно. Думаю будет у вас быстрее работать. Важный параметр cmoe насколько я помню. Экспериментировал с ними и это раьотало отлично. При том что контекст в 65к

Ошущение что еще меньше. Я просил написать стандартно игру для себя и она из 5 раз ни разу недописала. При том что локальные делают и при 8000

Если сделать gguf то сразу больше пользователей будет)

А вообще было бы интересно само описание процесса. Вы говорите берете llama3 открываете ее в какой-то программе, в этой программе указываете датасет, и нажимаете кнопку учись? Или как это происходит? Какая программа? Почему бы не взять за основу ту же gemma4 - более современная

Хотя кажется я вообще не так все понял и llama3 это просто архитектура и от нее ничего не было от готовой. Тогда все еще интереснее - что и как сделать в домашних условиях.

Сами данные такие в большинстве своем, я так думаю

Я согласен. В 2026 считать влезет ли llama 3.1 ну такое. Тут последнее время чуть не раз в неделю новое появляется. Вот недавно mtp модель qwen - у меня что-то не стабильная скорость, быстрее не стало как будто... Может что-то не так делаю. Буду пробовать. Но вот допустим 35b модель работает отлично. 27т/с для этого качества неплохо для моих 8+32озу

Жаль что в некоторые китайско-белорусские бренды такую технологию не завезли... Немного странно что не смогли осилить технологию - неужели так сложно? Или что-то про лицензии возможно?

Понял спасибо)

Да, истории разные тоже слышал. В целом показательно.

Хаха. Неожиданно для него наверное. Вряд ли ответит теперь)

Непонятна история с переводчиком и китайцами. Что там произошло? Китайцы уволили переводчика? Почему? Он в твиче работал?

Почему-то ассистенты в gguf не перегоняют... Есть несколько но они просят другие ветки llamacpp

Хорошая статья. Люблю практические. Запускаю на ртх 3070 8 гб - выдают по 27т/с не уверен что смогу выжать больше, но попробую ваши лайфхаки

Вот вы писали про эти 2 параметра, а в недавней статье говорили что их можно на -cmoe поменять. Это так?

Было бы классно гемма4 с ассистентом потести, но жаль что unsloth не спешит выпустить кванты свои для него. Видимо связано с тем что в llamacpp официально еще не завезли mtp

Скорее всего инфраструктура в видеокартах, потому что асики наверное не подойдут под задачи ии. Только сегодня я с одним товарищем обсуждал это - почему бы не придумать асики для ии.

1
23 ...

Информация

В рейтинге
5 178-й
Зарегистрирован
Активность