Обновить

Комментарии 18

Я тоже тетрисом тестирую, только горизонтальным и двойным. Пока что только Гемма-4 31b fp8 смогла с первого раза без пинков по одному промпту сделать рабочую игру.

А вообще, очень хороший результат если Квин 3.6 27b и Гемма-4 31b (обе в FP8) в паре работают - одна другую проверяет, пока не будет консенсуса.

Гемму лучше первой запускать - она более лаконичная. Квен всё время раздувает код.

Думающий режим - только мешает в большинстве случаев.

какая-то наркомания в вашей игре

впечатление как будто пьяным сел играть и постоянно меняется раскладка для игры. И то что выбор стороны случайный тоже не помогает)

Там всё логично. Не сдавайтесь, играйте :)

В таком формате запускать модели одной карточки точно не хватит, тем более вы говорите что запускаете 2 модели сразу... У вас наверняка не одна карточка)

Код от Квена потом замучаешься рефакторить от лишнего мусора

таблица в примечаниях трижды скопировалась, но в остальном интересно

я сам думаю как раз пересаживатся с подписочные на локальные по многим причинам и приятно видеть такие статьи - на huggingface милиарды моделей и какая лучше всего тебе подойдет хз

к слову вопрос - а как картина на расцензуреных? я знаю что они хуже кодят в пределах 2% но проверяли ли вы в реальности наживую?

Да, там есть еще и всякие квопусы... И как-то я пробовал но мне что-то не понравилось. Надо бы еще раз попробовать. Почему-то эти расцензуренные версии не вызывают доверия)

ну я пробовал их и в плане "нет интернета но нужно знать" они лучше чем обычные. потому как банальные вопросы по медецине и обычные сразу "нельзя". тесты так же.

в плане корректности - BAT-вирус расцензуренная написала верно, как и советы как можно сделать взрывчатку дома (имею опыт в детсве и в личной библиотеке книгу анархиста)

из последнего что заметил (исследование) современные подписочные вообще не дают рассиских анекдотов. с локальными еще не експерементировал на этом, как раз жду как приедет железо помощнее

Расцензуренные сетки годятся только для генерации бреда и фанфиков)

есть цифры и примеры хотя бы из личного опыта?

а то может вы там пыталитсь на 2b получить результат как от клода

Расцензуренные кодят лучше оригинальных не потому что выдают нечто "запретное", а потому что у них нет тормозов в виде цензуры, как ни странно. Изучите, как их цензурят, и как это делается наоборот - просто для лучшего понимания. Вот только не все uncensored модели - без цензуры. Или цензуры нет, но взяты изначально слабые модельки. Из "хороших" могу отметить модели с расцензуриванием типа "Heretic", программка для этого лежит на гитхабе, но нужна не она а вполне неплохое описание, как это все работает. В итоге Тетрисы и всякие программки вполне нормально пишутся моделью Gemma 4 31B Instruct Uncensored Heretic, несмотря на то, что Гемма изначально не заточена на код. Qwen 3.6 тоже очень неплоха.

Выше уже привели пример двух моделей работающих в паре. У меня с таким подходом Qwen 3.5 9b оно таки написало целую трехмерную игрушку. Модель одна в памяти сидит, а в скрипте сделаны разные контексты и разные системные промпты. Первый инстанс - программер, второй инстанс - тестировщик, который ревьюит код, запускает его и смотрит ошибки в консоли, а также дает советы по переписыванию кода. Итак до того, что игра хотя бы запустится....Несмотря что на видеокарте вся конструкция просто летает и генерит токены вагонами, что-то рабочее получается далеко не с первой попытки, дано 10 попыток во избежание переполнения контекста. И вот таким вот образом, запущенный на сутки, этот двухголовый монстр написал таки работающую (запускающуюся) версию майнкрафта (на питоне). Там можно даже ходить и ставить блоки, я вообще не ожидал что 9b моделька вообще на такое способна. А почему сутки? Потому что за сутки было написано около 15 готовых игр, которые хотя бы запускались без ошибок, но и все на этом. И еще очень много пустых попаданий, когда "программер" за 10 попыток не мог победить все свои косяки. Между тем "ревьюер" понравился мне больше - он действительно давал грамотные советы по улучшению кода, а вот программер далеко не всегда этим советам следовал. Короче, прикольно.

спасибо за развернутый ответ

Что вообще такое "Qwen 3.6" ? Это не конкретное название модели

Есть Qwen 3.6 36b a3b
Есть Qwen 3.6 27b

И они очень сильно друг от друга отличаются. Не говоря уже о том, что очень сильные отличия будут еще и от квантование. Оно тут тоже не указано. Отличия так же будут даже от количество контекста. А еще очень много даст подключенные MCP и выбор агента.

Согласен. Там в таблице тестирования я добавлял и ссылки и пояснения к моделям, причем ссылки на квантованые уже. Надо пожалуй больше контекста именно в статье оставить

Хотя если так разобраться МОЕ модели в заголовке говорят о чем-то)

Мне gemma4-26b нравится в обычном общении. Я имею ввиду просто поговорить, воспользоваться как энциклопедией. Задаю ей в системном промтте чтобы общалась на ты, с сарказмом, юмором и уместным матом и ловлю лулзы. Qwen3.6 в этом плане не такой весёлый.

Квантованная gemma-4 кстати вполне сносно запустилась у меня на не очень свежем ноуте с Ryzen5 и 16Gb RAM

Почему это находиться в "простых" статьях?) Хотя довольно интересно

Хорошая статья, спасибо, но тестирование десятка тяжелых моделей на трех примитивных играх в браузере вряд ли доказывает их готовность к реальным задачам в продакшене)

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации