Комментарии 18
Я тоже тетрисом тестирую, только горизонтальным и двойным. Пока что только Гемма-4 31b fp8 смогла с первого раза без пинков по одному промпту сделать рабочую игру.
А вообще, очень хороший результат если Квин 3.6 27b и Гемма-4 31b (обе в FP8) в паре работают - одна другую проверяет, пока не будет консенсуса.
Гемму лучше первой запускать - она более лаконичная. Квен всё время раздувает код.
Думающий режим - только мешает в большинстве случаев.
какая-то наркомания в вашей игре
впечатление как будто пьяным сел играть и постоянно меняется раскладка для игры. И то что выбор стороны случайный тоже не помогает)
В таком формате запускать модели одной карточки точно не хватит, тем более вы говорите что запускаете 2 модели сразу... У вас наверняка не одна карточка)
Код от Квена потом замучаешься рефакторить от лишнего мусора
таблица в примечаниях трижды скопировалась, но в остальном интересно
я сам думаю как раз пересаживатся с подписочные на локальные по многим причинам и приятно видеть такие статьи - на huggingface милиарды моделей и какая лучше всего тебе подойдет хз
к слову вопрос - а как картина на расцензуреных? я знаю что они хуже кодят в пределах 2% но проверяли ли вы в реальности наживую?
Да, там есть еще и всякие квопусы... И как-то я пробовал но мне что-то не понравилось. Надо бы еще раз попробовать. Почему-то эти расцензуренные версии не вызывают доверия)
ну я пробовал их и в плане "нет интернета но нужно знать" они лучше чем обычные. потому как банальные вопросы по медецине и обычные сразу "нельзя". тесты так же.
в плане корректности - BAT-вирус расцензуренная написала верно, как и советы как можно сделать взрывчатку дома (имею опыт в детсве и в личной библиотеке книгу анархиста)
из последнего что заметил (исследование) современные подписочные вообще не дают рассиских анекдотов. с локальными еще не експерементировал на этом, как раз жду как приедет железо помощнее
Расцензуренные сетки годятся только для генерации бреда и фанфиков)
Расцензуренные кодят лучше оригинальных не потому что выдают нечто "запретное", а потому что у них нет тормозов в виде цензуры, как ни странно. Изучите, как их цензурят, и как это делается наоборот - просто для лучшего понимания. Вот только не все uncensored модели - без цензуры. Или цензуры нет, но взяты изначально слабые модельки. Из "хороших" могу отметить модели с расцензуриванием типа "Heretic", программка для этого лежит на гитхабе, но нужна не она а вполне неплохое описание, как это все работает. В итоге Тетрисы и всякие программки вполне нормально пишутся моделью Gemma 4 31B Instruct Uncensored Heretic, несмотря на то, что Гемма изначально не заточена на код. Qwen 3.6 тоже очень неплоха.
Выше уже привели пример двух моделей работающих в паре. У меня с таким подходом Qwen 3.5 9b оно таки написало целую трехмерную игрушку. Модель одна в памяти сидит, а в скрипте сделаны разные контексты и разные системные промпты. Первый инстанс - программер, второй инстанс - тестировщик, который ревьюит код, запускает его и смотрит ошибки в консоли, а также дает советы по переписыванию кода. Итак до того, что игра хотя бы запустится....Несмотря что на видеокарте вся конструкция просто летает и генерит токены вагонами, что-то рабочее получается далеко не с первой попытки, дано 10 попыток во избежание переполнения контекста. И вот таким вот образом, запущенный на сутки, этот двухголовый монстр написал таки работающую (запускающуюся) версию майнкрафта (на питоне). Там можно даже ходить и ставить блоки, я вообще не ожидал что 9b моделька вообще на такое способна. А почему сутки? Потому что за сутки было написано около 15 готовых игр, которые хотя бы запускались без ошибок, но и все на этом. И еще очень много пустых попаданий, когда "программер" за 10 попыток не мог победить все свои косяки. Между тем "ревьюер" понравился мне больше - он действительно давал грамотные советы по улучшению кода, а вот программер далеко не всегда этим советам следовал. Короче, прикольно.
Что вообще такое "Qwen 3.6" ? Это не конкретное название модели
Есть Qwen 3.6 36b a3b
Есть Qwen 3.6 27b
И они очень сильно друг от друга отличаются. Не говоря уже о том, что очень сильные отличия будут еще и от квантование. Оно тут тоже не указано. Отличия так же будут даже от количество контекста. А еще очень много даст подключенные MCP и выбор агента.
Мне gemma4-26b нравится в обычном общении. Я имею ввиду просто поговорить, воспользоваться как энциклопедией. Задаю ей в системном промтте чтобы общалась на ты, с сарказмом, юмором и уместным матом и ловлю лулзы. Qwen3.6 в этом плане не такой весёлый.
Почему это находиться в "простых" статьях?) Хотя довольно интересно
Хорошая статья, спасибо, но тестирование десятка тяжелых моделей на трех примитивных играх в браузере вряд ли доказывает их готовность к реальным задачам в продакшене)

Тест локальных MOE моделей