Что-то много пеликанов на велосипеде начало появляться в ленте моего информационного пузыря в твиттер и я решил провести собственный, несколько сумбурный, но эксперимент.
Цель: Охватить экспериментом повседневные модели, которые можно легко проверить на качество генерации и получить сравнительную оценку способностей моделей.
Промпты
Приведены ниже, но так как задача генерации пеликана существует уже не менее пары лет, то промпт решено было немного модифицировать, чтобы убедиться, что модель не просто воспроизводит заученное решение, а действительно что-то там соображает по теме.
Исходный промпт - пеликан на велосипеде
Сформулирован следующий текст:
Напиши одностраничный HTML с SVG-анимацией: мультяшный пеликан (белый\светло-желтый, с большим зобом) едет на велосипеде с радиальными спицами, колеса вращаются, ноги крутят педали, фон смещается назад для имитации движения, чисто на CSS Keyframes, без внешних библиотек
Второй промпт - лягушка на старинном велосипеде
Напиши одностраничный HTML с SVG-анимацией: мультяшная лягушка (зеленый\светло-желтый, с большими глазами) едет на велосипеде типа пенни-фартинг с радиальными спицами, колеса вращаются, ноги крутят педали, фон смещается назад для имитации движения, чисто на CSS Keyframes, без внешних библиотек
Третий промпт - пеликан на велосипеде в эпоху победившего skynet
Напиши одностраничный HTML с SVG-анимацией: мультяшный пеликан (белый\светло-желтый, с большим зобом) едет на велосипеде с радиальными спицами, колеса вращаются, ноги крутят педали, фон смещаются назад для имитации движения, чисто на CSS Keyframes, без внешних библиотек. стиль постапокалипсис и война скайнет
Модели
В качестве испытуемых выступили:
GPT Astra
Big Pickle (бесплатная модель от Opencode, сообщество подозревает, что внутри GLM и DeepSeek)
DeepSeek
Алиса AI
ГигаЧат
Qwen 3.6 (локальная модель)
Qwen 3.8 (локальная модель)
Qwen 3.8 Flash Next (локальная модель)
тут выборка не претендует на полноту. Локальные модели просто уже развернуты и настроены.
Суть эксперимента
Каждый промпт отправляется в отдельный чат с чистой сессией с подключенной моделью. Никаких подсказок или дополнительного ввода не предполагается (есть исключение, но об этом ниже). Если чат поддерживает режим включения\выключения рассуждений, то генерации выполняются в обоих режимах и выбирается лучший результат. В конце работы модели проверяется результат в виде файла html на предмет (это все-таки субъективные критерии):
общего качества визуального оформления: стиль, оформление, единообразие стилевого оформления
правильной реализации велосипеда: колеса, вращение колес и педалей, рама, руль, пропорции
оформление фона и дороги, его детализация
Исключительные ситуации
В процессе работы возникло несколько исключительных ситуаций, которыми было решено пренебречь, так как они не должны были существенно повлиять на результат:
DeepSeek имеет ограничение на вывод reasoning и появляется кнопка “Продолжить”. Кнопка была нажата и рассуждение продолжилось с того же места.
ГигаЧат имеет какие-то проблемы с выводом голого HTML кода в блоках кода: он разбивается на части, где-то код в зоне чата, где-то в зоне блока. Пришлось скопировать текст и убрать мусорные строки от блоков кода “Копировать”.
Алиса быстро сгенерировала файл pelican.html и дала битую ссылку на него, пришлось каждый раз просить вывести текст страницы в чат.
Запуск моделей локально
Для локального запуска моделей использовался компьютер FEVM FAEX1 (AMD Ryzen AI Max+ 395, RAM 128 ГБ, AMD Radeon 8060S, cachyOS). llamacpp был собран из ветки для поддержки новой архитектуры qwen4exp:
Qwen 3.6-35B
/opt/llamacpp/rocm/bin/llama-server \ --threads 1 --threads-batch 1 --ctx-size 262144 --batch-size 4096 --ubatch-size 1024 \ --flash-attn auto --cache-type-k q4_0 --cache-type-v q4_0 --gpu-layers 999 --fit off \ --model /opt/llamacpp/models/Qwen3.6-35B-A3B-MTP-Q8_0.gguf \ --temp 1 --top-p 0.95 --parallel 2 \ --mmproj /opt/llamacpp/models/mmproj-F16.gguf \ --image-min-tokens 8192 --image-max-tokens 8192 \ --host 0.0.0.0 --port 8501 \ --spec-type draft-mtp --spec_draft_p_min 0.75 --spec_draft_n_max 4 \ --cont-batching --jinja --kv_unified \ --metrics --no-perf --reasoning_preserve
Qwen 3.8-27B
/opt/llamacpp/rocm/bin/llama-server \ --threads 1 --threads-batch 2 --ctx-size 262144 --batch-size 4096 --ubatch-size 1024 \ --flash-attn auto --cache-type-k q4_0 --cache-type-v q4_0 --gpu-layers 999 --fit off \ --model /opt/llamacpp/models/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q8_K_P.gguf \ --temp 0.9 --top-p 0.95 --parallel 2 \ --host 0.0.0.0 --port 8502 \ --spec-type draft-mtp --spec_draft_p_min 0.75 --spec_draft_n_max 4 \ --cont-batching --jinja --kv_unified \ --metrics --no-perf --reasoning_preserve
Qwen 3.8 Flash Next
/opt/llamacpp/rocm/bin/llama-server \ --threads 1 --threads-batch 2 --ctx-size 262144 --batch-size 4096 --ubatch-size 1024 \ --flash-attn auto --cache-type-k q4_0 --cache-type-v q4_0 --gpu-layers 999 --fit off \ --model /opt/llamacpp/models/UD-IQ4_XS/Qwen3.8-Flash-Next-UD-IQ4_XS-00001-of-00003.gguf \ --temp 0.9 --top-p 0.95 --parallel 2 \ --host 0.0.0.0 --port 8503 \ --spec-type draft-mtp --kv_unified \ --model-draft /opt/llamacpp/models/MTP/mtp-Qwen3.8-Flash-Next-Q4_K_M.gguf \ --spec_draft_n_max 4 --spec_draft_p_min 0.75 --cont-batching --metrics --no-perf \ --reasoning_preserve --jinja
Результаты эксперимента
Ниже обзор результатов генерации в виде картинок с моими краткими комментариями. Рядом с каждым примером есть ссылка на HTML страницу, чтобы можно было в живую посмотреть страницу или изучить ее код. Советую посетить репозиторий GitHub, там
GPT Astra - безусловный лидер
Новая модель оказалась весьма смышленой и легко справилась с этой задачей. Среднее время генерации около 7 минут. Общий стиль прослеживается хорошо.

Страница. Анимация педалей и лапок сделана правильно, колено сгибается назад. Единственное, к чем можно придраться, это ось вращения педалей на уровне ступни.

Страница. Тоже получилась неплохо, анимация правильная.

Страница. Тут одной страницей описана целая история, все логично и на своих местах. Есть облачко или дрон в виде колеса сверху. Зато на колесах появились ниппели, но цепь с передней звездочки слетела.
DeepSeek - твердый середнячок
При отключении режима рассуждений, ни одна генерация не завершилась удовлетворительным результатом. В рассуждениях DeepSeek активно считал формулами углы движения колес, педалей и ног, поэтому результат получился вполне достойный. Прослеживается мультяшный упрощенный стиль.

Страница. Картинка весьма упрощенная, но кручение педалей работает, видимых артефактов нет. Лапки в колене гнутся в другую сторону

Страница. Одноногая лягушка корректно крутит педали, велосипед почти правильных пропорций.

Страница. Лапки странные и тоже гнутся в другую сторону и растут из сидения.
Алиса AI - ленивые рассуждения
В начале эксперимента казалось, что режим рассуждения должен приводить к улучшению результатов генерации. С Алисой получилось совсем наоборот. При включении режима рассуждений, она быстро приводила любой пункт задачи, поставленной ею же самой, к упрощенной версии:
— надо считать движения ног
— это сложно, давай упростим ноги, чтобы они не сгибались
— все равно сложно считать, давай двигать ноги просто вверх-вниз
— все равно сложно, давай двигать ноги вверх-вниз одновременно
, получили две черные палочки, которые двигаются синхронно вверх и вниз и отвратительный общий результат. В режиме без изменения настроек чата, результат сопоставим с моделями уже позапрошлого поколения (qwen3.6):

Страница. Пеликан на велосипеде узнается, но все анимации колес, педалей и движений пеликана сломаны.

Страница. Велосипед не получился, хотя колеса вращаются. Анимации тоже некорректные, кроме фона.

Страница. Тут велосипед получился чуть лучше, но анимация вращения педалей сломана, велосипед не в том месте кадра.
Big Pickle — слабовато, с лимитом токенов, зато бесплатно
Результат вполне сопоставим с Алисой. Кручение педалей не получилось, но видно, что модель пыталась.

Страница. Танцующий пеликан рядом с едущим велосипедом. Kiki Challenge мы не просили. Анимации фона тоже сломаны.

Страница. Велосипед едет в обратную сторону, анимация колес правильная и даже ниппели есть, но кручение педалей не получилось, анимации также с ошибками.

Страница. Велосипед и фон получились, но кручение педалей оторвало ноги пеликану.
ГигаЧат - суверенный результат, какой есть
В режиме выключенных рассуждений дает совсем удручающие результаты: от пеликана на странице отобразилась только тень. В режиме включенных рассуждений видно попытки создания сцены, но обилие артефактов портит все впечатление. Я бы сказал, что общий результат чуть хуже моделей позапрошлого поколения, ну или очень близок к ним по нижней границе.

Страница. Картинка не получилась. Не угадывается, что хотел нам сказать “художник”.

Страница. Лягушка с забавно вылетающими глазами и абстрактный велосипед со сломанными анимациями. Фон тоже через некоторое время уезжает влево.

Страница. Тут ситуация получше, фон примитивно, но получился, вращение колес со спицами реализовано правильно, но нет рамы велосипеда и пеликан больше похож на цыпленка.
Qwen3.6-A3B-MTP - локальный трудяга-универсал
Как раз модель позапрошлого поколения (дальше 3.8 и 3.8 flash next\qwen 4). В интернете много примеров генерации пеликана на моделях этого уровня и все не проходят этот тест.

Страница. Сцена узнается, но анимация кручения педалей не реализована. Фон реализован корректно. Интересная у модели была задумка - везти рыбку в зобе, но что-то не получилось.

Страница. Лягушка и велосипед получились полностью со сломанными анимациями.

Страница. Ну, возможно, велосипеды будущего и будут с такой странной рамой, а пеликаны будут с дыркой в голове, но педали пеликану ноги, все-таки, оторвали.
Qwen 3.8 - философ на подработке
Очень спорная модель. Результаты, несмотря на недочеты, смотрятся лучше DeepSeek, но есть нюансы. На моем железе она выдает весьма низкую скорость - около 10т\с, а также очень склонна к длительным рассуждениям: от 1:40 до 2:40 на файл! Результат в итоге получается весьма достойный, но крайне медленно.

Страница. Колени не в ту сторону гнутся, а в остальном придраться не к чему: анимация правильная, ниппели на колесах и пыль из-под колес. А еще, это единственная модель, которая правильно анимировала движение цепи!

Страница. Тут обошлось не без ошибок, лягушка сидит на колесе, руль како-то раздельный и ниже обода колеса, зато центр вращения педалей находится четко на своем месте. Упрощенные ниппели тоже есть. Хороший результат.

Страница. Тут явно модель немного поленилась и не сделала анимацию цепи, дроны менее детализированные, чем у Астры. Картинка вполне целостная и стильная.
Qwen 3.8 Flash Next - сомнительно, но ок
Модель показывает хорошие результаты для драфта новой архитектуры. Инференс в два раза быстрее обычной Qwen 3.8 на моем железе. Это единственная модель, которая сгенерировала лендинги с прокруткой. То есть, у нее была несколько другая концепция размышлений.

Страница. Уровень детализации выше других моделей, да и оформление у моря интереснее. Но что-то в расчетах у нее пошло не так и ноги с педалями движутся на разных скоростях. При чем, в конце страницы есть пример и он тоже повторяет ошибку. Формально, тест не пройден, но результат хорош.

Страница. Единственная генерация, где велосипед едет влево. Только расчет движения педалей и ног тоже подкачал. Зато модель поняла контекст, что старый велосипед, это годы назад и попробовала весь текст сопроводить знакомым нам ѣ. Формально, тест не пройден, стиль интересный.

Страница. Вращение педалей получилось сделать, стиль интересно обыгран, есть артефакты, но они несущественные.
Выводы
По пунктам
Фронтир-модели (GPT Astra) опережают остальные модели. Российские модели (Алиса AI, ГигаЧат) заметно отстают — на уровне прошлых поколений (кажется, около 10–12 месяцев). DeepSeek показывает результаты на уровне недавних топов (модель обновили буквально на днях, результат уже может быть лучше).
Локально развёрнутые Qwen 3.8 (35B) показывают отличные результаты. И это при размерностях в ~286 раз меньше (35 миллиардов параметров против 10 триллионов у GPT Astra). Такими моделями можно смело пользоваться с высоким качеством получаемого результата.
Qwen 3.8 Flash (125B) — новая архитектура, результаты перспективные, но пока чуть уступает обычной Qwen 3.8 в некоторых нюансах. Выше скорость генерации, чуть менее склонна к длительным рассуждениям (пока статистика не набралась, но снижение около 10-15%).
Мультимодальность — ключевой фактор. Возможность модели посмотреть на сгенерированный результат (скриншот → итерация) радикально улучит итог. Даже Qwen 3.6 за несколько итераций добьётся нормального кручения педалей, но чем качественнее первый результат — тем проще доводить его до финала.
Режим рассуждений работает по-разному. У Qwen 3.8 — даёт глубокий анализ (но генерация длится от 1 ч 40 мин до 2 ч 40 мин). У Алисы AI — ухудшает: модель решает «всё упростить и доделать потом», что приводит к катастрофическим упрощениям. DeepSeek в reasoning-режиме показывает стабильные результаты.
Агентский цикл на скромном железе. Qwen 3.8 — для верификации/планирования/ревью, Qwen 3.6 — как исполнитель. В агентском цикле с многократными итерациями можно добиваться схожих результатов на относительно скромном оборудовании.
Интересные наблюдения
Нибиру или Планета Х есть на большинстве генераций пеликан - скайнет.
Дроны удивительно похожи между моделями, как и весь сеттинг скайнет генераций
Я ожидал увидеть больше признаков дистилляции у qwen моделей, но их особо не заметно
Вся лента твиттера заполнена китайскими генерациями пеликана и люди тоже движутся в сторону создания уникального промпта, на котором можно проверять поколения моделей. Они дошли до пеликана на велосипеде, который находится на крыле управляемым медведем самолета.
Поймал себя на мысли: на что мы сжигаем токены: у кого-то 10000 агентов решают задачу тысячелетия, а кто-то рисует пеликанов.
Рост качества поколений моделей явно нелинейный. А сейчас, скорее, даже символический. Разрыв в количестве параметров колоссальный. Малые модели, которые можно запустить на доступном железе, идут по пятам. Очень большие надежды питаю к перспективным новым архитектурам.
А у вас есть такой домашний тест моделей?
Все файлы статьи с описаниями размещены в репозитории GitHub

