Обновить

Комментарии 129

  • по некоторым бенчмаркам - лучше чем Opus 4.6

В задачах программирования для миддл+ не дотягивает до Опуса. Проверял на Qwen 3.8 27B Q8. Пока ощущение, что это улучшенная на ~10% Qwen 3.6 35B А3B Q8. Т.е. прогресс конечно есть, но не wow. Посмотрю детальнее на выходных.

В общих задачах прогресс оценить еще сложнее тк в предыдущих версиях все с этим было хорошо и так.

У меня первое впечатление как раз “вау”. Такого красивого тетриса мне еще ни одна модель локальная не генерила:

скриншот
Двойной тетрис
Двойной тетрис

Помимо синтетики большинство моделей сейчас активно прокачивают по тетрисам, квейку и что там еще на ютубе первым делом проверяют. Я писал о немного других задачах, например, собрать один датасет из нескольких, правильно переиндексировав метки, затем использовать этот датасет для обучения определенной архитектуры.

Я с первого же запроса получил зачётную трёхмерную змейку:

https://s3.fursov.family/shares/snake3d.html

Раньше с этим справлялся только Opus.

поиграл с удовольствием 78 длину собрал) спасибо

Побил ваш результат- 84.))))

а я ваш побил) 87
забавная штуковина получилась

Реально интересная вариация змейки! Где-то после 95, когда змейка уже длиннее окружности сферы, приходится подключать 3д мышление. Во времена SnakeII на Nokia, очень мне заходила их 3d гексагональная реализация!

Скрытый текст

103, забавная получилась змейка

103
103

)

114

Там реально сложно становится после 80
Там реально сложно становится после 80

Покажите пожалуйста промт!

write snake game on the sphere. The head of the snake it fixed in the center and the sphere is rotating. use HTML, CSS and JavaScript. The visible part of sphere shall be fully visible in the webView, not partially. The starting length of the snake shall be 3 and increasing every time the snake hit the food. Use keyboard control: LEFT and RIGHT arrows.

Какой же я наивный... Мне и в голову не пришло, что это не нативное приложение.

Жду 3д шахматы в вашем с квен исполнении)

Как выглядят 3D шахматы не знаю, а вот 3D крестики-нолики (3х3х3) думаю можно попробовать реализовать.

Долго мучались, или есть прям single-shot промпт, вставили и получили код для змейки. Поделите, если прям с промпта, а не много итераций, хочу проверить сам. ООО, спасибо, увидел выше промпт

Да они все примерно одно и то же рисуют.

мое впечатление тоже "вау" но жду модель МОЕ ибо 6 токенов в сек :-(

Strix Halo(Ryzen AI Max 395), 7 токенов в секунду, но скорость смотрел на коротких контекстах. Утрамбованная до UD_Q8_K_XL - 15 т/с, что уже довольно терпимо

Запускалась через vulkan или rocm?

Странно, я почему-то был уверен что стриксы на инференс будут пошустрее.

Чисто для справки, Q8 на RTX A6000 со спекулятивным декодигом (MTP) выходит примерно 50 т/с.

У стриксов узкое место - ПСП памяти.

вот такой же результат на этой архитектуре в половину медленне при генерации, раз в 6 при загрузке контекста чем unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q5_K_XL
пытаюсь пока с разным квантованием у 3.8 поиграться, но пока слишком медленно чтобы использовать в кодинге

Вот хрен с ним, с тетрисом, вы пробовали натравливать её на какой-нибудь большой проект и попробовать порефакторить его или же объяснить как работают его блоки?

Я пользуюсь опусом и в незнакомой мне части он выручает меня, когда некого спросить, а читать много.

Точно не на ~10%, проект на котором буксовал 3.6 35В А3В, 3.8 27В сделал даже не запнувшись, причем 3.8 27В все разложил по полочкам и практически полностью переписал проект, сам написал тесты о которых я даже не просил, протестировал и собрал готовый бинарник. Второй сложный проект 3.6 35В А3В не мог в принципе осилить он его ломал и закончить не смог, 3.8 27В его собрал за ночь и утром проснувшись увидел готовое приложение.

Так что тут явно не ~10% гораздо больше.

Точно не на ~10%

Линейкой или рулеткой измеряли? Я описал прирост на своих задачах, вы на своих. Очевидно, что прирост у нас может быть разным.

На чем запускали модель (железо) и где (harness)?

Ну… если ты сравнивал с 35Б то полагаю спорить тут смысла нет, так как 27 Б даже 3.6 была на ином уровне по сравнению с 35Б, именно в кодинге и агентской работе, 10%… Квен 3.6 была идеально но не вывозила мою автономную игровую студию, Квен 3.8 лупит уже 2 сутки, следует заданию, тестирует, не ломается, не попадает в замкнутые круги, да не фронтир, но я бы сказал что чем то она даже лучше учитывая что контроль у тебя в руках, а в задаче решает ТЗ и построенная последовательность, но то так как ты сравниваешь быструю модель с умной… не надо так делать.

"~10% Qwen 3.6 35B А3B" - то, что ты сравнил МоЕ модель с dense, да еще и в программировании, уже показывает твой уровень понимания моделей и, соотвественно, качество твоих наблюдений. Они могут показать похожий результат только если по-старперски использовать их как чат бот окно или на ооочень узких задачах с минимальной агентностью. Там не 10 и не 20 процентов разницы, там бездонная пропасть и это я про 3.6 27Б пишу, 35Б даже упоминать было бы кощунственно

Еще один.

Еще раз тебе говорю - ты понятия не имеешь, о чем пишешь, твоя неспособность отличить их на реальных задачах говорит только о слабой методологии проверки и слабых задачах. Для написания кода перегонки джейсончиков туда-сюда они действительно одинаковы примерно

Да как я вообще посмел проверять модели разных архитектур на собственных задачах. Как вообще у меня наглости хватило.

У меня с первого раза вышел зачетный пеликан на велике :))) Модель unsloth/Qwen3.8-27B-UD-Q8_K_XL.gguf , промпт: "Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style "

Для сравнения unsloth/Qwen3.6-27B-UD-Q8_K_XL.gguf 

Это вероятно давно устаревший тест. Теперь нужно придумать что-нибудь другое. Крокодил на самокате там или ещё что. Хотя так тоже близковато

Устаревший, неустаревший, однако большинство моделей с ним не справляются. Для чистоты эксперемента, вот код который сгенерила модель для рендеринга указанной выше картинки (можно вставить в txt файл, поменять разрешение на svg и открыть любым просмоторщиком)

<svg xmlns="http://www.w3.org/2000/svg" xmlns:xlink="http://www.w3.org/1999/xlink"
     width="700" height="580" viewBox="0 0 700 580" role="img" aria-labelledby="title desc">
  <title id="title">Friendly pelican riding a vintage bicycle</title>
  <desc id="desc">Minimalist flat vector illustration of a white pelican with a big orange beak and a red scarf, pedaling a red vintage bicycle with fenders and a headlamp. Transparent background.</desc>

  <defs>
    <g id="wheel">
      <circle r="88" fill="none" stroke="#264653" stroke-width="12"/>
      <circle r="74" fill="none" stroke="#264653" stroke-width="3.5"/>
      <g stroke="#264653" stroke-width="3.5" opacity="0.85">
        <line x1="0" y1="-74" x2="0" y2="74"/>
        <line x1="-74" y1="0" x2="74" y2="0"/>
        <line x1="-52" y1="-52" x2="52" y2="52"/>
        <line x1="-52" y1="52" x2="52" y2="-52"/>
      </g>
      <circle r="9" fill="#264653"/>
    </g>
  </defs>

  <!-- Ground shadow -->
  <ellipse cx="400" cy="532" rx="235" ry="16" fill="#1E293B" opacity="0.10"/>

  <!-- Motion lines -->
  <g stroke="#264653" stroke-width="6" stroke-linecap="round" opacity="0.28">
    <line x1="96" y1="372" x2="146" y2="372"/>
    <line x1="78" y1="410" x2="142" y2="410"/>
    <line x1="96" y1="448" x2="146" y2="448"/>
  </g>

  <!-- Far-side leg and pedal -->
  <g>
    <path d="M360 292 C356 322 357 362 359 388" fill="none" stroke="#E08E2B" stroke-width="8" stroke-linecap="round"/>
    <rect x="347" y="385" width="30" height="10" rx="5" fill="#E08E2B" stroke="#264653" stroke-width="3"/>
    <line x1="390" y1="430" x2="361" y2="400" stroke="#1B2A38" stroke-width="7" stroke-linecap="round"/>
    <rect x="346" y="395" width="28" height="9" rx="4" fill="#1B2A38"/>
  </g>

  <!-- Wheels -->
  <use href="#wheel" xlink:href="#wheel" transform="translate(250 430)"/>
  <use href="#wheel" xlink:href="#wheel" transform="translate(550 430)"/>

  <!-- Chain -->
  <g stroke="#264653" stroke-width="3" opacity="0.75">
    <line x1="390" y1="411" x2="252" y2="421"/>
    <line x1="390" y1="449" x2="252" y2="439"/>
  </g>

  <!-- Frame -->
  <g fill="none" stroke="#E63946" stroke-linecap="round">
    <line x1="390" y1="430" x2="250" y2="430" stroke-width="7"/>
    <line x1="342" y1="304" x2="250" y2="430" stroke-width="7"/>
    <line x1="390" y1="430" x2="342" y2="304" stroke-width="9"/>
    <line x1="390" y1="430" x2="506" y2="308" stroke-width="9"/>
    <line x1="344" y1="302" x2="502" y2="306" stroke-width="9"/>
    <line x1="504" y1="300" x2="515" y2="333" stroke-width="13"/>
    <path d="M515 333 C528 362 542 395 550 430" stroke-width="8"/>
    <line x1="504" y1="300" x2="496" y2="262" stroke-width="8"/>
    <path d="M496 262 C494 246 486 236 470 232" stroke-width="8"/>
    <line x1="342" y1="304" x2="334" y2="282" stroke-width="7"/>
  </g>
  <circle cx="468" cy="231" r="5.5" fill="#264653"/>
  <circle cx="487" cy="239" r="5.5" fill="#FFD166" stroke="#264653" stroke-width="3"/>

  <!-- Fenders -->
  <g fill="none" stroke="#264653" stroke-width="8" stroke-linecap="round">
    <path d="M158 377 A106 106 0 0 1 342 377"/>
    <path d="M475 355 A106 106 0 0 1 625 355"/>
  </g>
  <circle cx="524" cy="357" r="8" fill="#FFD166" stroke="#264653" stroke-width="4"/>

  <!-- Saddle -->
  <path d="M258 272 Q304 254 350 263 Q361 267 353 276 Q304 285 274 281 Q261 278 258 272 Z" fill="#5A3825" stroke="#264653" stroke-width="3"/>

  <!-- Chainring and near pedal -->
  <circle cx="390" cy="430" r="20" fill="#C1272D" stroke="#264653" stroke-width="3.5"/>
  <circle cx="390" cy="430" r="4.5" fill="#264653"/>
  <line x1="390" y1="430" x2="420" y2="458" stroke="#264653" stroke-width="7" stroke-linecap="round"/>
  <rect x="402" y="454" width="36" height="10" rx="5" fill="#40566B"/>

  <!-- Near leg -->
  <path d="M372 270 C382 332 402 402 416 452" fill="none" stroke="#F5A623" stroke-width="9" stroke-linecap="round"/>
  <rect x="400" y="443" width="46" height="13" rx="6.5" fill="#F5A623" stroke="#264653" stroke-width="3"/>
  <line x1="434" y1="448" x2="443" y2="453" stroke="#264653" stroke-width="2.5" stroke-linecap="round"/>

  <!-- Pelican -->
  <path d="M268 196 C240 188 220 194 208 208 C220 206 232 210 240 218 C226 220 216 230 212 242 C224 236 236 238 244 246 C252 230 260 212 268 196 Z" fill="#FDFDFD" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
  <path d="M352 118 C415 118 448 165 448 215 C448 272 405 292 352 292 C300 292 258 268 258 215 C258 160 290 118 352 118 Z" fill="#FDFDFD" stroke="#264653" stroke-width="4.5" stroke-linejoin="round"/>
  <path d="M330 168 C285 175 262 215 272 248 C280 272 310 280 335 268 C355 258 362 232 355 210 C349 190 344 172 330 168 Z" fill="#E3EBF3" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
  <path d="M300 240 C310 246 322 248 332 244 M302 224 C312 230 324 232 334 228" fill="none" stroke="#264653" stroke-width="3" stroke-linecap="round" opacity="0.45"/>
  <circle cx="420" cy="95" r="46" fill="#FDFDFD" stroke="#264653" stroke-width="4.5"/>
  <path d="M402 52 C398 38 404 28 414 25 M418 50 C418 34 428 26 438 25 M434 53 C438 40 447 34 456 33" fill="none" stroke="#264653" stroke-width="4" stroke-linecap="round"/>
  <path d="M450 114 L583 108 C589 110 588 116 581 121 C545 169 480 171 452 132 C448 124 448 118 450 114 Z" fill="#F79A3E" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
  <path d="M450 84 L583 99 C591 101 591 107 583 109 L452 116 C446 102 446 96 450 84 Z" fill="#FFB84C" stroke="#264653" stroke-width="4" stroke-linejoin="round"/>
  <line x1="468" y1="96" x2="478" y2="99" stroke="#264653" stroke-width="3" stroke-linecap="round"/>
  <circle cx="428" cy="74" r="9.5" fill="#264653"/>
  <circle cx="431.5" cy="70.5" r="3.2" fill="#FFFFFF"/>
  <ellipse cx="437" cy="111" rx="8.5" ry="5" fill="#FFB4A2" opacity="0.85"/>

  <!-- Scarf -->
  <path d="M378 128 Q412 148 448 136 L443 156 Q410 168 384 148 Z" fill="#E76F51" stroke="#264653" stroke-width="3.5" stroke-linejoin="round"/>
  <path d="M384 148 C350 156 330 146 306 154 C290 159 279 168 272 180 L288 184 L276 196 C292 194 306 186 318 178 C336 166 358 164 378 168 Z" fill="#E76F51" stroke="#264653" stroke-width="3.5" stroke-linejoin="round"/>
</svg>

Я в том плане что как только какой-то специфический тест достаточно широко распространяется то высока вероятность что в тренировочном корпусе появляется датасет специально под этот тип задач. Или даже вовсе под одну конкретную свгшку. И тот факт что какая-то сетка хорошо с ним справляется с какого-то момента особо ничего не говорит.

Недавно была статья с проверкой, занимаются ли разработчики пеликанмаксингом (спойлер: не занимались по крайней мере месяц назад)

Вот и у меня руки дошли. Нафиг пеликана.

"Нарисуй средствами SVG красивую стюардессу модницу 1950годов "

изображение png но код тоже есть разумеется
изображение png но код тоже есть разумеется

Честно говоря я в афиге.

Но думало оно где-то минут 40

А я попросил модельку, как профессионального UI дизайнера и художника, нарисовать качественного Чебурашку (мой любимый ЧебурБЕНЧ).

Результат через полчаса

Достойно.

Предлагаю теперь новый бенч. Пущай напишет простое музыкальное произведение в midi нотации...

Он нас опередил: сам музон встроил в Тетрис, только я пока не понял откуда звуки берутся :)

Неплохой промпт для теста.
1. Шедевр от Суверенного АИ, Алисы ;)
2. Qwen 3.6 27b
3. Gemini 3.6 flash

Всегда считал что Жемини хорошо рисует интерфейсы, модифицирует фотки, ну короче с дизайном там неплохо, жаль много остального у неё - печаль.

У Алисы какая-то инвалидная коляска получилась

Это прямо олицетворение возможностей Алисы, даже по сравнения с локальным 3.6 27b q3 это днище, дно... годы отставания. И так во всём, я ради поржать попробовал там покодить ;)

Это не только Алисы касается.
Я тут уже комментил по поводу даунгрейда Кандинского, предыдущая версия была просто отличная, а в последней версии такое ощущение, что они взяли какую-то не лучшую китайскую модель и начали с нуля, не развивая прошлую.
Результат удручающий на лицо так сказать.
https://habr.com/ru/companies/sberbank/articles/1028822/comments/#comment_29929468

а алиса какая, локальная есть?

так то онлайн гигачат мне такое нарисовал

Скрытый текст

он вам не svg нарисовал, кажется, svg - это текстовый формат

мде, я поверил первой картинке и не стал проверять. приложенный код рисует это.

локальная gemma 4 12B и то нарисовала получше

Если все слои поместились на GPU (gpu_offload="99"),

То cpu_threads="16" не нужен, потому что префил будет работать на GPU, - там где все слои, то есть без CPU.

cpu_threads имеет смысл только, если слои в RAM.

cache_type_k="q4_0" - я бы опасался так сильно квантовать, это реально делает модель тупее. Лучше сэкономить VRAM за счёт --no-mmproj-offload, и взять хотя бы q8_0

У меня опыта в этом почти нет. Локально тестирую. Спасибо, учту.

наконец запустил дополнительную видюху и qwen3.8-27b от vcruz305 на всем этом

22342 токена, 24m 42s

unsloth/qwen3.8-27b IQ2-XXS 16m 51s n_tokens = 24788

Первая картинка топ, такой фотореалистичности достичь даже нано-бананам нереально. Ну серьезно, как живой! А работа с освещением! И нет лишних пальцев (обычные ошибки нейросетей). Идеально. Я думал живой художник рисовал. Велосипед тоже наш, суверенный, не то что древние модели на других рисунках - скучно выглядят да и устарел концепт на сто лет. Алиса топчик прям, даже не ожидал от нее такого!

Нана банана рисует в свг, я что-то пропустил?

Это был сарказм)) Тег потерялся по дороге.

Может модель перекачать...

У вас сколько токенов потратила и сколько по времени заняло? 14 тыс токенов и конца не видно... Внутри Bionic LM Studio, вообще без дополнительного софта.

Попробуйте Reasoning Effort поставить на Low (вместо дефолтного Extra High). Модель действительно ужасно много думает без особого толку (или валится).

В MLX не было таких параметров.

Перекачал unsloth - там и efforts, и MTP. Небо и земля. Так можно пользоваться.

а что конкретно лучше? ну типо математика или код пишет?

Больше всего заметны улучшение в написании кода. И в работе с агентами - использовании tools.

Я кодом и картинками модель не проверял, но первое, что бросилось в глаза- объём рассуждений. По сравнению с qwen3.6-27b рефлексирует раза в 3-4 больше и ход мыслей мне нравится.

Как по мне, даже на простую задачу капец, как долго рассуждает. А на сложной я даже думал, что зациклилась, пришлось просить Agy разобраться, в чем дело

И из-за этих рассуждений итогового ответа ждать очень долго.

Мне в этом плане больше nemotron-cascade-2-30b-a3b зашел с его адаптивным CoT. На простой задаче буквально через 150-200 токенов размышлений ответ выдает. При этом на сложной - больше думает.

В общем, пока не заметил, какую из своих моделей я бы на qwen-3.8 заменил. Та же gemma-4-31b очень подробные объяснения выдает. Разве что не в скрытом CoT, а в финальном ответе.
Не сравнивали их на своих задачах?

Не пробовали изменить глубину размышлений? Доступны 4 настройки (xhigh, medium, low, nonе)

Не пробовал, все по дефолту.

Впрочем, и не вижу где. Поставил Bionic и там то ли бедненько с настройками. Ну или я пока не разобрался.

Вижу только Вкл/Выкл Reasoning Section Parsing. Впрочем, я даже TTL в настройках модели там не нашел, в отличие от привычной LM Studio.

Может в промпте можно указать уровень размышлений...

Уже стату на продовых серверах набрали (клиентская аналитика).

xhigh, thinking 88,2 с

medium, thinking 68,8 с

low, thinking 68,1 с

thinking выключен 21,5 с

Выводы: medium и low быстрее xhigh примерно на 22–23%, но по структуре результата не хуже.

MTP=4

а можно турбоквант использовать и получить меньше потребление памяти и качество выше чем в fp16

Прямо в момент выхода пилил небольшой проект с Qwen3.6-27b. Скачал, запустил, не то чтобы прям ВАУ, но прирост интеллекта явно заметен.

Дал очередную среднюю по сложности правку по проекту. Думала долго, по опыту с 3.6 уже начал ожидать что как обычно сделает кучу мелких ошибок при реализации но нет, с первого раза выдала хороший рабочий результат, попутно найдя и исправив баги которые перед этим сделала 3.6.

При этом на простых задачах думает заметно меньше. В целом качество размышлений заметно выше. Разработчикам огромный респект.

А что за проект? Почему не используете облачные llm?

Только сегодня читал про красное повышение цен на Дипсик с 16.08, думаю остальные за ним подтянутся. Цены на облачные ИИ растут, локальные модели "умнеют", так что я думаю в скором будущем большинство физлиц и мелких контор на локалки уйдут.

По множеству разных причин.

Есть железо которое позволяет запускать локально большой спектр конкурентоспособных локальных моделей (не сильно отстающих от облачных). При этом я не ограничен лимитами, ценами и не завишу от блокировок/перебоев с сетью и т.п.

Локальные модели уже позволяют уверенно закрывать средние по сложности задачи, более 'умные' модели на мой взгляд для них просто избыточны.

Скорость генерации которую я получаю на своём железе приемлема для того чтобы успевать отслеживать ход рассуждений моделей, что на мой взгляд позволяет лучше контролировать процесс разработки и даёт больше опыта в использовании ИИ. Более высокая скорость генерации также на мой взгляд избыточна.

Также много экспериментирую с лёгкими моделями, смотрю насколько они пригодны для создания приложений работающих прямо на устройствах пользователей.

Всё перечислять слишком долго, причин на самом деле много...

Извиняюсь, отвечал на вторую часть вопроса и совсем забыл про первую.

Проекты в основном для личного использования, автоматизация рутины, инструменты для мониторинга/управления, замена облачных сервисов локальными (перевод, инфраструктура), свои аналоги используемого софта (по сути своя кроссплатформенная оболочка на основе хромиума), эксперименты...

Прилично прокачалась в инфографике и управлении общими тулами и дебаг-тулами. Я слегка удивился, когда она начала сама двигать курсор в браузере и кликать мышой по кнопкам О_О.

Как уже отметили выше, на xhigh часто заходит в петли рассуждения на коротком контексте (70к не хватает, она думает до компактирования, а после - начинает заново размышлять и детализировать).

из забавного: первый раз увидел текстовыделитель при размышлениях (возможно это какая-то фича нового опенкод):



По детализации уделывает DS v4 flash.



Тестил в Q4_K_M на 3090, сейчас буду спускаться до Q4_0 так как очевидно нужен контекст 100+

НЛО прилетело и опубликовало эту надпись здесь

Спасибо!

используйте турбоквантование контекста, 256к без проблем в Q4_K_M на 3090

Сначала не запустилась Qwen 3.8 27B (unsloth ud5) llama.cpp server с claude code.(error 500)
Рецепт тут https://github.com/ggml-org/llama.cpp/issues/27107
Сейчас эта модель у меня лидирует на rtx 5090. Потратила ~10 минут на работающий лисп интерпретатор на "С"
Qwen3.6 справилась за полчаса

Народ, а подскажите, пожалуйста, как расширять контекст до 1 млн? И сколько это памяти отъедает?

recipe
---
recipe_version: "1"
name: Qwen3.8-27B-Unsloth-NVFP4-TP2-Service
summary: Unsloth Qwen 3.8 27B Dynamic V3 NVFP4 with 512K YaRN context
model: unsloth/Qwen3.8-27B-NVFP4
container: vllm/vllm-openai:v0.27.1
cluster_only: true
solo_only: false

defaults:
  port: 8040
  host: 0.0.0.0
  tensor_parallel: 2
  gpu_memory_utilization: 0.55
  max_model_len: 524288
  max_num_batched_tokens: 16384
  max_num_seqs: 5

env:
  VLLM_ALLOW_LONG_MAX_MODEL_LEN: "1"
  VLLM_BLOCKSCALE_FP8_GEMM_FLASHINFER: "0"

command: |
  model_root=/root/.cache/huggingface/safetensors/unsloth
  model_name=Qwen3.8-27B-NVFP4
  served_name=qwen3.8-27b-unsloth-nvfp4
  chat_template="$model_root/$model_name/chat_template.jinja"
  chat_kwargs='{{"enable_thinking":false}}'
  mm_limits='{{"image":1,"video":0}}'
  spec_config='{{"method":"mtp","num_speculative_tokens":2}}'
  hf_overrides='{{"text_config":{{"rope_parameters":{{"mrope_interleaved":true,'\
  '"mrope_section":[11,11,10],"rope_type":"yarn","rope_theta":10000000,'\
  '"partial_rotary_factor":0.25,"factor":2.0,'\
  '"original_max_position_embeddings":262144}}}}}}'
  kernel_config='{{"enable_flashinfer_autotune":false,'\
  '"enable_cutedsl_warmup":false,"enable_jit_warmup":false}}'
  vllm serve "$model_root/$model_name" \
    --served-model-name "$served_name" \
    --host {host} \
    --port {port} \
    --tensor-parallel-size {tensor_parallel} \
    --gpu-memory-utilization {gpu_memory_utilization} \
    --max-model-len {max_model_len} \
    --hf-overrides "$hf_overrides" \
    --max-num-batched-tokens {max_num_batched_tokens} \
    --max-num-seqs {max_num_seqs} \
    --kv-cache-dtype fp8 \
    --kv-cache-memory-bytes 20G \
    --max-parallel-loading-workers 1 \
    --mm-processor-cache-gb 0 \
    --skip-mm-profiling \
    --mm-encoder-tp-mode data \
    --kernel-config "$kernel_config" \
    --load-format safetensors \
    --attention-backend flashinfer \
    --enable-prefix-caching \
    --enable-chunked-prefill \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_xml \
    --reasoning-parser qwen3 \
    --chat-template "$chat_template" \
    --default-chat-template-kwargs "$chat_kwargs" \
    --trust-remote-code \
    --limit-mm-per-prompt "$mm_limits" \
    --speculative-config "$spec_config" \
    -O3 \
    --no-enable-log-requests

Log:

Using max model len 524288
GPU KV cache size: 1,188,900 tokens
Maximum concurrency for 524,288 tokens per request: 2.27x

VRAM - 35,5Gb на каждой ноде (всего 2).

Спасибо!

не за что! Вот, только что тест закончился на 512к:

90% контекста проверено:

 - 471 858 токенов
 - заполнение ровно 90.0%
 - exact retrieval: pass
 - prefill: 736.2 с
 - весь запрос: 741.8 с
 - эффективная скорость: 636 ток/с
monitoring 500k prefill
Заполнение и генерация
Заполнение и генерация

Спасибо, скачал)

Да лучшая модель для локальной, очень долго думает, зато первая локальная модель которая на threejs сделала в 3d игрушку и сразу заработала, делала через codex агент 40 минут(симулятор гонок на квадракоптере). На RTX2080ti 22GB с небольшим разгоном Q4 квант 148тысяч контекст с MTP дает 25-55 токенов в секунду ( в зависимости от текущего использованияглубины контекста, сначала 55 токенов в секунду, потом снижается по мере использования всего контекста до 25 токенов в секунду).

Где брали эту видеокарту?

На авито продают, 35к примерно. Отличный вариант как по мне.

На авито продают. Самое интересное, что две такие 44 GB VRAM и в tensor режиме дают 35-75 токенов в секунду на Q8 кванте 265тыс контекст q8 KV cache. Что больше чем на одной и меня сильно удивило и порадовало. За 70 тыс рублей пока самый недорогой вариант получить модель для кодинга уровня почти GPT 5.5

Попробовал на реальной задаче на программирование

Baked for 10h 12m 46s

Q6K при скорости 9 токенов в секунду за ночь добил задачку до состояния "ревью человеком / Fable" и можно отдавать в тестирование

В сравнении с Qwen 3.6 27B она прям получше: она добивает задачи до состояния "реально работает", а не врет о том что все готово при падающих тестах

Зацикливается как и все квены: три часа реального времени пыталась решить проблему с CORS которые настраивала криво, прогоняла тест и возвращалась к патчингу

Но из зацикливания вышла сама, довела задачу до конца и прибрала (вот уж неслыханно) за собой мусор из worktree

Я гоняю на Strix Halo, поэтому с утра не выдержал и прикрутил к ней MTP-бошку - 9 токенов превратились хотя бы в 20 и стало терпимо

А качество с МТР заметно падает?

По теории и тестам MTP не влияет качество инференса

я не заметил + два тестовых прогона показали бит-в-бит одинаковый ответ

Вообще нам гарантируют "zero quality degradation" для старых моделей (https://huggingface.co/RDson/Qwen3.6-27B-MTP-Q4_K_M-GGUF), так что я бы и для новых не ждал потерь

в халяву очется конечно верить, но подвох же должен быть. MTP можно за раз 2 токена получать, а можно по 5 или 20 сразу. неужели это всё бесплатно? тогда какой смысл это не использовать?

Для каждого токена нужно посчитать результат для каждого из 27 миллиардов параметров.

Посчитать - это процессор.

27 миллиардов параметров - это память.

Например на моей системе, с моими квантами, прочитать 27 миллиардов параметров из памяти занимает 100 мс (миллисекунд). Процессор (GPU) нагружен на 20%. Получается скорость генерации 10 токенов в секунду.

Как это можно ускорить?

Идея MTP: мы добавим ещё одну модель, в ~10-20 раз меньше нашей (например 1 миллиард), которая будет работать быстрее и хуже, но в половине+ случаев будет давать правильные токены, а результаты (токены) этой маленькой модели будем проверять на полной модели в то же самое время когда считаем следующий токен. Причём сразу по 3-5 токенов за раз. В этом случае у нас модель стала чуть больше и на каждый проход по 28 миллиардов параметров теперь у нас 110 миллисекунд, но в половине случаев за один проход мы получаем не один, а сразу 5 токенов. Нагрузка процессора теперь у нас стала 50%.

То есть MTP позволяет ускорить модель за счёт процессора.

У меня провайдер ростело стал сбрасывать соединение до CDN HF.

Есть еще кто-то с проблемой скачивания моделей?

Иногда наблюдаются проблемы, причем на разных провайдерах, что-то с самим HF происходит, отваливается наглухо так, что никакие веселые три буквы не помогают. Потом опять работает.

с ростелека мособл качаю, не всегда стабильно и не быстро, но потихоньку льется ~1-5 мб/с

Strix halo llama + mtp + Vulkan . Q4 дает < 25 токенов в секунду, что сходится с тем, что пишут AMD, совсем мало, жду MOE. В Hermes Agent модель стала заметно умнее по сравнению с 3.6 q4 xl, по крайней мере с тестами на генерацию аудио и фото через удаленный comfy ui справилась сама без подсказок.

Очень крутая модель. Пожалуй это лучшая модель ниже 35B. По сравнению с версией 3.5-3.6 это огромный скачек вперед. Использовал Q5_K_XL квантование. Рассуждения вышли на другой уровень, задачи решает более комплексно и лучше.

Точно стоит, если вам не важна скорость генерации. Где-то видел тесты, что Qwen 27B набирала больше балов во всех тестах чем 35B A3B. Гугл говорит, что выбор модели зависит от того, что вам важнее скорость генерации или качество ответов.

Сравнение Qwen 35B-A3B (MoE) и 27B (Dense) показывает выбор между высокой скоростью работы экспертной смеси и точностью плотной архитектуры. Модель 27B умнее в сложных логических задачах и кодинге, тогда как 35B-A3B быстрее генерирует токены и требует меньше активных ресурсов на один шаг инференса. [1, 2, 3]

Архитектура и производительность

  • Qwen 35B-A3B: Использует архитектуру MoE (Mixture of Experts) с 36B общих параметров, но задействует всего около 3B активных параметров на токен. Обеспечивает высокую скорость генерации (до ~150 токенов/сек в облаке) и низкую задержку. [1]

  • Qwen 27B: Плотная (dense) модель с ~27.8B параметров. Работает медленнее (~77 токенов/сек), но демонстрирует более высокие результаты на бенчмарках интеллекта, логики и агентского кодинга. [1, 2, 3]

Запуск локально (VRAM)

  • 35B-A3B: Из-за природы MoE требует объема памяти под полный набор весов, хотя активная часть мала. Для хорошей квантизации на ПК требуется мощная видеокарта (или связка с RAM), иначе на слабых GPU модель упирается в узкое горлышко пропускной способности памяти. [1]

  • 27B: Плотная модель отлично масштабируется под стандартные потребительские видеокарты с 16–24 ГБ VRAM при грамотном подборе квантования (например, GGUF/NVFP4), обеспечивая стабильное и предсказуемое качество без «промахов» экспертов

https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF

Проверка на RTX 5060 Ti 16Гб с запуском через ik_llama.cpp

Оффлоад 65/65 слоёв в GPU (12.78 ГБ весов)
VRAM всего 15.1 / 16 ГБ — влезает с запасом (KV-кэш сжат HyperAttention: 2.0 ГБ на 105k токенов вместо ~3.7 ГБ)
Prefill 33.9 t/s
Генерация 21.2 t/s
Качество «У Алисы 3 яблока, у Боба 5…» → «8 яблок» ✓, рассуждения работают
API/v1/chat/completions — HTTP 200, OpenAI-совместимый

А это уже не 6-7 токенов в секунду!

Prefill 33.9?

Это какое-то нереальное значение. Проверьте на более длинном промпте.

У меня prefill около 4000

4000 на какой карте? На 5060ti? Уточните, а то слюна потекла. У меня такая же карта.))) Но сомневаюсь, что на 5060ti.

cHunter789 обещал 45 токенов в сек на 5070ti на 5060ti вдвое меньше CUDA ядер и вдвое меньше скорость, как бы логично все

Prefill (некэшированная часть) 456.7 t/s (~900 t/s полный на batch 512)
Генерация 25.0 t/s стабильно
Итоговый контекст 10 442 токена
ngram-спекуляция 288 черновиков, 217 принято (75.3%)
VRAM 15.9 / 16.3 ГБ

-khad/-vhad пришлось отключить из параметров запуска, с ними карта не выходила на полную мощность и при длинном промте скорость кратно падала (при этом потребление карты колебалось на уровне 50 вт при загрузке GPU 99-100%)

5070 Ti, контекст - 32000, префилл 1300

на простых чатовских запросах:

генерация с MTP=2 - 60-65 t/s, без MTP - 45-50

с реальным контекстом:

генерация с MTP=2 - 50-55 t/s, без MTP - 45-50

MTP очень чувствителен к недостатку ВРАМ. Чуть что - сразу 3 токена в секунду

У меня RTX 3080 Laptop (Ampere, 2021) на 16ГБ. Тоже завелось на ik_llama.cpp с 105к контекста. Использовал внутри Hermes. Дал ему тестовую задачу на реальном проекте - написать чек-лист для тестирования функционала из указанного коммита. Вчера давал такую же задачку Qwen3.8, но запущенному на DGX Spark, который справился за 7 минут. А на 3080 - сделал за 28... Медленно, конечно, зато автономно. Воспользуюсь этим сетапом, когда будут проблемы с интернетом.

Провел небольшой бенчмарк:

1) Короткий промпт: TTFT - 1.40 с , генерация - 17.00

2) Глубина 8k: TTFT - 17.43 с , prefill - 465.8, генерация - 25.57

3) Глубина 30k: TTFT - 88.48 с , prefill - 346.3, генерация - 22.23

4) Переписывание файла: TTFT - 5.60 с , генерация - 33.00

Мой опыт тестовой задачи на 2-х RTX-3060/12GB

CGroup: /system.slice/llama-server.service

└─68683 /usr/bin/llama-server -m /srv/models/Qwen3.8-27B/Qwen3.8-27B-Q5_K_S.gguf -t 8 -c 32768 -b 1024 -ngl 99 --host 0.0.0.0 --port 8080 --parallel 1 --tensor-split 48,43 --temp 0.2 --top-p 0.8 --top-k 20 --min-p 0.00 --presence-penalty 0.0 --repeat-penalty 1.0 --frequency-penalty 0.0 -ctk q8_0 -ctv q8_0 --spec-type draft-mtp -fa on --jinja -ub 512 --reasoning auto


авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.147 I slot print_timing: id 0 | task 2 | prompt eval time = 2340.66 ms / 949 tokens ( 2.47 ms per token, 405.44 tokens per second)

авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.153 I slot print_timing: id 0 | task 2 | eval time = 531337.13 ms / 11272 tokens ( 47.14 ms per token, 21.21 tokens per second)

авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.154 I slot print_timing: id 0 | task 2 | total time = 533677.79 ms / 12221 tokens

авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.155 I slot print_timing: id 0 | task 2 | graphs reused = 3708

авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.171 I slot print_timing: id 0 | task 2 | draft acceptance = 0.66827 ( 7522 accepted / 11256 generated), mean len = 3.00

авг 16 13:22:25 rtx run-llama.sh[68683]: 9.41.123.250 I slot release: id 0 | task 2 | stop processing: n_tokens = 12223, truncated = 0


32к контекста для этой модели мало, она слишком много думает.

Ооо, бро с 2 rtx, привет! Спасибо за конфиг, попробую

docker run --restart=always -d -p 8080:8080
–gpus all
–name qwen
-v ~/.llm_tools/models:/models
-e CUDA_VISIBLE_DEVICES=0,1
ghcr.io/ggml-org/llama.cpp:full-cuda13
–server
–host 0.0.0.0
–port 8080
-m /models/qwen-3.8-27b-Q4/Qwen3.8-27B-Uncensored-Q4_K_M.gguf
–webui
-ngl 999
–flash-attn on
-c 65536
–cache-type-k q4_0
–cache-type-v q4_0
-t 6
-b 1024
-ub 256
–split-mode layer
–spec-type draft-mtp
–spec-draft-n-max 2
–parallel 1


У меня с таким конфигом получилось 24 токена в секунду выжать

При 128к частично сползла на CPU
При 128к частично сползла на CPU

● llama-server.service - Local LLM Server

Loaded: loaded (/etc/systemd/system/llama-server.service; enabled; preset: enabled)

Active: active (running) since Tue 2026-08-18 14:41:33 +03; 1min 32s ago

Invocation: d986ef4741914142b7520266233a0605

Main PID: 130805 (llama-server)

Tasks: 24 (limit: 38021)

Memory: 2.3G (peak: 3.8G)

CPU: 2min 301ms

CGroup: /system.slice/llama-server.service

└─130805 /usr/local/bin/llama-server -m /srv/models/Qwen3.8-27B/Qwen3.8-27B-Q5_K_S.gguf -t 8 -c 57344 -b 1024 -ngl auto --host 0.0.0.0 --port 8080 --parallel 1 --temp 0.2 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 --frequency-penalty 0.0 -ctk q4_0 -ctv q4_0 --spec-type draft-mtp --kv-unified -fa on --jinja -ub 512 --reasoning off

Две 5060ti 16gb крутит проект по квантованию в районе 3-5к строк кода с мат частью и обёрткой её в код работает гораздо лучше чем 3.6. Агент так же квиновский. Что заметил в отличии от 3.6 делает сама заметки по проекту. Расставляя акценты. Так же если ей дать невнятное тз которое противоречит изначальной идеии будет дефать артефакт(фокус) парадигму. Думать стала больше. Что несколько замедляет работу. Однако её автономность это компинсирует. Появилась уверенность что на тестовом запуске не будит сдесяток ошибок. В целом куда лучше держит структуру проэкта что облегчает разработку. В целом прогресс на лицо.

Добрый день. А на macbook с 64 gb ram такое можно запустить ?

конечно, кстати отпишись потом сколько токенов в сек генерит мак бук

похоже, на пеликана её тренировали специально,
"мой" пеликан - один к одному с предыдущим. Но время генерации неприятно удивило.

Ну можно пеликана заменить например на бобра :)) Тоже получается гораздо лучше чем у других нейросетей

А кто-то пытался сравнивать насколько становится хуже на 512к - 1м контексте?

Модель официально поддерживает до миллиона токенов. Про это написано вот тут:

https://huggingface.co/Qwen/Qwen3.8-27B

Context Length: 262,144 natively and extensible up to 1,000,000 tokens.

For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively, e.g., YaRN.

Насколько у модели получается "держать" контекст, сколько памяти для этого требуется - это хорошо бы узнать из реальных тестов.

У меня тут 262k не влезают, так что мне не до миллиона...

Мне понравилась новая версия модели.

Автор "Unsloth", квантование "Q5_K_XL".

GeForce RTX 4090 GAMING OC

В режиме "NoThink" (2 мин. 26 сек.; 3500 токенов):

Скрытый текст
Параметры скрипта "NoThink" (llama-server):
Параметры скрипта "NoThink" (llama-server):

Результат:

В режиме "DeepThink" (22 мин. 9 сек.; 34000 токенов):

Скрытый текст
Параметры скрипта "Think" (llama-server):
Параметры скрипта "Think" (llama-server):

Результат:

В режиме "NoThink" (2 мин. 26 сек.; 3500 токенов):

А можно тот же промт, но в режиме "reasoning_effort": "low"

Промпт использовали такой же как все? Мне интересно для статистики, у меня пеликаны один из критичных тестов.

Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style

Да, пожалуйста. Единственное, по рекомендации автора статьи выставил сжатие "q8_0":

Настройка:

Скрытый текст

Результат:

Скрытый текст

Код:

<svg width="400" height="400" viewBox="0 0 400 400" xmlns="http://www.w3.org/2000/svg">
  <!-- Bicycle Frame -->
  <g id="bicycle">
    <!-- Rear Wheel -->
    <circle cx="120" cy="300" r="50" fill="none" stroke="#2c3e50" stroke-width="4"/>
    <circle cx="120" cy="300" r="5" fill="#2c3e50"/>
    <!-- Rear Spokes -->
    <line x1="120" y1="250" x2="120" y2="350" stroke="#2c3e50" stroke-width="2"/>
    <line x1="70" y1="300" x2="170" y2="300" stroke="#2c3e50" stroke-width="2"/>
    <line x1="85" y1="265" x2="155" y2="335" stroke="#2c3e50" stroke-width="2"/>
    <line x1="85" y1="335" x2="155" y2="265" stroke="#2c3e50" stroke-width="2"/>

    <!-- Front Wheel -->
    <circle cx="280" cy="300" r="50" fill="none" stroke="#2c3e50" stroke-width="4"/>
    <circle cx="280" cy="300" r="5" fill="#2c3e50"/>
    <!-- Front Spokes -->
    <line x1="280" y1="250" x2="280" y2="350" stroke="#2c3e50" stroke-width="2"/>
    <line x1="230" y1="300" x2="330" y2="300" stroke="#2c3e50" stroke-width="2"/>
    <line x1="245" y1="265" x2="315" y2="335" stroke="#2c3e50" stroke-width="2"/>
    <line x1="245" y1="335" x2="315" y2="265" stroke="#2c3e50" stroke-width="2"/>

    <!-- Frame -->
    <path d="M 120 300 L 180 220 L 280 220 L 280 300" fill="none" stroke="#c0392b" stroke-width="6" stroke-linecap="round"/>
    <path d="M 180 220 L 120 300" fill="none" stroke="#c0392b" stroke-width="6" stroke-linecap="round"/>
    <!-- Seat post -->
    <line x1="180" y1="220" x2="175" y2="195" stroke="#2c3e50" stroke-width="4"/>
    <!-- Handlebar post -->
    <line x1="280" y1="220" x2="275" y2="190" stroke="#2c3e50" stroke-width="4"/>

    <!-- Seat -->
    <ellipse cx="175" cy="192" rx="15" ry="8" fill="#2c3e50"/>

    <!-- Handlebars -->
    <path d="M 260 190 Q 275 180 290 190" fill="none" stroke="#2c3e50" stroke-width="4" stroke-linecap="round"/>

    <!-- Pedals and Crank -->
    <circle cx="180" cy="260" r="8" fill="#2c3e50"/>
    <line x1="180" y1="260" x2="195" y2="275" stroke="#2c3e50" stroke-width="3"/>
    <rect x="190" y="272" width="12" height="6" rx="2" fill="#2c3e50"/>
  </g>

  <!-- Pelican -->
  <g id="pelican">
    <!-- Body -->
    <ellipse cx="160" cy="160" rx="45" ry="35" fill="#ecf0f1" stroke="#bdc3c7" stroke-width="2"/>

    <!-- Wing -->
    <path d="M 140 150 Q 120 140 130 160 Q 125 170 145 165 Z" fill="#d5dbdb" stroke="#bdc3c7" stroke-width="1.5"/>

    <!-- Neck -->
    <path d="M 190 145 Q 210 120 205 100" fill="none" stroke="#ecf0f1" stroke-width="18" stroke-linecap="round"/>
    <path d="M 190 145 Q 210 120 205 100" fill="none" stroke="#bdc3c7" stroke-width="1.5"/>

    <!-- Head -->
    <circle cx="205" cy="95" r="20" fill="#ecf0f1" stroke="#bdc3c7" stroke-width="2"/>

    <!-- Beak - Upper -->
    <path d="M 220 88 Q 260 85 270 95 Q 260 98 220 95 Z" fill="#f39c12" stroke="#e67e22" stroke-width="1.5"/>

    <!-- Beak - Lower Pouch -->
    <path d="M 220 95 Q 245 105 270 95 Q 255 115 220 100 Z" fill="#f5b041" stroke="#e67e22" stroke-width="1.5"/>

    <!-- Eye -->
    <circle cx="210" cy="88" r="4" fill="#2c3e50"/>
    <circle cx="211" cy="87" r="1.5" fill="#ffffff"/>

    <!-- Smile -->
    <path d="M 215 98 Q 220 102 225 98" fill="none" stroke="#e67e22" stroke-width="1.5" stroke-linecap="round"/>

    <!-- Feet on pedals -->
    <path d="M 155 190 Q 160 200 165 195" fill="none" stroke="#f39c12" stroke-width="4" stroke-linecap="round"/>
    <path d="M 170 188 Q 175 198 180 193" fill="none" stroke="#f39c12" stroke-width="4" stroke-linecap="round"/>

    <!-- Tail feathers -->
    <path d="M 115 155 Q 105 145 110 155 Q 100 150 108 160 Q 98 158 105 165" fill="#d5dbdb" stroke="#bdc3c7" stroke-width="1.5"/>
  </g>

  <!-- Motion lines -->
  <g id="motion" opacity="0.4">
    <line x1="50" y1="280" x2="70" y2="280" stroke="#bdc3c7" stroke-width="2" stroke-linecap="round"/>
    <line x1="40" y1="300" x2="65" y2="300" stroke="#bdc3c7" stroke-width="2" stroke-linecap="round"/>
    <line x1="55" y1="320" x2="75" y2="320" stroke="#bdc3c7" stroke-width="2" stroke-linecap="round"/>
  </g>
</svg>

5070Ti-16Gb Изначальный минималистичный промт:
Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style
Модель jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller (если кто посоветует что лучше для 16Gb VRAM - очень надеюсь).
Параметры запуска -cmoe -ngl 99 -c 64000 -fit off --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 --host 0.0.0.0 --port 8080 --cache_type_k q4_0 --cache_type_v q4_0

Нарисовало ужасно:

Поменяв промт на
Нарисуй в SVG пеликана в шапке на старинном велосипеде. Нарисуй без анимации, сначала составь план на 32 шага и по нему рисуй не отклоняясь от него
Получилось много лучше

Скорость генерации составила 45-48t/sec (в обоих случаях потратила более 30000 токенов)

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации