А это интересная тема. Unsloth для агентов рекомендуют 0 что бы не ограничивать модель в повторении токенов, т.к. в агентской истории по написании кода это частое явление. А для обычного чата рекомендуется 1.5
Аналогично с температурой. Для агентов минимально, для обычного общения побольше
MTP есть и для dense медленной и качественно модели qwen3.6 27b и MTP есть для быстрой и менее сообразительной moe модели qwen3.6 35b.
Надо понимать что MTP ускоряет генерацию токенов, но не ускоряет парсинг промпта. Последнее останавливает меня от использования 27b в агентских задачах, где контекст может быть очень большим.
Рекомендую просто пробовать все варианты и искать тот что вам больше подходит.
Поведения с кешированием промпта валидно для любой модели. Тормозить может и дальше, когда модели нужно будет еще 20к исходников прочитать например.
У меня Q5. Ответ всегда один. Уверенность прыгает от 0.95 до 1.0
Скрытый текст
Вопрос: “Моя машина грязная и я хочу её помыть.Автомойка в 100 м от дома. Как мне поступить: доехать на машине или прогуляться пешком? Ответь одним словом: ‘доехать’ или ‘прогуляться’.” Дай ответ на этот вопрос и оценку точности ответа, где 1.0 - абсолютно точно, 0.0 - абсолютно не точно и это критерий оценки твоей уверенности в этом ответе. Значения могу лежать в диапазоне от 0.0 до 1.0. Выдача должна быть в JSON со следующими полями: answer, accuracy
The user is asking a simple question: their car is dirty and they want to wash it. The car wash is 100m from home. Should they drive or walk? They want a one-word answer: “доехать” (drive) or “прогуляться” (walk).
This is a practical/logical question. If the car is dirty and needs washing, and the car wash is only 100m away, the most practical answer depends on context:
If they drive: they drive the dirty car 100m to the car wash, then leave it there to be washed.
If they walk: they walk 100m to the car wash, but then the dirty car is still at home. They’d need to drive it there later anyway.
The key point: to wash the car, the car needs to be at the car wash. So they need to drive it there. Walking doesn’t make sense if the goal is to get the car washed - they’d just be walking to the car wash and then still need to deal with the car at home.
So the answer is “доехать”. Now I’m thinking about how confident I am in this reasoning. It seems pretty solid - if the objective is washing the car, the car physically needs to be at the car wash, which requires driving it there. Walking wouldn’t accomplish that goal. I’d estimate this at around 0.9 confidence.
{ “answer”: “доехать”, “accuracy”: 0.95 }
Took 0.0s
⚡ 734.4 tok/s prefill · 59.1 tok/s gen
The user asked a simple logical question and I’ve provided the answer. Let me output the JSON result.
{
"answer": "доехать",
"accuracy": 0.95
}
Обоснование: Чтобы помыть машину, её нужно доставить на автомойку. Если просто прогуляться пешком, машина останется дома грязной. Единственный логичный способ — доехать на ней до мойки. Уверенность 0.95, так как теоретически можно загнать машину на мойку на эвакуаторе или толкать (нелепо), но в реалистичных условиях «доехать» — единственный осмысленный вариант.
Но активных экспертов осталось мало, т.е. по моему пониманию это "скорость вместо качества"
Количество экспертов не меняется. Меняется место выполнения (gpu/cpu). Т.е. cmoe на качество работы модели не влияет.
27b существенно лучше qwen3.6 35b или nemotron cascade 2 (кстати, контекст на ней хоть и меньше, но все еще внушительный. за маленьким контекстом в q4 обновленной лламе).
Понял, речь про ситуацию когда часть вычислений происходит на CPU и тогда tg резко падает. Ну да, тогда будет мало. Я видел тесты на Q3 (что бы модель с контекстом были только в VRAM) и тогда tg был 40-60.
Этот квен расколол мир локальных ллмок ) До него все целились в жирные MoE модели и нужно было много памяти и пофигу что компьют слабоват, а теперь появились реально хорошие Dense модели которым много памяти не нужно, зато нужен мощный компьют
"Сделай GTA VI в html, не ошибайся" как бы тоже спецификация, просто слишком фривольная )
"знаю по себе" - очень плохой заход в "системное мышление"
По ощущениям статья на год просто опоздала. В те времена ничего особо лучше и не было. Даже gpt-oss-20b еще не релизнули
Ютуб мне иногда подбрасывает видосики одного автора и очень уж мне нравится звук и сама клава у автора. Может подскажите что это за свитчи и что за клава https://youtu.be/wwJA9mDqIVc?si=mtvVU67c9JLKMBUH&t=111
А это интересная тема. Unsloth для агентов рекомендуют 0 что бы не ограничивать модель в повторении токенов, т.к. в агентской истории по написании кода это частое явление. А для обычного чата рекомендуется 1.5
Аналогично с температурой. Для агентов минимально, для обычного общения побольше
https://unsloth.ai/docs/models/qwen3.6
Так, MTP не влияет на активные параметры и т.д.
MTP есть и для dense медленной и качественно модели qwen3.6 27b и MTP есть для быстрой и менее сообразительной moe модели qwen3.6 35b.
Надо понимать что MTP ускоряет генерацию токенов, но не ускоряет парсинг промпта. Последнее останавливает меня от использования 27b в агентских задачах, где контекст может быть очень большим.
Рекомендую просто пробовать все варианты и искать тот что вам больше подходит.
Поведения с кешированием промпта валидно для любой модели. Тормозить может и дальше, когда модели нужно будет еще 20к исходников прочитать например.
pp/tg метрик инференса которые показывает llama
на маке mlx обычно лучше работает чем gguf от llama, потому и вопрос возник
Запуск клауд кода с локальным ллм не зависит от того будет это llama.cpp/lm-studio/omlx и т.д.
Угумс... еще и pp совсем маленький. Разве что на ночь отдавать кодить план сгенеренный в каком-нибудь клоде
m4 pro? сколько гпу ядер? какая скорость pp/tg? почему не mlx?
Думаю речь про температуру и сэмплинг:
У меня Q5. Ответ всегда один. Уверенность прыгает от 0.95 до 1.0
Скрытый текст
Вопрос: “Моя машина грязная и я хочу её помыть.Автомойка в 100 м от дома. Как мне поступить: доехать на машине или прогуляться пешком? Ответь одним словом: ‘доехать’
или ‘прогуляться’.” Дай ответ на этот вопрос и оценку точности ответа, где 1.0 - абсолютно точно, 0.0 - абсолютно не точно и это критерий оценки твоей уверенности в
этом ответе. Значения могу лежать в диапазоне от 0.0 до 1.0. Выдача должна быть в JSON со следующими полями: answer, accuracy
The user is asking a simple question: their car is dirty and they want to wash it. The car wash is 100m from home. Should they drive or walk? They want a one-word
answer: “доехать” (drive) or “прогуляться” (walk).
This is a practical/logical question. If the car is dirty and needs washing, and the car wash is only 100m away, the most practical answer depends on context:
If they drive: they drive the dirty car 100m to the car wash, then leave it there to be washed.
If they walk: they walk 100m to the car wash, but then the dirty car is still at home. They’d need to drive it there later anyway.
The key point: to wash the car, the car needs to be at the car wash. So they need to drive it there. Walking doesn’t make sense if the goal is to get the car washed -
they’d just be walking to the car wash and then still need to deal with the car at home.
So the answer is “доехать”. Now I’m thinking about how confident I am in this reasoning. It seems pretty solid - if the objective is washing the car, the car physically needs to be at the car wash, which requires driving it there. Walking wouldn’t accomplish that goal. I’d estimate this at around 0.9 confidence.
{
“answer”: “доехать”,
“accuracy”: 0.95
}
Took 0.0s
⚡ 734.4 tok/s prefill · 59.1 tok/s gen
The user asked a simple logical question and I’ve provided the answer. Let me output the JSON result.
Обоснование: Чтобы помыть машину, её нужно доставить на автомойку. Если просто прогуляться пешком, машина останется дома грязной. Единственный логичный способ — доехать на ней до мойки. Уверенность 0.95, так как теоретически можно загнать машину на мойку на эвакуаторе или толкать (нелепо), но в реалистичных условиях «доехать» —
единственный осмысленный вариант.
⚡ 166.8 tok/s prefill · 53.3 tok/s gen
Количество экспертов не меняется. Меняется место выполнения (gpu/cpu). Т.е. cmoe на качество работы модели не влияет.
27b существенно лучше qwen3.6 35b или nemotron cascade 2 (кстати, контекст на ней хоть и меньше, но все еще внушительный. за маленьким контекстом в q4 обновленной лламе).
Понял, речь про ситуацию когда часть вычислений происходит на CPU и тогда tg резко падает. Ну да, тогда будет мало. Я видел тесты на Q3 (что бы модель с контекстом были только в VRAM) и тогда tg был 40-60.
Да, ошибся в формулировках. Имел ввиду что много памяти не нужно, но нужна быстрая память что бы был хороший tg.
У 5070 и 3090 вроде ПCП примерно на одном уровне? Почему tg всего 5?
Этот квен расколол мир локальных ллмок ) До него все целились в жирные MoE модели и нужно было много памяти и пофигу что компьют слабоват, а теперь появились реально хорошие Dense модели которым много памяти не нужно, зато нужен мощный компьют
Смотря какие модели. Под эту память в самый раз MoE
Еще поддержку NPU от AMD XDNA завезли
Сравнивать надо было с одноклассником - qwen3.5 27b
Если под кодом человека понимают ДНК то это еще то дырявое штопанное перештопанное легаси ))
Я в докере держу и только недавно стал нормальное встроенный cron сервис работать