Comments 26
Gemma 4 при запросе по API прямо в ответ вставляет Chain-of-Thought элементы.
Я не смог её отучить это делать:)
И не получится, в самом описании модели про это и написано, фактически, теперь вместо блока <think></think> есть блок <|channel><channel|>. Не совсем понятно, для чего такие изменения, но теперь для моделей Gemma4 нужны свои правила обработки ответов.
Надо было её саму спросить :)
Вставьте это в запрос:
"chat_template_kwargs": {
"enable_thinking": false
}
Она действительно крутая.
Не работает:) пришлось изобретать алгоритм выкусывания контента из кучи тегов. Там ещё и два режима их отображения, в общем, нахрена они это всё сделали:)
Не в запрос
llama-server
--model ${gguf-dir}/gemma/gemma-4-E2B-text/gemma-4-E2B-it-UD-Q6_K_XL.gguf
--batch-size 2048
--cache-type-k "q8_0"
--cache-type-v "q8_0"
--flash-attn "on"
--gpu-layers 999
--jinja
--mlock
--no-context-shift
--parallel 1
--prio 1
--repeat-penalty 1
--split-mode "none"
--temp 0.6
--threads 8
--top-k 64
--top-p 0.95
--chat_template_kwargs '{"enable_thinking": false}'
--ctx-size 8196
Пока OpenAI ищет всё новые миллиарды для масштабирования инфраструктуры, Google и китайцы оптимизируют модели.
Интересно, зачем они это сделали. Хотя... если так подумать. Гугл единственный из великих, у кого есть источник прибыли помимо продажи токенов, и кому вот эта возня с LLM вообще заноза в жопе. Если лишить прибыли весь рынок, закрыв бизнесовые задачи локальными моделями, то, возможно, вот эта гонка за будущим станет досадным недоразумением. Да, люди уже не вернутся в классический поиск, но, по крайней мере, загашенные враги прекратят наступление на карты, гугл плей, ютуб, ибо для этого всего нужны деньги инвесторов, а уничтожение приза делает инвестиции бессмысленными
Потому что после схлопывания AI-пузыря они будут одними из немногих, кто получит преимущество, так как финансировали всю кухню "за свои", имеют положительный общий денежный поток и могут позволить себе переждать шторм, чтобы потом оказаться первыми на чистой поляне. Короче, топят конкурентов на своих условиях.
Это очень сильный удар по всем, кто сидит в минусе на раздутых обущаниях и финансировался за счёт инвесторов. Резко снижает клиентскую базу - компании теперь могут не OpenAI платить, а свои инстансы развернуть. При этом от Гугла никто не сбежит, так как у него поиск, облака и ещё куча всего - он всё равно в плюсе будет.
Gemma 4 хорошо выглядит, только из моделей huggingface убрали Multi-Token Prediction (MTP). Они медленее на 10-20%. Тему разговора незначительно уводит, непонятно как это замеряли и как интерпретировать.
# task: eval structure — simplified
# ~18% throughput improvement, no quality regression
"gemma4-base": {"throughput_tps": 847, "f1": 0.923, "exact_match": 0.871},
"gemma4-mtp": {"throughput_tps": 1001, "f1": 0.924, "exact_match": 0.873}
# task: open_ended_summarization
# ~11% throughput improvement
# Small but consistent increase in mid-sentence topic drift
# ROUGE difference is within noise, but topic_drift_rate is reproducible
"gemma4-base": {"throughput_tps": 612, "rouge_l": 0.441, "topic_drift_rate": 0.031},
"gemma4-mtp": {"throughput_tps": 679, "rouge_l": 0.438, "topic_drift_rate": 0.047},
topic_drift_rate here is an internal metric — we flag spans where the model shifts semantic focus within a sentence boundary. It’s a custom eval, not something you’ll find in standard benchmarks. (с) Marcus Chen
Гемма хороша, но печалит только нестабильность ее function calling, может заартачиться и вместо вызова просто вывалить команду в текст чата, с openhands вообще отказывается работать в CodeActAgent. Надеюсь, починят
Модель требует специального обращения и понимания как ее использовать. Пока пришлось ее везде отключить. Выдает результаты в каких-то странных формах не важно как ее спросить. Можно просто после нее запускать другую модель для корекции, но это время.
Можно ли запускать на 8 GB VPS на обычном CPU? Видео карты нет. Если да, как установить на Ubuntu?
Сейчас запустил в llama.cpp
Gemma-4-E4B в версии Q8_K_P.gguf
которая весит file size = 7.56 GiB
на процессоре
Intel(R) Core(TM) i5-4690 CPU @ 3.50GHz, 4 ядра и память ddr3
получается скорость 3.44 t/sec
Ответ на вопрос "кто ты" печатала примерно 2 минуты ( с этапом размышлений, около 400 токенов).
Та же модель, но на видеокарте p102-100 у меня дает 32 t/sec
( может еще стоит подкрутить настройки -ub и прочие чтобы поднять скорость)
я скачал себе ту же модель только в Q5 KS 6.7gb на lm studio на процессоре e 5 2670v3 ddr4 около 7-8t /sec вообще отлично как по мне)
Мне тоже очень нравится семейство Gemma. Четвёртая версия показалась мне сравнимой с Gemini 3. Конечно, с поправкой на размер.
Но мне очень интересно провести один эксперимент, для которого у меня нет вычислительных мощностей.
Один человек заметил, что если подобрать и продублировать определённый блок слоёв модели, у неё резко улучшаются показатели.
https://dnhkng.github.io/posts/rys/
https://dnhkng.github.io/posts/rys-ii/
И вот мне интересно, можно ли так улучшить модели серии Gemma 4? Это было бы шикарно!
Вот тред в обсуждении модели: https://huggingface.co/google/gemma-4-31B-it/discussions/60
Буду рад, если кто-нибудь там отпишется.
Хотелось бы уточнить, почему сравнивается модель GPT-5.2 , если уже рабоатает GPT-5.4
https://prnt.sc/tGgWWr-zUY-P
Корпорация может в оптимизацию. А OpenAI так и зависает в браузерах...
Gemma 4 31b в связке lm studio + vs code (cline) работает быстро, но в коде она ужасна, плохо знает grable, kotline. Как общение для того чтобы разобратся что хочу может помочь, но не более. Да и вообще локальные модели через lm studio + opencode от unsloth стали работать значительно хорошо, но локальная модель это всё равно не для кода, даже если брать квантование Q6_K_XL
Сравнивать надо было с одноклассником - qwen3.5 27b
Google окончательно убил OpenAI? Как Gemma 4 меняет правила игры