Pull to refresh

Comments 26

Gemma 4 при запросе по API прямо в ответ вставляет Chain-of-Thought элементы.
Я не смог её отучить это делать:)

И не получится, в самом описании модели про это и написано, фактически, теперь вместо блока <think></think> есть блок <|channel><channel|>. Не совсем понятно, для чего такие изменения, но теперь для моделей Gemma4 нужны свои правила обработки ответов.

Надо было её саму спросить :)

Вставьте это в запрос:

  "chat_template_kwargs": {
    "enable_thinking": false
  }

Она действительно крутая.

Не работает:) пришлось изобретать алгоритм выкусывания контента из кучи тегов. Там ещё и два режима их отображения, в общем, нахрена они это всё сделали:)

Не в запрос

      llama-server
      --model ${gguf-dir}/gemma/gemma-4-E2B-text/gemma-4-E2B-it-UD-Q6_K_XL.gguf
      --batch-size 2048
      --cache-type-k "q8_0"
      --cache-type-v "q8_0"
      --flash-attn "on"
      --gpu-layers 999
      --jinja
      --mlock
      --no-context-shift
      --parallel 1
      --prio 1
      --repeat-penalty 1
      --split-mode "none"
      --temp 0.6
      --threads 8
      --top-k 64
      --top-p 0.95
      --chat_template_kwargs '{"enable_thinking": false}'
      --ctx-size 8196

Пока OpenAI ищет всё новые миллиарды для масштабирования инфраструктуры, Google и китайцы оптимизируют модели.

Интересно, зачем они это сделали. Хотя... если так подумать. Гугл единственный из великих, у кого есть источник прибыли помимо продажи токенов, и кому вот эта возня с LLM вообще заноза в жопе. Если лишить прибыли весь рынок, закрыв бизнесовые задачи локальными моделями, то, возможно, вот эта гонка за будущим станет досадным недоразумением. Да, люди уже не вернутся в классический поиск, но, по крайней мере, загашенные враги прекратят наступление на карты, гугл плей, ютуб, ибо для этого всего нужны деньги инвесторов, а уничтожение приза делает инвестиции бессмысленными

Потому что после схлопывания AI-пузыря они будут одними из немногих, кто получит преимущество, так как финансировали всю кухню "за свои", имеют положительный общий денежный поток и могут позволить себе переждать шторм, чтобы потом оказаться первыми на чистой поляне. Короче, топят конкурентов на своих условиях.
Это очень сильный удар по всем, кто сидит в минусе на раздутых обущаниях и финансировался за счёт инвесторов. Резко снижает клиентскую базу - компании теперь могут не OpenAI платить, а свои инстансы развернуть. При этом от Гугла никто не сбежит, так как у него поиск, облака и ещё куча всего - он всё равно в плюсе будет.

Я видел сравнение Gemma 4 с топовыми моделями на реальных задачах, она хороша для opensource, но условный Opus не заменит. А при текущей скорости развития LLM, через пол года будет устаревшей (Google редко обновляет открытые модели).

Gemma 4 хорошо выглядит, только из моделей huggingface убрали Multi-Token Prediction (MTP). Они медленее на 10-20%. Тему разговора незначительно уводит, непонятно как это замеряли и как интерпретировать.

# task: eval structure — simplified
# ~18% throughput improvement, no quality regression

"gemma4-base":  {"throughput_tps": 847,  "f1": 0.923, "exact_match": 0.871},
"gemma4-mtp":   {"throughput_tps": 1001, "f1": 0.924, "exact_match": 0.873}

# task: open_ended_summarization
# ~11% throughput improvement
# Small but consistent increase in mid-sentence topic drift
# ROUGE difference is within noise, but topic_drift_rate is reproducible

"gemma4-base":  {"throughput_tps": 612, "rouge_l": 0.441, "topic_drift_rate": 0.031},
"gemma4-mtp":   {"throughput_tps": 679, "rouge_l": 0.438, "topic_drift_rate": 0.047},

topic_drift_rate here is an internal metric — we flag spans where the model shifts semantic focus within a sentence boundary. It’s a custom eval, not something you’ll find in standard benchmarks. (с) Marcus Chen

Гемма хороша, но печалит только нестабильность ее function calling, может заартачиться и вместо вызова просто вывалить команду в текст чата, с openhands вообще отказывается работать в CodeActAgent. Надеюсь, починят

Модель требует специального обращения и понимания как ее использовать. Пока пришлось ее везде отключить. Выдает результаты в каких-то странных формах не важно как ее спросить. Можно просто после нее запускать другую модель для корекции, но это время.

Можно ли запускать на 8 GB VPS на обычном CPU? Видео карты нет. Если да, как установить на Ubuntu?

Сейчас запустил в llama.cpp
Gemma-4-E4B в версии Q8_K_P.gguf
которая весит file size = 7.56 GiB
на процессоре
Intel(R) Core(TM) i5-4690 CPU @ 3.50GHz, 4 ядра и память ddr3
получается скорость 3.44 t/sec

Ответ на вопрос "кто ты" печатала примерно 2 минуты ( с этапом размышлений, около 400 токенов).

Та же модель, но на видеокарте p102-100 у меня дает 32 t/sec
( может еще стоит подкрутить настройки -ub и прочие чтобы поднять скорость)

я скачал себе ту же модель только в Q5 KS 6.7gb на lm studio на процессоре e 5 2670v3 ddr4 около 7-8t /sec вообще отлично как по мне)

У меня на AMD Ryzen 7 8840U с встройкой и 64 гиг рам памяти спокойно выдает 29 t/s на llama.cpp vulkan версии

gemma-4-e4b-Q4-K_M выдает 37t/sec на R5 8400F/32GB RAM,RTX3050 8VRAM. В LM Studio. Мне достаточно её скорости для использования в качестве замены google cloud translate/libre translate.

Мне тоже очень нравится семейство Gemma. Четвёртая версия показалась мне сравнимой с Gemini 3. Конечно, с поправкой на размер.

Но мне очень интересно провести один эксперимент, для которого у меня нет вычислительных мощностей.

Один человек заметил, что если подобрать и продублировать определённый блок слоёв модели, у неё резко улучшаются показатели.

https://dnhkng.github.io/posts/rys/

https://dnhkng.github.io/posts/rys-ii/

И вот мне интересно, можно ли так улучшить модели серии Gemma 4? Это было бы шикарно!

Вот тред в обсуждении модели: https://huggingface.co/google/gemma-4-31B-it/discussions/60
Буду рад, если кто-нибудь там отпишется.

сравнивают с моделями сравнимыми по производительности чтобы понимать окружение, и насколько открытые модели догоняют закрытые.

ОК, а я по глупости думал, что надо сравнивать актуальные на данный момент продукты, чтобы видеть реальную ситуацию.

но тогда интересно, почему конкретно в тесте MMLU Pro сравнение идет с OPUS 4.5, а в остальных - с OPUS 4.6

Корпорация может в оптимизацию. А OpenAI так и зависает в браузерах...

Gemma 4 31b в связке lm studio + vs code (cline) работает быстро, но в коде она ужасна, плохо знает grable, kotline. Как общение для того чтобы разобратся что хочу может помочь, но не более. Да и вообще локальные модели через lm studio + opencode от unsloth стали работать значительно хорошо, но локальная модель это всё равно не для кода, даже если брать квантование Q6_K_XL

Сравнивать надо было с одноклассником - qwen3.5 27b

Sign up to leave a comment.

Information

Website
bothub.chat
Registered
Founded
Employees
2–10 employees