Если вы собираетесь запустить эту модель, то имейте в виду, что есть много жалоб, что авторы что-то напутали с template, и из-за этого рассуждения (thinking) бывает не запускается, или останавливается на середине.
Поэтому я уже не гонюсь за последними фишками, а только успеваю следить: а что там добавили сейчас в llama.cpp?
Если кто-то где-то начал рассказывать новую модель, новую технологию, ... то скорее всего нет необходимости разбираться с новыми незнакомыми проектами, а можно подождать пару недель - и это появится в llama.cpp.
Да, каких-то фишек в llama.cpp нет долгое время (например i-quants), но это не так уж и критично.
Пол личным ощущениям, сейчас лучшая открытая модель для кодинга - это Kimi 2.7 (1 триллион параметров, 32 миллиарда активных).
GLM 5.2 (753 миллиарда параметров, 40 миллиардов активных) - тоже неплохо, но Kimi показалось умней. А ещё Kimi может принимать изображения, а GLM 5.2 - только текст, но держит контекст на миллион токенов.
Kimi 2.7 вроде бы можно запустить локально на компьютере с 512GB и вроде народ пишет что вполне можно пользоваться:
Понятно, что это не pytorch, но для определённых проектов эти карты - очень хорошее решение.
Я вот так смотрел на это дело: сколько $ стоит один GB VRAM?
96GB / RTX 6000 PRO - $111 / GB
32GB / RTX 5090 - $116 / GB
48GB / RTX 4090 - $81 / GB
24GB / RTX 3090 - $42 / GB
32GB / V100 - $18 / GB
Понятно, что память на всех этих устройствах разная по скорости. И производительность вычислений отличается очень сильно. Но для кэйсов, где упирается в размер памяти (а это в основном инференц) - V100 очень хороший вариант.
По моим исследованиям:
скорость генерации токенов на V100 приблизительно такая же как и на RTX 4090. Хотя тут есть ньюанс в котором надо разобраться - это с FlashAttention.
скорость обработка промпта (prompt processing) - на V100 в 3 раза медленнее чем на RTX 4090.
У модели Neumotron 30 есть одна крутая особенность - она из коробки поддерживает контекст на миллион токенов. Другие открытые модели могут поддерживать миллион, но там надо прикручивать YARN...
А насчёт огромного опыта: это на самом деле общеизвестный факт, что любые модели сами по себе плохо справляются с математическими вычислениями. Нужны tools.
Согласен. От ComfyUI мозги дымятся.
Вот бы кто сделал интерфейс попроще, для простых смертных...
Пока не поддерживается в llama.cpp.
Есть PR, который добавляет поддержку этой модели, но похоже он ещё довольно сырой:
https://github.com/ggml-org/llama.cpp/pull/25731
Так вот же есть выложенные весы:
https://huggingface.co/collections/Qwen/qwen3-tts
Сам я пользовался вот этим:
https://github.com/supertone-inc/supertonic
Но что-то они написали, что закрываются...
Если вы собираетесь запустить эту модель, то имейте в виду, что есть много жалоб, что авторы что-то напутали с template, и из-за этого рассуждения (thinking) бывает не запускается, или останавливается на середине.
Думаю в ближайшие дни это пофиксят.
Кванты уже перезаливали раз. Может ещё будут.
Ваш проект - коммерческий, не открытый. Верно?
Вот этот проект - ваш открытый конкурент: https://github.com/open-webui/computer. Верно? Можете сравнить?
Для кодинга prefill зачастую важнее скорости генерации.
У Mac OS скорость prefill - это было слабое место. Вроде бы у M5 большой прогресс в этом, но пока я не видел конкретных цифр.
Сомнительно как-то. Кто мне тут в Канаде может запретить DeepSeek?
Придут ко мне сканировать мои диски: А если найду?
Поэтому я уже не гонюсь за последними фишками, а только успеваю следить: а что там добавили сейчас в llama.cpp?
Если кто-то где-то начал рассказывать новую модель, новую технологию, ... то скорее всего нет необходимости разбираться с новыми незнакомыми проектами, а можно подождать пару недель - и это появится в llama.cpp.
Да, каких-то фишек в llama.cpp нет долгое время (например i-quants), но это не так уж и критично.
"двухпроцессорная система" плохо работает для инференца. Однопроцессорная система для инференца работает в разы быстрее двухпроцессорной.
Можно и дешевле.
У меня есть 72GB VRAM и я запускал Qwen 3.5-397B, с квантизацией UD-IQ4_NL.
Большая часть модели работала из RAM, скорость получалась 14 t / s. Для кодинга - может и медленно, а для чата - нормально.
И всё это удовольствие мне стоили менее $10k
Я попробовал через OpenRouter API.
Пол личным ощущениям, сейчас лучшая открытая модель для кодинга - это Kimi 2.7 (1 триллион параметров, 32 миллиарда активных).
GLM 5.2 (753 миллиарда параметров, 40 миллиардов активных) - тоже неплохо, но Kimi показалось умней. А ещё Kimi может принимать изображения, а GLM 5.2 - только текст, но держит контекст на миллион токенов.
Kimi 2.7 вроде бы можно запустить локально на компьютере с 512GB и вроде народ пишет что вполне можно пользоваться:
https://huggingface.co/unsloth/Kimi-K2.7-Code-GGUF
Я ещё не видел квантов для GLM-5.2. Думаю, что тоже будет возможно.
Открытость модели означает, что никакой важный шишка не сможет сказать "Стоп, никому больше не использовать эту модель!"
Работаю в большой корпорации, есть проекты на Scala и Java.
Создалось впечатление, что в последние пару лет интерес к Scala снижается, для новых проектов Scala уже не выбирают...
Про DGX Spark, народ пишет что для Qwen 3.6 27B Dense, с квантизацией FP8
скорость генерации токенов - 8 t/s
MTP помогает разогнаться до 15 t/s
Слабенько как-то.
https://forums.developer.nvidia.com/t/whats-the-best-speed-we-can-get-with-qwen-3-6-27b-without-quantizing/367561
Я у себя на RTX 4090 получаю 48 t/s (это с MTP):
https://huggingface.co/Qwen/Qwen3.6-27B-FP8/discussions/11
И карточки тоже можно запускать параллельно.
Скорость памяти (bandwidth) у всех карточек в моём сообщении выше: от 900 до 1700 GB/s
DGX Spark: 273 GB/s - как-то не очень. По скорости генерации токенов получается в 3 раза медленнее V100. Хотя за счёт MTP может и не всё так плохо.
Тут один чел поддерживает форк vLLM специально для V100:
https://github.com/1CatAI/1Cat-vLLM
Понятно, что это не pytorch, но для определённых проектов эти карты - очень хорошее решение.
Я вот так смотрел на это дело: сколько $ стоит один GB VRAM?
96GB / RTX 6000 PRO - $111 / GB
32GB / RTX 5090 - $116 / GB
48GB / RTX 4090 - $81 / GB
24GB / RTX 3090 - $42 / GB
32GB / V100 - $18 / GB
Понятно, что память на всех этих устройствах разная по скорости. И производительность вычислений отличается очень сильно. Но для кэйсов, где упирается в размер памяти (а это в основном инференц) - V100 очень хороший вариант.
По моим исследованиям:
скорость генерации токенов на V100 приблизительно такая же как и на RTX 4090. Хотя тут есть ньюанс в котором надо разобраться - это с FlashAttention.
скорость обработка промпта (prompt processing) - на V100 в 3 раза медленнее чем на RTX 4090.
V100 - старая карта (2018), но скорость памяти - весьма достойная: 900 ГБ/с.
Я заказал на Alibaba две карточки, каждая с 32 ГБ, каждая по $550.
У модели Neumotron 30 есть одна крутая особенность - она из коробки поддерживает контекст на миллион токенов. Другие открытые модели могут поддерживать миллион, но там надо прикручивать YARN...
Я это использую для работы с большими логами.
compose:
models.ini:
Это конфиг для моей карточки с 48GB VRAM.
В любой момент времени висит только одна запущенная модель.
Через WebUI можно переключаться между моделями, и при выборе новой - сначала автоматически выгружается предыдущая.
Ну, модель должна уметь пользоваться тулзами.
А насчёт огромного опыта: это на самом деле общеизвестный факт, что любые модели сами по себе плохо справляются с математическими вычислениями. Нужны tools.