Я экперементировал дома с k3s на трёх нодах. etcd кластер на трёх нодах.
Каждая нода - 2 TB NVMe диск, быстрый.
Но так как там вместе и поды и etcd, то постоянно в логах жалуется на тормоза диска. Но работает.
Я вот думаю поменять настройка дискового кэша, чтобы игнорировались fsync для etcd. Хотя везде пишут, что это прям плохо. А я вот думаю: ну если рассчитывать на backup даже каждый час, то всё равно будут какие-то потери. А если потеряется что-то из-за кэша, то это всё равно на так много, как потери при восстановлении из backup.
Как ещё можно оптимизировать etcd? kine ставить не хочу.
Для каждого токена нужно посчитать результат для каждого из 27 миллиардов параметров.
Посчитать - это процессор.
27 миллиардов параметров - это память.
Например на моей системе, с моими квантами, прочитать 27 миллиардов параметров из памяти занимает 100 мс (миллисекунд). Процессор (GPU) нагружен на 20%. Получается скорость генерации 10 токенов в секунду.
Как это можно ускорить?
Идея MTP: мы добавим ещё одну модель, в ~10-20 раз меньше нашей (например 1 миллиард), которая будет работать быстрее и хуже, но в половине+ случаев будет давать правильные токены, а результаты (токены) этой маленькой модели будем проверять на полной модели в то же самое время когда считаем следующий токен. Причём сразу по 3-5 токенов за раз. В этом случае у нас модель стала чуть больше и на каждый проход по 28 миллиардов параметров теперь у нас 110 миллисекунд, но в половине случаев за один проход мы получаем не один, а сразу 5 токенов. Нагрузка процессора теперь у нас стала 50%.
То есть MTP позволяет ускорить модель за счёт процессора.
Есть модели, которые можно запустить только у себя - никто их не предложит для подписки: например медицинские (MedGemma), или нецензурированные (abliterated, uncensored, ...)
Если все слои поместились на GPU (gpu_offload="99"),
То cpu_threads="16" не нужен, потому что префил будет работать на GPU, - там где все слои, то есть без CPU.
cpu_threads имеет смысл только, если слои в RAM.
cache_type_k="q4_0" - я бы опасался так сильно квантовать, это реально делает модель тупее. Лучше сэкономить VRAM за счёт --no-mmproj-offload, и взять хотя бы q8_0
Context Length: 262,144 natively and extensible up to 1,000,000 tokens.
For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively, e.g., YaRN.
Насколько у модели получается "держать" контекст, сколько памяти для этого требуется - это хорошо бы узнать из реальных тестов.
У меня тут 262k не влезают, так что мне не до миллиона...
write snake game on the sphere. The head of the snake it fixed in the center and the sphere is rotating. use HTML, CSS and JavaScript. The visible part of sphere shall be fully visible in the webView, not partially. The starting length of the snake shall be 3 and increasing every time the snake hit the food. Use keyboard control: LEFT and RIGHT arrows.
Было бы интересно почитать про то, как storage делится между VM.
Из своего небольшого опыта: даже одна VM постоянно делающая fsync (например так делает etcd) способна сильно замедлить ещё 20 VMs работающих с тем же диском. Даже если это быстрый NVMe.
Если вы собираетесь запустить эту модель, то имейте в виду, что есть много жалоб, что авторы что-то напутали с template, и из-за этого рассуждения (thinking) бывает не запускается, или останавливается на середине.
Так где твой харнесс то? Ссылка?
Я экперементировал дома с k3s на трёх нодах. etcd кластер на трёх нодах.
Каждая нода - 2 TB NVMe диск, быстрый.
Но так как там вместе и поды и etcd, то постоянно в логах жалуется на тормоза диска. Но работает.
Я вот думаю поменять настройка дискового кэша, чтобы игнорировались fsync для etcd. Хотя везде пишут, что это прям плохо. А я вот думаю: ну если рассчитывать на backup даже каждый час, то всё равно будут какие-то потери. А если потеряется что-то из-за кэша, то это всё равно на так много, как потери при восстановлении из backup.
Как ещё можно оптимизировать etcd? kine ставить не хочу.
Для каждого токена нужно посчитать результат для каждого из 27 миллиардов параметров.
Посчитать - это процессор.
27 миллиардов параметров - это память.
Например на моей системе, с моими квантами, прочитать 27 миллиардов параметров из памяти занимает 100 мс (миллисекунд). Процессор (GPU) нагружен на 20%. Получается скорость генерации 10 токенов в секунду.
Как это можно ускорить?
Идея MTP: мы добавим ещё одну модель, в ~10-20 раз меньше нашей (например 1 миллиард), которая будет работать быстрее и хуже, но в половине+ случаев будет давать правильные токены, а результаты (токены) этой маленькой модели будем проверять на полной модели в то же самое время когда считаем следующий токен. Причём сразу по 3-5 токенов за раз. В этом случае у нас модель стала чуть больше и на каждый проход по 28 миллиардов параметров теперь у нас 110 миллисекунд, но в половине случаев за один проход мы получаем не один, а сразу 5 токенов. Нагрузка процессора теперь у нас стала 50%.
То есть MTP позволяет ускорить модель за счёт процессора.
Есть модели, которые можно запустить только у себя - никто их не предложит для подписки: например медицинские (MedGemma), или нецензурированные (abliterated, uncensored, ...)
Если все слои поместились на GPU (gpu_offload="99"),
То cpu_threads="16" не нужен, потому что префил будет работать на GPU, - там где все слои, то есть без CPU.
cpu_threads имеет смысл только, если слои в RAM.
cache_type_k="q4_0" - я бы опасался так сильно квантовать, это реально делает модель тупее. Лучше сэкономить VRAM за счёт --no-mmproj-offload, и взять хотя бы q8_0
Ломают.
Забрали H265 из Video Station & Surveilance.
Убрали SMART информацию.
И ещё было несколько случаев.
Модель официально поддерживает до миллиона токенов. Про это написано вот тут:
https://huggingface.co/Qwen/Qwen3.8-27B
Насколько у модели получается "держать" контекст, сколько памяти для этого требуется - это хорошо бы узнать из реальных тестов.
У меня тут 262k не влезают, так что мне не до миллиона...
А ещё локальный Qwen3.8-27B может работать с изображениями, а локальный DeepSeek не может. Не знаю, как там по API.
Prefill 33.9?
Это какое-то нереальное значение. Проверьте на более длинном промпте.
У меня prefill около 4000
write snake game on the sphere. The head of the snake it fixed in the center and the sphere is rotating. use HTML, CSS and JavaScript. The visible part of sphere shall be fully visible in the webView, not partially. The starting length of the snake shall be 3 and increasing every time the snake hit the food. Use keyboard control: LEFT and RIGHT arrows.
Больше всего заметны улучшение в написании кода. И в работе с агентами - использовании tools.
Я с первого же запроса получил зачётную трёхмерную змейку:
https://s3.fursov.family/shares/snake3d.html
Раньше с этим справлялся только Opus.
Было бы интересно почитать про то, как storage делится между VM.
Из своего небольшого опыта: даже одна VM постоянно делающая fsync (например так делает etcd) способна сильно замедлить ещё 20 VMs работающих с тем же диском. Даже если это быстрый NVMe.
На сайте https://deepswe.datacurve.ai/
На графике, ноль - справа. Это ж как надо извращаться чтобы такое придумать?
Я не совсем понял как первая половина статьи (сравнение Mikrotik и x86) связана со второй половиной (GUI для Mikrotik).
У меня дома оптика от провайдера - 5Gbps, приходит на opnSense роутер, который работает 4 ядрах Intel Xeon и всё летает...
Github repo без README? Это как?
Согласен. От ComfyUI мозги дымятся.
Вот бы кто сделал интерфейс попроще, для простых смертных...
Пока не поддерживается в llama.cpp.
Есть PR, который добавляет поддержку этой модели, но похоже он ещё довольно сырой:
https://github.com/ggml-org/llama.cpp/pull/25731
Так вот же есть выложенные весы:
https://huggingface.co/collections/Qwen/qwen3-tts
Сам я пользовался вот этим:
https://github.com/supertone-inc/supertonic
Но что-то они написали, что закрываются...
Если вы собираетесь запустить эту модель, то имейте в виду, что есть много жалоб, что авторы что-то напутали с template, и из-за этого рассуждения (thinking) бывает не запускается, или останавливается на середине.
Думаю в ближайшие дни это пофиксят.
Кванты уже перезаливали раз. Может ещё будут.
Ваш проект - коммерческий, не открытый. Верно?
Вот этот проект - ваш открытый конкурент: https://github.com/open-webui/computer. Верно? Можете сравнить?