У меня, если ставить квант кеша отличный от 8/8 или 4/4, то начинает активно использоваться CPU и скорость падает на 30%. Досадно, так бы можно было сэкономить еще памяти за счет v кеша, например.
Если кому-то важно работать с изображениями, то VL голову mmproj можно держать в CPU RAM , если указать –no-mmproj-offload. Тогда распознавание изображений идет немного дольше, зато VRAM не занимает. По моим наблюдениям Dflash дает хороший буст скорости для кода- до 70-80t/s, против 30-40ts для человеческих текстов. MTP примерно одинаково работает для всего - 40-50ts, но при этом занимает места на 800мб меньше. Можно добавить контекста или повысить квант кеша до q8. Увеличение драфтов –spec-draft-n-max N увеличивает занятую VRAM.
Зомби стайл детектед. Рубленный стиль, кастрированные фразы. Такой уверенный и четкий нейрослоп, что аж кровь из глаз. Побольше живости и человечности уже хочется, сударь.
Первое - я не зожник и герой рассказа вызывает симпатию. Поэтому будет жаль, если поломает себя. Гуманизм и сострадание, слышали, не? Второе - мало ли кто решит, что надо на него равняться, но начать лучше сразу с бутылки игристого, а остальное приложится. Третье - возможно герою надо что-то в жизни изменить, чтобы не было потребности ежедневно находиться во хмелю. Четвертое - хаять незнакомых людей таким образом тоже какой-то дефект самоопределения, видимо.
Я сначала тоже попроще выриант с Termux пробовал, но без рута ничего там продвинутого запустить не получилось. Докер, фаервол и прочее не работали, упирались в защиту Андроида. С рутом уже не стал экспериментировать. Затем Droidian поставил и тоже упёрся в какие то лимиты. Далее - PMOS. Он уже заработал как натуральный Линукс сервер, правда не вся аппаратура. Но пока мне достаточно.
Тоже решил заморочиться с POCO X3 NFC (6/64Gb , 8 ядер) в качестве сервера. В поддерживаемых PMOS устройствах он есть. Можно поставить только консольку, без UI. Ставится с pmbootstrap без особых проблем. Но есть нюансы : - спец версии под устройство нет, используется generic qcom-sm7150 сборка. - без включенного bluetooth ребутится после загрузки ОС, поэтому оставил, отключив все функции для экономии. - ограниченное управление и мониторинг питания. Не удалось настроить отключение по достижению процента зарядки. Поэтому решил использовать розетку с таймером, чтобы регулярно отключать питание и экономить ресурс батареи. - не видит доп. SD карту через SIM разъем. Хотя, например, TWRP с ней может работать. - огорчило то, что не работает dual режим с зарядкой по OTG . Пока что либо зарядка, либо работа с устройствами в USB HUB (хочется подключить ethernet, и всякие USB девайсы, ). Поэтому сейчас коммуникация по WiFi + зарядка.
Докеры и прочие серверные штуки работают как положено. Энергопотребление - 1-2Вт/ч. только на батарее может дней 5-7 жить, если не сильно нагружать проц и WiFi. В целом, можно использовать в качестве сервера для каких то не сильно нагруженных вещей. У меня там Hermes агент, например.
Тоже поразило. При таких ежедневных вливаниях происходят гормональные изменения и перестройка организма. Это уже алкоголизм не лёгкой стадии. Лечиться придется в том числе и от зависимости. Жаль что не всем помогает. Знаю не по наслышке по близким людям.
Есть проект local deep research под докер https://github.com/LearningCircuit/local-deep-research. В связке с searxng (локальный или публичный) тоже дает неплохие результаты. Можно с локальной или дешевой LLM. Вполне себе замена perplexity
Мифический Франкенштейн мог заниматься осмысленной практической деятельностью. Стоит ли ожидать полезных артефактов от подобного подхода, кроме "ну да, и так тоже извратиться можно"?
Кажется, что практическая применимость малых, и к тому же медленных из за железа моделей очень ограничена. В большинстве популярных сценариев они будут сжирать личное время пользователя на исправления и перезапросы.
vLLM в нативном Windows пока не фунциклирует, а с виртуализацией это уже не торт. Из коментов видно, что народу интересно удобное и доступное решение для домашек, т.е. Windows в большинстве случаев. И насчет x2 к llama.cpp выглядит преувеличением. Для одиночного пользователя без конкуренции разницы может и не будет.
У меня полностью влезает в 80Gb VRAM в 3 карты, контекст ставлю до 160кб и еще можно добавить, только для parallel 1 смысла нет, т.к. после 120+кб PP начинает некомфортно долго думать, даже если попадает в кеш. На простом запросе "Расскажи о себе" дает 70 t/s. Мой конфиг, может кому пригодится: “.\bin_test\llama-server.exe” -m ^ f:\AI\LMStudio\models\unsloth\Qwen3.5-122B-A10B-GGUF\Qwen3.5-122B-A10B-UD-Q4_K_XL-00001-of-00003.gguf ^ –host 0.0.0.0 ^ –port 1234 ^ -c 160000 ^ -ngl 49 ^ –split-mode layer ^ –tensor-split 3.2,1.0,1.0 ^ –main-gpu 0 ^ –flash-attn on^ –threads 6 --threads-batch 6 ^ –batch-size 2048 ^ –ubatch-size 1024 ^ –kv-unified ^ –temp 0.6 --top-p 0.95 --min-p 0.00 ^ –cache-type-k q8_0 --cache-type-v q8_0 -a “qwen3.5-122b” ^ –jinja ^ –reasoning off ^ –cache-ram 10000 ^ –mmproj f:\AI\LMStudio\models\unsloth\Qwen3.5-122B-A10B-GGUF\mmproj-BF16.gguf ^ –parallel 1 ^ –no-mmap ^ –tools all
122 всяко лучше в целом, т.к. в ней в 3.5 раза больше данных. Но последняя 3.6-35b тоже для многих задач очень даже неплоха. Надо смотреть в реальных применениях. В ютубах уже полно обзоров и сравнений.
Пользуюсь. У меня она сейчас в Q4_K_XL (70Gb файл) помещается полностью в VRAM 80Gb на 3 карты в режие x8+x8+x4. Скорость 60-70 t/s на простом запросе. Если чуть уйти в RAM на пару гигабайт, то падает до 40 t/s и чем больше выгрузка в RAM тем медленнее. Модель большая для домашнего компьютера, и мне кажется что ваша конфигурация не будет выдавать комфортную скорость(хотя бы 30 тс). Но я не пользовался cmoe и ncmoe, как написано в статье. Возможно они существенно ускоряют инференс для этой модели в RAM.
Сработало. Спасибо!
У меня, если ставить квант кеша отличный от 8/8 или 4/4, то начинает активно использоваться CPU и скорость падает на 30%. Досадно, так бы можно было сэкономить еще памяти за счет v кеша, например.
Если кому-то важно работать с изображениями, то VL голову mmproj можно держать в CPU RAM , если указать –no-mmproj-offload. Тогда распознавание изображений идет немного дольше, зато VRAM не занимает.
По моим наблюдениям Dflash дает хороший буст скорости для кода- до 70-80t/s, против 30-40ts для человеческих текстов.
MTP примерно одинаково работает для всего - 40-50ts, но при этом занимает места на 800мб меньше. Можно добавить контекста или повысить квант кеша до q8.
Увеличение драфтов –spec-draft-n-max N увеличивает занятую VRAM.
Зомби стайл детектед. Рубленный стиль, кастрированные фразы. Такой уверенный и четкий нейрослоп, что аж кровь из глаз. Побольше живости и человечности уже хочется, сударь.
По теории и тестам MTP не влияет качество инференса
Первое - я не зожник и герой рассказа вызывает симпатию. Поэтому будет жаль, если поломает себя. Гуманизм и сострадание, слышали, не?
Второе - мало ли кто решит, что надо на него равняться, но начать лучше сразу с бутылки игристого, а остальное приложится.
Третье - возможно герою надо что-то в жизни изменить, чтобы не было потребности ежедневно находиться во хмелю.
Четвертое - хаять незнакомых людей таким образом тоже какой-то дефект самоопределения, видимо.
Я сначала тоже попроще выриант с Termux пробовал, но без рута ничего там продвинутого запустить не получилось. Докер, фаервол и прочее не работали, упирались в защиту Андроида. С рутом уже не стал экспериментировать. Затем Droidian поставил и тоже упёрся в какие то лимиты. Далее - PMOS. Он уже заработал как натуральный Линукс сервер, правда не вся аппаратура. Но пока мне достаточно.
Тоже решил заморочиться с POCO X3 NFC (6/64Gb , 8 ядер) в качестве сервера. В поддерживаемых PMOS устройствах он есть. Можно поставить только консольку, без UI.
Ставится с pmbootstrap без особых проблем. Но есть нюансы :
- спец версии под устройство нет, используется generic qcom-sm7150 сборка.
- без включенного bluetooth ребутится после загрузки ОС, поэтому оставил, отключив все функции для экономии.
- ограниченное управление и мониторинг питания. Не удалось настроить отключение по достижению процента зарядки. Поэтому решил использовать розетку с таймером, чтобы регулярно отключать питание и экономить ресурс батареи.
- не видит доп. SD карту через SIM разъем. Хотя, например, TWRP с ней может работать.
- огорчило то, что не работает dual режим с зарядкой по OTG . Пока что либо зарядка, либо работа с устройствами в USB HUB (хочется подключить ethernet, и всякие USB девайсы, ). Поэтому сейчас коммуникация по WiFi + зарядка.
Докеры и прочие серверные штуки работают как положено. Энергопотребление - 1-2Вт/ч. только на батарее может дней 5-7 жить, если не сильно нагружать проц и WiFi.
В целом, можно использовать в качестве сервера для каких то не сильно нагруженных вещей. У меня там Hermes агент, например.
Тоже поразило. При таких ежедневных вливаниях происходят гормональные изменения и перестройка организма. Это уже алкоголизм не лёгкой стадии. Лечиться придется в том числе и от зависимости. Жаль что не всем помогает. Знаю не по наслышке по близким людям.
Есть проект local deep research под докер https://github.com/LearningCircuit/local-deep-research. В связке с searxng (локальный или публичный) тоже дает неплохие результаты. Можно с локальной или дешевой LLM. Вполне себе замена perplexity
Еще есть https://github.com/itzcrazykns/vane , попроще но больше похож на perplexity по интерфейсу.
Могу дать платочек, чтобы рот вытереть.
Мифический Франкенштейн мог заниматься осмысленной практической деятельностью. Стоит ли ожидать полезных артефактов от подобного подхода, кроме "ну да, и так тоже извратиться можно"?
надо в конфиге opencode прописать параметры для модели
“modalities”: { “input”: [ “text”, “image” ], “output”: [ “text” ] }
Без этого работать не будет
Детали - в документации.
2. Зачем менеджеры, если можно просто запустить exe файл.из архива релиза
Можно путь к файлу скриншота
Зачем его в докере, если он в консоли работает? ИБ?
Если у нему подключить mcp playwright, то с хорошей VL моделью он сам отлаживает веб приложения и работает с изображениями
Кажется, что практическая применимость малых, и к тому же медленных из за железа моделей очень ограничена. В большинстве популярных сценариев они будут сжирать личное время пользователя на исправления и перезапросы.
Заход с другого бока: openrouter.ai . Там куча дешёвых "китайцев". есть и бесплатные, но тормозные обычно.
vLLM в нативном Windows пока не фунциклирует, а с виртуализацией это уже не торт. Из коментов видно, что народу интересно удобное и доступное решение для домашек, т.е. Windows в большинстве случаев. И насчет x2 к llama.cpp выглядит преувеличением. Для одиночного пользователя без конкуренции разницы может и не будет.
У меня полностью влезает в 80Gb VRAM в 3 карты, контекст ставлю до 160кб и еще можно добавить, только для parallel 1 смысла нет, т.к. после 120+кб PP начинает некомфортно долго думать, даже если попадает в кеш. На простом запросе "Расскажи о себе" дает 70 t/s.
Мой конфиг, может кому пригодится:
“.\bin_test\llama-server.exe” -m ^ f:\AI\LMStudio\models\unsloth\Qwen3.5-122B-A10B-GGUF\Qwen3.5-122B-A10B-UD-Q4_K_XL-00001-of-00003.gguf ^ –host 0.0.0.0 ^ –port 1234 ^ -c 160000 ^ -ngl 49 ^ –split-mode layer ^ –tensor-split 3.2,1.0,1.0 ^ –main-gpu 0 ^ –flash-attn on^ –threads 6 --threads-batch 6 ^ –batch-size 2048 ^ –ubatch-size 1024 ^ –kv-unified ^ –temp 0.6 --top-p 0.95 --min-p 0.00 ^ –cache-type-k q8_0 --cache-type-v q8_0 -a “qwen3.5-122b” ^ –jinja ^ –reasoning off ^ –cache-ram 10000 ^ –mmproj f:\AI\LMStudio\models\unsloth\Qwen3.5-122B-A10B-GGUF\mmproj-BF16.gguf ^ –parallel 1 ^ –no-mmap ^ –tools all
122 всяко лучше в целом, т.к. в ней в 3.5 раза больше данных. Но последняя 3.6-35b тоже для многих задач очень даже неплоха. Надо смотреть в реальных применениях. В ютубах уже полно обзоров и сравнений.
Пользуюсь. У меня она сейчас в Q4_K_XL (70Gb файл) помещается полностью в VRAM 80Gb на 3 карты в режие x8+x8+x4. Скорость 60-70 t/s на простом запросе. Если чуть уйти в RAM на пару гигабайт, то падает до 40 t/s и чем больше выгрузка в RAM тем медленнее. Модель большая для домашнего компьютера, и мне кажется что ваша конфигурация не будет выдавать комфортную скорость(хотя бы 30 тс). Но я не пользовался cmoe и ncmoe, как написано в статье. Возможно они существенно ускоряют инференс для этой модели в RAM.