Pull to refresh
-3
Вячеслав@vpman

User

0,4
Rating
Send message

Сработало. Спасибо!

У меня, если ставить квант кеша отличный от 8/8 или 4/4, то начинает активно использоваться CPU и скорость падает на 30%. Досадно, так бы можно было сэкономить еще памяти за счет v кеша, например.

Если кому-то важно работать с изображениями, то VL голову mmproj можно держать в CPU RAM , если указать –no-mmproj-offload. Тогда распознавание изображений идет немного дольше, зато VRAM не занимает.
По моим наблюдениям Dflash дает хороший буст скорости для кода- до 70-80t/s, против 30-40ts для человеческих текстов.
MTP примерно одинаково работает для всего - 40-50ts, но при этом занимает места на 800мб меньше. Можно добавить контекста или повысить квант кеша до q8.
Увеличение драфтов –spec-draft-n-max N увеличивает занятую VRAM.

Зомби стайл детектед. Рубленный стиль, кастрированные фразы. Такой уверенный и четкий нейрослоп, что аж кровь из глаз. Побольше живости и человечности уже хочется, сударь.

По теории и тестам MTP не влияет качество инференса

Первое - я не зожник и герой рассказа вызывает симпатию. Поэтому будет жаль, если поломает себя. Гуманизм и сострадание, слышали, не?
Второе - мало ли кто решит, что надо на него равняться, но начать лучше сразу с бутылки игристого, а остальное приложится.
Третье - возможно герою надо что-то в жизни изменить, чтобы не было потребности ежедневно находиться во хмелю.
Четвертое - хаять незнакомых людей таким образом тоже какой-то дефект самоопределения, видимо.

Я сначала тоже попроще выриант с Termux пробовал, но без рута ничего там продвинутого запустить не получилось. Докер, фаервол и прочее не работали, упирались в защиту Андроида. С рутом уже не стал экспериментировать. Затем Droidian поставил и тоже упёрся в какие то лимиты. Далее - PMOS. Он уже заработал как натуральный Линукс сервер, правда не вся аппаратура. Но пока мне достаточно.

Тоже решил заморочиться с POCO X3 NFC (6/64Gb , 8 ядер) в качестве сервера. В поддерживаемых PMOS устройствах он есть. Можно поставить только консольку, без UI.
Ставится с pmbootstrap без особых проблем. Но есть нюансы :
- спец версии под устройство нет, используется generic qcom-sm7150 сборка.
- без включенного bluetooth ребутится после загрузки ОС, поэтому оставил, отключив все функции для экономии.
- ограниченное управление и мониторинг питания. Не удалось настроить отключение по достижению процента зарядки. Поэтому решил использовать розетку с таймером, чтобы регулярно отключать питание и экономить ресурс батареи.
- не видит доп. SD карту через SIM разъем. Хотя, например, TWRP с ней может работать.
- огорчило то, что не работает dual режим с зарядкой по OTG . Пока что либо зарядка, либо работа с устройствами в USB HUB (хочется подключить ethernet, и всякие USB девайсы, ). Поэтому сейчас коммуникация по WiFi + зарядка.

Докеры и прочие серверные штуки работают как положено. Энергопотребление - 1-2Вт/ч. только на батарее может дней 5-7 жить, если не сильно нагружать проц и WiFi.
В целом, можно использовать в качестве сервера для каких то не сильно нагруженных вещей. У меня там Hermes агент, например.

Тоже поразило. При таких ежедневных вливаниях происходят гормональные изменения и перестройка организма. Это уже алкоголизм не лёгкой стадии. Лечиться придется в том числе и от зависимости. Жаль что не всем помогает. Знаю не по наслышке по близким людям.

Есть проект local deep research под докер https://github.com/LearningCircuit/local-deep-research. В связке с searxng (локальный или публичный) тоже дает неплохие результаты. Можно с локальной или дешевой LLM. Вполне себе замена perplexity

Еще есть https://github.com/itzcrazykns/vane , попроще но больше похож на perplexity по интерфейсу.

Мифический Франкенштейн мог заниматься осмысленной практической деятельностью. Стоит ли ожидать полезных артефактов от подобного подхода, кроме "ну да, и так тоже извратиться можно"?

надо в конфиге opencode прописать параметры для модели
“modalities”: { “input”: [ “text”, “image” ], “output”: [ “text” ] }

Без этого работать не будет

Детали - в документации.

2. Зачем менеджеры, если можно просто запустить exe файл.из архива релиза

  1. Можно путь к файлу скриншота

  2. Зачем его в докере, если он в консоли работает? ИБ?

    Если у нему подключить mcp playwright, то с хорошей VL моделью он сам отлаживает веб приложения и работает с изображениями

Кажется, что практическая применимость малых, и к тому же медленных из за железа моделей очень ограничена. В большинстве популярных сценариев они будут сжирать личное время пользователя на исправления и перезапросы.

Заход с другого бока: openrouter.ai . Там куча дешёвых "китайцев". есть и бесплатные, но тормозные обычно.

vLLM в нативном Windows пока не фунциклирует, а с виртуализацией это уже не торт. Из коментов видно, что народу интересно удобное и доступное решение для домашек, т.е. Windows в большинстве случаев. И насчет x2 к llama.cpp выглядит преувеличением. Для одиночного пользователя без конкуренции разницы может и не будет.

У меня полностью влезает в 80Gb VRAM в 3 карты, контекст ставлю до 160кб и еще можно добавить, только для parallel 1 смысла нет, т.к. после 120+кб PP начинает некомфортно долго думать, даже если попадает в кеш. На простом запросе "Расскажи о себе" дает 70 t/s.
Мой конфиг, может кому пригодится:
“.\bin_test\llama-server.exe” -m ^ f:\AI\LMStudio\models\unsloth\Qwen3.5-122B-A10B-GGUF\Qwen3.5-122B-A10B-UD-Q4_K_XL-00001-of-00003.gguf ^ –host 0.0.0.0 ^ –port 1234 ^ -c 160000 ^ -ngl 49 ^ –split-mode layer ^ –tensor-split 3.2,1.0,1.0 ^ –main-gpu 0 ^ –flash-attn on^ –threads 6 --threads-batch 6 ^ –batch-size 2048 ^ –ubatch-size 1024 ^ –kv-unified ^ –temp 0.6 --top-p 0.95 --min-p 0.00 ^ –cache-type-k q8_0 --cache-type-v q8_0 -a “qwen3.5-122b” ^ –jinja ^ –reasoning off ^ –cache-ram 10000 ^ –mmproj f:\AI\LMStudio\models\unsloth\Qwen3.5-122B-A10B-GGUF\mmproj-BF16.gguf ^ –parallel 1 ^ –no-mmap ^ –tools all

122 всяко лучше в целом, т.к. в ней в 3.5 раза больше данных. Но последняя 3.6-35b тоже для многих задач очень даже неплоха. Надо смотреть в реальных применениях. В ютубах уже полно обзоров и сравнений.

Пользуюсь. У меня она сейчас в Q4_K_XL (70Gb файл) помещается полностью в VRAM 80Gb на 3 карты в режие x8+x8+x4. Скорость 60-70 t/s на простом запросе. Если чуть уйти в RAM на пару гигабайт, то падает до 40 t/s и чем больше выгрузка в RAM тем медленнее. Модель большая для домашнего компьютера, и мне кажется что ваша конфигурация не будет выдавать комфортную скорость(хотя бы 30 тс). Но я не пользовался cmoe и ncmoe, как написано в статье. Возможно они существенно ускоряют инференс для этой модели в RAM.

1

Information

Rating
2,461-st
Location
Москва, Москва и Московская обл., Россия
Registered
Activity