Strix halo llama + mtp + Vulkan . Q4 дает < 25 токенов в секунду, что сходится с тем, что пишут AMD, совсем мало, жду MOE. В Hermes Agent модель стала заметно умнее по сравнению с 3.6 q4 xl, по крайней мере с тестами на генерацию аудио и фото через удаленный comfy ui справилась сама без подсказок.
Тоже использую llama + qwen3.6 xl mtp. Правда вместо windows у меня proxmox и, кажется, для strix halo это очень хороший выбор, можно в контейнерах lxc использовать gpu ускорение для llm без gpu passthrough.
Спасибо за идею использовать Claude code + local llm попробую)
Перепробовал много моделей для локального кодинг агента + ssh dev ops. Больше всего понравился Qwen 3 coder next 80b q6 именно под lm studio. На моем железе (strix halo + vulkan vulkan backend) он выдает 40-45 токенов в секунду, против 35 (ollama).
Еще большой плюс это build in lm studio link, который легко позволяет подключить клиента по интернету
Из минусов, иногда глючит API, такое ощущение, что ollama все же лучше оптимизирован в этом плане
Strix halo llama + mtp + Vulkan . Q4 дает < 25 токенов в секунду, что сходится с тем, что пишут AMD, совсем мало, жду MOE. В Hermes Agent модель стала заметно умнее по сравнению с 3.6 q4 xl, по крайней мере с тестами на генерацию аудио и фото через удаленный comfy ui справилась сама без подсказок.
Тоже использую llama + qwen3.6 xl mtp. Правда вместо windows у меня proxmox и, кажется, для strix halo это очень хороший выбор, можно в контейнерах lxc использовать gpu ускорение для llm без gpu passthrough.
Спасибо за идею использовать Claude code + local llm попробую)
Перепробовал много моделей для локального кодинг агента + ssh dev ops. Больше всего понравился Qwen 3 coder next 80b q6 именно под lm studio. На моем железе (strix halo + vulkan vulkan backend) он выдает 40-45 токенов в секунду, против 35 (ollama).
Еще большой плюс это build in lm studio link, который легко позволяет подключить клиента по интернету
Из минусов, иногда глючит API, такое ощущение, что ollama все же лучше оптимизирован в этом плане