У меня RTX 3080 Laptop (Ampere, 2021) на 16ГБ. Тоже завелось на ik_llama.cpp с 105к контекста. Использовал внутри Hermes. Дал ему тестовую задачу на реальном проекте - написать чек-лист для тестирования функционала из указанного коммита. Вчера давал такую же задачку Qwen3.8, но запущенному на DGX Spark, который справился за 7 минут. А на 3080 - сделал за 28... Медленно, конечно, зато автономно. Воспользуюсь этим сетапом, когда будут проблемы с интернетом.
Провел небольшой бенчмарк:
1) Короткий промпт: TTFT - 1.40 с , генерация - 17.00
На прошлой неделе тестировал модели для агентского кодинга. И если есть 128ГБ общей памяти, то можно рассмотреть Laguna S 2.1. Мне понравилась больше Qwen 3.6. Я, конечно, долго подбирал оптимальные параметры запуска на vLLM, но оно того стоило.
Да, у меня тоже сначала сложилось ощущение, что qwen 3.6 27b (dense) лучше пишет код, но на Spark она работает крайне медленно. Интересно будет попробовать qwen 3.8 27b. Может быть MTP как-то улучшит ситуацию со скоростью. Но в идеале, железка нужна другая.
Gigacode у меня изначально тоже вызывал только негатив - пришлось изрядно его тюнить навыками, чтобы хоть как-то с ним работать. Но для подстраховки держать можно, когда лимиты Claude исчерпываются.
А для какого спектра задач используете Qwen 3.6 27b?
По обзорам, которые мне попадались, и по советам Gemini, ChatGPT, DeepSeek. Смотрел на то, сколько памяти нужно для развертывания, какие показатели на бенчмарках.
Laguna, по сути, стала для меня открытием, которую посоветовал один из ИИ - позволяет выжать максимум из DGX Spark, как мне кажется
Попробовал настроить на другом сервере без настроек NAT и с Вашим вариантом создания туннеля. К сожалению, это не сработало.
Запустил dbgpClient на своем ПК, а из контейнера с PHP-FPM пытался обратиться на 172.18.0.1:9003 - подключение не удавалось. При запуске dbgpClient на внешнем сервере, из контейнера на этот адрес удается достучаться.
Но как только добавил правила для NAT и перезапустил туннель, как писал в статье, то все заработало.
У меня RTX 3080 Laptop (Ampere, 2021) на 16ГБ. Тоже завелось на ik_llama.cpp с 105к контекста. Использовал внутри Hermes. Дал ему тестовую задачу на реальном проекте - написать чек-лист для тестирования функционала из указанного коммита. Вчера давал такую же задачку Qwen3.8, но запущенному на DGX Spark, который справился за 7 минут. А на 3080 - сделал за 28... Медленно, конечно, зато автономно. Воспользуюсь этим сетапом, когда будут проблемы с интернетом.
Провел небольшой бенчмарк:
1) Короткий промпт: TTFT - 1.40 с , генерация - 17.00
2) Глубина 8k: TTFT - 17.43 с , prefill - 465.8, генерация - 25.57
3) Глубина 30k: TTFT - 88.48 с , prefill - 346.3, генерация - 22.23
4) Переписывание файла: TTFT - 5.60 с , генерация - 33.00
На прошлой неделе тестировал модели для агентского кодинга. И если есть 128ГБ общей памяти, то можно рассмотреть Laguna S 2.1. Мне понравилась больше Qwen 3.6. Я, конечно, долго подбирал оптимальные параметры запуска на vLLM, но оно того стоило.
Да, у меня тоже сначала сложилось ощущение, что qwen 3.6 27b (dense) лучше пишет код, но на Spark она работает крайне медленно. Интересно будет попробовать qwen 3.8 27b. Может быть MTP как-то улучшит ситуацию со скоростью. Но в идеале, железка нужна другая.
Gigacode у меня изначально тоже вызывал только негатив - пришлось изрядно его тюнить навыками, чтобы хоть как-то с ним работать. Но для подстраховки держать можно, когда лимиты Claude исчерпываются.
А для какого спектра задач используете Qwen 3.6 27b?
Qwen запускал с дефолтными параметрами, без mtp и пенальти за зацикливание. Отдельный system prompt не писал, использовался дефолтный для Hermes
По обзорам, которые мне попадались, и по советам Gemini, ChatGPT, DeepSeek. Смотрел на то, сколько памяти нужно для развертывания, какие показатели на бенчмарках.
Laguna, по сути, стала для меня открытием, которую посоветовал один из ИИ - позволяет выжать максимум из DGX Spark, как мне кажется
Попробовал настроить на другом сервере без настроек NAT и с Вашим вариантом создания туннеля. К сожалению, это не сработало.
Запустил dbgpClient на своем ПК, а из контейнера с PHP-FPM пытался обратиться на
172.18.0.1:9003- подключение не удавалось. При запуске dbgpClient на внешнем сервере, из контейнера на этот адрес удается достучаться.Но как только добавил правила для NAT и перезапустил туннель, как писал в статье, то все заработало.