Надо. Слишком долго расписывать почему. Но уверен, вы сами до этого дойдете. К примеру, в том же GitHub-MCP есть очень крутая функция поиска не только в коде, но и по тексту в Issues, Pull Requests, обсуждениях и релизах, что иногда очень помогает решать проблемы.
Что вы имеете ввиду? О каких специализированных агентах идёт речь и что за "персональные наборы инструментов"? В чем отличие от того подхода, что я описал?
Самый лучший вариант - продать rtx4090 и на вырученные деньги купить 2х rtx3090.
На 48 ГБ VRAM уже можно более-менее нормально работать. Запускать модель qwen3.8-27b-q8_k_xl с MTP, с максимальным контекстом 256k, с Vision и квантованием кэша q8_0. Как раз займет 46,5 ГБ из 48. Скорость будет от 1800 (с 0 токена) до 600 (на 250k-том токене) префил и от 80 до 60 токен/с генерация.
Размер 90 тыс токенов - это критически мало для боле менее серьезных задач. У меня только начальный промпт занимает ~45 тыс токенов, потому что включает в себя необходимые инструменты: SearXGN (для поиска в интернете), Context7 (информация о последних изменениях библиотек), GitHub-MCP и Browser MCP. Без них вообще не представляю как можно нормально работать. Отключение размышлений как показала практика работы с моделью qwen3.8-27b ведёт к существенному снижению качества итогового результата. Нужно ставить хотя бы уровень low. На самом деле с выходом qwen3.8 почти всегда стал упираться в ограничение 256k контекста. Для решения проблемы настроил правила handoff (это отдельная интересная тема)
Зависит от режима запуска. В llama.cpp если выбрать режим layer, то слои модели разделятся по видеокартам и будут обрабатываться последовательно, при этом по шине PCIE будет передаваться минимум информации. Производительность будет ограничена скоростью одного GPU, но за счёт суммарной VRAM вы сможете запускать большие модели на приемлемой скорости. А при запуске в режиме tensor все GPU работают одновременно и по шине передается большой объем информации и она становится узким местом.
За 10 лет постройки и использования "умного" дома, на базе Home Assistant (+ESPHome, Zigbee2MQTT) пришел к выводу, который взял себе за правило: 1) вся автоматизация должна дублироваться физическими кнопками, которые должны работать при падении сервера. 2) Везде где можно проложить провод нужно всегда использовать проводное подключение, а не беспроводное.
В статье 4 раза сказано что "Пиковое потребление VRAM составило 5,95 ГБ", многие другие моменты тоже по нескольку раз повторены. Физически тяжело такое читать. При этом главного вывода о скорости работы и стоит ли оно вообще того - нет. Из статьи я даже не понял зачем бралась модель bf16, а не q8 или q4 например. Не понял, можно ли было вместо 5,95 ГБ VRAM утилизировать больше видеопамяти так как видеокарта 4090 это позволяла - какой бы это дало эффект? Вообщем, очередная мусорная статья ни о чем....
Огромное преимущество обычных батареек по сравнению с аккумуляторами - низкий саморазряд. Если девайс потребляет очень мало тока, например пульт от телевизора или часы, то от обычных батареек он будет работать годами. А у аккумулятора иногда ток саморазряда выше чем потребление устройства. Конечно есть дорогие аккумуляторы с низким саморазрядом, но даже они по этому показателю не сравнятся с батарейками. С другой стороны, для устройств с большим энергопотреблением аккумуляторы гораздо лучше.
Вы используете 2 параллельных запроса в однопользовательском режиме правильно понимаю? То есть модель подключает субагента и тот работает параллельно основной задаче?
Для статистики. Запускаю на хоумлабе с 512 ГБ ОЗУ DDR4 2666 и тремя видеокартами 2х RTX3090 24ГБ (подключены через PCIE x16 v3.0) и RTX4070Ti Super 16ГБ (подключена через Okulink PCIE x4 v3.0) через llama.cpp, модель unsloth\Qwen3.8-Flash-Next-UD-Q4_K_XL (103ГБ).
При использовании всех трех видеокарт: промпт процессинг ~70-80 т/с, генерация токенов ~22-25
При использовании 2х RTX3090: промпт процессинг ~150-160 т/с, генерация токенов ~20-22 т/с
При использовании 1х RTX3090: промпт процессинг ~110 т/с, генерация токенов ~15 т/с
То есть для моей конфигурации лучше вариант с двумя видеокартами.
Для сравнения, модель Qwen3.8-27B-UD-Q8_K_XL (29.2 ГБ), с vision, квантованием кэша bf16, и максимальным контекстом 256k выдает на 2 или 3 видеокартах (разницы в скорости при этом особой нет): промпт процессинг ~1600-1800 т/с, генерация токенов ~45-50 т/с.
При этом чувствуется что Qwen3.8-Flash-Next более умная модель - на решение задач тратит меньше токенов и размышления гораздо адекватнее.
Но после того как привыкаешь к огромной скорости промпт процессинга на Qwen3.8-27B, работать на Qwen3.8-Flash-Next невозможно нормально...
Про то что с турбо квантом "качество" контекста выше чем базовые квантование f16 можете дать ссылку про исследование? Просто я везде на реддите читаю что турбо квант конечно сильно экономит память, но за счёт снижения качества
У вас разделение происходит в режиме tensor. Подскажите, у вас карты соединены с помощью nvlink? Если без nvlink, то в каком режиме работают PCIE слоты? (В Линукс скорость работы PCIE можно посмотреть утилитой nvtop)
Как я понял температура 1.0 в qwen3.6 не тоже самое что температура 1.0 в qwen3.8. Поэтому для одних и тех же сценариев для qwen3.6 разработчики рекомендуют 0.6, а для qwen3.8 - 1.0
Надо. Слишком долго расписывать почему. Но уверен, вы сами до этого дойдете. К примеру, в том же GitHub-MCP есть очень крутая функция поиска не только в коде, но и по тексту в Issues, Pull Requests, обсуждениях и релизах, что иногда очень помогает решать проблемы.
Что вы имеете ввиду? О каких специализированных агентах идёт речь и что за "персональные наборы инструментов"? В чем отличие от того подхода, что я описал?
Самый лучший вариант - продать rtx4090 и на вырученные деньги купить 2х rtx3090.
На 48 ГБ VRAM уже можно более-менее нормально работать. Запускать модель qwen3.8-27b-q8_k_xl с MTP, с максимальным контекстом 256k, с Vision и квантованием кэша q8_0. Как раз займет 46,5 ГБ из 48. Скорость будет от 1800 (с 0 токена) до 600 (на 250k-том токене) префил и от 80 до 60 токен/с генерация.
Вы никогда mcp-сервер не подключали к модели, или инструменты?
"Входной промпт" это как бы не только то что вы ручками в чате набили. Для некоторых задач он у меня и более 100k токенов занимал.
Размер 90 тыс токенов - это критически мало для боле менее серьезных задач. У меня только начальный промпт занимает ~45 тыс токенов, потому что включает в себя необходимые инструменты: SearXGN (для поиска в интернете), Context7 (информация о последних изменениях библиотек), GitHub-MCP и Browser MCP. Без них вообще не представляю как можно нормально работать. Отключение размышлений как показала практика работы с моделью qwen3.8-27b ведёт к существенному снижению качества итогового результата. Нужно ставить хотя бы уровень low. На самом деле с выходом qwen3.8 почти всегда стал упираться в ограничение 256k контекста. Для решения проблемы настроил правила handoff (это отдельная интересная тема)
Зависит от режима запуска. В llama.cpp если выбрать режим layer, то слои модели разделятся по видеокартам и будут обрабатываться последовательно, при этом по шине PCIE будет передаваться минимум информации. Производительность будет ограничена скоростью одного GPU, но за счёт суммарной VRAM вы сможете запускать большие модели на приемлемой скорости. А при запуске в режиме tensor все GPU работают одновременно и по шине передается большой объем информации и она становится узким местом.
Я по всей квартире разводил витую экранированную пару cat6. Проблем с 10 Gb нет. У оптики есть недостаток - не поддерживает PoE
За 10 лет постройки и использования "умного" дома, на базе Home Assistant (+ESPHome, Zigbee2MQTT) пришел к выводу, который взял себе за правило: 1) вся автоматизация должна дублироваться физическими кнопками, которые должны работать при падении сервера. 2) Везде где можно проложить провод нужно всегда использовать проводное подключение, а не беспроводное.
В статье 4 раза сказано что "Пиковое потребление VRAM составило 5,95 ГБ", многие другие моменты тоже по нескольку раз повторены. Физически тяжело такое читать. При этом главного вывода о скорости работы и стоит ли оно вообще того - нет. Из статьи я даже не понял зачем бралась модель bf16, а не q8 или q4 например. Не понял, можно ли было вместо 5,95 ГБ VRAM утилизировать больше видеопамяти так как видеокарта 4090 это позволяла - какой бы это дало эффект? Вообщем, очередная мусорная статья ни о чем....
Огромное преимущество обычных батареек по сравнению с аккумуляторами - низкий саморазряд. Если девайс потребляет очень мало тока, например пульт от телевизора или часы, то от обычных батареек он будет работать годами. А у аккумулятора иногда ток саморазряда выше чем потребление устройства. Конечно есть дорогие аккумуляторы с низким саморазрядом, но даже они по этому показателю не сравнятся с батарейками. С другой стороны, для устройств с большим энергопотреблением аккумуляторы гораздо лучше.
Вы используете 2 параллельных запроса в однопользовательском режиме правильно понимаю? То есть модель подключает субагента и тот работает параллельно основной задаче?
Не понял, вот это
-c 524288 --parallel 2зачем?Для статистики. Запускаю на хоумлабе с 512 ГБ ОЗУ DDR4 2666 и тремя видеокартами 2х RTX3090 24ГБ (подключены через PCIE x16 v3.0) и RTX4070Ti Super 16ГБ (подключена через Okulink PCIE x4 v3.0) через llama.cpp, модель unsloth\Qwen3.8-Flash-Next-UD-Q4_K_XL (103ГБ).
При использовании всех трех видеокарт: промпт процессинг ~70-80 т/с, генерация токенов ~22-25
При использовании 2х RTX3090: промпт процессинг ~150-160 т/с, генерация токенов ~20-22 т/с
При использовании 1х RTX3090: промпт процессинг ~110 т/с, генерация токенов ~15 т/с
То есть для моей конфигурации лучше вариант с двумя видеокартами.
Для сравнения, модель Qwen3.8-27B-UD-Q8_K_XL (29.2 ГБ), с vision, квантованием кэша bf16, и максимальным контекстом 256k выдает на 2 или 3 видеокартах (разницы в скорости при этом особой нет): промпт процессинг ~1600-1800 т/с, генерация токенов ~45-50 т/с.
При этом чувствуется что Qwen3.8-Flash-Next более умная модель - на решение задач тратит меньше токенов и размышления гораздо адекватнее.
Но после того как привыкаешь к огромной скорости промпт процессинга на Qwen3.8-27B, работать на Qwen3.8-Flash-Next невозможно нормально...
Про то что с турбо квантом "качество" контекста выше чем базовые квантование f16 можете дать ссылку про исследование? Просто я везде на реддите читаю что турбо квант конечно сильно экономит память, но за счёт снижения качества
Турбо квант вообще никак не связан с квантизацией модели. Турбо квант квантизирует кэш контекста.
У вас разделение происходит в режиме tensor. Подскажите, у вас карты соединены с помощью nvlink? Если без nvlink, то в каком режиме работают PCIE слоты? (В Линукс скорость работы PCIE можно посмотреть утилитой nvtop)
2 5080 16 ГБ это гораздо лучше для запуска qwen3.8-27b чем одна 4090. Можно использовать менее заквантованную модель и больше контекста
А drug dealer - это аптекарь или продавец лекарств?:)
Как я понял температура 1.0 в qwen3.6 не тоже самое что температура 1.0 в qwen3.8. Поэтому для одних и тех же сценариев для qwen3.6 разработчики рекомендуют 0.6, а для qwen3.8 - 1.0
xhigh ставится по умолчанию, если не ставить другой параметр. От этого и идут жалобы что модель якобы очень много думает