Мои долгие размышления на тему объёма VRAM остановились на том, что модель целиком должна влезать, а для этого минимум 24Гб нужно (жаба холодными лапками прикасается к моей шее).
Возможно я не дожал, но факт, что с полпинка не завелось.
Я это сделал потому что у меня часть слоёв на ГПУ, а часть на ЦПУ. Вроде как это позволяет кеш слоёв держать рядом с компьютом. (Не факт, что я понял правильно, как оно работает)
Я пробовал. К сожалению драйвера nvidia переводят карту в On-Demand состояние, и инференс падает до 10t/s. А если насильно выставить режим Performance - GUI переезжает обратно) Так и не смог добиться, чтобы видеокарта работала на полную силу, если через неё не выводится изображение. Но система не то чтобы много объедает ~600Мб VRAM
Вот с таким конфигом гоняю локальную qwen3.6 MTP на 3070 8GB + 12900k 64GB. Выдаёт около 40 t/s
llama.cpp/build/bin/llama-server \
--model llama.cpp/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
--parallel 1 \ - один пользователь за раз
--host 127.0.0.1 --port 8080 \
--offline \ - не лазить в интернет
--no-mmap \
--n-gpu-layers 99 \ - постараться как можно больше засунуть в ГПУ
--cpu-moe \ - все эксперты - на ЦПУ
--threads 8 \ - 8 потоков на ЦПУ
--batch-size 512 --ubatch-size 128 \
--ctx-size $((64*1024)) \ - контекст, сколько влезет
--cache-ram 16000 \ - на всякий случай
--flash-attn on \ - куда ж без flash attention
--cache-type-k q8_0 --cache-type-v q8_0 \ - квантование KV кеша
--no-kv-unified \ - не объединять кеш
--temperature 0.0 \ - отключаем "креативность"
--top-k 1 \ - жадно берём один токен
--repeat-last-n 0 \ - не штрафуем за повторы
--reasoning off \ - тут по вкусу
--spec-type draft-mtp \ - минисетка для предсказания токенов
--spec-draft-n-min 0 \ - разрешаем ничего не брать
--spec-draft-n-max 16 \ - ограничиваем цикл опроса минисетки
--spec-draft-p-min 0.75 \ - уверенность, ниже которой больше не опрашиваем
--spec-draft-type-k q8_0 --spec-draft-type-v q8_0 - квантуем уже кеш минисетки
Можно тупо пессимизировать маской выходные логиты токенов не на латинице и кириллице. Только это все токены надо просмотреть предварительно, и в готовую модель слой добавить.
Поскольку фотон двигается со скоростью света, для него между моментом излучения и моментом поглощения ничего нет, из чего делается ошибочный вывод, что и для остальных это мнговенно.
"Когда ветер дует - деревья качаются. Чтобы задул ветер - надо качать деревья"
Корелляция не означает причинность.
Мои долгие размышления на тему объёма VRAM остановились на том, что модель целиком должна влезать, а для этого минимум 24Гб нужно (жаба холодными лапками прикасается к моей шее).
Возможно я не дожал, но факт, что с полпинка не завелось.
А если у тебя СНИЛС малиновый, то эцилопп тебя не имеет права бить по ночам... никогда!
2 собеседования и испытательный срок. Не надо выдумывать на ровном месте.
Определённо был, во времена ледников в Сахаре была степь, и народы-скотоводы.
Загрязняется, их иногда на чистку останавливают. И через несколько чисток - зеркала под замену, насколько мне известно.
Я это сделал потому что у меня часть слоёв на ГПУ, а часть на ЦПУ. Вроде как это позволяет кеш слоёв держать рядом с компьютом. (Не факт, что я понял правильно, как оно работает)
На просьбу нарисовать гайки мне Шедеврум упорно рисовал орехи, потому что и то, и другое - "nuts"
Звёзд с неба не хватает, но может выполнять задачи уровня "посмотри, как сделано А, и сделай по образу и подобию Б,В и Г"
Я пробовал. К сожалению драйвера nvidia переводят карту в On-Demand состояние, и инференс падает до 10t/s. А если насильно выставить режим Performance - GUI переезжает обратно) Так и не смог добиться, чтобы видеокарта работала на полную силу, если через неё не выводится изображение. Но система не то чтобы много объедает ~600Мб VRAM
Вот с таким конфигом гоняю локальную qwen3.6 MTP на 3070 8GB + 12900k 64GB. Выдаёт около 40 t/s
Да, Xiaomi'шная помойка getApps тоже ставила, но и GooglePlay не отставал.
На недавно купленном Xiaomi 15 google play без спроса сам ставил игры и приложения, даже после того, как я отказался их ставить сам.
Можно тупо пессимизировать маской выходные логиты токенов не на латинице и кириллице. Только это все токены надо просмотреть предварительно, и в готовую модель слой добавить.
зато не пухнет с голоду в неурожайные года
раньше от нынешней х-ни помирали
пахать надо, т.к. у трудящегося всё так же забирают все излишки
неселение планеты растёт как на дрожжах последние 100 лет
Видимо для антенн надо место в конструкции фюзеляжа предусмотреть
А так ещё в 2024 году соглашение о сотрудничестве с Аэрофлотом подписали
Скрытый текст
Поскольку фотон двигается со скоростью света, для него между моментом излучения и моментом поглощения ничего нет, из чего делается ошибочный вывод, что и для остальных это мнговенно.
Отличная штука была. В детстве читал статьи и анекдоты)
О, давно забытый срач)
Там просто жёлтая лампочка, по полу это отчётливо видно
Скрытый текст