Pull to refresh
64K+
101
Евгений Ледванов@gliderman

Инженер по робототехнике

91,3
Rating
67
Subscribers
Send message

У меня стоит в планах - взять что-то из нового мое-квена локального и вырезать оттуда экспертов которые не относятся к программированию, останутся веса только по программированию. вот из таких весов на 75 гб https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF - должно что-то легковесное выйти гигов на 25.

Mashinist x99 d4, но лучше смотрите в сторону серверных плат где не задушены линии на видеокарты, скрин есть в коментах выше, V100 поприятнее будет- работает в целом в 1.5-2 раза быстрее на генерации. Я рассматриваю уже пару 2 v100 по 32 гб - это будет уже вполне живая машина для квен 3.8-некст.

Гонял одну и ту же модель https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF на своем стенде и на одной V100 16гб - настройки практически одинаковые, за исключением kv 4 бит и 8 бит квант на моем стенде - разница в генерации моделью ответов 22 т\с против 32 т\с.

На агентской работе с файлами на компьютере на типичной задаче, к примеру, распаковать 5 файлов с журналами месячных отчетов с дипсика по использованию токенов - слить их в один вывести эксельку, с разбивкой ко ключам и деньгам в один выходной файл выходило за 3 минуты 20 сек, против 3 минуты 30 сек - разница несущественна.

Практика показывает - важна модель и ее тонкая настройка. Да, модель рекомендую, переехал на нее полностью, очень качественно квантована, 3 бита, а чувствуется 8 битным квантом.

Это серверный зион - он холодный, этого кулера с лихвой-он 165 ватт тепла на мосфетах даже охлаждает. Прежде чем ставить, теплопакет на зион TDP 120W уточнял.

Хорошая модульность помогает нейросетям также как и людям. Спорить не буду, но я бы такой код в прод не выпустил.

Опус навалил все в один монолит compiler.cpp (80 тыс. строк) ?

Не видел достойных вариантов, потом там с доп питанием есть головняк, версии разные существуют, да и на рынке их мало. в100 16 гб покупал зимой на попробовать, тогда эта тема с локальными моделями была не очень популярна, да и модели под такой объем были туповаты.

Вот точное наблюдение. Я скажу про дипсик еще - я пользуюсь с 1 мая этого года, так вот первые пару месяцев это было быстро, качественно, дешево. Сейчас качество не стабильное. Моя оценка - нагрузка дипсика сильно выросла, и сейчас хорошее качество идет только по ночам с 21 до 2 по МСК. Днем с 8 утра - и качество упало и ценник вырос. И я стараюсь днем работать на локальных моделях.

Ваша статья, видимо, интересна 1 читателю Хабра из 1000, и специалисты ее оценят, не волнуйтесь, интернет отиндексирует и все запомнит. А по моей статье, наверное, каждый десятый примеряет к себе - а не собрать ли себе такой сервак домой. Не дорого же, а еще у людей много десктопов пылится без дела, а тут такой вариант заиметь личного Джарвиса на полку.

Гермес ходит в интернет если надо с этими моделями, просто даю ссылку и говорю что надо сделать, а локальная модель потом пыхтит, но по скорости да, если опять с пресловутым дипсиком 4 флеш сравнить- втрое больше времени тратит.

Есть понятие - достаточное решение. Никто не возит на карьерном самосвале пиццу клиентам, к примеру. Если задача выполняется - зачем платить больше?

Тесты шли на 224, для гарантии в пикере потом было снижено, если без визион, можно было бы оставить 224

Жир вытяжка убирает, а сервак на подоконнике далеко от плиты. В комнатах пыли точно больше, ежегодно из компа выгребаю клубки.

Вот у меня есть такой лог:

  1. Рабочая схема — serve-qwen38.sh (порт 11889, алиас qwen38) — это то, что потом стояло в пикере: --model D:/Models/Qwen3.8-27B-UD-Q5_K_XL.gguf --mmproj D:/Models/Qwen3.8-27B-mmproj-F16.gguf ← vision -ngl 99 --device CUDA0,CUDA1 --split-mode tensor -c 184320 (слот 180K, -np 1) --cache-type-k q8_0 --cache-type-v q8_0 --reasoning off --spec-type draft-mtp --spec-draft-n-max 2 --host 127.0.0.1 --port 11889 --log-file server_qwen38.log --log-timestamps -to 1800 Замеры по ней: покой 15 852 / vision-пик 15 914 MiB, 23–24 t/s, prefill 131–161 t/s; 224K (229376) стартовал, но на генерации 15 784 MiB — запас 600 MiB, посчитали риском; 256K не стартовал вовсе. В конфиге Hermes у алиаса стоит context_length 184320 и extra_body {temperature 0.6, top_p 0.95}.

1
23 ...

Information

Rating
75-th
Location
Санкт-Петербург, Санкт-Петербург и область, Россия
Registered
Activity

Specialization

Инженер встраиваемых систем, Промпт-инженер
Ведущий