Я этот фильм раз 100 смотрел. Просто так получилось, что было лето, заняться нечем, есть видеомагнитофон и только одна видеокассета с этим фильмом. Компьютеров тогда еще не было дома практически ни у кого.
preserve thinking я пробовал включать, но особо не заметил разницы (точнее - разница есть, но неоднозначно, в разных задачах может результат быть лучше или хуже), а контекст заполняется быстрее. Поэтому выключил, у меня нормально работает без него.
Использую IQ4_NL квант от unsloth, все работает очень хорошо. Я поставил протестировать в день выхода и так и остался на ней, перестал использовать облачные модели. Зацикливания были, но в основном в режиме размышления, я добавил в конфиг ограничения на длину размышлений, больше не сталкивался с этим.
Мой конфиг llama.cpp для RTX 2080 Ti 22Gb, если кому надо
llama-b9254-bin-win-cuda-12.4-x64\llama-server.exe -hf unsloth/Qwen3.6-35B-A3B-MTP-GGUF:IQ4_NL --host 0.0.0.0 --port 54321 --jinja --parallel 1 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --ubatch-size 128 --batch-size 128 --mmproj-offload --no-mmap --reasoning on --reasoning-budget 8192 --reasoning-budget-message " Thinking token budget is over. Now I must give an answer."
MTP пробовал включать, но так и не понял, вроде где-то есть профит, а где-то наоборот хуже работает, а главное, при ограниченной памяти отъедает контекст.
Взяли в группу фронт-меном рок-звезду, а теперь ноют, что он разнес гримерку и набил морду бас-гитаристу. То, что группа теперь собирает стадионы и ездит в мировые туры это, само собой, заслуга менеджмента. Главный вопрос на повестке - как сделать, чтобы фронт-мен стал зайкой, и при этом продолжал собирать стадионы. Я правильно изложил?
Промпт не буду выкладывать к открытый доступ (сначала хотел), потому что планирую им тестировать каждый мажорный выход ИИ, иначе ИИшки найдут его и научатся решать.
Уже нашли ))
Скрытый текст
Приходит ученик к Мастеру и говорит:
— О, Мудрый! Я придумал нечто такое, чего точно нет в Интернете!
Я думаю, что внедрение ИИ - это только предлог. На самом деле надвигается тяжелый экономический кризис, и компании пытаются постелить соломки, в частности срезать расходы на персонал.
Дирижеру нужен хотя бы оркестр, состоящий из профессиональных музыкантов. Если этого нет, никакие книги не помогут. Будет как в басне Крылова: "А вы друзья, как ни садитесь, всё в музыканты не годитесь". Сам более 10-ти лет занимал должность технического руководителя, являясь интравертом. Это был ад. Когда представилась возможность, ушел в ИТ программистом и ни секунды не жалею.
С ключом --no-mmap процесс памяти занимает меньше ОЗУ. В в производительности разницы не заметил. Как я понял llama-cpp пишет модель в vram, если она полностью вмещается, то отображать файл на память уже не надо. По поводу скорости загрузки - это только на этапе экспериментов важно, кроме того - llama-cpp по скорости загрузки несравнимо быстрее той же vLLM, если диск быстрый - никаких проблем.
А зачем? За такие деньги уже можно нормальный GPU взять. RTX PRO 5000 или, если надо именно много vram - доску nv-link и четыре V100 32Gb. Это 100% будет быстрее чем мак работать. В маке памяти много, но не настолько она быстрая.
Вы все правильно написали, в общем случае так и есть, но у меня тут свои причины именно так настроить. Во-первых VRAM не 24Гб а 22. Во вторых мне нужен vision модуль именно в vram потому что при офлоаде он начинает работать на cpu и это очень медленно в моем случае (CPU старый и медленный), а для меня в некоторых задачах нужно чтобы он быстро работал. IQ4_NL выбрал потому что он на 4Гб меньше, чем тот же UD-Q4_K_XL и дает больше места под kv-кэш, так что получается запустить на полном контексте.
Такие люди тоже могут приносить пользу, если их правильно применять. На тех же конференциях бренд компании продвигать, тоже дело.
Я этот фильм раз 100 смотрел. Просто так получилось, что было лето, заняться нечем, есть видеомагнитофон и только одна видеокассета с этим фильмом. Компьютеров тогда еще не было дома практически ни у кого.
preserve thinking я пробовал включать, но особо не заметил разницы (точнее - разница есть, но неоднозначно, в разных задачах может результат быть лучше или хуже), а контекст заполняется быстрее. Поэтому выключил, у меня нормально работает без него.
Использую IQ4_NL квант от unsloth, все работает очень хорошо. Я поставил протестировать в день выхода и так и остался на ней, перестал использовать облачные модели. Зацикливания были, но в основном в режиме размышления, я добавил в конфиг ограничения на длину размышлений, больше не сталкивался с этим.
Мой конфиг llama.cpp для RTX 2080 Ti 22Gb, если кому надо
MTP пробовал включать, но так и не понял, вроде где-то есть профит, а где-то наоборот хуже работает, а главное, при ограниченной памяти отъедает контекст.
Взяли в группу фронт-меном рок-звезду, а теперь ноют, что он разнес гримерку и набил морду бас-гитаристу. То, что группа теперь собирает стадионы и ездит в мировые туры это, само собой, заслуга менеджмента. Главный вопрос на повестке - как сделать, чтобы фронт-мен стал зайкой, и при этом продолжал собирать стадионы. Я правильно изложил?
Уже нашли ))
Скрытый текст
Приходит ученик к Мастеру и говорит:
— О, Мудрый! Я придумал нечто такое, чего точно нет в Интернете!
Мастер спрашивает:
— А как ты это проверял?
Ученик отвечает:
— Я ввёл это в поисковик, и ничего не нашёл!
Мастер улыбается и говорит:
— Теперь есть.
Вы немного отстали ))
Скрытый текст
llama.cpp
Я думаю, что внедрение ИИ - это только предлог. На самом деле надвигается тяжелый экономический кризис, и компании пытаются постелить соломки, в частности срезать расходы на персонал.
Я вот что не понимаю - при сжатии контекста разве system prompt тоже попадает под сжатие?
Дирижеру нужен хотя бы оркестр, состоящий из профессиональных музыкантов. Если этого нет, никакие книги не помогут. Будет как в басне Крылова: "А вы друзья, как ни садитесь, всё в музыканты не годитесь".
Сам более 10-ти лет занимал должность технического руководителя, являясь интравертом. Это был ад. Когда представилась возможность, ушел в ИТ программистом и ни секунды не жалею.
Гречка с тушенкой (если тушенка хорошая) гораздо вкуснее всяких там омаров )))
Не просто карандашом, а "химическим"!
Paybeamахаха что ты делаешь, остановись!
Она хорошая, но медленная потому что dense.
--fit on по-умолчанию включен. Так что можете и его убрать ))
С ключом --no-mmap процесс памяти занимает меньше ОЗУ. В в производительности разницы не заметил. Как я понял llama-cpp пишет модель в vram, если она полностью вмещается, то отображать файл на память уже не надо. По поводу скорости загрузки - это только на этапе экспериментов важно, кроме того - llama-cpp по скорости загрузки несравнимо быстрее той же vLLM, если диск быстрый - никаких проблем.
V100 32GB SXM2 около 65к можно найти у китайцев.
А зачем? За такие деньги уже можно нормальный GPU взять. RTX PRO 5000 или, если надо именно много vram - доску nv-link и четыре V100 32Gb. Это 100% будет быстрее чем мак работать. В маке памяти много, но не настолько она быстрая.
Вы все правильно написали, в общем случае так и есть, но у меня тут свои причины именно так настроить. Во-первых VRAM не 24Гб а 22. Во вторых мне нужен vision модуль именно в vram потому что при офлоаде он начинает работать на cpu и это очень медленно в моем случае (CPU старый и медленный), а для меня в некоторых задачах нужно чтобы он быстро работал. IQ4_NL выбрал потому что он на 4Гб меньше, чем тот же UD-Q4_K_XL и дает больше места под kv-кэш, так что получается запустить на полном контексте.