Pull to refresh
29
Михаил Соколов@debagger

Инженер и программист

0,9
Rating
2
Subscribers
Send message

около 70 т/с на пустом контексте

Это всегда рандом, просто более квантованные модели сильнее этому подвержены. Там меньше возможностей усреднить вероятность. Но это не значит, что большие модели от этого застрахованы. Я обычно, если вижу, что работа идет не туда, откатываю, уточняю промпт и запускаю еще раз, в килокоде это удобно делается - один клик и все непотребства откатились.
Раньше замечал что Килокод своевольно переключается в режим редактирования и правит файлы, сейчас вроде такого нет в настройках по умолчанию. Думаю вам стоит его переустановить. Или что-то другое попробовать.

Такие люди тоже могут приносить пользу, если их правильно применять. На тех же конференциях бренд компании продвигать, тоже дело.

Я этот фильм раз 100 смотрел. Просто так получилось, что было лето, заняться нечем, есть видеомагнитофон и только одна видеокассета с этим фильмом. Компьютеров тогда еще не было дома практически ни у кого.

preserve thinking я пробовал включать, но особо не заметил разницы (точнее - разница есть, но неоднозначно, в разных задачах может результат быть лучше или хуже), а контекст заполняется быстрее. Поэтому выключил, у меня нормально работает без него.

Использую IQ4_NL квант от unsloth, все работает очень хорошо. Я поставил протестировать в день выхода и так и остался на ней, перестал использовать облачные модели. Зацикливания были, но в основном в режиме размышления, я добавил в конфиг ограничения на длину размышлений, больше не сталкивался с этим.

Мой конфиг llama.cpp для RTX 2080 Ti 22Gb, если кому надо
llama-b9254-bin-win-cuda-12.4-x64\llama-server.exe -hf unsloth/Qwen3.6-35B-A3B-MTP-GGUF:IQ4_NL  --host 0.0.0.0 --port 54321 --jinja --parallel 1 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --ubatch-size 128 --batch-size 128 --mmproj-offload --no-mmap --reasoning on --reasoning-budget 8192 --reasoning-budget-message " Thinking token budget is over. Now I must give an answer."

MTP пробовал включать, но так и не понял, вроде где-то есть профит, а где-то наоборот хуже работает, а главное, при ограниченной памяти отъедает контекст.

Взяли в группу фронт-меном рок-звезду, а теперь ноют, что он разнес гримерку и набил морду бас-гитаристу. То, что группа теперь собирает стадионы и ездит в мировые туры это, само собой, заслуга менеджмента. Главный вопрос на повестке - как сделать, чтобы фронт-мен стал зайкой, и при этом продолжал собирать стадионы. Я правильно изложил?

Промпт не буду выкладывать к открытый доступ (сначала хотел), потому что планирую им тестировать каждый мажорный выход ИИ, иначе ИИшки найдут его и научатся решать.

Уже нашли ))

Скрытый текст

Приходит ученик к Мастеру и говорит:

— О, Мудрый! Я придумал нечто такое, чего точно нет в Интернете!

Мастер спрашивает:

— А как ты это проверял?

Ученик отвечает:

— Я ввёл это в поисковик, и ничего не нашёл!

Мастер улыбается и говорит:

— Теперь есть.

Вы немного отстали ))

Скрытый текст

Я думаю, что внедрение ИИ - это только предлог. На самом деле надвигается тяжелый экономический кризис, и компании пытаются постелить соломки, в частности срезать расходы на персонал.

Я вот что не понимаю - при сжатии контекста разве system prompt тоже попадает под сжатие?

Дирижеру нужен хотя бы оркестр, состоящий из профессиональных музыкантов. Если этого нет, никакие книги не помогут. Будет как в басне Крылова: "А вы друзья, как ни садитесь, всё в музыканты не годитесь".
Сам более 10-ти лет занимал должность технического руководителя, являясь интравертом. Это был ад. Когда представилась возможность, ушел в ИТ программистом и ни секунды не жалею.

Гречка с тушенкой (если тушенка хорошая) гораздо вкуснее всяких там омаров )))

Не просто карандашом, а "химическим"!

Она хорошая, но медленная потому что dense.

--fit on по-умолчанию включен. Так что можете и его убрать ))

С ключом --no-mmap процесс памяти занимает меньше ОЗУ. В в производительности разницы не заметил. Как я понял llama-cpp пишет модель в vram, если она полностью вмещается, то отображать файл на память уже не надо. По поводу скорости загрузки - это только на этапе экспериментов важно, кроме того - llama-cpp по скорости загрузки несравнимо быстрее той же vLLM, если диск быстрый - никаких проблем.

Information

Rating
2,128-th
Location
Новоуральск (Свердловская обл.), Свердловская обл., Россия
Date of birth
Registered
Activity