В таком случае, наверное, надо ввести ещё дополнительную категорию "нравится процесс". В таком случае ни "мотивация", ни "дисциплина" не нужны - подкрепляющая обратная связь работает прямо здесь и сейчас, а не отложена в будущее.
Кажется, что "мотивация" - это когда с нетерпением ждёшь и болеешь за результат своего труда, а "дисциплина" - это когда результат тебя лично не интересует (он просто должен быть хорошего качества в силу профессионализма). Соответственно от того, что "человек с палкой" это я сам - результат меня интересовать не начнёт.
Мои долгие размышления на тему объёма VRAM остановились на том, что модель целиком должна влезать, а для этого минимум 24Гб нужно (жаба холодными лапками прикасается к моей шее).
Возможно я не дожал, но факт, что с полпинка не завелось.
Я это сделал потому что у меня часть слоёв на ГПУ, а часть на ЦПУ. Вроде как это позволяет кеш слоёв держать рядом с компьютом. (Не факт, что я понял правильно, как оно работает)
Я пробовал. К сожалению драйвера nvidia переводят карту в On-Demand состояние, и инференс падает до 10t/s. А если насильно выставить режим Performance - GUI переезжает обратно) Так и не смог добиться, чтобы видеокарта работала на полную силу, если через неё не выводится изображение. Но система не то чтобы много объедает ~600Мб VRAM
Вот с таким конфигом гоняю локальную qwen3.6 MTP на 3070 8GB + 12900k 64GB. Выдаёт около 40 t/s
llama.cpp/build/bin/llama-server \
--model llama.cpp/models/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
--parallel 1 \ - один пользователь за раз
--host 127.0.0.1 --port 8080 \
--offline \ - не лазить в интернет
--no-mmap \
--n-gpu-layers 99 \ - постараться как можно больше засунуть в ГПУ
--cpu-moe \ - все эксперты - на ЦПУ
--threads 8 \ - 8 потоков на ЦПУ
--batch-size 512 --ubatch-size 128 \
--ctx-size $((64*1024)) \ - контекст, сколько влезет
--cache-ram 16000 \ - на всякий случай
--flash-attn on \ - куда ж без flash attention
--cache-type-k q8_0 --cache-type-v q8_0 \ - квантование KV кеша
--no-kv-unified \ - не объединять кеш
--temperature 0.0 \ - отключаем "креативность"
--top-k 1 \ - жадно берём один токен
--repeat-last-n 0 \ - не штрафуем за повторы
--reasoning off \ - тут по вкусу
--spec-type draft-mtp \ - минисетка для предсказания токенов
--spec-draft-n-min 0 \ - разрешаем ничего не брать
--spec-draft-n-max 16 \ - ограничиваем цикл опроса минисетки
--spec-draft-p-min 0.75 \ - уверенность, ниже которой больше не опрашиваем
--spec-draft-type-k q8_0 --spec-draft-type-v q8_0 - квантуем уже кеш минисетки
Да выправится динамика после нынешнего переходного процесса. Взрывной рост населения в 20м веке был вызван резким снижением детской смертности.
В таком случае, наверное, надо ввести ещё дополнительную категорию "нравится процесс". В таком случае ни "мотивация", ни "дисциплина" не нужны - подкрепляющая обратная связь работает прямо здесь и сейчас, а не отложена в будущее.
Кажется, что "мотивация" - это когда с нетерпением ждёшь и болеешь за результат своего труда, а "дисциплина" - это когда результат тебя лично не интересует (он просто должен быть хорошего качества в силу профессионализма). Соответственно от того, что "человек с палкой" это я сам - результат меня интересовать не начнёт.
Да, крупные компании сильно озабочены утечкой данных через ноутбуки, чтобы потом радостно слить эти же данные своим поставщикам ЛЛМок.
Это базовые модели, которые потом дообучаются под задачи, так называют в америках. Для чат-ботов, например, это базовые продолжатели текста - GPT.
Джвадцать лет жду, когда будет на лету генериться трансляция из глаз футболиста. Пока только на рефери камеру нацепили.
Полагаю, что даже хлопок в ладоши их излучает
"Когда ветер дует - деревья качаются. Чтобы задул ветер - надо качать деревья"
Корелляция не означает причинность.
Мои долгие размышления на тему объёма VRAM остановились на том, что модель целиком должна влезать, а для этого минимум 24Гб нужно (жаба холодными лапками прикасается к моей шее).
Возможно я не дожал, но факт, что с полпинка не завелось.
А если у тебя СНИЛС малиновый, то эцилопп тебя не имеет права бить по ночам... никогда!
2 собеседования и испытательный срок. Не надо выдумывать на ровном месте.
Определённо был, во времена ледников в Сахаре была степь, и народы-скотоводы.
Загрязняется, их иногда на чистку останавливают. И через несколько чисток - зеркала под замену, насколько мне известно.
Я это сделал потому что у меня часть слоёв на ГПУ, а часть на ЦПУ. Вроде как это позволяет кеш слоёв держать рядом с компьютом. (Не факт, что я понял правильно, как оно работает)
На просьбу нарисовать гайки мне Шедеврум упорно рисовал орехи, потому что и то, и другое - "nuts"
Звёзд с неба не хватает, но может выполнять задачи уровня "посмотри, как сделано А, и сделай по образу и подобию Б,В и Г"
Я пробовал. К сожалению драйвера nvidia переводят карту в On-Demand состояние, и инференс падает до 10t/s. А если насильно выставить режим Performance - GUI переезжает обратно) Так и не смог добиться, чтобы видеокарта работала на полную силу, если через неё не выводится изображение. Но система не то чтобы много объедает ~600Мб VRAM
Вот с таким конфигом гоняю локальную qwen3.6 MTP на 3070 8GB + 12900k 64GB. Выдаёт около 40 t/s
Да, Xiaomi'шная помойка getApps тоже ставила, но и GooglePlay не отставал.
На недавно купленном Xiaomi 15 google play без спроса сам ставил игры и приложения, даже после того, как я отказался их ставить сам.