Comments 24
А зачем устанавливать Git for Windows, если он в данной инструкции применяется только для скачивания (клонирования) GitHub-репозитория? Скачать репозиторий в zip-файле с GitHub можно посредством браузера, который уже встроен в Windows. А распаковать zip-файл сможет Windows Explorer.
Git даёт опцию скачать обновления с репозитория, не забирая весь код с нуля, как в случае с архивом. Также установка git может быть использована для других задач, например для настройки агентской разработки или Git-возможностей IDE.
Почему не использовать LM-Studio, Ollama? Зачем так сложно? Для 99% пользователей даже прочитать вашу статью - уже подвиг, а для 1%, кто ее поймёт - она по сути бесполезна...
А есть у LM-Studio какие-то прям видные минусы/недостатки? Я локально тоже через llama.cpp запускал сервер, но честно, очень не хочу читать и разбираться в куче флагов и как их друг с другом женить. А у LM-Studio, вроде как, простой интерфейс.
Я только-только вкатываюсь в эту тему (и не по своей воле), поэтому есть у меня пачечка глупых вопросов. :)
ИМХО: Для новичков - лучший вариант.
Недостаток только один, нет возможности подключить свои lora/qlora...
Я как начал копать глубже, прошел следующим путем Ollama, LM-Studio, llama.cpp, beellama. И последний самый функциональный и быстрый, и не сталкивается с проблемами, и по факту самый удобный, сильно проще добавить какой то флаг в строку, чем искать где какой то переименованный флаг в настройках клиента, с учётом того что того что ты ищешь в данной реализации может небыть, а ещё лишнее место и потребление ресурсов, ну и самое важно очень часто там где ты взял модель в описании есть готовая команда для llama. Я не хотел во все это лезть но мне пришлось из за того что, разработчикам враперов было в падлу заглянуть чуть глубже и вывести в настройки самые важные параметры. А в итоге вопрос решает только llama и ее форки для разного рода быстрых кэшей и мтп, что для всего остального по факту не доступно, либо под linux.
Спасибо за развернутый ответ. А под линуксом эта тема нормально заводится? Нвидия там дрова завозит на линукс? Или это не принципиальный момент? Я просто размышляю пока над покупкой железа (ужас, уже на 330к насобирал на 5080, i7, 32 ddr5), а винда если честно немного пугает. Вот пока размышляю, смотрю, что там на работе делается, будет ли скоращение, имеет ли это всё смысл, в этот период изучаю теорию :) Вообще, есть смысл на своём железе запускать? То есть, понятно, что подписки быстрее в разы, но это могут отобрать, да и безопасники не жалуют. Может, на опыте если, расскажешь., как оно вообще? Можно код писать? Или лучше на ипотеку эти деньги потратить? :)))
Я запускаю на tesla v100 32gb, с учётом выхода недели назад qwen3.8 27b по уровню она между gpt5.5 и 5.6 по сути выше нее в списке только самые последние облачные модели. Кодить одно удовольствие уже 2мес код руками не пишу, по факту ещё с прошлой их модели 3.6 27b для локалки изменилось все, следующая сопоставимая модель весит раз в 10 больше. Софт для ЛЛМ вообще больше под Линукс заточен т.к. серверная инфраструктура и атом числе cuda драйверы, под Винду не все можно запустить особенно то что рассчитано на неквантованные модели. На локалке имеет смысл от 32гб vram иначе просто не хватит контекста что бы нормально задачи ставить, и это прям самый минимум для полноценного кодинга, приходится жертвовать длинной контекста и периодически ловить вылеты из за нехватки память. Меньше придется явно писать что где менять, а так сама раскапывает проект. Для работы я бы просто набрал таких же карт как у меня, пару штук, учитывая что аналог по возможностям только 5090 а за ее стоимость можно купить 6 таких. По скорости получается 5090 в 2 раза быстрей 1 v100, но опять же 2 v100 будут чуть медленнее но по возможностям несоизмеримо круче 5090. Правда новые архитектура позволяет запускать nvfp4 но это опять же для тех у кого памяти нет. На счёт облаков, тут сложно сказать я пробовал SourceCraft от Яндекса они не раскрывают модели, но они явно тупее этого Qwen, у Claude годные, но там лимиты непонятные у остальных дорого, я подсчитывал при моем режиме использования карта за мес окупается. Плюс нервов не хватит смотреть на то как горят твои токены из за того что сеть в цикл ушла, когда уже есть решение а облакам впадлу его внедрять, а может и просто не хочется. Да и по поводу скорости вообще не факт, сервак же не на одного тебя рассчитаны, там тоже крутят то запрос более тупой модели отдадут во время нагрузки, какие настройки, системные просты и шаблоны чатов там тоже хз.
На самом деле на линуксе оно изначально и работает, и даже можно просто скачать контейнер готовый в докер. По поводу модели и запуска на геймерском железе могу сказать из своего опыта, для моих задач по кодингу я лично локальную модель нормально работать заставить не смог. Ассистент пихает в неё гору контекста, и на 3-4 вопросе окно контекста в чате заканчивается, собственно запуск llama-server мне помог разобраться в вопросе, потому что можно видеть сырой промпт в консоли без обрезок. Ну и работает всё это не особо быстро с такими большими моделями, у меня 4090.
Я начинал с ollama, после чего перешел на LM-Studio, но в итоге собрал и сейчас использую llama-server, который собрал из исходников, и произвёл квантование модели, во всём помог разобраться deep-seek, на всё про всё ушло времени примерно час, не считая скачиваний, билда и конвертации. Всё потому что скаченный свежий бинарник llama-server под CUDA упорно не хотел грузить модель в память видеокарты. Цель данных действий, иметь полный контроль, которого нет ни с ollama ни с LM-Studio.
PS: Заставить Qwen 3.8 поменьше думать мне всё-же так и не удалось -_-
Это философский вопрос -- кому-то не хочется разбираться в чёрном ящике, если он работает, а кому-то хочется понимать чуть больше, чем просто скачивать собранный бинарный файл. Мои мотивы изложены в начале статьи -- я решил повторить шаги из другой статьи, и потратил пару вечеров, чтобы их выполнить. Как итог, получилась очень большая статья, которая может быть полезна тем, кто настраивает модели в компаниях на своих серверах и тем, кто хочет понять базовую производительность своего оборудования (baseline).
Кто настраивает модели под 3090 в компании? Если у компании есть деньги только на 3090, нужны ли этой компании такие заморочки? Вообще не понимаю, почему именно под 3090?
Была бы статья именно о настройках модели, о том, что и на что влияет, без привязке к llama.cpp и 3090, у меня вопросов бы не было. А так - просто поток сознания...
Спасибо за вашу оценку, но статья именно про локальный запуск модели Qwen3.8-27b на RTX3090 с помощью llama.cpp, а не про настройку модели, о которой достаточно написано, например, здесь. Также инструкция легко дорабатывается под любое другое оборудование, которое вы посчитаете достойным для компаний.
Можно и llama.cpp , только для чего её самому собирать, когда уже собранные сборки выкладываются на GitHub.
GGUF (GPT-Generated Unified Format) — бинарный формат хранения языковых моделей, созданный разработчиками
llama.cpp.
Откуда Вы берете такую забористую чушь?
Читайте первоисточники:
gguf
This is a Python package for writing binary files in the GGUF (GGML Universal File) format.
https://github.com/ggml-org/llama.cpp/blob/master/gguf-py/README.md
А GG в GGML - это инициалы Georgy Gerganov, который написал первый вариант llama.cpp в одно лицо.
См. эмблему в левом верхнем углу на странице:
Это гугл в ИИ-сводке выдаёт. С самого начала у меня и не было сомнения, что, GG - инициалы, GGML же, вроде и так ясно. А потом вот это GPT-Generated увидел, аж засмеялся: только что generated что ли?
Спасибо, поправил расшифровку аббревиатуры. Первоисточник - это всё-таки описание спецификации формата файла, а не описание Python-пакета для работы с этим форматом.
https://github.com/ggml-org/ggml/issues/220
Зачем вообще собирать llama из исходников? Проще скачать готовый актуальный бинарник. Зачем самому квантовать? Есть куча репо с готовыми квантами, которые куда более качественно квантованы, чем то что получаем при самостоятельном квантовании.
Да только попробуй найди собранный llama с turboquant, aggresivemtp, dflash2 а для некоторых моделей их разрабы прям на HF пишут вот возьми этот комит llama и накоти на него этот гит патч, иначе модель не запустится. Почему так делают, из за cuda, которой миллион версий и большинство несовместимо между собой, а она с чего то вдруг должна иметь клиентскую библиотеку при сборке совпадающую с твоим драйвером. Я вообще в шоке с того как nvidia это поддерживает, вроде все обновляют и по много лет, но нах такие обновления если какая либо совместимость напрочь отсутствует.
Интересно это gpt генерировала или sonnet?
Сколько полезных действий, вместо примитивного ollama run, чтобы уже у модельки спросить как поставить llama.cpp со всеми mtp'шками
ollama.com Qwen3.8-27B КвантованиеQ4_K_M 17GB qwen3.8:27b
from ollama import chat response = chat( model='qwen3.8:27b', messages=[{'role': 'user', 'content': 'Hello!'}], ) print(response.message.content)
Пардон, форматирование глючит
В репозитории llama.cpp в разделе Release уже лежат готовые бинарники для Windows, разные варианты с Cuda, только под CPU, для AMD и прочее.
Без матрицы квантования квант получится низкокачественный. Для чего по вашему Unsloth и прочии авторы делают свои матрицы квантования под каждую модель. Oт нечего делать ?
Качайте качественные готовые кванты и пользуйтесь.
Как запустить Qwen3.8-27B локально на RTX3090 (Win10)