Комментарии 6
А зачем устанавливать Git for Windows, если он в данной инструкции применяется только для скачивания (клонирования) GitHub-репозитория? Скачать репозиторий в zip-файле с GitHub можно посредством браузера, который уже встроен в Windows. А распаковать zip-файл сможет Windows Explorer.
Почему не использовать LM-Studio, Ollama? Зачем так сложно? Для 99% пользователей даже прочитать вашу статью - уже подвиг, а для 1%, кто ее поймёт - она по сути бесполезна...
GGUF (GPT-Generated Unified Format) — бинарный формат хранения языковых моделей, созданный разработчиками
llama.cpp.
Откуда Вы берете такую забористую чушь?
Читайте первоисточники:
gguf
This is a Python package for writing binary files in the GGUF (GGML Universal File) format.
https://github.com/ggml-org/llama.cpp/blob/master/gguf-py/README.md
А GG в GGML - это инициалы Georgy Gerganov, который написал первый вариант llama.cpp в одно лицо.
См. эмблему в левом верхнем углу на странице:
Зачем вообще собирать llama из исходников? Проще скачать готовый актуальный бинарник. Зачем самому квантовать? Есть куча репо с готовыми квантами, которые куда более качественно квантованы, чем то что получаем при самостоятельном квантовании.
Интересно это gpt генерировала или sonnet?
Сколько полезных действий, вместо примитивного ollama run, чтобы уже у модельки спросить как поставить llama.cpp со всеми mtp'шками
ollama.com Qwen3.8-27B КвантованиеQ4_K_M 17GB qwen3.8:27b
from ollama import chat response = chat( model='qwen3.8:27b', messages=[{'role': 'user', 'content': 'Hello!'}], ) print(response.message.content)
Пардон, форматирование глючит

Как запустить Qwen3.8-27B локально на RTX3090 (Win10)