Что за ерунду ты написал. Сейчас надо минимум 150 Мб для ядра, а если ещё запасное есть( по умолчанию) то полгига надо точно, а лучше гиг. Я уже переносил старый бут раздел, потому что в 10 лет назад дефолтные 256 Мб нифига не влезает, даже с компрессией
К сожалению, чувак поломался и прогнулся под систему. Даже жаль, что “радость” у него закончилась. Это так ужасно, что человеку кажется, что удобство не важно лишь бы не тратить на это время. Хороший критерий кстати отсеивать лодырей, которые не будут работу делать нормально. У меня тоже полно таких “коллег”, которые мышами возят, как слоупоки, 2 часа, хоть у меня в настроенном окружении на это 15 минут уходит. И не надо тут заливать про настройку системы с нуля каждый раз, сейчас с дотфайл менеджерами у меня уходит всего 15 минут на установку пакетов и раскидывание всех файлов по своим местам. Дефолт - это как переломать руки и ноги и запрыгнуть с этим на велик.
Я запускаю qwen3.6-35 q4 на стареньком ноуте асус с амд процом и мобильной ненавидиа на 6гб vram. 25-30 т/с и контекст 120к. Секрет - выгрузка мое в оперативку
Это только недавно добавили в llama.cpp, раньше такое нельзя было сделать. Но llama-swap у меня сервисом висит и модели загружаются только по запросу, память не забивают без надобности. В принципе не критично, но я уже давно пользуюсь, привык к нему. Там кстати не только llama.cpp можно запускать, все что угодно можно, включая онлайн провайдеров, кобольд, виспер и тд.
В том смысл, что разные модели с разными параметрами запускаются и можно держать несколько моделей сразу, если железо позволяет. У меня 2 модели часто работают. Маленькая планирует, большая исполняет
По каким именно бенчам? В первые дни туда лучше не смотреть, поддержка в тулах допиливается, первые загруженные модели часто с ошибками в конфигах и не оптимальными настройками. Вот через недельку уже можно смотреть
До сих пор
--force-with-leaseне поддерживает?Что за ерунду ты написал. Сейчас надо минимум 150 Мб для ядра, а если ещё запасное есть( по умолчанию) то полгига надо точно, а лучше гиг. Я уже переносил старый бут раздел, потому что в 10 лет назад дефолтные 256 Мб нифига не влезает, даже с компрессией
Что за бред? ФФ поддерживает абсолютно любое расширение с сабжа, они специально код писали для такой поддержки
К сожалению, чувак поломался и прогнулся под систему. Даже жаль, что “радость” у него закончилась. Это так ужасно, что человеку кажется, что удобство не важно лишь бы не тратить на это время. Хороший критерий кстати отсеивать лодырей, которые не будут работу делать нормально. У меня тоже полно таких “коллег”, которые мышами возят, как слоупоки, 2 часа, хоть у меня в настроенном окружении на это 15 минут уходит. И не надо тут заливать про настройку системы с нуля каждый раз, сейчас с дотфайл менеджерами у меня уходит всего 15 минут на установку пакетов и раскидывание всех файлов по своим местам. Дефолт - это как переломать руки и ноги и запрыгнуть с этим на велик.
Я запускаю qwen3.6-35 q4 на стареньком ноуте асус с амд процом и мобильной ненавидиа на 6гб vram. 25-30 т/с и контекст 120к. Секрет - выгрузка мое в оперативку
skill caveman для opencode/gemini спасает от этой ерунды
На моем реалми за 800 баксов без проблем 15 т/с выдает и картинки парсит
Google Edge gallery - топ, там уже и тулы тестируют, про аудио / фото уже молчу даже
Видно, что вы явно не трогали systemd, там зависимости и таргеты с первой версии
Edge gallery от гугл уже умеет голосом создавать встречи в календаре с выключенным инетом. Добавят других тулов, будет ещё больше возможностей
Это только недавно добавили в llama.cpp, раньше такое нельзя было сделать. Но llama-swap у меня сервисом висит и модели загружаются только по запросу, память не забивают без надобности. В принципе не критично, но я уже давно пользуюсь, привык к нему. Там кстати не только llama.cpp можно запускать, все что угодно можно, включая онлайн провайдеров, кобольд, виспер и тд.
В том смысл, что разные модели с разными параметрами запускаются и можно держать несколько моделей сразу, если железо позволяет. У меня 2 модели часто работают. Маленькая планирует, большая исполняет
llama-swap. Можно настраивать, сколько и какие модели одновременно запускаются, а прокси одно, с полной поддержкой всех популярных апи
Zed позволяет внутри себя клауд код/гемини/опенкод запускать, лучшее из двух миров.
Лучше чем трекбол может быть только 2 трекбола)))
У меня на AMD Ryzen 7 8840U с встройкой и 64 гиг рам памяти спокойно выдает 29 t/s на llama.cpp vulkan версии
Не в запрос
llm-fit
По каким именно бенчам? В первые дни туда лучше не смотреть, поддержка в тулах допиливается, первые загруженные модели часто с ошибками в конфигах и не оптимальными настройками. Вот через недельку уже можно смотреть
Когда-то такое поведение было у вирусов