Pull to refresh

Comments 40

Правильно не дают! В чем проблема сразу поднять vLLM и получить нормальную конкурентность на запросах в отличие от OLLAMA?

Потому что vllm требует прямых рук, линукса, отдельных процессов для каждой модели и возни с роутерами и тд. Олаама - это setup.exe, anykey, anykey.

Но по хорошему и vllm давать друзьям тоже можно условно, потому что prefix_cache

В статье упомянута llama‑swap , которая оркестрирует модели не только из llama.cpp, но и vllm легко подключить. Вообще, llama-swap стала для меня открытием, очень повысила удобство работы с локальными моделями. Рекомендую попробовать.

Поскольку на Хабре до сих пор нет кнопки "сделать выжимку этого нейрослопа" , я сделаю это за них (да, я полезнее всей администрации Хабре, не благодарите):

"Ollama критикуют за сокрытие работы на движке llama.cpp, падение скорости в форках, путаницу в именах моделей и уход в облако ради венчурной монетизации, хотя существуют открытые альтернативы."

Призываю всех пользователей делать свои выжимки нейрослоп-лонгридов, пока хабра-чинуши не почещутся.

Я даже могу предложить способы улучшения этих выжимок:

  1. Ваша оценка нейрослопности статьи

  2. Оценка пользы от материала, а не актуальности (это исследование или просто "новость")

  3. Оценка хозяйственной полезности (другими словами, оценка уровня воды, обсуждения ради обсуждения)

  4. При наличии в статье ссылки на телеграмм автора, его аккаунт должен быть немедленно бит ссаными тряпками по лицу. К сожалению, российское законодательство запрещает нам бить автора по другим местам, кроме аккаунта.

Предлагайте свою систему оценок.

От души рад приветствовать человека с горящими глазами! На Хабре, вот ей-ей, такого не то чтобы не хватает, но редакция точно менять не рвется примерно ничего.

Однако, пост не нейросетевой. Точнее, может таки да, но - примус не мой, я его только починял переводил. Там в плашке про перевод в заголовке указан оригинальный автор - думаю, ему стоит написать!

Хотя, признаться, написано и у него весьма авторски, более того, английскими довольно язвительными оборотами - я их, как смог, передал.

Что касается слопа или нет: не примкну к любой стороне, потому что ИИ - это инструмент, вроде печатной машинки (ок, он не такая умная, но отдельные модели, скажем, умели табуляцию - это как, проблема, или все же нет?), а за текст отвечает тот, кто под ним подписался.

Сказать по правде, не было бы корпблогов, мы бы меньше тут плевались, но - см. выше про редакцию и её желание измерять мир Хабр к лучшему.

Редакция давно уже не торт- товарищ Денис изволили пойти по стрёмненькой дорожке "чем больше контента- тем больше открученной рекламы". О качестве и тематичной уместности речи давно уже нет, к сожалению. К сожалению, аналога подобного специализированного ит-шного хаба нету(((

Думаю, в любой нормальной редакции это решается тем, что главный редактор издания рулит редакцией, имея в виду некую цель.

Раз здесь погоня за контентом выливается только в благостно выглядящие отчеты про свершения за минувший месяц, то либо выше нет никого критически настроенного, либо оптимизация и правда сделана хорошо, потом денег есть, а дальше хоть трава не расти издание живет привычной жизнью.

Интересно было бы найти тот момент, когда хабр перестал быть тортом. По-моему я зарегался уже когда он тортом перестал быть (в 2008). Раньше прям читал статьи, сейчас воспринимаю статью (по аналогии с нейронками) как стартовый контекст для обсуждений. В них как раз самое интересное.

Да, самое интересное в комментах..

Я вот как раз изучаю архив постов и комментов на Хабре - но с целью понять, когда хабравские новости стали... Как бы это сказать, обратное значение слову "торт" - вот этим вот!

Как поняли, что статья (а точнее перевод этой статьи) - "нейрослоп"? Если на уровне собственных субъективных ощущений, то может стоить упомянуть, что вам так показалось? А лучше вообще пройти мимо, если формат подачи не ваш.

Я лично прочитал с интересом и удовольствием. Тема важная, перевод качественный, у меня не возникло ощущение машинного перевода. Автору спасибо.

Искатель нейрослопа не способен пройти мимо статьи, которая ему не понравилась. Художники этим тоже болели пару лет после релиза stable diffusion, ловили друг-друга на "генерациях", размазывали всякое по стенам, и прочие прелести гейткипинга.

И эти выздоровеют.

Проблема таких детекторов в том, что критерий у них обычно один: «человек так не пишет». А человечество, к сожалению для классификатора, пишет примерно вообще как угодно.

В какой-то момент борьба с нейрослопом становится отдельным жанром того же нейрослопа: набор узнаваемых штампов, чёткий диагноз без проверки источника и обязательное сообщение окружающим, что автора удалось разоблачить.

Надо хабру отдельный хаб делать не для нейротекстов - а для охотников на них. My dear diary..., так сказать.

Ну и как черта под этими спорами: все мы там будем. Пройдёт пара лет: станет только хуже. Но язык останется русским, просто натренированным на другом корпусе - и на словечках отдельных авторов.

ну вот как бы вы всё верно пишете, но статья прям видно, что через ChatGPT пропущена.
я не осуждаю, но к чему отрицать очевидное?

ну, либо вы много и плотно работаете с ChatGPT и нахватались от него характерных оборотов (тоже, кстати, вполне возможный вариант).

Мы тратим значительную часть времени на исправления и доработки

дада, за всё время существования как нормально работать с несколькими гпу так и непридумали..

Friends Don’t Let Friends Use Ollama

Это: "Друзья, не позволяйте друзьям использовать Ollama", а не "Друзья не позволяют друзьям использовать Ollama" же. T_T

Нет, именно второе, здесь нет ни повелительного наклонения, ни обращения. Это известный шаблон.

Я думал перевести попроще для русского глаза, но там по тексту ссылка на коммент именного такого вида - и это важно по идее текста.

как и в русском, в английском обращение должно быть выделено запятой, перевод верный, не говоря уже о том, что в культуре это используется именно так, как было переведено. не болтайте ерундой.

Я тоже когда-то начинал с ollama, но быстро про нее все понял все и перешел на llama.cpp
Писать статью об этом не стал, думал что все и так все видят, чего тут говорить :)

А вот llama.cpp настолько быстро развивается, что
попутно ломает что-то, и иногда это чинят, а иногда - нет.
Может быть, и стоит об этом написать статью, хотя и не уверен.

Например, если речь идет об отказе от поддержки старых архитектур
то на починку шансов нет.
Планомерно ухудшается в llama.cpp поддержка моих основных
карт инференса p102-100 вот такая сборка:
-DCMAKE_CUDA_ARCHITECTURES=61
Все труднее найти опции запуска для этих карт, которые хотя бы
не ухудшают производительность по сравнению с тем, что было в прошлом коммите.

Мне даже пришлось написать скрипт llama.cpp.update
который может делать сборку llama.cpp к любой дате, и любому коммиту - чтобы искать тот коммит который еще работает.
А затем, получать дельту изменений между работающим коммитом и сломанным и анализировать эту разницу - чтобы понять как починить.

Конечно, удушение архитектуры делает не только llama.cpp
к этому причастен и проект CUDA, выкинувший архитектуру в 13 версии,
и ядро ликнукс 7 в котором теперь проблемы с драйвером 570.211.01 для видеокарты.
Можно, конечно, попробовать сделать форк от llama.cpp для паскаль архитектуры,
но надо будет еще думать что делать с CUDA и драйвером на новых ядрах линукса.

ухудшается в llama.cpp поддержка моих основных карт инференса p102-100

Дайте уже паскалю помереть спокойно)..

Полтора десятка моих паскаль-карт все еще хотят жить,
и успешно кутят сейчас модели типа
GLM-5.3-Flash-UD-Q4_K_XL
Qwen3.8-Flash-Next-UD-IQ4_XS

А скоро, попробую на них запустить
Qwen3.8-2.4T-A95B, но с этим будет много
"колдунства" которое, еще неизвестно чем закончится.

От скрипта, которым я ранее вручную анализировал коммиты llama.cpp
теперь перехожу к автоматическому анализу и исправлению агентом OpenCode,
используя локальный инференс на той же llama.cpp и на моих картах.

Вот, кстати, в Lama.cpp недавно завезли агентный режим, ( я еще не пробовал ),
высока вероятность что теперь llama.cpp сможет сама себя чинить и подстраивать под паскаль.

Вообще, я категорически не приемлю
концепцию "запланированного устаревания".



Полтора десятка моих паскаль-карт

Там счет за электричество получится дороже облака, не?

UP: какая у вас скорость на нексте, кстати?

Потребление:
Каждая карта p102-100 в режиме ожидания берет около 9 w, в режиме инференса в среднем около 70... 80 w. ( иногда в пиках до 200 w)
Сейчас у меня на одной машине не более пяти таких карт потому, что в у меня микс из разных типов gpu - я распределяю задачи соответственно их возможностям - в одни больше слоев модели, в другие больше KV-кеша.
Стараюсь давать больше вычислительной нагрузки на более мощные карты типа rtx 4090, а слабые карты - что-то вроде замены ddr5, которой у меня нет совсем.

Когда ранее запускал без микса gpu
то на одной карте p102-100 получал примерно 32 t/s для модели Gemma-4-E4B (Q8)
на шести картах p102-100 получал примерно 25 t/s для модели Qwen3-Coder-Next (Q4)
Это все результаты без драфт - ускорителей, а с драфтом, может давать почти в два раза больше на задачах кодогенерации.

Для новых моделей вроде
Qwen3.8-Flash-Next-UD-IQ4_XS пока получил скорость около 15 -18 t/s на шести картах, на одной машине, но я только начал подбирать оптимальный режим для них, и сейчас меняю аппаратную конфигурацию, посмотрим что получится выжать.
Здесь имеет значение что у меня ddr4 и это главная проблема.

Для Qwen3.8-2.4T-A95B планируется распределенный запуск на нескольких машинах, специально подготовленного кванта - не от Unsloth или Bartowski, а самодельного, по особому рецепту :)

Облачные модели использовать не планирую совсем, никогда.
Независимо от их возможностей и цены.
Приватность дороже всего.

Qwen3.8-Flash-Next-UD-IQ4_XS пока получил скорость около 15 -18 t/s на шести картах

Просто вброшу, что у меня Qwen3.8-Next на 80-ваттной коробке показывает 35+ т/c. Это не какой-то камень в ваш огород, это к вопросу, почему про паскаль все забыли. Потому что разрабы сидят в основном в западных странах, где за одно электричество ваш риг выжрет однозначно больше, чем облако.

А почему паскали, а не v100, например?

Карты брал примерно полтора года назад,
б/у после майнинга, примерно по 3500 руб.
Итого 15 *3500 = 52 500 руб ( за 150 gb VRAM)
Цена за гигабайт решает все.

Кажется, что в тот момент не было такого изобилия v100, они появились массово чуть позже, да и некоторое время у меня не было понимания как их правильно использовать (от физической обвязки до драйверов).
Вот, да, сейчас думаю - брать ли v100.

Коробочка (AI Max+ 395) хорошая, но уж больно дорогая.
Не знаю, стоит ли вкладывать в нее... или на те же деньги - поставить солнечных батарей побольше на загородный дом, если электричество когда-то станет слишком дорого :)
Скорость работы с моделью, видимо, связана с быстрой памятью, если мои карты пересадить на систему с DDR5 то и они дадут сразу больше.


Не знаю, стоит ли вкладывать в нее...

В нее не стоит, если вы морально и физически готовы к колхозу из серверных карт (а мне кажется вы готовы), они однозначно будут лучше.

Для тех кто пока нейронки только по подписке гоняет, поделитесь опытом на каком компе модели нормально гонять модели? Желательно чтобы в форм-факторе ноутбука был :)

Ни на каком, зачем гонять модели на ноутбуке, если можно купить обычный системный блок и видео карту и пользоваться моделью с ноутбука удаленно

Так что использовать нужно вместо?

Ollama основана зимой 2021 года. llama.cpp появилась в 2023 году. Простите за тупой вопрос, а что Ollama делала эти 2 года? Какой инструмент использовали?

И откуда такая информация?

На их гитхабе самая первая версия версия 3 года и зависела от llama.cpp. И почему у них такое название? Они в 2021 смогли вдохновиться моделью, которая выйдет в феврале 2023 года?

И откуда такая информация?

Из обсуждаемой статьи. У меня поэтому вопрос и возник. Что-то не состыковывается с датами.

В результате социальные сети заполнили сообщения людей, утверждавших, что они запускают «DeepSeek‑R1» на обычном домашнем железе, а затем недоумевавших

И статей от инфоцыган, на фоне хайпа дипсика, утверждающие это на "серьезных щах",
Сейчас похоже, они уже стали CEO\CTO\CPO\Co-founders и так далее)))

Ollama стала популярной потому, что первой предложила простой интерфейс поверх llama.cpp

А уж у llama.cpp крайне сложный интерфейс.... Оба работают из командной строки, примерно одинаково запускаются. Никогда не понимал зачем нужен этот посредник ollama, который к тому же качает сильно квантованные модели и не говорит об этом (во всяком случае так было раньше), да и вообще сильно урезан. К тому же с каких-то версий у llama.cpp появился WebUI (если запускать через сервер и обращаться к localhost), можно работать с моделями прямо в браузере через легковесный веб-интерфейс (SvelteKit-based WebUI), чем-то напоминающий старый GPT3.5, если кому так удобно.

Максимально тупая обёртка только для тех, у кого есть карты от Nvidia. Llama.cpp выпускает кучу сборок под каждый отдельный тип ускорителя

ollama для меня была точкой входа - именно скачать и потрогать локальную модель (через гуй под виндой). все эти статьи и коменты на хабре про ии только будоражили интерес. потом через статьи и комментарии понял что есть куча параметров (температура и прочие) которые не были доступны и lm-studio стала вторым шагом - позволяющим просто пощупать и разобраться с тонкостями. ну и сейчас llama-server в погоне за токенами, и прям щас узнаю про llama-swap. конечно плохо что создатели ollama решили скрыть истинного автора, но все эти модели обучались на каких данных? (риторический вопрос - на всех данных которые удалось выкачать в т.ч. и с торрентов). для меня ollama останется тем первым опытом который привел меня в мир ии, а плагиат - ну во многих отраслях он есть. ну и это был именно "простой опыт" - скачал программу, скачал модель и болтаешь в чате - отличная точка входа для не специалиста.

Sign up to leave a comment.

Articles