Pull to refresh

Comments 18

Почему все подобные статьи пишут люди далекие от темы, которым столь лениво самим разбираться, что выплевывают устаревшую на годы инфу? Что их заставляет так делать? И ведь даже не смутила надпись на скрине со списком моделей, что DeepSeek R1 0528 Qwen 8B был выложен 370 дней назад!

  • DeepSeek — модели для общего общения, программирования и рассуждений.

  • Llama — семейство моделей Meta.

  • Qwen — семейство моделей Alibaba, хорошо подходящее для самых разных задач.

  • Gemma — компактные модели Google.

  • Mistral — модели французской компании Mistral AI.

  • Phi — небольшие модели Microsoft, рассчитанные в том числе на запуск на относительно слабом железе.

DeepSeek самая маленькая современная модель занимает 167Гб, она изначально с весами 4 бита, так что даже если квантовать агрессивно, нужен весьма продвинутый комп, чтоб запустить и погрустить от того, как оно медленно.

llama - их последняя модель вышла в апреле 2025 и тоже была слишком большая для обычных компов, причем весьма посредственная, что привело к тому, что руководителя заменили и теперь Мета пилит закрытые модели с другим именем.

Mistral - последний релиз в марте не задался, во-первых mistral small теперь на 116B параметров, что слишком много для обычных компов, во-вторых модель так себе, хуже конкурентов.

Phi - последний релиз в декабре аж 2024, вроде по слухам команду распустили, кто-то уволился, кто-то перешел в другие отделы.

Ага, а еще на смартфоны их ставить пытаются? Для чего? Ну даже топовый смарт не тянет слабенькие модельки. А это типа, потому что можем...Не, ну...модельку от карпатого можно даже на esp32 запустить спору нет, а зачем? Это как дум на тестах для беременности?

Gemma4 e4b вполне себе работает и вполне шустро

3-8 токенов в сек? или таки уже до 9+ токенов в сек разогнали?

Если это ирония, то не уместна. 6-8 секунд это уже вполне комфортная скорость для многих задач.

у меня 10-12 tps. для большинства простых задач и правда хватает. ну оно и не для вайбкодинга или по каким вы там критериям оцениваете.
да и смартфон у меня 4 летней давности...

Вот одна из самых маленьких: qwen3.5:0.8b 1.0GB 256K Text, Image, но на Iphone 16 запускал qwen3.5:4b. Вполне нормально отвечает и при том распознает изображения.

Прежде чем всё это делать, нужен Шаг 0 - выбор, покупка и установка железа, на котором всю эту красоту запускать. Вот это гораздо интереснее обсудить. И вот с этим реально непонятно что делать:) Цены растут (и конца этому процессу не видно), слабое железо покупать не хочется, потому что оно и слабое недешевое, а результат будет хуже чем у онлайн моделей. А реально мощное железо стоит уже очень дорого.

Также, концептуально есть мощные видеокарты Nvidia, под которые всё заточено (CUDA и т.д.). И есть новый класс устройств - UMA (Unified Memory Architecture) / APU (Accelerated Processing Unit), когда процессор и видеокарта объединены и используют общий пул памяти (причем памяти там больше чем у видеокарт). Скорость работы меньше чем у видеокарт, но зато памяти больше (128 гигов против 32...48). И это не огромная видеокарта, требующая десктопа, а самостоятельное портативное устройство. Apple с чипами M-серии или AMD Strix Halo.

Но цены пока огромные и на карты, и на UMA/APU.

Чего же непонятно)? Если достаточно небольших моделей, то видеокарта 3060 на 12гб, или система на ддр 5 в 2-х канале, или ддр4 в 4-х канале. Если надо большие модели, то тогда опять же 3060, серверная мать с 128+ гб ОЗУ ддр4, и МоЕ модели. Есть много вариантов с устаревшими серверами видеокартами, но я не поклонник этих решений.

А ChatGPT тоже можно скачать на компьютер?

Да -> https://openai.com/index/introducing-gpt-oss/

Для видеокарты с 8 ГБ памяти оптимальной является модель Ornith-1.0-9B. Перепробовал много, она самая сильная и быстрая (60-70 токенов/сек).

Ну статья, как я понимаю, для НЕ программистов (люди работающие в сфере программирования знают куда больше автора), а обычным людям эта модель не поможет, т.к она для кодинга

А что можно полезного запустить на 8Гб? Просто интересно, я вот сомневаюсь покупать ли 12Гб или просто тупо подождать пару-тройку лет и купить что-то нормальное, чтобы уже надолго хватило.

Имхо лучше не ждать, а докупить то, что сильно (вдвое) ускорит инференс и вчетверо расширит выбор моделей - Nvidia CMP 50HX 10 GB за 4 тыс. руб.

Ну не ускорит. Там еще жосткие пляски с бубном нужны. И даже так не ускорит. https://habr.com/ru/articles/948396/

Имхо уже года 2 есть тенденция "llm на cpu", медленно но качественно. И даже с нынешней ценой RAM оно все равно дешевле остается. Скорость не ахти. Но смотря что делать. А карты как взлетели при майнинге, так особо и не дешевеют, еще и ИИ рынок вскипятил.

Спасибо за ссылку, полезная статья. На CPU/RAM с 2-5 t/s уж очень сильно сбивается привычный ритм разработки, надо тщательнее планировать и сегментировать задачи. Агент не совсем тонко понимает людские настроения. Хотя, наверно, это зависит и от самой задачи, и от цейтнота при ее решении.

8 гБ есть смысл менять на 24 гб только.

Sign up to leave a comment.

Articles