Comments 18
Почему все подобные статьи пишут люди далекие от темы, которым столь лениво самим разбираться, что выплевывают устаревшую на годы инфу? Что их заставляет так делать? И ведь даже не смутила надпись на скрине со списком моделей, что DeepSeek R1 0528 Qwen 8B был выложен 370 дней назад!
DeepSeek — модели для общего общения, программирования и рассуждений.
Llama — семейство моделей Meta.
Qwen — семейство моделей Alibaba, хорошо подходящее для самых разных задач.
Gemma — компактные модели Google.
Mistral — модели французской компании Mistral AI.
Phi — небольшие модели Microsoft, рассчитанные в том числе на запуск на относительно слабом железе.
DeepSeek самая маленькая современная модель занимает 167Гб, она изначально с весами 4 бита, так что даже если квантовать агрессивно, нужен весьма продвинутый комп, чтоб запустить и погрустить от того, как оно медленно.
llama - их последняя модель вышла в апреле 2025 и тоже была слишком большая для обычных компов, причем весьма посредственная, что привело к тому, что руководителя заменили и теперь Мета пилит закрытые модели с другим именем.
Mistral - последний релиз в марте не задался, во-первых mistral small теперь на 116B параметров, что слишком много для обычных компов, во-вторых модель так себе, хуже конкурентов.
Phi - последний релиз в декабре аж 2024, вроде по слухам команду распустили, кто-то уволился, кто-то перешел в другие отделы.
Ага, а еще на смартфоны их ставить пытаются? Для чего? Ну даже топовый смарт не тянет слабенькие модельки. А это типа, потому что можем...Не, ну...модельку от карпатого можно даже на esp32 запустить спору нет, а зачем? Это как дум на тестах для беременности?
Gemma4 e4b вполне себе работает и вполне шустро
3-8 токенов в сек? или таки уже до 9+ токенов в сек разогнали?
Вот одна из самых маленьких: qwen3.5:0.8b 1.0GB 256K Text, Image, но на Iphone 16 запускал qwen3.5:4b. Вполне нормально отвечает и при том распознает изображения.
Прежде чем всё это делать, нужен Шаг 0 - выбор, покупка и установка железа, на котором всю эту красоту запускать. Вот это гораздо интереснее обсудить. И вот с этим реально непонятно что делать:) Цены растут (и конца этому процессу не видно), слабое железо покупать не хочется, потому что оно и слабое недешевое, а результат будет хуже чем у онлайн моделей. А реально мощное железо стоит уже очень дорого.
Также, концептуально есть мощные видеокарты Nvidia, под которые всё заточено (CUDA и т.д.). И есть новый класс устройств - UMA (Unified Memory Architecture) / APU (Accelerated Processing Unit), когда процессор и видеокарта объединены и используют общий пул памяти (причем памяти там больше чем у видеокарт). Скорость работы меньше чем у видеокарт, но зато памяти больше (128 гигов против 32...48). И это не огромная видеокарта, требующая десктопа, а самостоятельное портативное устройство. Apple с чипами M-серии или AMD Strix Halo.
Но цены пока огромные и на карты, и на UMA/APU.
Чего же непонятно)? Если достаточно небольших моделей, то видеокарта 3060 на 12гб, или система на ддр 5 в 2-х канале, или ддр4 в 4-х канале. Если надо большие модели, то тогда опять же 3060, серверная мать с 128+ гб ОЗУ ддр4, и МоЕ модели. Есть много вариантов с устаревшими серверами видеокартами, но я не поклонник этих решений.
А ChatGPT тоже можно скачать на компьютер?
Да -> https://openai.com/index/introducing-gpt-oss/
Для видеокарты с 8 ГБ памяти оптимальной является модель Ornith-1.0-9B. Перепробовал много, она самая сильная и быстрая (60-70 токенов/сек).
Ну статья, как я понимаю, для НЕ программистов (люди работающие в сфере программирования знают куда больше автора), а обычным людям эта модель не поможет, т.к она для кодинга
А что можно полезного запустить на 8Гб? Просто интересно, я вот сомневаюсь покупать ли 12Гб или просто тупо подождать пару-тройку лет и купить что-то нормальное, чтобы уже надолго хватило.
Имхо лучше не ждать, а докупить то, что сильно (вдвое) ускорит инференс и вчетверо расширит выбор моделей - Nvidia CMP 50HX 10 GB за 4 тыс. руб.
Ну не ускорит. Там еще жосткие пляски с бубном нужны. И даже так не ускорит. https://habr.com/ru/articles/948396/
Имхо уже года 2 есть тенденция "llm на cpu", медленно но качественно. И даже с нынешней ценой RAM оно все равно дешевле остается. Скорость не ахти. Но смотря что делать. А карты как взлетели при майнинге, так особо и не дешевеют, еще и ИИ рынок вскипятил.
8 гБ есть смысл менять на 24 гб только.
А что, так можно было? Как (а главное — зачем) установить нейросеть на компьютер