Спасибо. Я просто эти чаты джипити просил рассчитать примерную скорость. Там был ответ, что около 5 токенов в секунду. Но самому по ощущениям казвлось, что больше. Сгорело потому что китайцы неправильно питание рассчитали с новыми чипами?
Может у кого есть опыт? Есть 3060, хотел докупить модифицированную 2080ti 22 gb. И не знаю имеет ли смымл для qwen 27b. Адекватная ли будет скорость и размер контекста? Просто не хочется контекст меньше 200к, потому что в агентских сценариях он заполняется очень быстро.
2.8 триллиона параметров? Я боюсь представить сколько стоит это запустить. Ощущение, что это выкладывают так, для галочки, а не для того, чтобы кто-то у себя запустил. Тут даже если дистилировать в мелкие самостоятельно, это будет стоить десятки, если не сотни тысяч долларов. Комьюнити явно таким заниматься не будет.
Проблема в том, что опенсорс моделей как-то и нету. Есть модели с открытыми весами, но их поставляют те же наркодилеры. Квен как-то апнулся до версии 3.8, но моделей после 3.6 с открытыми весами не выкладывал. Соответственно, возможность домашнего инференса зависит от крупных компаний. А датасетов, на которых можно обучить модели сопоставимого качества нет, да и дорого это. И момент такой, что не факт, что даже датасеты, на которых открытые модели обучаются, получены легальным путём. Там может быть дистилят моделей других вендоров, которые этого не разрешали, объекты защищенные авторским правом, персональные данные и т. д. Если компании могут скрывать на чём они учат модели, то в опенсорсе это всё сразу станет ясно и дейтсвиям таких энтузиастов могут сразу дать правовую оценку.
А вот какой юридический статус вот у этого всего. Допустим, какой-нибудь майкрософт возьмёт и перепишет ffmpeg и выставит под своей лицензией. И формально это нечестно, потому что за основу были взяты результаты тестов, которые разработаны под лиценией GNU.
А ещё, допустим, исходники от майков окажутся в открытом доступе и кто-нибудь форкнет и вернёт под GNU... Кто будет прав тогда?
У них ведь минимальные системные требования 4 гига? Не? А так у меня есть ноут с таким же процом i3 6100 U и оперативкой 4 гига. И комфортно линукс минт на нём всегда работал и работает, всё происходит без фризов и т. д. У мамы на ноуте винда 11 и 16 гигов оперативки и вот там есть фризы. Когда перешёл на линукс это больше всего и впечатлило, что во время простой задачи - ввода текста, нет фризов, никогда.
Вот да. Если они не закроют ADB, то обход через Termux + adb останется рабочим. Как будто это защита от мошенников, а по факту они просто контроль усиливают. И ещё слышал, что могут ввести период охлаждения для разработчиков, что тоже добавляет неопределенности. И вообще столько про это пишут, но непонятно что будет.
Вообще зависит от многих факторов. Самое главное убедиться, что llama cpp скомпилирована с cuda. У меня 20 токенов было когда я случайно для mesa скомпилировал. Ещё Gemma MTP плохо работает с квантованым kv кэшем. У меня скорость до 30-35 падает. Ну и лучше всего скорость была на модели q4 NL, получше качество текста, но медленнее (50-60 токенов) на q4 kxl. А так я больше предпочитаю квены).
Но тем не менее крушение дирижабля "Гинденбург" полностью похоронило дирижабли как вид транспорта. И в США от космических шаттлов полностью отказались после крушения "Колумбии".
Спасибо. Я просто эти чаты джипити просил рассчитать примерную скорость. Там был ответ, что около 5 токенов в секунду. Но самому по ощущениям казвлось, что больше. Сгорело потому что китайцы неправильно питание рассчитали с новыми чипами?
Может у кого есть опыт? Есть 3060, хотел докупить модифицированную 2080ti 22 gb. И не знаю имеет ли смымл для qwen 27b. Адекватная ли будет скорость и размер контекста? Просто не хочется контекст меньше 200к, потому что в агентских сценариях он заполняется очень быстро.
А тут намек, что не будет ((( https://github.com/modelscope/ms-swift/commit/a45f1d4f73157ba59062a7fd1f55a40dae759156
Ну или решили подержать интригу
Там вроде тарифы считают ещё токены на вход и на кэш. Но да, если посмотреть ещё стоимость электричества, то не сильно выгодно выходит.
По ощущениям эти ternary bonsai глупее моделей от unsloth. Как будто moe модели по качеству выигрывают даже.
del
Чтобы не закрывать большинство приложений, можно кабель втыкать во встройку)
2.8 триллиона параметров? Я боюсь представить сколько стоит это запустить. Ощущение, что это выкладывают так, для галочки, а не для того, чтобы кто-то у себя запустил. Тут даже если дистилировать в мелкие самостоятельно, это будет стоить десятки, если не сотни тысяч долларов. Комьюнити явно таким заниматься не будет.
Проблема в том, что опенсорс моделей как-то и нету. Есть модели с открытыми весами, но их поставляют те же наркодилеры. Квен как-то апнулся до версии 3.8, но моделей после 3.6 с открытыми весами не выкладывал. Соответственно, возможность домашнего инференса зависит от крупных компаний. А датасетов, на которых можно обучить модели сопоставимого качества нет, да и дорого это. И момент такой, что не факт, что даже датасеты, на которых открытые модели обучаются, получены легальным путём. Там может быть дистилят моделей других вендоров, которые этого не разрешали, объекты защищенные авторским правом, персональные данные и т. д. Если компании могут скрывать на чём они учат модели, то в опенсорсе это всё сразу станет ясно и дейтсвиям таких энтузиастов могут сразу дать правовую оценку.
А вот какой юридический статус вот у этого всего. Допустим, какой-нибудь майкрософт возьмёт и перепишет ffmpeg и выставит под своей лицензией. И формально это нечестно, потому что за основу были взяты результаты тестов, которые разработаны под лиценией GNU.
А ещё, допустим, исходники от майков окажутся в открытом доступе и кто-нибудь форкнет и вернёт под GNU... Кто будет прав тогда?
Как минимум на ПК запускается через llama cpp. В теории можно собрать кастомный llama cpp на андроиде в termux. По крайней мере инструкция есть https://github.com/PrismML-Eng/llama.cpp/blob/prism/docs/android.md Но официальный llama cpp не поддерживает.
Интересно как её мозги отличаются от MOE версий гемм и квенов с нормальными квантовками.
Ну убунту да, он тяжелый. Просто получается, что из всех утюгов кричат, что винда работает на слабом железе, а по факту в системных требованиях врут)
У них ведь минимальные системные требования 4 гига? Не? А так у меня есть ноут с таким же процом i3 6100 U и оперативкой 4 гига. И комфортно линукс минт на нём всегда работал и работает, всё происходит без фризов и т. д. У мамы на ноуте винда 11 и 16 гигов оперативки и вот там есть фризы. Когда перешёл на линукс это больше всего и впечатлило, что во время простой задачи - ввода текста, нет фризов, никогда.
Вот да. Если они не закроют ADB, то обход через Termux + adb останется рабочим. Как будто это защита от мошенников, а по факту они просто контроль усиливают. И ещё слышал, что могут ввести период охлаждения для разработчиков, что тоже добавляет неопределенности. И вообще столько про это пишут, но непонятно что будет.
Вроде как они хотели оставить возможность установки через adb. Поэтому необязательно будет рутовать. Конечно, если эту лазейку оставят.
Да тут и так видно) Вон был как-принц Уильям сфоткался на фоне логина/пароя от какой-то системы ВВС Великобритании)
Вообще зависит от многих факторов. Самое главное убедиться, что llama cpp скомпилирована с cuda. У меня 20 токенов было когда я случайно для mesa скомпилировал. Ещё Gemma MTP плохо работает с квантованым kv кэшем. У меня скорость до 30-35 падает. Ну и лучше всего скорость была на модели q4 NL, получше качество текста, но медленнее (50-60 токенов) на q4 kxl. А так я больше предпочитаю квены).
Для версии q4 kxl qat у меня такие параметры:
Если видеопамять позволяет, batch size нужно выкрутить получше. При работе с агентами важно, чтобы он контекст быстро строил.
Ну и смотреть что ещё запущено. У меня вчера включенная яндекс музыка снизила скорость квена с 45 до 15-20)
Как только условный клод начнёт писать хуже, антропики выкупят конкурента и закроют его)
Такие прецеденты с антропиками уже были в этом году)
Но тем не менее крушение дирижабля "Гинденбург" полностью похоронило дирижабли как вид транспорта. И в США от космических шаттлов полностью отказались после крушения "Колумбии".