2.8 триллиона параметров? Я боюсь представить сколько стоит это запустить. Ощущение, что это выкладывают так, для галочки, а не для того, чтобы кто-то у себя запустил. Тут даже если дистилировать в мелкие самостоятельно, это будет стоить десятки, если не сотни тысяч долларов. Комьюнити явно таким заниматься не будет.
Проблема в том, что опенсорс моделей как-то и нету. Есть модели с открытыми весами, но их поставляют те же наркодилеры. Квен как-то апнулся до версии 3.8, но моделей после 3.6 с открытыми весами не выкладывал. Соответственно, возможность домашнего инференса зависит от крупных компаний. А датасетов, на которых можно обучить модели сопоставимого качества нет, да и дорого это. И момент такой, что не факт, что даже датасеты, на которых открытые модели обучаются, получены легальным путём. Там может быть дистилят моделей других вендоров, которые этого не разрешали, объекты защищенные авторским правом, персональные данные и т. д. Если компании могут скрывать на чём они учат модели, то в опенсорсе это всё сразу станет ясно и дейтсвиям таких энтузиастов могут сразу дать правовую оценку.
А вот какой юридический статус вот у этого всего. Допустим, какой-нибудь майкрософт возьмёт и перепишет ffmpeg и выставит под своей лицензией. И формально это нечестно, потому что за основу были взяты результаты тестов, которые разработаны под лиценией GNU.
А ещё, допустим, исходники от майков окажутся в открытом доступе и кто-нибудь форкнет и вернёт под GNU... Кто будет прав тогда?
У них ведь минимальные системные требования 4 гига? Не? А так у меня есть ноут с таким же процом i3 6100 U и оперативкой 4 гига. И комфортно линукс минт на нём всегда работал и работает, всё происходит без фризов и т. д. У мамы на ноуте винда 11 и 16 гигов оперативки и вот там есть фризы. Когда перешёл на линукс это больше всего и впечатлило, что во время простой задачи - ввода текста, нет фризов, никогда.
Вот да. Если они не закроют ADB, то обход через Termux + adb останется рабочим. Как будто это защита от мошенников, а по факту они просто контроль усиливают. И ещё слышал, что могут ввести период охлаждения для разработчиков, что тоже добавляет неопределенности. И вообще столько про это пишут, но непонятно что будет.
Вообще зависит от многих факторов. Самое главное убедиться, что llama cpp скомпилирована с cuda. У меня 20 токенов было когда я случайно для mesa скомпилировал. Ещё Gemma MTP плохо работает с квантованым kv кэшем. У меня скорость до 30-35 падает. Ну и лучше всего скорость была на модели q4 NL, получше качество текста, но медленнее (50-60 токенов) на q4 kxl. А так я больше предпочитаю квены).
Но тем не менее крушение дирижабля "Гинденбург" полностью похоронило дирижабли как вид транспорта. И в США от космических шаттлов полностью отказались после крушения "Колумбии".
Последние версии gemma это скорее не про программирование. Они выпустили супер быструю gemma 12b, которая и на rtx3060 выдаёт 70 токенов в секунду, но в агентов она совершенно не умеет. По факту из всех открытых моделей только квен умеет в агентов, но они после 3.6 открывать свои веса не торопятся.
Я пробовал как хобби в формате: 1. Спроектируй такую фичу -> маленькая модель 2. Напиши замечания -> ChatGPT 3. Исправь замечания -> маленькая модель 4. 2-3 итерации 5. Реализуй -> маленькая модель
По факту какие я сделал выводы:
Как агенты модели могут допускать серьёзные огрехи, например у меня в режиме Ask редактировал код без предупреждения, модифицировал системный питон с флагом --break-system(без него в питоне стояла защита от этого) и т. д.
Маленькая модель может игнорировать инструкции. Например, по плану мы сошлись на то, что нужно добавить haptic feedback, у модели с ходу не получилось, она не добавила, а по фактуотписала, что всё сделала
Своеволие. Например, попросил внести изменения, модель внесла, попросил поправить варнинги(в том числе, которые висят давно) - модель сделала git stash, проверила варнинги и отказалась делать, мол это было до меня. Или такой кейс. И часто это "я не буду этого делать" лечится только перезапуском сессии. Пытался сделать 2 приложения, которые должны были интегрироваться. Интеграция не заработала. Запустил 2-х агентов. Одного для одного проекта, другого - для другого. Так они друг на друга гнали, мол у меня всё ок, смотри что в другом проекте.
Ну и не получилось до сих пор у меня приучить ни локальные, ни платные модели к хорошему коду. Если модель сделает большой кусок проекта, а потом что-то не сможет пофиксить, то нужно лезть самому. А там, как правило, что-то трудное для понимания. И поэтому когда в приложении баг, из-за которого им невозможно пользоваться, приходится сначала делать рефакторинг практически в ручном режиме и потом уже искать ошибку.
И главное, что хороший план в этой ситуации не помогал мне избежать этого всего. План был достаточно подробный, со структурой проекта, примерами кода и т. д.
ИИ часто добивается отсусттвия варнингов сапресами и фиксит тесты удалением их) Мол после этого всё хорошо собирается. И мне вспомнилось было видео у Славного Друже, где он с какой-то азиаткой что-то из крабов готовил. Друже говорит, мол у нас некоторые считают негуманным бросать раков в кипяток, ему ведь больно, он барахтается. Азиатка отрывает крабу все лапы и бросает в кипяток. И говорит, мол не барахтается, значит не больно.
Страшно представить как ИИ анестезиолог может сделать анестезию :D
Что самое интересное, за каждый токен мёртвого кода уплачено) Ситуация как в Индии, когда им платили за строчки кода и они стали писать много непонятных строчек. Так и ИИшке платят за токены и она пытается нагенерировать больше токенов, чтобы больше платить, а всё остальное не важно)
Так контекст везде ограничен, поэтому и разработка идёт итерациями такими, чтобы не больше 100-150к токенов было, потому что любая модель после ужатия контекста в качестве теряет больше, чем от ужатия по квантам.
2.8 триллиона параметров? Я боюсь представить сколько стоит это запустить. Ощущение, что это выкладывают так, для галочки, а не для того, чтобы кто-то у себя запустил. Тут даже если дистилировать в мелкие самостоятельно, это будет стоить десятки, если не сотни тысяч долларов. Комьюнити явно таким заниматься не будет.
Проблема в том, что опенсорс моделей как-то и нету. Есть модели с открытыми весами, но их поставляют те же наркодилеры. Квен как-то апнулся до версии 3.8, но моделей после 3.6 с открытыми весами не выкладывал. Соответственно, возможность домашнего инференса зависит от крупных компаний. А датасетов, на которых можно обучить модели сопоставимого качества нет, да и дорого это. И момент такой, что не факт, что даже датасеты, на которых открытые модели обучаются, получены легальным путём. Там может быть дистилят моделей других вендоров, которые этого не разрешали, объекты защищенные авторским правом, персональные данные и т. д. Если компании могут скрывать на чём они учат модели, то в опенсорсе это всё сразу станет ясно и дейтсвиям таких энтузиастов могут сразу дать правовую оценку.
А вот какой юридический статус вот у этого всего. Допустим, какой-нибудь майкрософт возьмёт и перепишет ffmpeg и выставит под своей лицензией. И формально это нечестно, потому что за основу были взяты результаты тестов, которые разработаны под лиценией GNU.
А ещё, допустим, исходники от майков окажутся в открытом доступе и кто-нибудь форкнет и вернёт под GNU... Кто будет прав тогда?
Как минимум на ПК запускается через llama cpp. В теории можно собрать кастомный llama cpp на андроиде в termux. По крайней мере инструкция есть https://github.com/PrismML-Eng/llama.cpp/blob/prism/docs/android.md Но официальный llama cpp не поддерживает.
Интересно как её мозги отличаются от MOE версий гемм и квенов с нормальными квантовками.
Ну убунту да, он тяжелый. Просто получается, что из всех утюгов кричат, что винда работает на слабом железе, а по факту в системных требованиях врут)
У них ведь минимальные системные требования 4 гига? Не? А так у меня есть ноут с таким же процом i3 6100 U и оперативкой 4 гига. И комфортно линукс минт на нём всегда работал и работает, всё происходит без фризов и т. д. У мамы на ноуте винда 11 и 16 гигов оперативки и вот там есть фризы. Когда перешёл на линукс это больше всего и впечатлило, что во время простой задачи - ввода текста, нет фризов, никогда.
Вот да. Если они не закроют ADB, то обход через Termux + adb останется рабочим. Как будто это защита от мошенников, а по факту они просто контроль усиливают. И ещё слышал, что могут ввести период охлаждения для разработчиков, что тоже добавляет неопределенности. И вообще столько про это пишут, но непонятно что будет.
Вроде как они хотели оставить возможность установки через adb. Поэтому необязательно будет рутовать. Конечно, если эту лазейку оставят.
Да тут и так видно) Вон был как-принц Уильям сфоткался на фоне логина/пароя от какой-то системы ВВС Великобритании)
Вообще зависит от многих факторов. Самое главное убедиться, что llama cpp скомпилирована с cuda. У меня 20 токенов было когда я случайно для mesa скомпилировал. Ещё Gemma MTP плохо работает с квантованым kv кэшем. У меня скорость до 30-35 падает. Ну и лучше всего скорость была на модели q4 NL, получше качество текста, но медленнее (50-60 токенов) на q4 kxl. А так я больше предпочитаю квены).
Для версии q4 kxl qat у меня такие параметры:
Если видеопамять позволяет, batch size нужно выкрутить получше. При работе с агентами важно, чтобы он контекст быстро строил.
Ну и смотреть что ещё запущено. У меня вчера включенная яндекс музыка снизила скорость квена с 45 до 15-20)
Как только условный клод начнёт писать хуже, антропики выкупят конкурента и закроют его)
Такие прецеденты с антропиками уже были в этом году)
Но тем не менее крушение дирижабля "Гинденбург" полностью похоронило дирижабли как вид транспорта. И в США от космических шаттлов полностью отказались после крушения "Колумбии".
Последние версии gemma это скорее не про программирование. Они выпустили супер быструю gemma 12b, которая и на rtx3060 выдаёт 70 токенов в секунду, но в агентов она совершенно не умеет. По факту из всех открытых моделей только квен умеет в агентов, но они после 3.6 открывать свои веса не торопятся.
Они не забыли KV-кэш квантовать и batch-size, ubatch-size выкрутить, чтобы быстрее на вход токены подавались?
Я пробовал как хобби в формате:
1. Спроектируй такую фичу -> маленькая модель
2. Напиши замечания -> ChatGPT
3. Исправь замечания -> маленькая модель
4. 2-3 итерации
5. Реализуй -> маленькая модель
По факту какие я сделал выводы:
Как агенты модели могут допускать серьёзные огрехи, например у меня в режиме Ask редактировал код без предупреждения, модифицировал системный питон с флагом --break-system(без него в питоне стояла защита от этого) и т. д.
Маленькая модель может игнорировать инструкции. Например, по плану мы сошлись на то, что нужно добавить haptic feedback, у модели с ходу не получилось, она не добавила, а по фактуотписала, что всё сделала
Своеволие. Например, попросил внести изменения, модель внесла, попросил поправить варнинги(в том числе, которые висят давно) - модель сделала git stash, проверила варнинги и отказалась делать, мол это было до меня.
Или такой кейс. И часто это "я не буду этого делать" лечится только перезапуском сессии.
Пытался сделать 2 приложения, которые должны были интегрироваться. Интеграция не заработала. Запустил 2-х агентов. Одного для одного проекта, другого - для другого. Так они друг на друга гнали, мол у меня всё ок, смотри что в другом проекте.
Ну и не получилось до сих пор у меня приучить ни локальные, ни платные модели к хорошему коду. Если модель сделает большой кусок проекта, а потом что-то не сможет пофиксить, то нужно лезть самому. А там, как правило, что-то трудное для понимания. И поэтому когда в приложении баг, из-за которого им невозможно пользоваться, приходится сначала делать рефакторинг практически в ручном режиме и потом уже искать ошибку.
И главное, что хороший план в этой ситуации не помогал мне избежать этого всего. План был достаточно подробный, со структурой проекта, примерами кода и т. д.
ИИ часто добивается отсусттвия варнингов сапресами и фиксит тесты удалением их) Мол после этого всё хорошо собирается. И мне вспомнилось было видео у Славного Друже, где он с какой-то азиаткой что-то из крабов готовил. Друже говорит, мол у нас некоторые считают негуманным бросать раков в кипяток, ему ведь больно, он барахтается. Азиатка отрывает крабу все лапы и бросает в кипяток. И говорит, мол не барахтается, значит не больно.
Страшно представить как ИИ анестезиолог может сделать анестезию :D
https://habr.com/en/news/1039430/
Что самое интересное, за каждый токен мёртвого кода уплачено) Ситуация как в Индии, когда им платили за строчки кода и они стали писать много непонятных строчек. Так и ИИшке платят за токены и она пытается нагенерировать больше токенов, чтобы больше платить, а всё остальное не важно)
Так контекст везде ограничен, поэтому и разработка идёт итерациями такими, чтобы не больше 100-150к токенов было, потому что любая модель после ужатия контекста в качестве теряет больше, чем от ужатия по квантам.