Обновить

ИИ Qwen3.6-27B запустили на смартфоне: 1 бит на вес и 90% интеллекта оригинала

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели16K
Всего голосов 17: ↑16 и ↓1+16
Комментарии16

Комментарии 16

До сих пор не укладывается в голове, как можно все общие знания человечества запихнуть в обьем dvd диска.

По факту никакие знания не впихиваются. Впихивается математическая модель размещения токенов (условно, слов). Что есть основой любого текста? Алфавит + различные символы. Дальше можно взять словарь. По большому счету, из этого можно собрать абсолютно любой текст. Так что в основе текстовых знаний лежит не так уж много базовых элементов. Другой вопрос, чтобы из этих элементов собрать вот эти вот все знания - это да, технология неотличимая от магии.

А разве общих знаний так уж много, если без подробностей и лишних деталей?

Сколько учебников может вместиться на dvd диск, очень много.

Там доля процента от знаний)). Даже в моделях на терабайт нету всех данных.

Статья несколько принижает. 11 токенов в секунду - это вполне приемлимо для беседы. И даже для простых агентских операций.

Медлительно, конечно, но вполне юзабельно

Если только без ризонинга

Интересно как её мозги отличаются от MOE версий гемм и квенов с нормальными квантовками.

Я проверил — 90% от оригинала является сильным преувеличением.

Кто нибудь у себя на телефоне запустил? Через какую программу? Pocket pal нос воротит

Как минимум на ПК запускается через llama cpp. В теории можно собрать кастомный llama cpp на андроиде в termux. По крайней мере инструкция есть https://github.com/PrismML-Eng/llama.cpp/blob/prism/docs/android.md Но официальный llama cpp не поддерживает.

Мобильный ИИ интересен именно как автономный агент, который за тебя сделает рутину. Если он начнёт на этом сыпаться, то 11 токенов в секунду покажутся вечностью

1 бит с 90% конечно сомнительно, но тернарная версия интересна.

11 токенов в сек для демонстрации отлично конечно, но в реале после облачных моделей такая скорость как то медленно

Эх 27B медленный конечно 27tps всего, Вот если бы они сделали версию MoE 35B - Qwen3.6 35B A3B то цены бы ему не было. Хотя он и в 2bit квантовании от Unsloth очень неплох. Но занимает 10ГБ.

@runaway_llm

Мне давно было любопытно что из локальных Abliterated ИИ можно поднять на телефоне например на Device: Samsung S21 5G (Snapdragon 888, Adreno 660, 8GB RAM, Android 12, One UI 4.1, No Root).

Я тесты не проводил, просто установил, и поставил задачу, с которой сносно справилась модель 4В, и хорошо 9В. Эта справилась очень плохо. И это реальное применение, а не тесты.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации