Обновить
1
Антон@Requiems

Пиш чисто ради себя, так я могу запомнить легче

Отправить сообщение

Немного углубился в этот вопрос, вообще задумка очень хорошая, но нет, существует множество причин почему это невозможно. Самая главная - структура Moe моделей, MoE Router за каждый проход определяет нового агента, а ANE(Apple Neural Engine) по архитектуре запускает только модели, которые за каждый проход делают одно и тоже(т.е. перемножают одни и те же матрицы). NPU слишком специализированный. Еще одна причина в том, что MoE модели очень большие, внутри NPU есть 32 МБ SRAM, из этой памяти как раз NPU и умножает, в этом и проблема: Apple делят модель на маленькие кусочки, чтобы NPU могла их считать, смена этих кусочков занимает время, поэтому чем больше модель - тем больше времени понадобится на её работу. Существуют еще проблемы, но эти 2- главные

Вообще я пользуюсь NPU только для текстовых задач, использую qwen coder на 1.5b и скорость очень даже хорошая(около 40 токенов в секунду). Честно говоря, мало знаю о запуске на NPU таких моделей как whisper, но я немного почитал в интернете и нашел, что можно запустить, если скомпилировать whisper.cpp под CoreML. Очень советую попробовать, макбук почти не нагревается

Неплохо, не хочешь попробовать запустить на NPU? Скорость переработки маленьких видео будет такой же, а больше(часов 3-6) будет конечно больше(минут 20-30, может ещё больше), однако у меня тоже MacBook M4, и мне дико не нравится когда он нагревается, а нагревается он только когда я делаю что то с нейросетями

Информация

В рейтинге
6 004-й
Откуда
Беларусь
Дата рождения
Зарегистрирован
Активность