Комментарии 13
Самое забавное, что проблема обычно всплывает не на коротких звонках, а когда встреча идет час-полтора)
To record audio only in OBS Studio, navigate to Settings > Output, set Mode to Advanced, and go to the Recording tab. Select Custom Output (FFmpeg) from the dropdown. Under Container Format, choose mp3 or wav, and set the Video Encoder to Disable to skip video processing completely
А так- поздравляю с открытием mlx-whisper
..."но связка torchcodec с Intel ffmpeg развалилась" - у меня получилось это решить только вручную скачав версию ffmpeg7 shared и указав в скрипте путь до них.
os.add_dll_directory(r"C:\ffmpeg7\bin")
Для винды прокатило.
Для NIX, думаю, будет достаточно добавить в PATH (но надо проверять)
Плюсом, добавил в скрипт конвертацию аудио в моно 16 и нормализацию громкости через ffmpeg перед транскрибацией
Неплохо, не хочешь попробовать запустить на NPU? Скорость переработки маленьких видео будет такой же, а больше(часов 3-6) будет конечно больше(минут 20-30, может ещё больше), однако у меня тоже MacBook M4, и мне дико не нравится когда он нагревается, а нагревается он только когда я делаю что то с нейросетями
Тоже M4, тоже греется на длинных прогонах. Я гоняю mlx на GPU, не на NPU для созвонов по часу хватает. На трёх-шести часах, наверное, ваш путь разумнее. Чем пользуетесь, напишите, гляну.
Вообще я пользуюсь NPU только для текстовых задач, использую qwen coder на 1.5b и скорость очень даже хорошая(около 40 токенов в секунду). Честно говоря, мало знаю о запуске на NPU таких моделей как whisper, но я немного почитал в интернете и нашел, что можно запустить, если скомпилировать whisper.cpp под CoreML. Очень советую попробовать, макбук почти не нагревается
Ни слова больше ушел в пробовать :)
А можно ли на нем запустить что-то более серьезное, например, qwen-3.6-35b-a3b?
Немного углубился в этот вопрос, вообще задумка очень хорошая, но нет, существует множество причин почему это невозможно. Самая главная - структура Moe моделей, MoE Router за каждый проход определяет нового агента, а ANE(Apple Neural Engine) по архитектуре запускает только модели, которые за каждый проход делают одно и тоже(т.е. перемножают одни и те же матрицы). NPU слишком специализированный. Еще одна причина в том, что MoE модели очень большие, внутри NPU есть 32 МБ SRAM, из этой памяти как раз NPU и умножает, в этом и проблема: Apple делят модель на маленькие кусочки, чтобы NPU могла их считать, смена этих кусочков занимает время, поэтому чем больше модель - тем больше времени понадобится на её работу. Существуют еще проблемы, но эти 2- главные

56 минут созвона → текст за 5 минут на M4 без OBS и облака