Обновить

Комментарии 13

Самое забавное, что проблема обычно всплывает не на коротких звонках, а когда встреча идет час-полтора)

Верно. На двоих вообще не проблема. А вот когда 4–6 и больше — уже да.

Вчера доработал скрипт под большее число спикеров. На встрече были два Саши, девочка и мальчик. Всё получилось, но лишние 30 минут на это убил.

To record audio only in OBS Studio, navigate to Settings > Output, set Mode to Advanced, and go to the Recording tab. Select Custom Output (FFmpeg) from the dropdown. Under Container Format, choose mp3 or wav, and set the Video Encoder to Disable to skip video processing completely

А так- поздравляю с открытием mlx-whisper

О, вот это я мимо прошёл. Спасибо. Я тогда уже на созвоне ловил квак и просто сменил софт, а не полез глубже в OBS.

mlx-whisper да, поздновато «открыл» 🙂 Зато на своих часовых звонках оно меня спасло, уже не отпущу.

Понимаю. Сам его начал активно использовать буквально года 2 назад.

..."но связка torchcodec с Intel ffmpeg развалилась" - у меня получилось это решить только вручную скачав версию ffmpeg7 shared и указав в скрипте путь до них.
os.add_dll_directory(r"C:\ffmpeg7\bin")
Для винды прокатило.
Для NIX, думаю, будет достаточно добавить в PATH (но надо проверять)
Плюсом, добавил в скрипт конвертацию аудио в моно 16 и нормализацию громкости через ffmpeg перед транскрибацией

О, спасибо. Про mono и нормализацию до распознавания заберу в README. У меня на Mac voxscriber просто лег от torchcodec + Intel ffmpeg, свернул на свой скрипт. Windows с ffmpeg7 не пробовал.

Неплохо, не хочешь попробовать запустить на NPU? Скорость переработки маленьких видео будет такой же, а больше(часов 3-6) будет конечно больше(минут 20-30, может ещё больше), однако у меня тоже MacBook M4, и мне дико не нравится когда он нагревается, а нагревается он только когда я делаю что то с нейросетями

Тоже M4, тоже греется на длинных прогонах. Я гоняю mlx на GPU, не на NPU для созвонов по часу хватает. На трёх-шести часах, наверное, ваш путь разумнее. Чем пользуетесь, напишите, гляну.

Вообще я пользуюсь NPU только для текстовых задач, использую qwen coder на 1.5b и скорость очень даже хорошая(около 40 токенов в секунду). Честно говоря, мало знаю о запуске на NPU таких моделей как whisper, но я немного почитал в интернете и нашел, что можно запустить, если скомпилировать whisper.cpp под CoreML. Очень советую попробовать, макбук почти не нагревается

Ни слова больше ушел в пробовать :)

А можно ли на нем запустить что-то более серьезное, например, qwen-3.6-35b-a3b?

Немного углубился в этот вопрос, вообще задумка очень хорошая, но нет, существует множество причин почему это невозможно. Самая главная - структура Moe моделей, MoE Router за каждый проход определяет нового агента, а ANE(Apple Neural Engine) по архитектуре запускает только модели, которые за каждый проход делают одно и тоже(т.е. перемножают одни и те же матрицы). NPU слишком специализированный. Еще одна причина в том, что MoE модели очень большие, внутри NPU есть 32 МБ SRAM, из этой памяти как раз NPU и умножает, в этом и проблема: Apple делят модель на маленькие кусочки, чтобы NPU могла их считать, смена этих кусочков занимает время, поэтому чем больше модель - тем больше времени понадобится на её работу. Существуют еще проблемы, но эти 2- главные

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации