Обновить

Комментарии 44

Да, gigaam хорош. И удивительным образом малоизвестен. Хотя работает быстрее и качественнее whisper-large

отличный и приятно выглядящий проект

Спасибо! Внешний вид во многом заслуга стороннего разработчика, он прислал три пул-реквеста и подтянул меню и плашку к системному виду

планируется реализация для windows?

Попробуйте handy https://handy.computer/ для локальных моделей. Мне там больше понравилась модель Нематрон. Она со стримингом, поэтому позволяет… Транскрибирует уже часть речи, пока вы до конца фразу не договорили. Получается быстро. По крайней мере быстрее чем гигачатовская модель и работает точнее когда у вас смесь русского и английского.

А если локальные модели вам не критичны, для облачных моделей попробуйте Spokenly https://spokenly.app/

Для Windows есть Handy, с этой же моделью.

Да, на днях хочу заняться виндой

Да хочу попробовать для винды запилить тоже

Мне как разработчику он не подошел. Я с ИИ моделями разговариваю на смеси русского и английского. А он вообще английские термины не понимает, и слова английские не понимает и так далее.

Я сейчас использую Gemini 3.5 Transcribe. Вот эту заметку набираю голосом через него.

Подскажите пример фразы, которая не распозналась? В моих тестах вкрапления латиницей проходят ровно например проверь pull request на GitHub или скинь link на Google Doc, ломается она, только когда английского становится много модель русская, и длинную английскую речь пишет латиницей, но фонетически Если у вас именно такой режим, то да, Писарь не подойдёт, я об этом честно написал в статье. Если же падают отдельные термины, хочу разобраться, пришлите примеры.

Я использовал Handy может там модели GigaAM v3 как то неверно работают. Сейчас перешел на Spokenly там сетевые модели можно выбирать, GigaAM там нет.

Сейчас в Handy по быстрому протестировал три модельки GigaAM, Nemotron и Parakeet.

Победила GigaAM. Русский на отлично, со знаками препинания и даже уместными кавычками. Самая быстрая. Английский не только понимает отдельные слова и вставляет в текст, но и полностью диктовку на английском правильно расшифровывает. Заметил, чтобы именно на английском печатала, надо с английским акцентом говорить, а не как Мутко.

Остальные две русский понимают хорошо, чуть медленнее расшифровывают. Английский у всех вроде одинаковый.

А на чём Handy крутили, CPU или GPU?

Наверное на CPU. В настройках я не нашел, на чем крутить, да и CUDA у меня нет.
Мне еще Handy понравилась, потому что инсталлятор разрешил портабельнвый вариант установить.

Вот это скорость. Мгновенно считай. На cpu. Но внешний аудиофайл я так понимаю ему не подсунуть.

Пока нельзя, но в планах разработки есть такая фича.
Я вообще не люблю обновления, особенно, Windows, но это обновление Handy буду ждать.

Подсунуть — у них есть CLI.

Только под линуксом. В винде вообще ключи никакие не обрабатывает.

Так, это была моя ошибка. Хэнди не поддерживает, да, транскрибацию файлов.

handy это Windows GUI приложение, поэтому она выводит в невидимую консоль, и надо вывод перенаправлять через другое приложение в стандартную консоль.

"%LOCALAPPDATA%\Handy\handy.exe" --help | more

И там вы увидите опцию транскрибации. Только через Виспер модели работает. Звездочка отображаться, напротив скачанных моделей, Виспер.

"%LOCALAPPDATA%\Handy\handy.exe" --list-models | findstr /I "whisper"

Сама транскрибация

"%LOCALAPPDATA%\Handy\handy.exe" -f audio.wav --model "handy-computer/whisper-small-gguf/whisper-small-Q8_0.gguf" | more

Не, не работает, хотя на хелп отвечает. Другие ключи просто никак не работают. И опция есть.А толку через виспер, он и без ханди будет работать, а тут скорость ведь!

Я все уже перепробовал и вывод в другую консоль тоже. Молчит и ничего не делает. Вывод пустой.

Вы модель-то загрузили? У меня работает. На вход надо подавать именно WAV 16 кГц моно. Модели только виспер поддерживаются. После транскрибации ищите JSON файл с текстом.

У меня Handy запускает транскрибацию используя GPU, получается очень быстро.

И да, к сожалению, транскрибация через командную строку не поддерживает другие модели.

Разобрался. Ну как и думал, работает немного чуть быстрее оригинального Виспера (на видеокарте). Но сберовская моделька это прям сверхзвук именно на CPU, не всегда можно отдавать видеокарту под такие процессы, на GPU и дурак может короче говоря =) Жаль что нельзя другие модели.

Сайт глянул — значит, вы на v3 e2e, пунктуация вшита в модель, красиво. Любопытно, какой из пяти вариантов взяли: e2e_rnnt? И как крутите его на CPU — чистый PyTorch или перегнали в ONNX? На rnnt-декодере разница бывает заметной.
Ну и вопрос на перспективу: в июне Сбер выложил GigaAM Multilingual — посимвольный CTC на 70+ языков, русский там всё ещё топовый. Она бы, может, закрыла и английскую диктовку без всякого Whisper?

Multilingual, к сожалению, в пунктуацию не умеет. Впрочем, это можно решить прогоном через дополнительную небольшую нейроночку. Но, это дополнительное время.

e2e_rnnt, да в ONNX, int8, через ONNX Runtime, торча в приложении нет, про разницу на декодере согласен, поэтому декодер написал свой, на Свифте 6 секунд речи разбираются за 0,08 с

Multilingual пробовал на тех же записях, английский она выдаёт кириллицей. Большую multilingual не гонял, если она пишет латиницей, можно попробовать как опциюю Если у вас есть опыт с ней, поделитесь

Свой декодер на Swift при ONNX int8 — это уже движок, а не обёртка, красиво. 6 сек речи за 0.08 — это порядка 75× быстрее реального времени.

По large_multilingual: руками не щупал, но по карточке ai-sage/GigaAM-Multilingual ответ, похоже, неутешительный — на английском и 600M-версия сильно хуже Whisper: FLEURS WER 9.4 против 3.9 у Whisper large v3, Common Voice 21.5 против 20.0. И токенизатор там посимвольный, общий на 70+ языков — если малая пишет английский кириллицей, large, скорее всего, тоже: это свойство тренировочных данных, а не алфавита (латиница в нём есть — узбекский же). Проверить можно за 10 минут вашими же записями, но чуда, боюсь, не будет.

Так что ваш стек, кажется, и так оптимален: русский на e2e_rnnt, а английские вкрапления — отдавать «Мозгу» на постобработку. Одна инструкция «верни правильное написание терминов» — и «агайл» превращается в Agile.

Диаризация есть?

в gigaam нет диаризации, вот пример как можно делать диаризацию https://github.com/antirek/calls-pipeline

Нет, Писарь про диктовку в один голос, диаризацию GigaAM сама не делает, нужен pyannote или похожее сверху, если будет запрос на расшифровку встреч, подумаю, но это уже другой продукт

Про Тайп не знал, спасибо и хорошо, что появляется ещё что-то на GigaAM, но к Сбёру он, судя по всему, отношения не имеет, или косвенное, подписан частным разработчиком, возможно их сотрудником.

Теперь зачем Писарь, во первых, два лучше чем один :) во вторых код у меня полностью открыт, берите, смотрите, дописывайте, в третьих размер: приложение 32 МБ против 575 у Тайпа. И главное, ради чего им пользуюсь я и все, кому раздал, это локальный Мозг. Нейронка (GigaChat или Qwen на выбор), котрую подгружаешь из меню и она живёт на твоей машине, работает быстро. Раньше я писал текст, копировал в gpt, просил причесать, копировал обратно. Теперь просто выделяю текст, зажимаю клавишу и говорю, что с ним сделать: причесать, сократить, перевести, результат встаёт на место, все локально интернет не нужен.

Это ваш перввый проект? Если да, то отличное начало.

Да это мой дебют, спасибо

Проверил - работает просто шикарно, быстро и без ошибок. Есть способ поддержать как-то проект?

Спасибо, за отзыв, для меня самая ценная поддержка это ваши комментарии, рад что заходит, пользуйтсь и делитесь на здоровье.

А можно как-то вместо микрофона подсунуть ему запись — аудио или видео со звуковой дорожкой?

В само приложение файл не подсунуть. Оно про микрофон. Зато есть консольная версия на том же ядре

github.com/moznoazachem/giga-pisar-cli

Скармливаете ей файл и получаете текст, понимает любой формат который знает ffmpeg. Видео тоже, звук вытащит сама, работает на процессоре. Длинные записи режет по паузам.

Есть такой проект https://verba.pw/ , уже все готовое и под все платформы и с gigam

Оно и англицизмы поддерживает ?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации