Комментарии 15
Вчера каждый уважающий себя программист писал парсер json. А сегодня - систему распознавания речи
Это не просто система распознавания речи — она также позволяет улучшать текст с помощью внутренних ресурсов. Например, если у вас есть подписка на Claude Code, на Claude или на ChatGPT, можно просто подключить Codex или Claude Code, и их возможности будут использоваться для улучшения текста внутри приложения.
Также можно подключить внешний ИИ — например, через провайдера. По результатам тестов расход на это небольшой: не более 100 рублей, даже если диктовать много.
Кроме того, пока в демоверсии есть небольшой проект — FreeAI, посмотреть его можно на GitHub. Подобные системы есть и у других, но здесь система сама сканирует провайдеров, в том числе бесплатных. У разных провайдеров есть разные модели, поэтому можно выбрать подходящие модели или подключить свою — система будет распределять запросы по бесплатным лимитам.
Этого более чем достаточно для личного использования, если развернуть систему у себя. При необходимости я могу это протестировать. Интересно здесь то, что платить вообще не придётся.
Со своей стороны, это скорее не разработка приложения в том смысле, в каком её понимаете -- каждый уважающий себя программист, — например, парсер, как вы говорите, или систему распознавания речи. У меня было наоборот: я вернулся к проекту и сделал его более-менее аккуратным и более-менее устойчивым, а также улучшил распознавание речи.
Я пользуюсь этим проектом самостоятельно на постоянной основе. Мои близкие, которым я его дал, пользуются им на постоянной основе, но очень довольны всем, что есть, поэтому у меня есть некоторая обратная связь от них. Соответственно, я планирую и дальше развивать этот проект по мере обнаружения багов.
По сути, весь основной функционал уже есть и, на удивление, работает очень хорошо. Если появляются какие-то баги, я сразу же их исправляю.
В день я в среднем диктую по 70–100 сообщений, а то и больше, и многие из них достаточно большие.
Поэтому, да, действительно, как вы и говорите: раньше каждый уважающий себя программист писал парсер, а теперь — систему распознавания речи. Хотя это не совсем система распознавания речи — это система распознавания с возможностью структурирования с помощью нейронных сетей.
Для примера: то, что я сейчас сказал, тоже надиктовано с помощью этого приложения и структурировано им же.
Завтра все будут клепать своих локальных агентов для автодополнения кода)
Как альтернативу можно упомянуть https://handy.computer/. Пользуюсь на десктопе. Довольно удобно. Пока не нашел модель для него, которая хорошо справляется с распознаванием it-жаргона и англицизмов. Приходится диктовать на литературном русском.
Соглашусь с вами только частично. Основное отличие – это возможность ИИ модернизации текста. Часто приходится работать с коллегами и заказчиками, диктуя им текст и структурируя его, что занимает время. Данное приложение позволяет выполнять эту операцию полностью автоматически одним нажатием.
Также хотел бы оставить небольшой комментарий: вы можете дополнительно настраивать сам промпт прямо в приложении. У вас написаны IT-жаргон и англицизмы, а стандартные нейросети хорошо справляются с такими вещами. Тем более, если вы современный программист, у вас наверняка есть нейросеть.
Если нет — в комментарии выше я описывал одну из систем, которая позволяет получать бесплатные API из доступных. Это простой проект; при необходимости я могу предоставить к нему доступ для вашего личного теста. Он пока находится в тестировании (в бета-версии), но тем не менее получает бесплатный доступ к нейросетям в рамках их лимитов. Если лимиты закончились или какая-то из нейросетей не отвечает, система автоматически переключается на другую, выполняет по ним автосканирование и периодически обновляется. Поэтому, по сути, там есть постоянный доступ, что может помочь вам в работе.
телефону и боту нужен кто-то, кто распознает
Относительно свежий ведроид телефон всё-таки и сам достаточно производителен для локального распознавания. FUTO Voice Input, например, всё делает локально.
Я полностью согласен. То же самое можно сказать даже о встроенном распознавателе речи Google в Android: он не выполняет структурирование текста — не убирает ошибки, не структурирует и так далее. Это одна из важных функций и возможностей данного приложения.
Также хотелось бы упомянуть качество самого распознавания. Встроенное распознавание речи может работать, однако качество в данном приложении будет выше, поскольку используется Whisper Large третьей версии, у которого меньше проблем. Как я говорил ранее, это приложение в первую очередь сделано для компьютера, но есть возможность добавить, например, телефон. Кроме того, в Telegram есть бот, которому вы передаёте токены: всё работает через компьютер, через сервер, а далее — через Telegram или приложение на телефоне.
Так, вы коменты через ИИ пишете?
Ещё для локального распознования речи на Android есть приложение с открытым исходным кодом Offline Voice Input. Преимущество в том, что можно устанавливать разные модели распознавания в формате GGUF для transcribe.cpp (также как, например, в десктопном Handy). Также есть прикольная фича субтитры в реальном времени для любого приложения (например, можно включить субтитры в Twitch).
Спасибо за отзыв. Как я уже отмечал, Android — это дополнительная возможность. В основном я использую систему распознавания Windows на компьютере. Поддержка Android добавлена лишь для удобства работы с телефона. Это надстройка над основным функционалом, а не его основа. Главная цель — использование на компьютере, что позволяет существенно ускорить и упростить процесс написания текстов.
Если говорить откровенно, Android-версию я разработал и интегрировал исключительно по одной причине: моя мама захотела использовать это приложение. Поэтому я использовал как Telegram, так и Android. Распознавание речи на телефоне было необходимо в первую очередь ей, а также некоторым сотрудникам, с которыми я работаю. Им было бы удобно использовать Telegram и Android для этой цели.
Я полностью согласен с тем, что на Android существуют локальные решения, однако, как мы знаем, они не всегда показывают лучший результат, особенно если речь идет не просто о диктовке текста. Есть официальные встроенные решения, но в моем случае ситуация иная. Я часто диктую текст с помощью CGPT, постоянно печатаю код и выполняю рабочие задачи, требующие структурирования текста и исправления ошибок. Это занимало значительное время.
Я реализовал приложение таким образом, чтобы оно было удобным. В нем используется искусственный интеллект, который позволяет структурировать текст и выявлять ошибки в зависимости от выбранных параметров. Также есть возможность структурировать предыдущее введенное сообщение, что упрощает работу. Локальные решения, как правило, более стабильны, чем тот же CGPT, который может работать только до 10 минут, в то время как иногда требуется диктовать гораздо больше.
Приложение быстро загружается и выключается, и существует множество способов для реализации распознавания речи. Можно выбрать нужную модель и запустить распознавание. Удобство использования также играет важную роль: автозапуск, включение и выключение, перезагрузка, а также интерфейс, который позволяет видеть, что вы диктуете в течение определенного времени.
Кроме того, приложение поддерживает интеграции и обработку файлов, например, преобразование видео в текст. Важно также наличие истории работы с приложением и возможность настройки интерфейса: изменение размера, выбор светлой или темной темы, а также настройка расположения панели записи. Язык интерфейса можно выбрать как английский, так и русский. Окно, которое всплывает, достаточно компактное, но информативное.
Все кнопки и функции приложения основаны на моем личном опыте, что и стало причиной его создания. Главная особенность заключается не только в распознавании речи, но и в качестве этого распознавания. Важно отметить, что приложение может работать с искусственным интеллектом, что является значительным преимуществом. Пользователи могут настраивать промпты, отправляемые на обработку, что позволяет учитывать специфические термины, используемые в вашей команде.
В дальнейшем был создан сервер, который позволяет работать не только локально, но и глобально, а также проект FreeAI, предоставляющий бесплатные API с возможностью проверки в заданные промежутки времени. Android-приложение служит интерфейсом для взаимодействия. Я согласен с мнением комментаторов, что распознавание можно сделать быстрее, но нейронные сети, используемые в приложении, достаточно удобны.
Обновления происходят автоматически, без необходимости дополнительной загрузки. Если меня что-то не устраивает, я постоянно адаптирую приложение под свои нужды, учитывая комментарии пользователей. Важно также, что вы можете выбрать модель распознавания, а не просто место, где оно будет происходить. Все эти аспекты в совокупности предоставляют значительные преимущества по сравнению с другими приложениями, которые я смог найти, включая те, которые упоминались в комментариях. Возможно, некоторые из них удобнее, но с такой же логикой работает встроенное распознавание текста в Windows.
Случайный порт для общения электрона с питоном это ок, но локальные сокеты работают надежнее и не триггерят параноидальные виндовые фаерволы

Я печатаю медленнее, чем думаю: локальная диктовка на Whisper для Windows, телефона и Telegram