Обновить
16K+
16
Eduard@Kubataba

Пользователь

14,1
Рейтинг
5
Подписчики
Отправить сообщение

Опубликовали Сборку 8 — что изменилось и что тестировать

Синтезированный звук из предыдущих сборок очищен и создастся заново при первом воспроизведении — это ожидаемо, не баг. Книги, записи и импортированное аудио не тронуты.

  1. Перевод звучит из подготовленного файла. Перевод → «Слушать» или «Показывать и слушать». Регулятор скорости в плеере теперь действительно меняет темп перевода, и не должно пропускаться ни одного предложения, короткого абзаца или пункта списка.

  2. Подсветка слов следует тому тексту, который на экране. При чтении — за произносимыми словами. При дубляже поверх видео или подкаста — за оригинальной записью, синхронно.

  3. Нет остановок между абзацами. Запустите главу (лучше такую, где первый абзац длинный) и просто слушайте несколько минут, ничего не нажимая. Если всё же встанет и потребует Play или тапа — сообщите книгу, номер абзаца и примерное время.

  4. Нейроголоса стартуют на первом абзаце. Выберите Silero или Piper, начните главу с начала. После нескольких секунд «Preparing voice…» абзац должен зазвучать сам, без нажатия кнопки ER.

  5. Заблокированный экран. Запустите воспроизведение, заблокируйте экран на несколько минут, разблокируйте. Чтение и прогресс должны идти без сбоев.

  6. Выбор голоса перенесён в карточку книги. «Default Voice» теперь рядом с «Source Language», список отфильтрован по языку книги, есть переключатель «показать все языки». На автоопределении сначала спросит язык.

  7. Импорт .fb2.zip. Импортируйте архив с книгой напрямую, не распаковывая. Проверьте название и главы.

  8. Скорость открытия настроек. Тап по шестерёнке — экран должен появляться мгновенно.

  9. Импорт и голоса. EPUB/PDF/TXT, статья по ссылке, новостная или подкаст-лента. Apple-голоса и загрузка нейропака в Настройки → Silero Voices (или Piper Latvian).

  10. Языковые паки, пунктуация, иммерсивный ридер. Первый импорт книги на неанглийском тихо докачивает словарный пак (0,1–5 МБ) — после этого нажмите «Analyze content» и проверьте разбор слов в иммерсивном ридере. Настройки → Transcription → «Neural Punctuation», затем распознайте запись (главная цель — русский). Попробуйте чат и аналитические слои.

Сообщайте о любых странностях в звуке, вылетах, зависаниях, неверно определённом языке и проблемах интерфейса — с моделью устройства и версией iOS. Требуется iOS 18.6 или новее.

Готовим к выпуску 8 версию на этой неделе - Добавим режим перевода live - будет перевод и синтез на русском чтобы синтез успевал подхватывать без перевода всей книги и разогрева телефона - идея включаете в плеер три точки - перевод выбираете Listen только слушать перевод Booth слушать и видеть русский текст - приложение будет переводить и синтезировать параллельно без длительного ожидания - в эту же версию добавим fb2.zip .

Большое спасибо за отзыв и именно такие комменты определят каким будет приложение к окончанию тестирования. По шестеренке - посмотрю как ускорить - на симуляторе и на 15 про макс тормозов не было. Словарь ударений - в настройках той самой шестеренке - есть Russian Stress Dictionary - там две колонки магглов* м+агглов - ударение ставим перед гласной, а звездочка это все слова таким же началом маггловский. Этот словарь меняет ударения для всех таких слов в тексте - но если слово омограф - туда лучше не заносить. Мы очень ждем обновление акцентора от Силеро - они обещают улучшение омографов. По fb2.zip добавим в форматы раз это популярно. По маленьким кнопкам - пытались разместить все функции - но уже несколько просьб увеличить - подумаем как. Еще вопрос на каком языке слушали и какие голоса понравились, помогает ли вам разбивка глав на сцены ?

Из системных Милена улучшенный голос самый приятный русский по мне. А так рекомендую ставить Silero - там все нейтронные голоса говорят по русски и есть отличные - можно послушать на сайте. Но обязательно надо скачивать модель для ударений русских - без них синтез будет ужасный! И кстати, если транскрипты русские нужны, то надо и пунктуатор Silero скачивать - Apple не имеет знаков препинания для русских транскриптор, а с Silero текст будет с точками и запятыми. Скачивать можно в настройках приложения - кнопка с шестеренкой.

И еще в телефоне выполняется эвристическая обработка почти без ЛЛМ - она легкая и создание эмбедингов самая тяжелая ее часть - это около 1 минуты на книгу 500 страниц и вы сразу получаете размеченную по сценам передачу или главы книги. Это позволяет сразу видеть о чем это - так как название сцен это ключевое предложения из них, а в атмосфере видны все персонажи, статистика и главные леммы по важности из текста. По факту с таким приложением вам не нужен ни сервис транскрипции ни перевода ни суммаризации - все доступно локально на вашем телефоне. И потом возможность сохранить статью локально без рекламы и читать или слушать без баннеров само по себе приятно.

По секрету у меня как у разработчике в приложение сразу встроена CLI для обработки файлов локально на мак мини. Понятно что такая комбинация не знает о перегреве который настигает телефон через 10-20 минут транскрипции или перевода. И на ПК я при создании say файла с эмбедингами из книги использую локальную модель для валидации границ сцен, разметки ключевых предложений и разметки персонажей по каждому предложению. Я подумаю как сделать такой дуэт доступным для всех пользователей. И в планах издавать в формате say с эмбедингами и разметкой тексты публичных книг - таких как Остров сокровищ или Затерянный Мир. Главное преимущество нашего формата - один раз модель обрабатывает и размечает книгу и потом семантическая таблица доступна в самой книге без необходимости повторного анализа.

Силеро как всегда молодцы - выкатили кавказскую модель на 15 языков для которых практически нет синтезаторов кроме их модели CIS . Синтезировал кабардинский и адыгский контрольный текст - скорость на мак мини 80х качество синтеза очень высокое у всех спикеров - ошибок практически нет. Одна удивительная особенность - спикеры на адыгском и абазинском читают кабардинский текст не хуже родных спикеров - так что по факту у нас не 3 голоса а целых 7 пригодных для кабардинского языка. Что еще интереснее синтез кабардинского спикерами осетинского ингушского чеченского почти идеален с небольшим акцентом - но вполне пригоден. Не знаю как ученные а на мой слух версия о едином про северкавказском корне у этих языков кажется вполне убедительной.

Да адыгейский и кабардинский единый исходный язык , но они разошлись достаточно давно, так что разница существенная наверно можно сравнить с русским и белорусским. Я понимаю его достаточно хорошо, там есть ряд замен которые надо знать, чтобы понимать и с гласными там еще хуже чем в кабардинском - их почти нет. Адыгейский более архаичный он конечно близкий родственник, но грамматика своя например Нэху по кабардински свет в адыгейском присходит замена на Ф - Нэфын если ты об этом не знаешь то переведешь как слепой, а не свет :) можно погонять в Яндекс переводчике https://translate.yandex.ru/?source_lang=ru&target_lang=ady&text=свет

Добрый день , спасибо за обновление ! Интонации вопросительных предложений значительно улучшат натуральность синтеза - а возможность выделения ключевых слов подтвердит что Силеро лидер доступных решений синтеза на русском языке ! Очень ждем ваше обновление омографов для русского языка !

модель ставит обычное произношение в этой фразе корректно

📖 Loading vocabulary from /opt/homebrew/lib/python3.11/site-packages/ruaccent/model/vocab.json...

   Vocabulary size: 224

🤖 Initializing model...

📦 Loading weights from /opt/homebrew/lib/python3.11/site-packages/ruaccent/model/acc_model.pt...

✅ Accentor initialized successfully!

Э'то моя' ипоста'сь

Спасибо за оценку, вчера поздно выгружал и упустил, но вы помогли быстро устранить ошибку.

Прогнал "стресс-тест" на 50 уникальных предложениях, чтобы обойти кэширование и проверить именно чистую работу нейросети на посимвольном анализе. Результаты ниже:

  1. Морфологическая интуиция: Тест на "Глокой куздре" пройден корректно. Модель верно расставила ударения в несуществующих словах (Гло'кая куздра' штеко' будла'нула), что подтверждает к обобщающую способность.

  2. Устойчивость к "грязным" данным: Опечатки в словах и смешанный регистр (мгази'нзАбО'рЧиКоМ) не сбивают модель — она корректно восстанавливает позицию ударения по контексту символов.

  3. Омографы: Порадовало разрешение омографа в связке мо'лол муку'. Контекст "мельницы" считан верно.

  4. Производительность: Без кэша на MPS около 440 симв/сек (в среднем 98 мс на фразу). Для посимвольной модели потребуется около 30 минут на книгу.

Лог тестов прилагаю:

text

============================================================
Loading Custom Accentor
============================================================
✅ Using Apple MPS (Metal)
📖 Loading vocabulary from /opt/homebrew/lib/python3.11/site-packages/ruaccent/model/vocab.json...
   Vocabulary size: 224
🤖 Initializing model...
📦 Loading weights from /opt/homebrew/lib/python3.11/site-packages/ruaccent/model/acc_model.pt...
✅ Accentor initialized successfully!

🚀 Запуск теста на 50 УНИКАЛЬНЫХ предложениях (без кэша)...
============================================================
⏱  Чистое время обработки: 4.8993 сек
📊 Среднее на фразу: 97.99 мс
🚀 Скорость: 439 симв/сек
============================================================
-> Вчра я пошл в мгази'н за вксуны'м кфе.
-> Прграмми'ст нписа'л кд на я'зке Питн.
-> Тэо'Т тЕкст НаПиСа'н зАбО'рЧиКоМ дЛя ПровЕ'рКи.
-> Шла Са'ша по шоссе' и соса'ла су'шку.
-> The quick bron fox jumps ove ver the lazy dog.
-> Устано'вка Xindoms заверши'лась с крити'ческой оши'бкой 0x0001.
-> Ква'нтовая суперпози'ция электро'на в а'томе водоро'да.
-> Архите'ктор Растре'лли спроекти'ровал Зи'мний дворе'ц.
-> В антаркти'де пингви'ны гре'ются друг о дру'га.
-> Синхрофазотро'н испо'льзуется для ускоре'ния элемента'рных ча'стиц.
-> Ма'ма мыла' ра'му чи'стым мы'лом до'лго.
-> Гло'кая куздра' штеко' будла'нула бокра'.
-> Битко'ин и эфи'риум обвали'лись на криптоби'рже.
-> Ста'рый ме'льник мо'лол му'ку на ме'льнице.
-> Ю'ный натура'лист изуча'л пова'дки ди'ких живо'тных.

Обновил версию 1.2.0 перенес файлы модели в папку акцентора и теперь модель корректно скачивается с пакетом. Обновите командой pip install ruaccent-predictor --upgrade или pip uninstall ruaccent-predictor и потом обновите pip install ruaccent-predictor==1.2.0

Убрал из статьи упоминание о ручной разметки - валидировал отобранные пары, но не вручную, а перепроверяя через silero stress при фильтрации

К сожалению какой датасет был такой и использован, по мере озвучки книг и исправления ошибок буду обновлять датасет парами с ручной разметкой и переобучать при необходимости. Попытаюсь еще валидировать разными акценторами отобранный датасет.

📖 Loading vocabulary from model/vocab.json...

   Vocabulary size: 224

🤖 Initializing model...

📦 Loading weights from model/acc_model.pt...

✅ Accentor initialized successfully!


Зале'й э'тот commit в ве'тку.

Добрый день, нашел баг с относительными путями в коде - сейчас обновлю

Модель понимает и русские и аншлийские символы

Эту же модель можно попробовать дообучить и на поэзии - вопрос нужен хороший датасет. Что касается LLM - это долго и дорого - символьная модель запускается локально и работает относительно быстро.

Добрый вечер, спасибо за комментарий -

✅ Accentor initialized successfully!

В лесу' родила'сь ёлочка

Ваш вариант ударения относиться к ограничению модели -

  • Авторская метрика vs обычное произношение

Если вы поставите ударение в предложении - Моя дочь родилась в Москве - вы услышите что в обычном произношении правильно родила'сь

1

Информация

В рейтинге
554-й
Зарегистрирован
Активность

Специализация

Разработчик мобильных приложений, Инженер по автоматизации тестирования
Средний
Python
Английский язык
Алгоритмы и структуры данных
C++
Базы данных