Обновить

Комментарии 4

Изучение английского по json книгам с озвучкой

Я тоже работаю в этом направлении, но, как всегда, в подобных случаях, со своими нюансами. Вместо «json книг с озвучкой» использую файлы базы данных, формата Sqlite, для загрузки их в свою обучающую программу, что позволяет работать с ними в трех основных режимах («Конспект», «Видео» и «Экзамен») и трех альтернативных (когда оригинал и перевод меняются местами) – http://lecole.free.nf/articles.php :

Обучающая программа «L'école» с простыми озвученными фразами на английском языке
Обучающая программа «L'école» с простыми озвученными фразами на английском языке

Для двуязычных книг предпочитаю html-формат, Эксэл-формат и видео формат:

Скриншот французского учебника грамматики на английском языке. Горизонтальное представление.
Скриншот французского учебника грамматики на английском языке. Горизонтальное представление.
Скриншот французского учебника грамматики на французском языке. Вертикальное представление.
Скриншот французского учебника грамматики на французском языке. Вертикальное представление.

Представление в Эксэл – аналогичное (преимущество – удобство редактирования и форматирования), а видео формат для видео-книг можно посмотреть на примере французско-русских глаголов: https://my.mail.ru/mail/emmerald/video/_myvideo/27.html .

В принципе, фразы книг можно делать очень короткими, что способствует лучшему сопоставления перевода – оригиналу:

Начало французской художественной книги «Красная лилия», Анатоля Франца
Начало французской художественной книги «Красная лилия», Анатоля Франца
Продолжение французской художественной книги «Красная лилия», Анатоля Франца
Продолжение французской художественной книги «Красная лилия», Анатоля Франца

Три недели вайбкодинга и 200$ ушло на проект.

Я предпочитаю использовать бесплатные ИИ-сервисы.

Хотя я не готовлю книги руками, создание книг даже с помощью нейросетей, это сложный многоходовый процесс.

У меня процесс создания двуязычных книг – следующий:

• Получаю регулярный текст на языке оригинала.

• Делаю его предобработку, с помощью собственного скрипта на Питоне.

• Перевожу с помощью «Гугл-транслэйт», в режиме «Текст», оригинальный материал. Кстати, это можно делать с помощью того же сервиса, но в режиме «Документ». Объем документов (pdf, xlsx, docx) до 10 Мб или до 300 страниц. В режиме «Текст» за раз доступно только 5000 символов. Но, режим «Текст» переводит точнее, там гораздо меньше литературной отсебятины, как в режиме «Документ».

Чтобы автоматизировать процесс, я использую запросы к «Гугл-транслэйт», в режиме «Текст», с помощью своих скриптов на Питоне. Задержку, между запросами выставляю – 11 секунд.

• Для исходного текста и его перевода я делаю их постобработку, с помощью того же Питона. Пытаюсь разделить длинные фразы на .короткие (сегментация) по знакам пунктуации и ключевым словам разделителям. Естественно, это не даёт полного соответствия, но сильно упрощает дальнейшую ручную правку двух текстов.

Правку можно делать в Notepad++ (в разных вкладках) либо в таблице «Ворда» с одной таблицей на лва столбца и одну строку, в которые я помещаю оригинальный текст и перевод. Эти способы работают, но, думаю, всё же написать свою программу типа «ПараТекст» для более удобного форматирования и сопоставления пары текстов.

• Имея сопоставление фразы разных текстов, можно уже легко сформировать двуязычную книгу любого формата.

P.S. если нужна озвучка для оригинальных фраз, то можно использовать бесплатные TTS-модели. Я применяю onnx-модели (в одной из последних статей, здесь, я описал эту технологию).

думаю, всё же написать свою программу типа «ПараТекст» для более удобного форматирования и сопоставления пары текстов.

в статье есть ссылка на мой сайт 2003 года, там покопайся и найдешь программу GoldenEggs это редактор с двумя окнами и он написан для удобного сопоставления текстов. Можешь посмотреть идею программы. А прогу напиши нейросетью.

Чтобы автоматизировать процесс, я использую запросы к «Гугл-транслэйт», в режиме «Текст», с помощью своих скриптов на Питоне. Задержку, между запросами выставляю – 11 секунд.

Используй gemmatranslate это локальная модель для перевода от гугл и на моем ryzen 3 3200g с 16гб без видеокарты работает замечательно. мои книги я переводил через чат в бесплатной нейросети и это долго. поэтому следующие буду через модель.

ну и на мой взгляд тебе пригодится почитать статью Как я упростил продукт в 10 раз.

Так учить бессмысленно. С таким же успехом можно смотреть фильмы на английском с русскими субтитрами. Эффекта от такого изучения 0

по фильмам с субтитрами лично мне сложнее сопоставлять слова и перевод, плюс у меня можно покликать отдельные слова для озвучки. по поводу бессмыслено учить - ну во первых я думаю мы вкладываем разный смысл в слово учить. давайте конкретно возьмем одну фичу моего проекта - это видеть речевые обороты, то есть устойчивые сочетания слов которые вместе имеют смысл отдаленный от пословного перевода. например room for milk это говорят официанту чтобы он оставил место под молоко в кружке кофе, а не комната для молока. count me in это я в деле, stay put это оставайся на месте, Let's meet at 9 o'clock sharp, это встретимся ровно в 9, а не в 9 остро. в общем смысл в этом методе есть. а то что вы считаете что метод бессмысленный, и эффекта от него 0, то есть обьективная оценка моего метода - это количество продаж. и пока вы абсолютно правы)

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации