Обновить

Переводим книги нейронками для себя: год спустя. Словари, скорости и почему переводчики всё ещё нужны

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели10K
Всего голосов 17: ↑16 и ↓1+22
Комментарии17

Комментарии 17

У меня немного другая идея. Нейронка переводит текст по ходу чтения. С учётом возникающих комментариев пользователя и памятью о его замечаниях. А заодно сразу идёт обсуждение текста. Получается модель не переводим-читаем, а скорее этакое совместное чтение с агентом. Эксперементируем пока

эти словари собираются гигантскими, ... в формате оригинал = перевод, категория, род, примечания

Интересно, насколько они большие - по сравнению с объёмом самой книги и по количеству слов на произведение. Как вы их отдаёте LLM если они так велики. Как поступаете с синонимами (вероятно я не понял какую роль играют категория, род и примечание).

На три книги по 700-600кб текста - 300кб словарь с ограничениями от 10 повторов, потом я его вырезаю до 5-15кб текста. словари динамические - в чанк для перевода попадают только те слова что есть в чанке, причем они заменяются до начала перевода.

Привет ! Интересная статья... Извини, возможно чайнеццкий вопрос, но не мог бы ты описать конфигурацию своего сервера и сколько примерно это будет стоить ??? А то глянул, сами видеокарты идут за довольно гуманный прайс. Если и остальное тоже, хотелось бы с этим поиграться.

в моем случае это просто старый сервер в гараже , в который через удлинители воткнуты в pciex16 две видеокарты + турбинки для охлаждения карт и напечатные корпуса турбинок (теслы без вентиляторов - надо дорабатывать) + блок питания.
если дома - то вероятно rtx3090 будет разумнее. более ничего и не надо.

я бы для начала купил 2 API доступа к гуглу и qwen - и посмотрел на тестовой книжке сколько будет стоит перевод. он точно будет очень быстр и возможно недорог. проксиапи даже за рубли продают - дело 10 минут

А например с deepl качество сравнивали?

я же говорил выше, книги особенно фантастика она расползается по словам , тутАлиса, потом Элис, потом еще как. меня к примеру это бесит. Очень много книг переводят такими переводчиками, они есть , и даже потом доведенные они не дотягивают немного. читать можно но коробит.
или к примеру обсценная лексика, у некоторох авторов это фишка, но последние 2 тома перевода Империи вампиров от Джея Кристофа - полностью это убрали потому как нейронками перевели и не погрузились.

Несколько месяцев назад встретил вашу прошлую статью, и пробовал ИИ для перевода с английского, тем более был повод - непереведенные книги Брэндона Сандерсона в серии, первые книги которой я уже прочитал.
Вариант использования через API вместо ИИ агента мне был неудобен, в итоге навайбил через глм 5.2 собственный скилл, идеи в нем все те же - словарь, проверяемый пользователем, черновой перевод, затем полировка. Правда, автосоздаваемый словарь тянет уж слишком много терминов, в своем решении я даю это нейронке, она выбирает наиболее подходящие термины типа имен и названий, сразу их переводит и отдает человеку на проверку. Если что-то пропустила, то по ходу перевода добавляет в словарь и снова ждет утверждения.

Насчет потребления токенов - 1.5-2 миллиона каких токенов, с учетом кеша или нет? У меня выходило около 1-3/20/0.2 миллиона input/cache/output на книгу в 128 страниц epub (Snapshot от того же Сандерсона). Те книги, про которые я говорил в начале, раза в 2-4 больше, и токенов на них тратится тоже больше, не кратно, но всё же.
В переводах точно нужно пробовать разные модели, результаты могут быть совершенно нелогичными) Среди тех что пробовал, на удивление лучше всего переводила китайская Hy3 - намного более живой слог, чем у deepseek v4 flash 0731, хотя последний умнее по бенчмаркам.

та мне не будет кэша почти, вот пример
============================================================ 2026-09-02 00:57:23,881 - INFO - TRANSLATION METRICS REPORT 2026-09-02 00:57:23,881 - INFO - ============================================================ 2026-09-02 00:57:23,881 - INFO - Successful translations: 110 2026-09-02 00:57:23,882 - INFO - Failed translations: 0 2026-09-02 00:57:23,882 - INFO - Total tokens: 2,943,935 2026-09-02 00:57:23,882 - INFO - Retry tokens: 0 (0.0%) 2026-09-02 00:57:23,882 - INFO - Rechunk events: 0 2026-09-02 00:57:23,882 - INFO - XML repairs: 0 2026-09-02 00:57:23,882 - INFO - Language mismatch retries: 0 2026-09-02 00:57:23,882 - INFO -

Но тут надо погрузится какие токены, вход, выход и посмотреть как считает. если уж лезть глубже.

Очень интересно, спасибо!

Посмотрел гитхаб; сам занимался переводами.

Вопрос - я правильно понял, что словарь пока создается только через spacy и эмпириками и без перевода, а не через LLM с предположительными вариантами перевода? Второе было бы крайне удобно - чтобы сама сеть проанализировала на 0 проходе текст, и сформировала глоссарий. Потому что руками тяжко и долго.

У меня это сделано на сайте так - посмотрите, может что пригодится.

нет, не верно ) готовый словарь уже с переводом, ида он делается spacy+ частотники , а потом улетает в llm для перевода, его можно дополнять комментами, гендером и т.п., хотя гендер часто берется из синопсиса предыдущей главы.

готовый словарь уже с переводом, ида он делается spacy+ частотники , а потом улетает в llm для перевода

А можете подсказать, на каком этапе он делается? Потому что я так понял по документации, что сразу же идет первый этап перевода (включая Fast mode), но не понял, когда делается словарь.

И да - не хотите сделать опциональное заполнение словаря через LLM вместо spacy?

заполнение словаря через LLM вместо spacy?

Какие по-вашему положительные и отрицательные стороны у такой замены?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации