Сергей Ю. Каменев@inetstar
Алгоритмист. Автор. Поставщик SSD, RAID, серверов.
Информация
- В рейтинге
- 22-й
- Откуда
- Москва, Москва и Московская обл., Россия
- Работает в
- Дата рождения
- Зарегистрирован
- Активность
Специализация
Бэкенд разработчик, Архитектор программного обеспечения
Ведущий
От 500 000 ₽
SQL
Python
Linux
MySQL
Базы данных
Golang
Высоконагруженные системы
ООП
Docker
PostgreSQL
На роутерах их не было.
Обычно говорят "С тобой/вами всё в порядке?".
Вот полное описание методики. там больше сотни контрольных точек на разные темы. И что касается именно этого пункта, то почти все ведущие сети не имеют с ним проблем.
Методика 1.4.0 — https://github.com/sukamenev/booktrans/blob/main/docs/bench/README.ru.md
Я доработал бенчмарк. Вот новая таблица. Она не сильно изменилась. Fable полднялась. Sol 5.6 сравнялся с Flash 3.8.
Astra 79,6
Sol 5.6 78,8
Gemini 3.8 Flash 78,2
Fable 5.1 76,0
Gemini 3.7 Flash 73,6
Opus 5.5 73,4
GPT-6 Sol 72,0
Kimi K2.7 Code 70,4
Muse Spark 1.3 64,8
DeepSeek V4 Flash 63,9
GLM 5.3 60,4
DeepSeek V4.1 Flash 60,4
Kimi K3 58,4
Hy4 55,2
Qwen 3.8 Flash 38,1
Haiku 36,5
Судья — GPT-6 Sol, по одному прогону на модель. Полная таблица с областями и штрафами в репозитории:
https://github.com/sukamenev/booktrans/blob/main/docs/bench/results-en-ru.md
Методика 1.4.0 — https://github.com/sukamenev/booktrans/blob/main/docs/bench/README.ru.md
В задании на перевод текст подсказывает: «“Shit,” said Siobhan, who never swore» — фраза держится на том, что тихая суперинтендантка впервые выругалась. Если по-русски она говорит «Чёрт», ремарка «которая никогда не ругалась» повисает: «чёрт» у нас говорят и те, кто не ругается вовсе. Нужна настоящая брань: «Дерьмо», «Вот дерьмо», «Твою ж мать».
По логике результаты переносимы, так как любая иностранная модель знает английский лучше русского.
Сейчас я сделал уже новую версию бенчмарка 1.4, в которой многие замечания учтены.
Ну, как покойник, например. Или отвратительно.
В обычном общении скорее спросят "Как ты?", чем "Ты в порядке?".
Многоточия теперь не учитываются. Это типографика.
В ключе 1.4.0 после переписывания A12 сказано прямо: «зелёная / зелёненькая» в смысле неопытности — верно, провал только если фраза читается как цвет лица или болезнь («выгляжу бледно-зелёной», «зелёная от болезни»).
Бенчмарк происходит внутри конвейера BookTrans, который требует перевода в метрическую систему, если не идёт речь об абстрактных миллионах миль. А если в одно предложении тонны и унции, то это дл ярусского - косяк.
По новому бенчмарку рейтинг почти не поменялся. Сол 5.6 встал почти вровень с Flash 3.8. Астра - лидер.
Вы правы. Готовлю следующую версию бенчмарка, где этой проверки не будет. В текущем бенчарке она снимет 1 балл у большинства моделей. То есть рейтинг не поменяется.
Что самое крутое для русского языка?
Чтобы сервер "дышал". На нём ещё и другие процессы крутятся.
Что такое LSB?
Потенциально, конвейер переводит с любого языка на любой. Так что, давайте пробоват, нужно какое-то великое ранобе не имеющее перевода. В группу, в Request FREE translation закиньте такое, пожалуйста.
Opus даже в теории не был рассмотрен, а зря. Он образнее переводит, чем Sol. А Flash 3.7 лучше, чем Pro 3.1 (про создана в январе 2026)
И есть какие-то профильные сайты, которые исследуют качество перевода английский -русский для ведущих LLM? Поделитесь.
Думаю, вы на таком сайте прямо сейчас.
Вот что говорил человек. Он как раз 1.5 дня назад обновился.
В тексте есть дописка про 3.8. Она не лучше, чем 3.7 для перевода.
Спасибо за критику. Улучшил структуру конвейера.
Nano banana
А где вы там нашли прямые запросы к модели? Они же вынесены в папку promts.
Если о пользовательском запросе через --pt, то это нормально.
Код, конечно, есть куда улучшать. Но он хорошо работает уже сейчас.
Более высоий уровень размышлений уменьшает число правок у опуса-судьи-редактора, но он не выгоден. Лучше (и скорее всего дешевле), опус на high, чем соннет на max.