У некоторых, особенно, старых сотрудников акции, которые они могут продать обратно в OpenAI даже до IPO. Соответственно, их крайне интересует, чтобы капитализация была повыше.
Слева — результат работы Google Translate. Справа — текст с вашего сайта.
Есть даже совпадающие слово в слово абзацы. Их примерно треть от числа общих.
В остальных случаях различия минимальны: «LOL»/«лол», «програмное обеспечение»/«инструментарий» и так далее. Исправлены косяки машинного переводчика, который не разбирается в техническом жаргоне.
Иногда изменения ради изменений: вместо «проще.» стоит «проще, верно?». Но вообще структура предложений полностью совпадает.
Там по ссылке перевод, похожий на машинный, от пользователя, имевшего привычку размещать переводы, похожие на машинные. Так что ничего дурного в дублирующем переводе в данном случае нет.
собственно, оно и в обсуждаемой статье понятно откуда происходит - в качестве метрики выбран exact match, с-но, в рамках этой метрики между "сеть совсем не угадала" и "сеть почти угадала" разницы нет - и то и другое идет в unmatch.
В оригинальной работе по эмерджентным способностям в приложении A2 есть результаты бенчмарков с partial credit. Демонстрируется то же самое.
В ответе Джейсона выбор exact match обоснован так: чаще всего важны в первую очередь точные совпадения. Если упрощать до простых примеров, то на вопрос «15 + 23» нужен ответ «38». Конечно, 37 — это близко, но нет смысла давать за это какие-то баллы. А вот выбор альтернативных «суррогатных» метрик наоборот, может создать иллюзию роста способностей.
Если показать плавность для каких-то задач, то это не значит, что плавный рост существует для всех. Джейсон Вэй указывает, что для задачи по транслитерации частота ошибок падает резко. Как он считает, предсказать такое невозможно.
Вообще, само «опровержение» никак не отрицает существование эмерджентных способностей. Говорит это даже не Джейсон Вэй, а один из соавторов «опровержения».
Ну и дальше по тексту Вэй отвечает на все остальные претензии про выбор логарифмической шкалы и про выбор датапойнтов. Не играет роли также выбор логарифмической шкалы. Джейсон публикует график с линейной шкалой, где видно ровно то же самое. Моделей же просто не так много, чтобы была возможность демонстрировать настолько плавные переходы с кучей точек на графиках.
Вот как раз таки закопирайченного материала там не обнаружилось. Ну или такой вопрос в исследовании никто не поднимал. К примеру, «Ворон» Эдгара Аллана По опубликован в XIX веке, ещё встречаются куски каких-то текстов с веб-сайтов или что-то типа дампов «Википедии».
Прикладываю сравнение случайного фрагмента в переводе через Google Translate (слева) и в вашем переводе (справа).
Вижу: совпадения целых абзацев, если различия есть — на уровне слов и словосочетаний, но никогда не на уровне конструкции предложения. Не думаю, что такие совпадения возможны даже на уровне эквивалентности перевода-подстрочника.
Здесь различий вижу больше, чем в других случаях, но общий уровень примерно тот же. Сто́ит отметить, что в комментах прозвучали многочисленные возгласы про общую негармоничность звучания ПЯ, языка перевода (1, 2, 3, 4). Вероятно, что текст мог быть исправлен позднее.
Текст про бан Python — детально рассмотрен выше. Ну да бог с ними со сравнениями, давайте его хоть почитаем:
Я давно работаю в компьютерной индустрии и имею немалое количество контактов. Трое друзей, работавших в Meta** (двое нынешних, один бывший), предложили мне проверить это.
Разница с переводом Google Translate этого абзаца — только словосочетание «некоторое время» вместо «давно». Но давайте его хоть прочитаем.
Что такое «это» в конце? Что проверить, тот факт, что у него немалое количество контактов? Звучит странно.
Почему «работавших в Meta»? Два из них до сих пор там работают. Время причастия неправильное. Правильнее было бы перефразировать в что-то вида «трое друзей из Meta, один бывший, два сейчас там работают».
Структура предложений и порядок слов вообще те же самые. Есть только редкие различия в некоторых словах. В абзаце иногда бывают различия лишь в одном–двух словах.
Совпадающие ошибки. К примеру, Meta (компания) в машинном переводе получается мужского рода, но и у автора тоже мужского. Ошибка необычная: в русском языке даже без уточнения родового слова интуитивно хочется определить Meta как слово грамматически женского рода.
Также к переводу ничего ни прибавить, ни убрать. А иногда хочется добавить пояснения с другими источниками (откуда у этого дядьки взялись контакты в «Фейсбуке»? нужна мини-биография) и убрать несколько раз повторённые моменты.
Наконец, иллюстрация из DALL-E у Лернера страшная и с явными анатомическими ошибками. Я взял получше.
Расширил этот абзац, спасибо.
У некоторых, особенно, старых сотрудников акции, которые они могут продать обратно в OpenAI даже до IPO. Соответственно, их крайне интересует, чтобы капитализация была повыше.
Может и быть. Там же написано «может» — очень обтекаемая формулировка.
https://www.diffchecker.com/3PR8ktIY/
Слева — результат работы Google Translate. Справа — текст с вашего сайта.
Есть даже совпадающие слово в слово абзацы. Их примерно треть от числа общих.
В остальных случаях различия минимальны: «LOL»/«лол», «програмное обеспечение»/«инструментарий» и так далее. Исправлены косяки машинного переводчика, который не разбирается в техническом жаргоне.
Иногда изменения ради изменений: вместо «проще.» стоит «проще, верно?». Но вообще структура предложений полностью совпадает.
Там по ссылке перевод, похожий на машинный, от пользователя, имевшего привычку размещать переводы, похожие на машинные. Так что ничего дурного в дублирующем переводе в данном случае нет.
Вы читали текст?
Вы на Хабре пишете только вопросы в комментариях?
Владельцам сайтов пора учиться: XSS нужно просто запретить в пользовательском соглашении.
Это совсем не недавнее: на эту статью ещё весной успел ответить Джейсон Вэй, один из соавторов работы про эмерджентные способности.
jasonwei.net/blog/common-arguments-regarding-emergent-abilities
В оригинальной работе по эмерджентным способностям в приложении A2 есть результаты бенчмарков с partial credit. Демонстрируется то же самое.
В ответе Джейсона выбор exact match обоснован так: чаще всего важны в первую очередь точные совпадения. Если упрощать до простых примеров, то на вопрос «15 + 23» нужен ответ «38». Конечно, 37 — это близко, но нет смысла давать за это какие-то баллы. А вот выбор альтернативных «суррогатных» метрик наоборот, может создать иллюзию роста способностей.
Если показать плавность для каких-то задач, то это не значит, что плавный рост существует для всех. Джейсон Вэй указывает, что для задачи по транслитерации частота ошибок падает резко. Как он считает, предсказать такое невозможно.
Вообще, само «опровержение» никак не отрицает существование эмерджентных способностей. Говорит это даже не Джейсон Вэй, а один из соавторов «опровержения».
Ну и дальше по тексту Вэй отвечает на все остальные претензии про выбор логарифмической шкалы и про выбор датапойнтов. Не играет роли также выбор логарифмической шкалы. Джейсон публикует график с линейной шкалой, где видно ровно то же самое. Моделей же просто не так много, чтобы была возможность демонстрировать настолько плавные переходы с кучей точек на графиках.
Прочитайте текст, пожалуйста, там объясняется, почему это неожиданно.
Где про это можно почитать?
Вот как раз таки закопирайченного материала там не обнаружилось. Ну или такой вопрос в исследовании никто не поднимал. К примеру, «Ворон» Эдгара Аллана По опубликован в XIX веке, ещё встречаются куски каких-то текстов с веб-сайтов или что-то типа дампов «Википедии».
Добавил слово «примерно», спасибо.
Буквально любая версия лучше, чем забагованная Half-Life: Source.
Лучше мне молоко несите за вредность производства. Я ведь выложил только один скриншот — эта истерика в личке у меня продолжается до сих пор.
Ваше поведение возмутительно. Угрозы физической расправы — это предел моего терпения.
Я так понимаю, фразой про 20 минут вы признаёте, что перевод машинный.
У меня проблемы с вашими переводами.
Последние три перевода на вашем аккаунте похожи на машинные.
Текст: Lotus 1-2-3 для Linux.
Прикладываю сравнение случайного фрагмента в переводе через Google Translate (слева) и в вашем переводе (справа).
Вижу: совпадения целых абзацев, если различия есть — на уровне слов и словосочетаний, но никогда не на уровне конструкции предложения. Не думаю, что такие совпадения возможны даже на уровне эквивалентности перевода-подстрочника.
Текст: Как я сделал переполнение кучи в curl.
Сравнение всего текста (слева — Google Translate, справа — ваш перевод).
Здесь различий вижу больше, чем в других случаях, но общий уровень примерно тот же. Сто́ит отметить, что в комментах прозвучали многочисленные возгласы про общую негармоничность звучания ПЯ, языка перевода (1, 2, 3, 4). Вероятно, что текст мог быть исправлен позднее.
Текст про бан Python — детально рассмотрен выше. Ну да бог с ними со сравнениями, давайте его хоть почитаем:
Разница с переводом Google Translate этого абзаца — только словосочетание «некоторое время» вместо «давно». Но давайте его хоть прочитаем.
Что такое «это» в конце? Что проверить, тот факт, что у него немалое количество контактов? Звучит странно.
Почему «работавших в Meta»? Два из них до сих пор там работают. Время причастия неправильное. Правильнее было бы перефразировать в что-то вида «трое друзей из Meta, один бывший, два сейчас там работают».
Уж очень тот перевод похож на машинный. Ну хотя бы в diffcheck с вариантом из Google Translate различия подозрительно минимальны:
Нашлись три дословно совпадающих абзаца.
Структура предложений и порядок слов вообще те же самые. Есть только редкие различия в некоторых словах. В абзаце иногда бывают различия лишь в одном–двух словах.
Совпадающие ошибки. К примеру, Meta (компания) в машинном переводе получается мужского рода, но и у автора тоже мужского. Ошибка необычная: в русском языке даже без уточнения родового слова интуитивно хочется определить Meta как слово грамматически женского рода.
Также к переводу ничего ни прибавить, ни убрать. А иногда хочется добавить пояснения с другими источниками (откуда у этого дядьки взялись контакты в «Фейсбуке»? нужна мини-биография) и убрать несколько раз повторённые моменты.
Наконец, иллюстрация из DALL-E у Лернера страшная и с явными анатомическими ошибками. Я взял получше.
Сейчас должно работать.
Поправил, спасибо.
Идея в том, чтобы для сетки из тысячи ботов нужно было найти тысячу банковских карт и тысячу телефонных номеров. Так затею объясняет сам Маск.