Обновить

Смотрим на конспирологическую теорию о том, что авторство “12 стульев” и “Золотой телёнок” принадлежит М. Булгакову

Время на прочтение3 мин
Охват и читатели12K
Всего голосов 10: ↑9 и ↓1+13
Комментарии90

Комментарии 90

а для меня Булгаков - это продолжение Гоголя. Можно тоже проверить не Гоголь ли Мастера и Маргариту написал, наверно.

Гоголь "Мёртвые души" также в анализе стоит, см. 5-ю строками выше от Ильфа/Петрова на изображ. Или скачайте приложенный на гугл диск файл и проверьте.

Сходство по кластеризации всего 9%, т.е. тексты разных авторов. Но тут я бы на одну кластеризацию не полагался, Именно в этом произведении в моем экземпляре (текст от издания 2002г) у текста аномально высокое лексическое разнообразие для произведения 19 века, т.е. редактура внесла немалый шум.
Сходство по кластеризации всего 9%, т.е. тексты разных авторов. Но тут я бы на одну кластеризацию не полагался, Именно в этом произведении в моем экземпляре (текст от издания 2002г) у текста аномально высокое лексическое разнообразие для произведения 19 века, т.е. редактура внесла немалый шум.

По атмосфере/антуражу также "МиМ" не сильно коррелирует с "Мертвыми душами"

Тепловая карта антуража:: сходство и различия текстов по тематике и атмосфере на основе анализируемых файлов (всегда лемматизирует тексты, группирует схожие произведения и выполняет их детальное попарное сравнение).
Тепловая карта антуража:: сходство и различия текстов по тематике и атмосфере на основе анализируемых файлов (всегда лемматизирует тексты, группирует схожие произведения и выполняет их детальное попарное сравнение).

Другие тексты Ильфа и Петрова не стали добавлять в сравнение?

На романах (из-за большой длины текстов) авторский почерк лучше всего снифится. У Ильфа/Петрова из романов общеизвестные упомянутые 2 - про Остапа Бендера и, кажется, всё остальное рассказы.

Скачать и склеить рассказы Ильфа/Петрова, прогнать на общую оценку и смотреть на множество других метрик, тем более в ПО они реализованы, но я посвятил пост именно кластеризации: см. комментарий от Хабраюзера, он его оставил его к упрощённому, классическому алгоритму, описанному в той статье.

Нда, жаль, что Ильф и Петров не написали больше ничего сравнимого. Но "Одноэтажная Америка" по объему близка к романам. Если алгоритмы претендуют на анализ именно уникального авторского стиля, другой жанр не должен быть помехой.

У Ильфа и Петрова есть одноэтажная Америка, достаточно общеизвестные и даже с клонами/римейками.

Всегда любил и Булгакова, и Ильфа с Петровым, но схожесть стиля объяснял себе схожестью обстоятельств и времени. Так же как мы в 2026 году говорим примерно об одних и тех же проблемах примерно одним и тем же языком. Для нас в XXI веке культурный код делает схожесть важнее различий. Примерно как мы смотрим на фотографии женщин двадцатых годов прошлого века: в первую очередь видим одинаковые прически, шляпки и макияж. И только во вторую очередь видим различия, если вообще видим.

но схожесть стиля

А в чем она заключается, собственно? То что они все вместе работали на ниве сатиры, разве что? Булгаков был личностью с европейским менталитетом до мозга костей, поэтому его проза очень тонкая, элегантная, как скрипичное кончерто, если угодно. Ильф с Петровым тоже прекрасные писатели, но они все же ближе к некой массовости, к стенгазетной сатире, поп-фельетонистике, которой Михаил Сергеевич, конечно, тоже занимался, но его крупные произведения написаны совсем иначе.

То как писал дуэт, с журналистской искринкой и обрушающей самоиронией, знанием жизни и ее липкой бытописательской подоплеки - недоступно даже такому мастеру как Булгаков. Он жил другой жизнью.

А то как дуэт ходил “по краю” дозволенного - просто подвиг. Но удивляют результаты опроса. В подтверждение собственной веры в чудеса - люди готовы эти самые чудеса затоптать, поверив заговорщикам.

У Дмитрия Галковского есть серия статей на эту тему. Булгаков написал под именем Ильфа и Петрова, ибо если бы опубликовал сатиру на большевиков сам, его бы очень сильно прижали. И так за Белую Гвардию расстрелять хотели. А тут и сказал все, что хотел, и взятки гладки.

Гений...

Любопытно было бы проверить известную теорию, что Дюма - это Пушкин, инсцинировавший свою смерть. Приводят множество фактов в этой сравнительной мифологии биографий. https://pikabu.ru/story/pushkin_yeto_dyuma_faktyi_iz_papki_5120764

У них французский язык общий, Дюма с русского переводил, но вроде не писал. Попадалось видео с этой теорией какого-то общества пушкинистов, где заявлялось что они графологически сверяли их тексты и посчитали идентичными.

Хех, пикабушный брат)) ровно за тем же пришел в комментарии))) рад что я не один такой стукнутый, два дня подряд хочу кому-нибудь такой вопрос задать (вчера Бунтману хотел, но в записи смотрел…)

Автору исследования можно посоветовать попробовать проводить не просто текстовый анализ, а сначала перевести произведение в метрику образов и смыслов.

Например взять образы Берлиоза, Босого, Лиходеева и сравнить их с образами отца Сергия, инженера Птибурдукова или Александра Яковлевича Альхена.

Сатира на СССР получается довольно с высоким коэффициентом корреляции.

перевести произведение в метрику образов и смыслов.

У меня есть общий алгоритм для книг, который извлекает ключевые слова произведения и темы (на основе NMF, не LDA). Пример, для упомянутой книги:

Скрытый текст

• СМЫСЛОВОЕ ЯДРО ТЕКСТА УСПЕШНО ИЗВЛЕЧЕНО
ТОП-15 ключевых лемм::
иван; кот; николаевич; берлиоз; квартира; воланд; гражданин; стол; маргарита; вода; солнце; коровьев; сегодня; немой; кричать

ТОП-10 тем::
Тема 1: мастер, маргарита, азазелло, роман, иванушка
Тема 2: прокуратор, ершалаим, игемона, иуда, капюшон
Тема 3: иван, поэт, консультант, пилат, бора
Тема 4: финдиректор, римский, варенуха, степ, администратор
Тема 5: маргарита, крем, николай, щётка, наташа
Тема 6: веранда, арчибальд, арчибальдович, официант, швейцар
Тема 7: профессор, немец, берлиоз, поэт, аллея
Тема 8: воланд, бегемот, мессир, мастер, коровьев
Тема 9: никанор, иванович, председатель, артист, переводчик
Тема 10: маргарита, бал, королева, коровьев, король

Мне кажется, что алгоритм несовершенен. Как минимум слова стол и кричать не являются основой книги.

Могу предложить вам альтернативный вариант его реализации. Надо вводить вектор типовых характеристик персонажей.

В комментарии указано, ключевых лемм, а не слов. См. что такое лемматизация текста. Т.е. под леммой "стол" подразумевается разные вариации, например, "за столом, на столе и т.д.", т.е. там где пишут рукописи и что-то выкладывают. По лемме "кричать" -> "крикнув, вскрикнув, закричала..."

А какую интересную реализацию алгоритма предлагаете? Я открыт к обсуждению.

Чтобы Ваша система была достоверной и применимой, предлагаю добавить следующие три модуля:
1) сравнение книг одного автора. То есть мы должны взять "Мертвые души", "Тараса Бульбу", "Вечера на хуторе близ Диканьки" и "Шинель" и выработать такой алгоритм, который достоверно доказывает, что они написаны Гоголем.

Приведу пример из смежной области. Горячо любимый нашими прекрасными женщинами Стас Михайлов лично утверждает, что фишка его песен - повторения слов в припеве. "Без тебя, без тебя, всё ненужным сразу стало без тебя."

"Ну вот и все, ну вот и все, ну вот и все...
Я ухожу из твоей жизни.
Лишь только плачет за окном
Холодный ветер января.
Ну вот и все, ну вот и все, ну вот и все...
И от венчания до тризны
Хотел с тобою рядом быть,
Но видно это не судьба".

2) Из этого логически следует отдельный модуль стилевой разметки. Например, все мы знаем стиль Маяковского. Поэтому хороший лингвист может написать стихи "под Маяковского" достаточно спокойно.

Ерундой занимаются гады,
опозорили Евросоюз.
Ананасы им жрать до упаду,

зад давно их похож на арбуз.
Только врёшь, не дождешься германец,

коммуниста не сломит война.

Футуристы на ваш блядский танец,
зычно скажут - "идите-ка на..."

Более того, хороший автор каждую работу пишет по-разному. То есть можно, конечно, говорить о том, что стиль чеховских рассказов совпадает, или что у О`Генри или у Достоевского однотипные сюжетные линии в их произведениях. Но чем круче автор - тем разнообразнее его работы. Условно - "Севастопольские рассказы" и "Анна Каренина" (первое и последнее произведения Толстого) должны серьезно различаться.

3) надо вводить понятие "вектора персонажа".
Например: (а1, а2, а3, а4, а5).
а1: национальность. Русский, немец, еврей, поляк, кавказец.
а2: возраст. Молодой, средних лет, старый.
а3: политическое кредо. большевик, беспартийный, либерал, монархист ...
а4: честность. Негодяй, праведник, ловкач, дурак.
а5: авторская позиция. Одобряет, осуждает, относится нейтрально.
и т.д.
=======================================
Например Иван Бездомный. Русский, молодой, (в начале романа большевик, потом беспартийный), (в начале романа дурак, в конец - праведник). Автор относится благосклонно.
Шура Балаганов. Русский, молодой, беспартийный, ловкач(трикстер), автор относится скорее благосклонно.

Для примера возьмем роман "Мать".

Павел Власов. Русский, молодой, (в начале романа пьяница (как и все русские в творчестве Горького), в конце - идейный большевик), по сути своей - негодяй, ибо борется за разрушение своего государства, авторская позиция - одобряет.

Ну и т.д.

Дальше надо сравнивать векторы персонажей, ибо истинный замысел любого писателя - заложить в читателей свою картину мира через примеры.


"хороший лингвист может написать стихи "под Маяковского"

Как вы думаете, как работает алгоритм на основе символьных n-грамм, плюс ещё признаки, которые добавил? (упомянул в статье). Например один из признаков у меня, как у автора - это подсознательное обилие круглых скобок в текстах (для пояснений), я могу с этим как-то бороться, но победив один признак в алгоритме остаётся ещё не менее в буквальном смысле 1500 признаков. Или вот другой признак: контекст из К/Ф "Матрица" прорывается в статьях, примеры:

https://habr.com/ru/articles/843752/
Тут же на Хабре Матрица у меня в другом месте. А неприятнее всего оказалось совсем другое слово моем в топ-е (был невероятно удивлён и немного растроен, когда спарсил свои комментарии с Хабра и прогнал).
Тут же на Хабре Матрица у меня в другом месте. А неприятнее всего оказалось совсем другое слово моем в топ-е (был невероятно удивлён и немного растроен, когда спарсил свои комментарии с Хабра и прогнал).
В ПО в функцию "облако слов"/силуэты: винишко и Матрица получились в самом центре (этот момент я уже не проконтролировал, вышло непреднамеренно, но думается мне неслучайно). Но даже если победить и это, остаётся ещё 1499 признаков, которые нужно подделать, как вы пишите, чтобы закосить под Маяковского.
В ПО в функцию "облако слов"/силуэты: винишко и Матрица получились в самом центре (этот момент я уже не проконтролировал, вышло непреднамеренно, но думается мне неслучайно). Но даже если победить и это, остаётся ещё 1499 признаков, которые нужно подделать, как вы пишите, чтобы закосить под Маяковского.

На данный момент меня восхищает добротная, русскоязычная, технически крутая работа многолетней давности от сопровождающего "Фантлаб" по поводу лингвопрофилей писателей, не зря они евро премию отхватили.

Цитата из описания:
Алгоритм, приведённый выше, позволяет распознавать автора романа с вероятностью 98.79%, рассказа — 84.32%.

Я не очень хочу погружаться в математику алгоритма на основе символьных n-грамм, скорее даю Вам рекомендации, как лингвист и историк русской литературы.

Просто суть конспирологической версии об Булгакове, как авторе "Золотого теленка" в том, что он владел словом и писал то, что хотел, но так, чтобы к нему не возникло вопросов у проверяющих. Проще говоря - "Мастер и Маргарита" и "Теленок" и не должны совпадать лингвистически. А вот по смыслу и посылу - вполне.

Более того, то что они не совпадают - ещё один аргумент в поддержку данной версии. Просто возьмите все нормальные произведения, написанные в 20-40 годы в СССР в жанре сатиры на Советскую власть, и окажется, что 50% из них - это Булгаков. И в цикле про Бендера он отвёл душу по полной...

Но работа у вас очень хорошая и полезная. Большое спасибо, что опубликовали код. На досуге попробую поправить его и может быть даже опубликую свои результаты.

Поэтому хороший лингвист может написать стихи "под Маяковского" достаточно спокойно.

Евтушенко-стайл получился, сорян. И немного Носов ;)

Интересно, если сравнить МиМ и Белую Гвардию - у них один автор получится?

Попробуйте сделать вывод: смотрите на матрицу так: по Y выбирайте интересующее вас произведение, а по X другое произведение с чем сравнить, смотрите на цифру в точке пересечения. У "МиМ" и "Белой гвардии" цифра рапортует о явно большем сходстве, чем любое Булгаковское с Ильфом/Петровым. Можно найти на опубликованной матрице и некоторые неожиданные результаты, короче, вы можете сравнить между собой 76 текстов.

Есть нюансы: Хабр пережимает изображения, загружал для статьи png в разрешении "2200 x 1668", а Хабр снизил качество до "1560 x 1182" - матрица замылилась, неприятно; если неудобно глазами искать точку пересечения, то скачайте файл, там прицел (липкое перекрестье) и всплывающая подсказка работают, т.е. сравните очень быстро без напряга для глаз.

Интересно, а не проверяли версию что тексты Катаева, так как они родственники с Петровым?

История детально описана Катаевым в книге "Алмазный мой венец". Начинал произведение он, но у него центральной фигурой был Паниковский. Ему надо было куда-то ехать (кажется, в отпуск), а план горел. Тогда он нанял двух литературных негров. По возвращении он получил от них такой текст, что сразу отказался от авторства. Единственное, что он от них потребовал - золотой портсигар. Они его обманули. Портсигар подарили, но женский (меньшего размера, чем мужской).

Странно что до сих пор никто не спросил про Шолохова и Тихий Дон.

А вообще, очень классная штука!!

А что про него спрашивать? С чьими текстами сравнивать "Тихий Дон"?

С текстами Крюкова, конечно.

Сравнивали же уже.
Но вообще задача непростая: если предположить, что Шолохов украл черновики Крюкова, то явно их редактировал и переделывал, а часть событий, описанных в ТД, Крюков не застал и описать их не мог вовсе, т.е. последние тома написаны без опоры на его черновики. И вообще ТД из многих лоскутов собран, там абзацами переписаны мемуары современников - это как правильно учесть в подобных анализах?

Ну, последние тома и явно хуже, демонстрируют заметно более слабое знание языка, быта и народной культуры того региона, несмотря на то, что писались сильно дольше, а автор получил поддержку и славу и мог уделять работе куда больше времени. Не говоря уже о том, что стал взрослее и опытнее.
Т.е. теория о том, что Шолохов явно использовал при работе на первым (лучшим из всех) томом чьи-то работы - не на пустом месте возникла.

Шолохов явно использовал при работе на первым (лучшим из всех) томом чьи-то работы

С этим я как раз и не спорю. Я даже не удивлюсь, если окажется, что вообще все, кроме "Донских рассказов", написано не им (или не только им).

Пишу совсем о другом:
1. не очень понятно, что осталось от черновиков Крюкова (или какого-то другого автора) в ходе переписывания и редактирования их Шолоховым, насколько продуктивно сравнивать этот конечный текст (а вернее - тексты: рукопись Шолохова, первое издание, поздние советские издания отличаются) с текстами Крюкова (или кого-то еще).
2. насколько вообще уместно анализировать текст, скомпилированный из различных источников и затем более или менее однообразно отредактированный?

Я даже не удивлюсь, если окажется, что вообще все, кроме “Донских рассказов”, написано не им

Ну вот Берроуз явно говорит, что первый том и “Донские рассказы” написаны одним автором. Это что-то для Вас значит?

Тут я уже скорее удивлюсь. Донские рассказы по сравнению с ТД намного слабее.

А что Берроуз говорит про остальные тексты Шолохова? Весь ТД, Поднятая целина? Да и про Крюкова с Серафимовичем заодно. Есть теории, что Серафимович приложил руку к тому, что издавалось под именем Шолохова.

Всё давно опубликовано: https://nevmenandr.github.io/portfolio/assets/pdf/QuietDon.pdf

Не Крюков. Про Серафимовича - это просто горячечный бред одного отдельно взятого господина.

Занятно: Вам что-то показалось, и Вы, опираясь на то, что показалось, уже делаете сильное утверждение: “не на пустом месте возникла”. А если есть те, кто уверен, что последние тома, как минимум, не хуже, со знанием языка и быта там все в порядке. то для них все же на пустом месте возникла?

Получается, так, могу поверить что для кого-то все тома выглядят одинаково. Доля субъективности здесь есть.


Как, например, для меня разговор об авторстве "Двенадцати стульев" Булгакова выглядит как пустой треп)
Я читал "12 стульев" и "Теленка" раз 10, я читал столько же раз "МиМ", читал другие произведения Булгакова - и на мой взгляд, это совершенно разные стили написания, имеющие очень мало общего. Также как и культурные контексты произведений и используемая ими лексика и детали.

Я уже не говорю о всяких очевидных вещах. Например, есть записные книжки и дневники Ильфа и Петрова в которых находятся тысячи фрагментов и прототипы персонажей, потом вошедшие в их книги. Есть записные книжки и дневники Булгакова - в которых находятся детали его произведений и его прототипы. Но нет никаких вообще намеков на что-то из мира Остапа Бендера в книжках, рукописях и дневниках Булгакова. Даже сам этот разговор считаю высосанным из пальца.

могу поверить что для кого-то все тома выглядят одинаково. Доля субъективности здесь есть.

Вам же доводилось слышать о когнитивных искажениях?

Что касается черновиков и набросков, то жизнь на Дону была непростая и сохранять рукописи было сложно. Вы, наверное, знаете, что даже рукопись ТД во время оккупации была утрачена? От Вергилия, кстати, тоже фрагментов и прототипов персонажей не осталось: это не всегда аргумент.

Вы, наверное, знаете, что даже рукопись ТД во время оккупации была утрачена?

Лет 20 назад была же найдена.

Эксперименты показывают, что Бёрроуз нечувствителен к редактуре. Можно довольно серьезно отредактировать и это не повлияет на результаты

Не очень понятно, как это возможно.

Да нет, все как раз очень понятно. Но если бы даже и не было понятно, это факт.

Видимо, для сравнения используется не авторский стиль речи, а что-то другое.

Было бы интересно озадачить нескольких авторов изложить сюжет одного и того же фильма, а потом сравнить их тексты.

А почему не Севского?

Странно что до сих пор никто не спросил про Шолохова и Тихий Дон

Ваша правда: это самый первый вопрос, когда рассказываешь про методы определения авторства

текст написан в соавторстве с Р. Папсуевым

Это тот самый Роман Папсуев, который, по мнению Мартина, точнее всех рисует его мир? UPD Да, он. Экий матёрый человечище!

Пришла в голову мысль о любопытном эксперименте: что, если взять оба романа С. Витицкого и сравнить их с произведениями Стругацких, написанных совместно? Вычислить, так сказать, удельный вес каждого из братьев в тандеме.

времена-то разные.

Примечательно, что эта мысль за несколько лет до этого была реализована, вот научная статья с результатами: https://pushkinskijdom.ru/wp-content/uploads/2025/09/02_staroverova.pdf

Наслаждайтесь!

12 стульев, Золотой теленок и некоторые другие произведения, приписываемые Ильфу и Петрову, написал без сомнения Булгаков. Доказательства этому приведены в серии статей. https://teletype.in/@poddelkamnet/+bulgakov-avtor-12-stul-ev-i-zolotogo-telenka. Доказательств более чем достаточно. Строгие статистические методы, один из которых применили Вы, здесь не подходят. Возможность их применения предварительно должна быть обоснована тем, что по произведениям одного и того же автора они должны всегда давать одинаковые результаты, отличные от результатов по другим авторам, чего в реальности не происходит. Рекомендация Вам прогнать Ваш метод по другим авторам и произведениям, и прежде всего, по Ильфу и Петрову. Также для полноты картины можно взять писавших в одно время и даже в одном месте с Булгаковым и ИиП Катаева и Олешу. Заодно добавить и Зощенко. Я это все уже проходил, результаты описаны в статьях по ссылке выше.

Рекомендация Вам прогнать Ваш метод по другим авторам и произведениям, и прежде всего, по Ильфу и Петрову.

Простите, а вы на изображении не видите результаты по другим авторам и произведениям?

Донцова, Лукьяненко и т.п.в Вашем сравнении явно неуместны. Возьмите все крупные произведения известных авторов того времени, в т.ч перечисленных мной, и докажите сначала, что в пределах произведений одного и того же автора при прогонке Вашим методом ВСЕГДА получаются достоверные результаты. Этого в Вашей статье я не нашел. Методом доли служебных слов иди с использованием критерия Манна Уитни такой картины не получается. Авторы, "доказавшие" в своих статьях, что Булгаков не есть автор 12С и ЗТ, часто подгоняют расчеты под нужный результат. Подробный разбор одной из таких подгонок здесь: https://teletype.in/@poddelkamnet/abQNXn-EzzOtCrM5.

Согласен с Вами. Было бы интересно добавить в таблицу "Повести Белкина" и посмотреть, насколько они совпадают с другими работами Пушкина.

Какими инструментами вы лично пользовались, чтобы заявлять о стилометрии как о точной науке? Судя по вашим комментариям, для вас это что-то новое и неизвестное. Что значит перечисленные авторы неуместны? Вы специально аккаунт зарегали сегодня, чтобы оставить эти трогательные комментарии?

Чем больше авторов в библиотеке, тем точнее алгоритм будет сближать одинаковый авторский стиль и отдалять разный. Донцова тут вообще к месту, потому что в одной ее книге доля диалогов сумасшедшая, даже больше, чему у Достоевского в "Преступление и наказание". Если прогнать алгоритм через 10 авторов и тем более на основе 2-3-х авторов он покажет не то, что от него ожидают.

Судя по вашим комментариям, для вас это что-то новое и неизвестное.

Да, поэтому и прошу Вас сначала доказать достоверность этого метода на известных литературных произведениях, чего Вы, как я понял, делать не хотите. И ещё

простыми словами: на этом шаге игнорирую шум - сюжет и диалоги), добавляю признаки на основе пунктуации и доли эмоционального тона,

В стандартных статистических методах ничего удалять или добавлять по своему усмотрению нельзя. Докажите, что это не подгонка.

Вы неправильно понимаете. Про стандарты, которые вы пишите и приводя мою цитату, так вот, цитата - это и есть часть стандарта 20-летней давности. Для вас поясню подробнее, что она означает. Когда вы смотрите на символьные n-граммы, включая знаки препинания специально разделённых с обоих сторон пробелами, алгоритму плевать в каком это контексте: в диалогах, в динамике или в телесном повествовании, он просто занимается подсчётом знаков на этом шаге (и берет не больше 5 знаков от слов, в английском языке вообще обычно берут еще меньше: 3-4 знака), вот что значит моя цитата, которую вы привели, как нарушающую стандарты статистических методов.

Написано очень непонятно. Кроме Вас вряд ли кто поймет о чем идёт речь. А должно быть так, чтобы всем было не только понятно, но и перепроверяемо. Для этого иногда проводят примеры как подготавливались тексты к эксперименту. Вам бы такие примеры тоже не помешали.

На эту "статью" я потратил час, увидел комментарий и сразу выложил поверхностный анализ, планировал обычный пост, а не статью, но Хабр не позволяет в посте вставлять более одного изображения, а у меня их несколько. В прошлом году написал подробный материал/лонгрид, на который у меня ушло несколько месяцев, тут же на Хабре

там расписал подробно, как все устроено, в результате оказалось невыгодно публиковаться (статью практически не заметили, в отличие от этого поста), профитнее было бы потратить силы на подготовку текста для научного журнала.

Что касается "вряд ли" кто-то поймёт. В ПО будет огромный раздел справки, который качеством будет на порядок выше, чем данный пост, но ниже чем мой прошлый лонгрид.

Проверить Вашу программу можно слепым методом. Кто-то ( не Вы) даёт Вам обезличенный текст одного из известных авторов, Вы пропускаете его через свою программу и называете одного или нескольких авторов. Потом считаете % попаданий. Для чистоты эксперимента выбор теста для анализа должен быть независим от вас.

Убедиться в том, что 12С и ЗТ написали не ИиП, может каждый, очень просто и без сложных статистических методов. Достаточно перечитать эти произведения и потом сразу же почитать Одноэтажную Америку ИиП. Достаточно будет первых 50 страниц. Никакого желания читать дальше не останется.

Сравнивать эти произведения нельзя. Гротеск в Америке был недопустим. С точки зрения стиля и слога - сомнений нет в авторстве ИиП, он самобытен. У Булгакова этого нет. У него вообще смешного нет почти ничего.

Сравнивать эти произведения нельзя

Что значит нельзя? Если они написаны одними и теми же авторами, то статистические методы должны это подтвердить. Чего нет. Но повторю, что многим достаточно просто их прочтения.

сомнений нет в авторстве ИиП, он самобытен

Про самобытность 12С и ЗТ, выразившееся, в том числе, в уникальных словах и выражениях, присутствующих в произведениях Булгакова и полностью отсутствующих в прочем творчестве ИиП, можете почитать здесь https://teletype.in/@poddelkamnet/aW9zsBoxe13L2-ou и здесь https://teletype.in/@poddelkamnet/aXxsMf-Vg1CfUYEN. Про штампы Булгакова в 12С и ЗТ - https://teletype.in/@poddelkamnet/VxUSR_t8D_S

У Булгакова этого нет. У него вообще смешного нет почти ничего.

Ну да, несмешные Собачье сердце и Иван Васильевич, по которым сняли несмешные фильмы.

Добавлю ещё сами фельетоны Булгакова в "Гудке". Например "о пользе алкоголизма".

Крайне заинтересованные члены профсоюза поддержали доклад дополнив примеры своим: «Чай не водка, много не выпьешь!». Председатель хстал продолжать и так убедительно, что пять человек сбежали с собрания в пивную — пока она не закрылась...

Заканчивается фельетон «эпилогом», где цитируется письмо того же рабкора 2619: «…рабочие массы выбрали в кандидаты месткома известного алкоголика, и на другой же день он сидел пьяный, как дым, на перроне и потешал зевак анекдотами, рассказывая, что разрешено пить лишь бы не было вреда».

Реально не смешно, если вспомнить Ельцина.

Чем больше авторов в библиотеке, тем точнее алгоритм будет сближать одинаковый авторский стиль и отдалять разный

Все не так просто, к сожалению. Тексты других эпох действительно путают карты, при составлении корпуса желательно учитывать эволюцию языка и жанровые ограничения. Вот пример: https://arxiv.org/abs/2407.10301

Да какая разница, кто написал. Главное, что написано.

от того, кто написал, меняется смысл многих эпизодов, да и общий смысл книги. Если написали Ильф и Петров - это просто "прикольная книга про приключения авантюристов Бендера и Ко". Именно так в детстве я воспринимал все фильмы про Бендера. Если писал Булгаков - это язвительная сатира на советскую власть, послание русского писателя следующим поколениям с разбором каждого типажа нового общества. Для меня другими красками заиграли каждая глава, когда я понял о чем тут реально пишет автор.

"Он увидел десятка полтора голубых, резедовых и бело-розовых звонниц; бросилось ему в глаза облезлое кавказское золото церковных куполов. Флаг клубничного цвета трещал над официальным зданием. У белых башенных ворот провинциального кремля две суровые старухи разговаривали по-французски, жаловались на советскую власть и вспоминали любимых дочерей. Из церковного подвала несло холодом, бил оттуда кислый винный запах. Там, как видно, хранился картофель.

– Храм Спаса на картошке, – негромко сказал пешеход.

Пройдя под фанерной аркой со свежим известковым лозунгом: «Привет 5й окружной конференции женщин и девушек», он очутился у начала длинной аллеи, именовавшейся Бульваром Молодых Дарований.

Нет, – сказал он с огорчением, – это не Рио-де-Жанейро, это гораздо хуже."

Для меня другими красками заиграли каждая глава, когда я понял о чем тут реально пишет автор.

«Я‑то думал, что это у них в кармане картофелина лежит — а это, оказывается, фига»?

С Вами трудно согласиться, к сожалению. Ильф и Петров точно так же могли написать язвительную сатиру (что они, кстати, и сделали). Кто бы им запретил. А играть в интеллектуальную игру "представим, что этот текст написал кто-то другой и посмотрим, что получится", никто не сможет запретить уже Вам.

Полностью с Вами согласен. Играть в игры я люблю и делаю это с большим удовольствием. Особенно если получается выигрывать.

А кто бы и что запретил Ильфу и Петрову - показано в Мастере и Маргарите. Союз писателей по команде Луначарского или кого повыше мог спокойно объявить тотальный бойкот. А продолжили бы гадить родной советской власти - ГПУ могли бы оформить самоубийство, как у Есенина или Маяковского.

Вы историю и социологию литературы по художественным произведениям изучаете? Это даже не смешно. Как Вам идея изучить, скажем, кластеризацию да и вообще Python по какому-нибудь роману?

"Оформить самоубийство" - это Вы сильно придумали. Самоубийство потому и называется самоубийством, что человек совершает его сам, как и было с Есениным и Маяковским. ГПУ тут совсем ни при чем.

Лет 40 назад искусствоведы активно обсуждали существование Шекспира. Но читателя эта проблема не интересует. С Козьмой Прутковым вопросов нет, но многие читатели знают Жемчужниковых только через Пруткова. Для агентства по авторским правам важны, конечно, фамилии в паспортах, но читатели читают книги, а не паспорта. И если на книге написано Н. Щедрин, не обязательно знать М. Е. Салтыкова (но желательно).

Подобные инструменты в первую очередь для исследователей языка/филологов, писателей, изданий и даже логопедов, читателям может и вправду не очень интересно вертеть тексты. Пример академического лингвистического ПО: Stylo, его не то что пользователю его с подсказками ИИ за час не запустить, пока не подготовишь среду.

Не люблю шаблоны, но не могу удержаться: "можно, а зачем? "

Зачем перечисленным группам подобные инструменты?

1) [для меня, разработчика лингвистического ПО] Сравниваю топовый инструмент Stylo (или Textinspector), которые на русскоязычных текстах почти не работают, и своё ПО. Смотрю, как академики реализовали тот или иной подход в алгоритмах, силюсь понять: почему забили на интерфейс, есть ли у них что-то подобное из мер, что рассчитываю я...
2) [для филологов] Там люди вообще гранты получают за статьи по исследованию языка, иногда диву даёшься, как некоторые труды вообще проходят контроль. Доказать, что О. Славникова унаследовала Набоковский стиль (большая глубина, как у Набокова - есть такая метрика, ее вообще в школе на уроке русского языка изучают), или судебная экспертиза: поискать экстремизм в "котиках", (не)осудить, (не)наказать и тд...
3) [для писателей] Вообще-то творческих личностей в СНГ не мало, взглянуть только на Автор.Тудей. Им свое творчество прогнать и увидеть, например, как под конец повествования планка падает на лексическом разнообразии, или море орфографических ошибок, которые наоборот, вообще задирают ЛР. Я начинал именно так: набрасывал скрипты на своем Termux, чтобы своё художество в первую очередь проверять, потом стало интересно сравнивать разных авторов, произведения - цензурированные и не очень...
4) [для логопедов] их сфера включает и работу с детьми, у которых могут наблюдаться признаки афазии...
5) [для изданий] Пример, пришла рукопись от известного и уважаемого человека, ответственный за работу с текстами не будет читать (у него их сотни) - это ёмкая работа, он просто просканирует разок текст, увидит треш в метриках и отправит фантаста на Пикабу и никакого договора не будет, чтобы не уронить репутацию издевательства...
6) [для читателей]. Кого-то точно двигает любопытство и подобные инструменты его удовлетворяют...

Stylo (или Textinspector), которые на русскоязычных текстах почти не работают

Простите, а что Вы имеете в виду? В чем именно stylo не работает на русскоязычных текстах?

Но читателя эта проблема не интересует.

Читателя как раз ужасно интересует! Ученые как раз пытались 60 лет назад убедить общественность в том, что это неважно, с помощью яркой метафоры "смерти автора", но ничего не получилось. Общественность по-прежнему требует открыть ей тайну авторства "Тихого Дона", хоть ты тресни.

Можно напрячь ИИ и установить, кто (Аркадий или Борис) написал фразу про промышленное производство святой воды при появлении запаха серы. Но Стругацкие хотели, чтобы читатель думал не об этом.

Осталось понять, при чем тут ИИ. Вера в его всемогущество может дорого обойтись. Нет, ИИ про авторство ничего не знает, есть другие, более эффективные методы. А про то, чего хотели или не хотели Стругацкие, не знаем уже мы.

Хорошо, если выполнение операций "стилистическое сходство между книгами вычисляю через косинусное расстояние" происходит без ИИ, но в любом случае - он только инструмент и дело не в нем, а про постановку задачи и ее смысл. Можно, например, установить, на одной стороне листа или на двух был написан первый экземпляр любого текста. А зачем?

А вы знаете, что "Илиаду" написал не Гомер, а другой грек, носящий то же имя?

Намек на "Двойную звезду"?

Математики там нет, я вкратце написал, как работает алогритм. А что в статье?

Такие невысокие цифры получились потому, что это фан проект на несколько часов.

Понятно.

СТАТИСТИКА ТЕКСТОВ: author word_count unique_words avg_word_length lexical_diversity 0 Булгаков 69693 18714 5.272811 0.268521

Откуда там 18К уникальных слов? их там 10К (для этого лемматизация и существует, чтобы книга, книги, книгу, книгам, книге - было как 1 уникальная единица: "книга", а не 5, без лемматизации таких "уникальных слов" 19К, зависит от издания), у автора лексическое разнообразие 0.268521, что это за цифра (вероятно 27%)? TTR, MATTR, MTLD, HD-D? MSTTR? Она бьётся только с метрикой ЛР - TTR 27% - устаревшая мера, которая сама по себе считается невалидной, но даже она получена на не лемматизированном тексте (на постобработке TTR = 14%), полная чушь.

Добавлю, что лексическое разнообразие у Булгакова выше и на локальном уровне и на глобальном, пишет почище многих современных авторов, факт.

Косинусное сходство, дельту Бёрроуза как он считал? Её считать можно для разных языков по разному (я написал, как ее считал, а он нет), ничего не сообщается, ниже такие же выкладки от машинного обучения, ни пояснений, ни математики, вообще ничего кроме вывода, которые еще и не бьются, даже не указал через что тексты свои необработанные? прогонял, предположу, что через Scikit-learn.

Зовите автора в комменты для публичной IT-порки.

Такие невысокие цифры

На таких крошечных датасетах это адекватные цифры.

Лемматизация дело правильное, только нужна ли она здесь, если используем n-граммы? Если мы хотим выявить стиль, устойчивые обороты, повторения слов - лемматизация помешает.

Видел методы, где исследуют использование коротких слов, не буквенно - цифровых символов, длину слов - наверное тоже выделение основы не будет правильным подходом.

Лемматизация дело правильное, только нужна ли она здесь, если используем n-граммы?

Нет, тут она не нужна. Она нужна, например, для расчета ЛР, результат который демонстрирует исследователь с первых же строк, цитата "unique_words/lexical_diversity".

Но если автор решит сравнивать кроме стиля еще и атмосферу/сюжет (см. рыжий график к этому посту в 3 комменте), то нужна.

Добавлю, что одних символьных n-грамм недостаточно, чтобы получать более точные результаты по стилю на русскоязычных текстах, для грубого анализа, да, сойдет.

лексическое разнообразие у Булгакова выше и на локальном уровне и на глобальном

Что такое локальный и глобальный уровень? И в чём измеряется лексическое разнообразие (суммарное число всех метрик - оно есть? )?

Вы отредактировали свой комментарий (убрали "математику"), правильно, Вы и есть тот исследователь, сразу и не разобрал по нику.

Что такое локальный и глобальный уровень?

Цитата из материала по ЛР из моей прошлой работы:

MATTR/MTLD — отражают расчёты последовательного потока (фрагментарно): насколько разнообразен язык прямо сейчас в сцене, локальные метрики текста. Меры показывают то, как автор комбинирует слова в отрывках, порядок слов очень важен — поэтому меры и локальные. Оценка структуры текста. HD-D — показывает словарное разнообразие автора в целом через всевозможные комбинации выборок в 42 слова. Условно глобальная метрика текста. Мера отображает то, как как автор пользуется своим словарём на протяжении всего изложения: гармонично или “тавтологично”. Порядок слов абсолютно не важен, но важны пропорции слов. Оценка глобального лексического разнообразия. КУЛ — отображает истинное богатство словарного запаса автора на прозе, а не лексическое разнообразие на уровнях. Порядок слов абсолютно не важен и не важны пропорции слов. Глобальная метрика текста...

Выше абзац, возможно, сложно будет понять без обилия примеров с разных сторон, поэтому (о локальном и глобальном уровне ЛР), прямая связь MATTR с MTLD расписал подробно в прошлом лонгриде, даже шахматы пошли, примеры с Пеховым и Пановым и не только, читайте.

Не включая голову, просто жжем танки перемножаем матрицы?

Если уж гипотетически допустить, что Булгаков писал “Золотого теленка”, а потом это издавали под именем Ильфапетровых, то ну наверно бы Булгаков немножко стилизовался под Ильфапетровых, и это могло отразиться на результатах? Это вам не пришло в голову?

Вы хотели осмысленных интересных задачек? Их есть у меня.

Прежде чем свято верить в подобные методики “доказательного установления авторства”, неплхо сначала проверить, насколько хорошо они работают для авторов, которые пишут под несколькими псевдонимами, стараясь придерживаться разных стилей.

Например:

Был такой известный писатель, Дональд Уэстлейк. У него есть серия юмористического детектива под своим именем, про персонажа Дортмундера. А есть серия под псевдонимом Ричард Старк, тоже детективная, но “сурьезно с каменным лицом”, про персонажа Паркера. Можно взять романов по семь из начала каждой серии, и сравнить их в разных комбинациях (романы внутри каждой серии между собой, романы разных серий между собой, среднее по сериям между сериями, и так далее). Будет ваша система надежно работать?

А в других подобных случаях?

Кажется, Вам не попадалась на Хабре эта статья? https://habr.com/ru/articles/834912/ Жаль, если так.

Конечно, впечатляет, что Вы столько дополнительных параметров использовали (“признаки на основе пунктуации и доли эмоционального тон”), но правда ли они нужны и не зашумляют ли сигнал? До предела в этом дошла в своей диссертации А. Ю. Хоменко.

“считаю буквенные n-граммы текстов, как придумал Бёрроуз в 2002 году однако с учётом морфологии русского языка” - вот это непонятно; считаете так, как считал Бёрроуз, или считаете буквенные n-граммы? как учтена морфология?

Осталось убедиться, что эта методика действительно работает, птому что несмотря на неправильный Манхэттан, про Берроуза-то мы убедились.

А почему рассматривается только это вариант? А другие: 2) за Булгакова писали Ильф и Петров, 3) за них троих (и за Шолохова) писал Алексей Толстой и множество других вариантов...

Времена были стрёмные, тексты аллегорические, да и попадать в классические, узнаваемые метафоры надобно...

... проявляется ли при таком раскладе авторский стиль?

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации