Pull to refresh

Comments 16

Восемь тысяч охвата, семь плюсов и три комментария — это норма площадки, а не неудача.

И всё-таки семь плюсов это провал. И восемь провал. И девять. Вот десять уже можно считать нормальным результатом.

Но не потому, что семь плюсов это медиана, и половина статей имеет ещё меньше, а потому что в настройках Habr можно задать порог рейтинга только

  • Все; ≥0; ≥10; ≥25; ≥50 и ≥100

А порога “≥7” нет, и уже через несколько дней статью никто не увидит — те, кто смотрит с порогом “Все” или “≥0” не доберутся до #адцатой страницы, на которую статья опустилась, а те, кто смотрит с порогом “≥10” (а также те, кто смотрит “Лучшие”) ее вообще не увидят в выдаче даже если рассматриваемый в статье вопрос им мог бы быть интересен ¯\_(ツ)_/¯

/imho

₽$ У меня в июле вышло две статьи:

и по остальным критериям (охват, закладки, комментарии) они выше медианных значений, а вот по рейтингу как раз медианные “+7”, и увы, это провал ¯\_(ツ)_/¯

Я согласен, что в интерфейсе нет порога >=7, и через неделю статью с рейтингом 7 почти не видно, вы правы. Я имел в виду, что нужно понимать, чего ожидать сразу после публикации. Если у статьи через сутки 7 плюсов, автор может посчитать это провалом, хотя это средний показатель для этой площадки. А вот то, как долго статья будет находиться в поиске, - это уже другой показатель, и там действительно нужно 10 плюсов.

Заглянул в ваши статьи. По охлаждению Mini-PC хабы у вас как раз сильные - DIY и Читальный зал, у них медианный рейтинг 18 и 14, то есть с хабами всё правильно,И 9 рейтинга при них уже нижняя часть распределения, а не провал. А вот у "3D-игр на слабой видеокарте" стоит формат "Туториал", и это как раз тот единственный формат, который по моим данным на личных блогах значимо проседает, там медиана 4 против 7 у неуказанного, p=0.018. Кейс или просто снять формат, по идее, должно тянуть вверх. Но это только гипотиза :)

Я имел в виду, что нужно понимать, чего ожидать сразу после публикации.

Это я понял, я имел в виду что критерии имеют разный “вес”.

Например если какая-то статья на какуюто специфическую тему не наберёт сразу много просмотров, но при этом сразу (за первые несколько дней) получит высокий рейтинг, то потом со временем она доберет и просмотры, а если по каким-то причинам статья не наберёт ≥10 (а лучше ≥25), то потом она опустится в выдаче, и ее уже ничего не спасет. При этом просмотры набегают всю жизнь, а рейтинг только в первый месяц (а фактически первые несколько дней, поскольку потом просмотры резко падают, и набор рейтинга резко замедляется, падая до нуля).

Например у меня есть весьма специфическая статья “не для всех” FullHD vs 4k и integer scaling: всегда ли 2 x 2 = 4?, набравшая +12 буквально в первые дни (для своей аудитории тема действительно интересная), и она до сих пор набирает просмотры, и есть статья Освещённость рабочего места, backlight, яркость экрана vs усталость глаз с рейтингом +3 (ИМХО из-за первого комментария, уведшего обсуждение в сторону), которая интересна для очень многих, и которая добирает просмотры из-за внешних ссылок на нее, хотя внутри habr она скажем так, не особо популярна.

₽$ Ну и самое главное — просмотры, закладки и обсуждения добираются всю жизнь, а рейтинг только в первый месяц.

А вот у “3D-игр на слабой видеокарте” стоит формат “Туториал”, и это как раз тот единственный формат, который по моим данным на личных блогах значимо проседает, там медиана 4 против 7 у неуказанного, p=0.018. Кейс или просто снять формат, по идее, должно тянуть вверх.

Попробую изменить на “Кейс”, хотя сейчас наверное уже поздно, +3 к рейтингу уже вряд ли успею добррать, ну и по большому счету это уже читерство - при публикации думать не только о содержимом статьи, и для кого она может оказаться интересна, а под каким соусом форматом ее выкладывать.

₽₽$ Сейчас посмотрел - обе мои статьи резко добрали до +9 рейтинга с момента моего предыдущего поста. Возможно вы помогли (в таком случае спасибо), может кому-то из читателей вашей статьи они оказались интересны (а в своей обычной выдаче он их не увидел из-за их невысокого рейтинга) а может просто так совпало.

Но “проходной балл” +10 пока все равно не получается…

Про разные скорости вы точно сформулировали то, что у меня в статье осталось между строк: рейтинг набирается в первые сутки-двое и потом почти замирает, а охват копится месяцами через поиск и внешние ссылки. Это две отдельные метрики с разной динамикой, и оптимизируются они тоже по-разному: рейтинг через форму и первое впечатление на день публикации, охват же через тему, которую ищут годами. Ваша "FullHD vs 4K с integer scaling" и "освещённость рабочего места" - это то, что будет тянуть трафик из поиска ещё долго, даже с рейтингом 3 и 12.

Про формат не обязательно поздно, я не знаю точно, реагирует ли алгоритм на смену метки уже опубликованного материала, но в интерфейсе она меняется. Если поменяете "Туториал" на "Кейс", то интересно будет посмотреть через недельку, сдвинется ли что-то. Если да, то это будет полезное наблюдение для следующей итерации моего разбора.

Если поменяете “Туториал” на “Кейс”, то интересно будет посмотреть через недельку, сдвинется ли что-то.

Я вчера в первой статье “Туториал” поменял сначала “Кейс”, а потом просто снял формат, а во второй вместо “Обзор” тоже снял формат.

Хотя в принципе обе статьи можно поставить “Кейс” (по смыслу это вроде как обеим статьям соответствует), но судя по вашей “Аналитике” без формата предпочтительнее…

Ну, в общем посмотрим… Сейчас обе-две с рейтингом “+9”

это то, что будет тянуть трафик из поиска ещё долго, даже с рейтингом 3 и 12.

И тем не менее с “+12” в выдаче поиска habr будет выше, чем с “+3” (правда тут уже нет градации ≥10 vs ‹10).

Хотя сейчас эти статьи в основном через внешниие ссылки просмотры набирают, а там скорее всего никакие метрики не имеют значения.

Прочитал статьи, понравились. Поставил +. Теперь 10

Вы правы, на обложке визуализация того, что написано в тексте, а не реальный scatter по датасету. Я чуть позже сделаю график и пришлю вам сюда, чтобы вы могли ознакомиться :)

Ряд параметров не могут быть связаны с охватом. Например, наличие гифок, обилие иллюстраций или графиков. Читатели сначала открывают статью (плюс к охвату), а потом видят гифку. То есть, на рейтинг это может повлиять, на охват - нет. Конечно, охват зависит от рейтинга. Но опять же. Это если выставить фильтр на сайте. А, например, в rss рейтинг не видно.

По каждой статье собраны метаданные площадки (охват, рейтинг, закладки, комментарии, хабы, теги, сложность, формат, время публикации) и разбор тела публикации: количество слов и символов, картинок, гифок, встроенных видео, блоков кода, подзаголовков, пунктов списков, таблиц, внешних ссылок, длина первого абзаца и заголовка.

ИМХО не хватает анализа наличия в теме опросов (и может быть их количества).

С одной стороны, опросы оживляют обсуждение темы и увеличивают охват (да и сами по себе результаты опросов бывают весьма интересны как для автора, так и для читателей), а с другой стороны могут увести обсуждение в сторону — может перейти из обсуждения темы в обсуждение опросов.

В общем, может быть интересная метрика.

/imho

Пишите для себя, тогда точно как минимум одному человеку понравится и пригодится, и этот человек вам не чужой :)

А если пытаться закрывать потребности рынка, то потом: "А почему не взлетело", "Для кого старался", "Столько времени и сил в никуда", "Больше здесь ничего не напишу"...

В таблице с корреляциями что-то не сходится. В вирусной выборке вы считаете связь признаков с охватом, в контрольной — с рейтингом. Поэтому по этой таблице нельзя сделать вывод, что знак изменился из-за ошибки выжившего. Для этого нужно сравнить один и тот же показатель на двух выборках.

И ещё: как вы считали десятичный логарифм рейтинга, если 7,1% статей получили нулевой или отрицательный рейтинг? Вы сдвигали значения, отсекали их или исключали эти статьи из модели?

Спасибо, замечания справедливые. С колонками я действительно накосячил: сравнил разные Y. Перепроверил на одинаковом рейтинге - знаки всё равно меняются, так что вывод остался тем же, но показать это сразу было бы честнее.

С log тоже верно: я обрезал отрицательные рейтинги до нуля. Это не лучшая обработка данных. Если использовать рейтинг как есть, качество модели было бы даже ниже.

На главный вывод это не влияет: форма статьи объясняет очень мало. Но оформить и объяснить методику стоило аккуратнее. Учту на будущее.

Автор, спасибо за ответ и за то, что перепроверили расчёты. Статью читать было суперинтересно. Успехов!

Как раз сейчас пытаюсь разобраться почему одни статьи заходят, а другие нет. На самом деле немного запуталась: по тексту как будто ничего не влияет кроме хабов, а потом тестирование с параметрами основываясь на предыдущих анализах. Не понятно почему выбрана пятница вечер?

Но главный вопрос - может есть связь популярности статьи от дня недели в зависимости от длины? Гипотеза в том, что по утрам приходят за чем-то быстрым, а лонгриды оставляют на выходные.

Вашу гипотезу проверил. Длинные статьи (3000+ слов) в будни дают медианный рейтинг 10, в выходные 9, разница незначима (p=0.65). Короткие: 6 против 4, тоже незначимо. Утро против вечера также, ни для длинных, ни для коротких значимой разницы нет. длина работает одинаково во все дни. Интересно то, что длинные стабильно берут выше коротких (8–11 против 3–7), и это держится и в понедельник, и в субботу. То есть взаимодействия день x длина нет, есть просто эффект длины сам по себе.

Также воскресенье проваливает всё подряд независимо от длины (рейтинг 3–4), а суббота даёт лучший охват, но скорее всего это просто потому что публикаций в этот день вдвое меньше и конкуренция за ленту ниже.

Sign up to leave a comment.

Articles