Comments 14
Восемь тысяч охвата, семь плюсов и три комментария — это норма площадки, а не неудача.
И всё-таки семь плюсов это провал. И восемь провал. И девять. Вот десять уже можно считать нормальным результатом.
Но не потому, что семь плюсов это медиана, и половина статей имеет ещё меньше, а потому что в настройках Habr можно задать порог рейтинга только
Все; ≥0; ≥10; ≥25; ≥50 и ≥100

А порога “≥7” нет, и уже через несколько дней статью никто не увидит — те, кто смотрит с порогом “Все” или “≥0” не доберутся до #адцатой страницы, на которую статья опустилась, а те, кто смотрит с порогом “≥10” (а также те, кто смотрит “Лучшие”) ее вообще не увидят в выдаче даже если рассматриваемый в статье вопрос им мог бы быть интересен ¯\_(ツ)_/¯
/imho
₽$ У меня в июле вышло две статьи:
Запуск тяжелых 3D-игр на компьютере со слабой видеокартой — от теории к практике
Дополнительное охлаждение Fanless Mini-PC — push vs pull: на обдув или на выдув?
и по остальным критериям (охват, закладки, комментарии) они выше медианных значений, а вот по рейтингу как раз медианные “+7”, и увы, это провал ¯\_(ツ)_/¯
Я согласен, что в интерфейсе нет порога >=7, и через неделю статью с рейтингом 7 почти не видно, вы правы. Я имел в виду, что нужно понимать, чего ожидать сразу после публикации. Если у статьи через сутки 7 плюсов, автор может посчитать это провалом, хотя это средний показатель для этой площадки. А вот то, как долго статья будет находиться в поиске, - это уже другой показатель, и там действительно нужно 10 плюсов.
Заглянул в ваши статьи. По охлаждению Mini-PC хабы у вас как раз сильные - DIY и Читальный зал, у них медианный рейтинг 18 и 14, то есть с хабами всё правильно,И 9 рейтинга при них уже нижняя часть распределения, а не провал. А вот у "3D-игр на слабой видеокарте" стоит формат "Туториал", и это как раз тот единственный формат, который по моим данным на личных блогах значимо проседает, там медиана 4 против 7 у неуказанного, p=0.018. Кейс или просто снять формат, по идее, должно тянуть вверх. Но это только гипотиза :)
Я имел в виду, что нужно понимать, чего ожидать сразу после публикации.
Это я понял, я имел в виду что критерии имеют разный “вес”.
Например если какая-то статья на какуюто специфическую тему не наберёт сразу много просмотров, но при этом сразу (за первые несколько дней) получит высокий рейтинг, то потом со временем она доберет и просмотры, а если по каким-то причинам статья не наберёт ≥10 (а лучше ≥25), то потом она опустится в выдаче, и ее уже ничего не спасет. При этом просмотры набегают всю жизнь, а рейтинг только в первый месяц (а фактически первые несколько дней, поскольку потом просмотры резко падают, и набор рейтинга резко замедляется, падая до нуля).
Например у меня есть весьма специфическая статья “не для всех” FullHD vs 4k и integer scaling: всегда ли 2 x 2 = 4?, набравшая +12 буквально в первые дни (для своей аудитории тема действительно интересная), и она до сих пор набирает просмотры, и есть статья Освещённость рабочего места, backlight, яркость экрана vs усталость глаз с рейтингом +3 (ИМХО из-за первого комментария, уведшего обсуждение в сторону), которая интересна для очень многих, и которая добирает просмотры из-за внешних ссылок на нее, хотя внутри habr она скажем так, не особо популярна.
₽$ Ну и самое главное — просмотры, закладки и обсуждения добираются всю жизнь, а рейтинг только в первый месяц.
А вот у “3D-игр на слабой видеокарте” стоит формат “Туториал”, и это как раз тот единственный формат, который по моим данным на личных блогах значимо проседает, там медиана 4 против 7 у неуказанного, p=0.018. Кейс или просто снять формат, по идее, должно тянуть вверх.
Попробую изменить на “Кейс”, хотя сейчас наверное уже поздно, +3 к рейтингу уже вряд ли успею добррать, ну и по большому счету это уже читерство - при публикации думать не только о содержимом статьи, и для кого она может оказаться интересна, а под каким соусом форматом ее выкладывать.
₽₽$ Сейчас посмотрел - обе мои статьи резко добрали до +9 рейтинга с момента моего предыдущего поста. Возможно вы помогли (в таком случае спасибо), может кому-то из читателей вашей статьи они оказались интересны (а в своей обычной выдаче он их не увидел из-за их невысокого рейтинга) а может просто так совпало.
Но “проходной балл” +10 пока все равно не получается…
Про разные скорости вы точно сформулировали то, что у меня в статье осталось между строк: рейтинг набирается в первые сутки-двое и потом почти замирает, а охват копится месяцами через поиск и внешние ссылки. Это две отдельные метрики с разной динамикой, и оптимизируются они тоже по-разному: рейтинг через форму и первое впечатление на день публикации, охват же через тему, которую ищут годами. Ваша "FullHD vs 4K с integer scaling" и "освещённость рабочего места" - это то, что будет тянуть трафик из поиска ещё долго, даже с рейтингом 3 и 12.
Про формат не обязательно поздно, я не знаю точно, реагирует ли алгоритм на смену метки уже опубликованного материала, но в интерфейсе она меняется. Если поменяете "Туториал" на "Кейс", то интересно будет посмотреть через недельку, сдвинется ли что-то. Если да, то это будет полезное наблюдение для следующей итерации моего разбора.
Если поменяете “Туториал” на “Кейс”, то интересно будет посмотреть через недельку, сдвинется ли что-то.
Я вчера в первой статье “Туториал” поменял сначала “Кейс”, а потом просто снял формат, а во второй вместо “Обзор” тоже снял формат.
Хотя в принципе обе статьи можно поставить “Кейс” (по смыслу это вроде как обеим статьям соответствует), но судя по вашей “Аналитике” без формата предпочтительнее…
Ну, в общем посмотрим… Сейчас обе-две с рейтингом “+9”
это то, что будет тянуть трафик из поиска ещё долго, даже с рейтингом 3 и 12.
И тем не менее с “+12” в выдаче поиска habr будет выше, чем с “+3” (правда тут уже нет градации ≥10 vs ‹10).
Хотя сейчас эти статьи в основном через внешниие ссылки просмотры набирают, а там скорее всего никакие метрики не имеют значения.
Есть ложь, есть большая ложь, а есть статистика КЛИКБЕЙТ. Извините, но КПДВ не соответствует статье вообще.
https://habrastorage.org/r/w1560/getpro/habr/upload_files/997/430/430/9974304304fbbebf26cf77d5afa9fc61.png
Покажите этот график.
Ряд параметров не могут быть связаны с охватом. Например, наличие гифок, обилие иллюстраций или графиков. Читатели сначала открывают статью (плюс к охвату), а потом видят гифку. То есть, на рейтинг это может повлиять, на охват - нет. Конечно, охват зависит от рейтинга. Но опять же. Это если выставить фильтр на сайте. А, например, в rss рейтинг не видно.
По каждой статье собраны метаданные площадки (охват, рейтинг, закладки, комментарии, хабы, теги, сложность, формат, время публикации) и разбор тела публикации: количество слов и символов, картинок, гифок, встроенных видео, блоков кода, подзаголовков, пунктов списков, таблиц, внешних ссылок, длина первого абзаца и заголовка.
ИМХО не хватает анализа наличия в теме опросов (и может быть их количества).
С одной стороны, опросы оживляют обсуждение темы и увеличивают охват (да и сами по себе результаты опросов бывают весьма интересны как для автора, так и для читателей), а с другой стороны могут увести обсуждение в сторону — может перейти из обсуждения темы в обсуждение опросов.
В общем, может быть интересная метрика.
/imho
Пишите для себя, тогда точно как минимум одному человеку понравится и пригодится, и этот человек вам не чужой :)
А если пытаться закрывать потребности рынка, то потом: "А почему не взлетело", "Для кого старался", "Столько времени и сил в никуда", "Больше здесь ничего не напишу"...
В таблице с корреляциями что-то не сходится. В вирусной выборке вы считаете связь признаков с охватом, в контрольной — с рейтингом. Поэтому по этой таблице нельзя сделать вывод, что знак изменился из-за ошибки выжившего. Для этого нужно сравнить один и тот же показатель на двух выборках.
И ещё: как вы считали десятичный логарифм рейтинга, если 7,1% статей получили нулевой или отрицательный рейтинг? Вы сдвигали значения, отсекали их или исключали эти статьи из модели?
Спасибо, замечания справедливые. С колонками я действительно накосячил: сравнил разные Y. Перепроверил на одинаковом рейтинге - знаки всё равно меняются, так что вывод остался тем же, но показать это сразу было бы честнее.
С log тоже верно: я обрезал отрицательные рейтинги до нуля. Это не лучшая обработка данных. Если использовать рейтинг как есть, качество модели было бы даже ниже.
На главный вывод это не влияет: форма статьи объясняет очень мало. Но оформить и объяснить методику стоило аккуратнее. Учту на будущее.
Разобрал 1233 статьи Хабра: всё, что советуют авторам, объясняет 6% результата