Pull to refresh
19
Генрих@Ananiev_Genrih

аналитика и визуализация данных

39
Subscribers
Send message

Для этого нам поможет статистика:

μ — среднее расстояние до центроида кластера (средняя длина);

  • σ  — стандартное отклонение (среднеквадратичное отклонение).

  • Зная эти величины, мы очень просто высчитаем границу кластера

А в какой момент в статье вы пришли к тому что у вас везде нормальное распределение чтобы этим пользоваться?

Где:

Иначе k— это квантиль нормального распределения, соответствующая вероятности выброса.

Ощущение что где-то здесь потерялась формула

Найдём точки, которые лежат за median + 2σ

Какой-то винегрет из тёплого с мягким, вы либо среднюю используйте в комбинации с сигмой, либо медиану в комбинации с MAD

Если n < 30

?

Байесовская оценка k — не единственная оценка, которой можно придерживаться. Это лишь экспоненциальное сглаживание.

Я бы не был столь категоричен

Зачем вообще в 2026 году при наличии duckdb и polars говорить про оптимизации в pandas для ресурсоемких наборов данных на локальной машине?

Осталось надеяться что инвесторы проявят интерес и не дадут утонуть в тонне других исследований

потому что лучше джун удалит 1 запись из user, а не 1 запись из user и все связанные из order :)

А нечего при создании FK явно самому себе стрелять в ногу в виде доп опции:

 ... on delete cascade

и будут FK уберегать от таких кейсов сторожа консистентнось

Сотрудники делали огромные выгрузки на 30к строк, это все было очень долго и сопровождалось затупами

30k - это не ошибка?

теперь наконец-то вместо 3х строк кода появилась уникальная возможность и на piechart побольше выбросов co2 на землю-матушку выпустить. Зато +1 хайп игрушка

Приземляем в реальность: в категории Х (пусть это будет пиво) магазина Y содержится на остатках 25 sku (бренд, емкость, и т.д., ну то есть 25 номенктаурных позиций). Из них 20 имеют регулярные продажи (история продаж в магазине за ... ну пусть будет 18 месяцев) но с аномальными выбросами (0 или близко к тому из-за недопоставки или всплески как из-за ремонта соседнего магазина-конкурента так и в следствие запуска промо со скидками 30% от полочной цены). Так же 5 из этих 20 имеют асимптотическую тенденцию продаж почти около 0 за последние 2 месяца (собираются выводить из матрицы магазина) , а те 5 из 25 - это относительные новинки для этого магазина которые завели в матрицу 2 недели назад (история продаж ==14 дней). Нужен прогноз горизонтом в 8 недель по датам по всем 25 sku. Всего таких категорий - полный ассортимент магазина (ну если не фарма а условный продуктовый FMCG, то 1000 sku разных категорий) и прогноз нужен по всем. В реальности сейчас весь forecasting в бизнесах : градиентные бустинги для которых такие ситуации - повседневность (если точнее -повсеночность). А как будет LLM'ная сеть такое решать за рамками лаборатории?

2025 год: ёжики плакали, кололись, упорно игнорировали polars и duckdb продолжая давиться пандасом "потому что дисклеймер"

честно признаюсь что "минусанул" статью за низкий технический уровень материала . Раз уж это что-то про NLP направление, то давайте посчитаем хотя бы на easy- уровне долю предложений, соотвествующих тематике заголовка от всего корпуса этой статьи (даже без стемминга/лемматизации). И долю по тематике "топ Х советов чтобы не кинул заказчик".

Лучше бы сделали хороший авторский перевод статьи по своему заголовку чтобы Хабр стал больше похож на торт

А кто-то делает code review за этими "self service bi джедаями"?

А то потом выснится что неправильные пчёлы оказывается делают неправильный мед от которого bi сервису становится плохо, но польза бизнесу в виде широких портянок конечно наносится, спору нет.

(Вопрос не надуманный - реальность)

Наталья, прочитал до конца. Внимательно кстати ибо заголовок тригернул и тема очень актуальная. А о чем была статья? Если это вводная для целой серии - то ок, ждём матчасть в суровых оффлайн реалиях (подходы к стратификации, сэмплингу, стат.методы для малых выборок и т.д.). Если статья просто о том как в оффлайне все иначе, то зачем статья тогда в принципе? (И так очевидно что все иначе и свои особенности)

Embedding+ vector search (HNSW, product quantization, locality sensitive hashing) пробовали?

https://en.m.wikipedia.org/wiki/Vector_database

https://faiss.ai/

Интересная статья, спасибо

Недавно прочитал эту статью про то как оценивать эффект A/B теста через бинарную классификацию и ROC/AUC. Этот подход укладывается в перечисленные способы нестандартной оценки или это совершенно про разное?

Вопрос на миллион: что с производительностью, каким движком выполняется проверка? Если там под капотом а-ля пандас, то возможно на игрушечных датасетах - норм. А на нагрузке как все это у вас работает? Успевают данные прокачиваться в регламентные окна при этом DQ?

Спасибо за статью.

Насколько это решение применимо в классификации для такого рода задач когда классов трейнсета примерно 70000, документов (текстовых наименований продукции ) в среднем по 4 на класс (т.е. документов около 300_000 в трейне) ?

Это пример из реальности где я в том числе делал стемминг https://habr.com/ru/articles/658501/

Статья хорошая и сервис получился интересный, видно что ваша команда вложила силы и душу в проект. Не понятна только цель у вашего заказчика. Получить многопользовательской файловый data swamp чтобы потом утонуть в нём же?

1
23 ...

Information

Rating
Does not participate
Location
Москва, Москва и Московская обл., Россия
Date of birth
Registered
Activity

Specialization

Data Analyst, BI Developer
Lead