Обновить
128K+

Математика *

Царица всех наук

241,15
Рейтинг
Сначала показывать
Порог рейтинга

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_9

?Вопрос_9: В чем разница между Rapids, Vaex, Pandas, Polars, Modin, Dask они же все для анализа данных ?

✔️Ответ:

  1. Pandas предоставляет гибкие структуры данных, такие как DataFrame, и мощные инструменты для манипуляции, фильтрации, агрегации и анализа данных. Pandas обычно используется для работы с небольшими и средними объемами данных, которые могут поместиться в оперативную память одного компьютера;

  2. Dask позволяет обрабатывать данные, превышающие объем доступной оперативной памяти, с использованием распределенных вычислений. Dask предоставляет абстракции, такие как DataFrame и Array, которые подобны структурам данных из Pandas и NumPyx;

  3. Polars обладает высокой производительностью благодаря использованию Rust в своей реализации, а также предлагает возможности параллельной обработки данных. Она может работать с большими объемами данных и поддерживает некоторые распределенные вычисления;

  4. Vaex использует ленивые вычисления и эффективные алгоритмы для выполнения операций над данными. Она обладает высокой производительностью и может работать с многопоточностью, многопроцессорностью и распределенными вычислениями;

  5. Modin предоставляет интерфейс, совместимый с Pandas, но с оптимизированной производительностью. Она использует различные движки обратной совместимости, такие как Dask и Ray, для распределенных и параллельных вычислений.

    https://t.me/DenoiseLAB

Теги:
Всего голосов 4: ↑4 и ↓0+4
Комментарии0

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_8

?Вопрос_8: Какие алгориммы поиска аномалий в данных существуют и чем они отличаются ?

✔️Ответ:

  • DBSCAN (Density-Based Spatial Clustering of Applications with Noise) - алгоритм кластеризации данных, который основывается на плотностной информации о расположении объектов. Он определяет кластеры как плотные области в пространстве признаков, разделенные областями разреженности;

  • LOF (Local Outlier Factor): LOF также использует информацию о плотности для обнаружения аномалий. Он вычисляет локальный коэффициент выброса для каждого объекта, основываясь на плотности окрестности данного объекта по сравнению с плотностью окрестности его соседей. Значения LOF выше единицы указывают на аномальные объекты;

  • Isolation Forest использует случайные деревья для изоляции аномалий. Он строит ансамбль изолирующих деревьев, разделяя объекты по случайным разделениям до тех пор, пока каждый объект не будет изолирован в отдельном листе. Аномалии обычно требуют меньшего числа разделений для изоляции, и поэтому имеют более короткий путь в дереве;

  • One-Class SVM (Support Vector Machines): One-Class SVM - алгоритм, который строит модель только для "нормальных" данных. Он пытается найти гиперплоскость, которая наилучшим образом разделяет нормальные данные от выбросов в пространстве признаков. Объекты, находящиеся далеко от этой гиперплоскости, считаются аномалиями.

    https://t.me/DenoiseLAB

Теги:
Всего голосов 4: ↑2 и ↓20
Комментарии3

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_7

?Вопрос_7: Какие есть разновидности Adam optimization и в чем их разница ?

✔️Ответ:

  1. AdamW вводит дополнительное слагаемое в обновление параметров модели для уменьшения влияния больших значений параметров. Это помогает справиться с проблемой увеличения значений параметров во время обучения нейронных сетей, что может приводить к переобучению. Дополнительное слагаемое регуляризует обновление параметров и способствует лучшей обобщающей способности модели;

  2. Nadam (Nesterov-accelerated Adaptive Moment Estimation) является вариацией алгоритма Adam с коррекцией Nesterov Momentum. Она использует модификацию алгоритма Momentum для вычисления градиентов в моменты времени, отличные от текущего;

  3. AMSGrad (Adaptive Moment Estimation with Variance Correction) вводит исправление для оценки второго момента градиентов. Оно предотвращает возможное увеличение оценки второго момента в сравнении с алгоритмом RMSprop;

  4. AdaBelief использует адаптивные скорректированные оценки моментов и вводит дополнительные гиперпараметры для контроля скорости обучения и сглаживания оценок моментов;

  5. RAdam (Rectified Adam) вводит коррекцию для оценки первого момента градиентов, чтобы устранить проблему смещения оценки первого момента на начальных итерациях обучения. RAdam также включает в себя масштабирование скорости обучения на начальных итерациях для стабилизации процесса обучения.

    https://t.me/DenoiseLAB

Теги:
Всего голосов 3: ↑2 и ↓1+1
Комментарии1

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_6

?Вопрос_6: Всегда ли PCA спасает от проблеммы "проклятие размерности" и если нет, то что можно использовать вместо него ?

✔️Ответ:
РСА не всегда спасает от проклятия размерности, однако существует несколько продвинутых алгоримов для решения данной проблеммы:

  • t-SNE (t-Distributed Stochastic Neighbor Embedding): Этот алгоритм позволяет визуализировать данные высокой размерности в двух или трех измерениях, сохраняя при этом их локальную и глобальную структуру. Он основан на вероятностной модели, которая пытается сохранить близость между объектами в исходном пространстве и их представлением в пространстве меньшей размерности.

  • LLE (Locally Linear Embedding): LLE ищет линейные зависимости между соседними точками данных и пытается сохранить эти зависимости при снижении размерности. Алгоритм строит локальные линейные модели для каждой точки данных и затем находит низкоразмерное представление, которое наилучшим образом воспроизводит эти локальные модели.

  • UMAP (Uniform Manifold Approximation and Projection): UMAP является относительно новым алгоритмом снижения размерности, который сочетает в себе методы локальной связности и глобальной структуры данных. Он строит граф связности между точками данных и затем находит низкоразмерное представление, которое сохраняет геометрическую структуру данных.

    Кроме того, в ряде задач применяются: Isomap, MDS, Random Projection, Sparse Coding, NMF.

    https://t.me/DenoiseLAB

Теги:
Всего голосов 1: ↑1 и ↓0+1
Комментарии0

В лингвистике имеется слабо изученный закон Ципфа, применяемый для изучения распределений числовых значений различной природы. При этом отсутствует внятное теоретическое объяснение природы этого закона. Попытаемся придумать объяснение.

Рассмотрим следующую модель. Допустим, есть множество вершин, линейно упорядоченных и образующих граф, в котором из каждой вершины идут рёбра во все последующие вершины. В случайно выбранную вершину поступает новая информация. Вершина передает эту информацию в случайно выбранную вершину, в которую из нее идёт ребро, и так по цепочке. Если мы посчитаем для каждой вершины вероятность прохождения пути через неё, получим распределение частоты получения информации между вершинами. Будет ли подчиняться это распределение закону типа Ципфа?

Если взять выборку цепочек передачи информации, то они выделят подграф исходного графа, в котором частоты получения информации вершинами будут соответствовать степеням вершин. Известно, что распределение узлов интернета по степеням подчиняется закону Парето, который аналогичен закону Ципфа.

В качестве обобщения можно рассмотреть в качестве исходного графа произвольное частично упорядоченное множество. Еще одно обобщение – переменная густота этого графа, которая может привести к изменению степенного параметра распределения для разных групп вершин.

Вообще применимость закона Ципфа для конкретной предметной области зависит от простоты выдвигаемой модели. Если моделируемый объект ведет себя примерно так, то модель применима

Теги:
Рейтинг0
Комментарии0

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_5

?Вопрос_5: Что означает термин "Variance Inflation Factor" и как он интерпритируется и есть ли ему аналоги ?

✔️Ответ:

"Variance Inflation Factor" (VIF) относится к статистическому показателю, используемому для измерения степени мультиколлинеарности в модели линейной регрессии. Мультиколлинеарность происходит, когда две или более независимые переменные в модели сильно коррелируют друг с другом, что может исказить результаты регрессии.

VIF равен 1, когда вектор предиктора ортогонален каждому столбцу матрицы проектирования для регрессии предиктора на другие ковариаты. В противном случае, если вектор предиктора не ортогонален всем столбцам матрицы проектирования для регрессии предиктора на другие ковариаты, VIF будет больше 1.

Интерпретация VIF следующая: если VIF предиктора равен 5.27 (корень из 5.27 = 2.3), это означает, что стандартная ошибка для коэффициента этого предиктора в 2.3 раза больше, чем если этот предиктор имел бы корреляцию 0 с другими предикторами в модели. VIF измеряет количество завышенных дисперсий, вызванных мультиколлинеарностью. 

В качестве аналога VIF можно рассмотреть "Tolerance Index" (TI), который также используется для измерения степени мультиколлинеарности в модели. TI также представляет собой отношение дисперсии оценок параметра к дисперсии модели.

https://t.me/DenoiseLAB

Теги:
Рейтинг0
Комментарии0

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_4

?Вопрос_4: Как проверить нормальность набора данных или признака?

✔️Ответ: Существует список проверок нормальности, они следующие:

  • W-тест Шапиро-Уилка:

    1. Рассчитывается выборочное среднее и ковариационная матрица выборки;

    2. Затем вычисляются статистики заказа (например, i-е наименьшее число в выборке) и ожидаемые значения из статистики заказа, выбранные из стандартного нормального распределения;

    3. Наконец, вычисляется W-статистика, которая сравнивается с критическим значением, полученным через моделирование Монте-Карло;

    4. Если W-статистика значима, то гипотеза о нормальном распределении данных отвергается, то есть данные, не следуют нормальному распределению;

  • Тест Мартинеса-Иглевича:

    1. Вычисляются квантили выборки;

    2. Эти квантили сравниваются с квантилями стандартного нормального распределения;

    3. Расстояние между квантилями выборки и стандартного нормального распределения вычисляется для каждого квантиля;

    4. Если все расстояния меньше некоторого критического значения, то гипотеза о нормальном распределении данных принимается.

  • Тест Д'Агостино

    1. Вычисляются эксцесс и асимметрия выборки и эти значения сравниваются с ожидаемыми значениями для нормального распределения;

    2. Расстояние между вычисленными и ожидаемыми значениями вычисляется для каждого из них;

    3. Если оба расстояния меньше некоторого критического значения, то гипотеза о нормальном распределении данных принимается.

    https://t.me/DenoiseLAB

    #work #coding #testing #optimization #ml #learning

Теги:
Всего голосов 1: ↑1 и ↓0+1
Комментарии0

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_3

?Вопрос_3: Что такое преобразование Бокса-Кокса?

Преобразование Бокса-Кокса (Box-Cox transformation) - это преобразование, которое преобразует "ненормальные" зависимые переменные в нормальные переменные, так как нормальность является наиболее распространенным предположением при использовании многих статистических методов. Оно было предложено Георгом Боксом и Дэвидом Коксом в 1964 году.

Преображование Бокса-Кокса (Общий вид)
Преображование Бокса-Кокса (Общий вид)

Оно имеет параметр лямбда, который при значении "0" означает, что это преобразование эквивалентно лог-трансформации. Оно используется для стабилизации дисперсии, а также для нормализации распределения. Выбор оптимального значения параметра (лямбда) при использовании преобразования Бокса-Кокса может быть выполнен с использованием различных методов:

  1. Метод максимального правдоподобия: В этом подходе подбирается значение (лямбда), которое максимизирует правдоподобие модели. Это можно сделать с помощью численных методов оптимизации, таких как метод Ньютона-Рафсона или метод Брента;

  2. Критерии информационного критерия: можно использовать информационные критерии, такие как критерий Акаике (AIC) или критерий Шварца (BIC);

  3. Кросс-валидация: При этом данные разбиваются на обучающую и проверочную выборки, и производится оценка преобразования Бокса-Кокса для различных значений (лямбда) на обучающей выборке. Затем оцениваются результаты на проверочной выборке и выбирается лучшее значение.

    https://t.me/DenoiseLAB

Теги:
Рейтинг0
Комментарии0

❓100 Вопросов по Машинному обучению (Machine Learning) - Вопрос_2

?Вопрос_2: Объясните, что такое One-hot encoding и Label Encoding. Как они влияют на размерность заданного набора данных ?

✔️Ответ:

One-hot encoding - это представление категориальных переменных в виде двоичных векторов, при котором каждая уникальная категория переменной преобразуется в новый бинарный столбец, называемый "фиктивной переменной". В этом новом столбце значение 1 указывает на принадлежность к соответствующей категории, а значение 0 - на принадлежность к другим категориям. Таким образом, каждая уникальная категория представлена отдельным столбцом. Это позволяет алгоритмам машинного обучения интерпретировать категориальные значения и использовать их в расчетах. Не создает ложного упорядочения или отношения между значениями категориальных переменных и помогает избежать проблемы ложной корреляции между категориями переменных. Однако, использование one-hot encoding увеличивает размерность набора данных ("проклятие размерности").

Label Encoding - это процесс преобразования каждого значения категориальной переменной в целочисленный код. Каждой уникальной категории присваивается уникальное число. Label Encoding не добавляет новые столбцы к набору данных и не увеличивает размерность. Однако, важно понимать, что числовые значения, присвоенные категориям, могут создать ложное упорядочение или отношение между ними. 

#work #coding #testing #optimization #ml #learning

Телеграмм: https://t.me/DenoiseLAB

Теги:
Всего голосов 2: ↑2 и ↓0+2
Комментарии0

Youtube-канал ones and zeros опубликовал визуализации нахождения маршрута между двумя точками в реальных городах (Чикаго и Рим) при помощи A*. Алгоритм A* — это рекурсивный алгоритм поиска пути в графах на основе эвристик, изобретённый в 1968 году как усовершенствованная версия алгоритма Дейкстры. Этот алгоритм активно применяется в разработке игр.

Статья про A* в Википедии: ссылка

Пара статей на Хабре с объяснением работы алгоритма: 1, 2

Теги:
Всего голосов 16: ↑16 и ↓0+16
Комментарии3

Для решения задачи наименьших квадратов с двумя переменными предлагается круговой метод оптимизации. Задано отображение из плоскости в m-мерное пространство, координатные функции которого могут удовлетворять, например, свойству покоординатной монотонности, а также свойству замедления роста: каждая координата растет тем слабее, чем больше ее величина. Задача наименьших квадратов состоит в минимизации суммы квадратов m функций, зависящих от двух переменных.

Цель - найти все оптимумы, не вычисляя производные. Пусть задано два начальных приближения a, b. Первый шаг алгоритма: найти решение линеаризованной задачи наименьших квадратов в этом направлении. В результате получится точка c. Второй шаг алгоритма: решить задачу линейного поиска относительно угла. Развернем вектор bc на такой угол, в котором значение целевой функции станет локально минимальным. Для решения этой задачи можно использовать метод парабол, если вычислить значения целевой функции при развороте вектора, скажем, на ±5° и приблизить зависимость от угла многочленом второй степени. Далее полученная точка становится вторым приближением, а второе приближение с предыдущего шага - первым.

Метод вырезает на плоскости треугольники, в которых не должно оказаться оптимума, хотя этот вопрос открыт. Таким образом, запустив алгоритм из всех углов объемлющего прямоугольника, можно получить информацию о том, где уже не следует искать оптимумы. Алгоритм удобен нормированностью углов и может быть обобщен на более высокие размерности.

Теги:
Всего голосов 4: ↑3 и ↓1+2
Комментарии0

Профессор Университета Дрекселя Дарий Гринберг выложил на arXiv.org 422-страничный конспект по теории графов. Документ на английском «An introduction to graph theory» рекомендует себя как материал на курс Math 530 в Дрекселе длиной в четверть. Текущая редакция датируется 2 августа 2023 года.

Рассматриваются простые графы и мультиграфы, эйлеровы циклы, гамильтоновы циклы, остовные деревья, матричная теорема о деревьях, теорема де Брёйна — Эренефест — Смита — Татта, правильная раскраска, теорема Турана, двудольные графы, теорема Менгера и теорема Галлая — Мильграма. Также включены около сотни задач (без решений).

Гринберг вообще любит свободно распространять информацию. У себя на странице на сайте университета он непринуждённо ссылается на книги на пиратской библиотеке Library Genesis.

arXiv:2308.04512

Теги:
Всего голосов 5: ↑5 и ↓0+5
Комментарии0

Постановка задачи:

Бесконечное число математиков заходят в бар.
Первый просит пол кружки пива, второй треть, третий четверть...

Бармен отвечает: У меня столько пива нет.


Вот программа, которая это считает:

const бармен = function (математиков) {
    let пиво = 0;
    let счётчик = 1;
    let делитель = 2;
    while (счётчик <= математиков) {
        пиво += 1 / делитель++;
        счётчик++;
    }
    return пиво;
};

Вот пиво в зависимости от количества математиков:

1 - 0.5
10 - 2.02
100 - 4.197
1 000 - 6.486
10 000 - 8.788
100 000 - 11.09
1 000 000 - 13.393
10 000 000 - 15.695
100 000 000 - 17.998
```
Результаты расчётов расхода пива на математиков
Результаты расчётов расхода пива на математиков

С каждым разрядом, начиная от 10 000 математиков, прирост пива составляет 2,3 литра.

Вот вариация данной задачи:

Бесконечное число математиков заходит в бар.
Первый заказывает одно пиво, второй - половину кружки, третий - четверть.
Бармен отвечает: Вот дурачьё! - И наливает две кружки.

Предлагайте Ваши варианты задач про пиво с математиками. Пишите интересные наблюдения.

Теги:
Рейтинг0
Комментарии4

Ближайшие события

Я прочитал много математических статей про числа и мне пришли в голову бредовые мыслт. Некоторые числа оказались трудно находимыми. Например \sqrt[]{-1}, долго представлял для математиков большую проблему. Пока не сошлись на мнимой единице.

Следующее число, которое трудно найти это сумму находящегося ряда: x=1-1+1-1... Дело в том, что в зависимости от методов подсчёта мы можем получить любой число. Ряд бесконечный, мы можем собрать бесконечные варианты, которые могут нам дать любое целое число.

Так почему бы и не отметить это так, как надо: x=Z. Z - это любое целое число. Намного легче было бы найти, если бы мы пытались узнать к чему стремиться сумма этого ряда. Тут ответ ясен: 1/2. При этом сумма ряда и стремление суммы ряда это разные операции.

Далее, деление на ноль. Есть 5/x=0, чему равно x? x=5/0=0. Далее y*0=7, чему равен y? Ответ: этого числа нет на привычной нам числовой прямой. А где оно? Оно находится на прямой сингулярных мнимых нулевых дробей и выглядит так: 5/0. Если есть мнимая единица, почему бы не быть мнимой нулевой дроби?

Тот ещё бред сознания, но почему бы и нет?

Теги:
Всего голосов 1: ↑1 и ↓0+1
Комментарии5

Пока писал статью про алгоритм Дойча https://habr.com/p/759352/, зашёл на его сайт в блог https://www.daviddeutsch.org.uk/2013/10/monty-hall-problem/

Monty Hall Problem

October 26, 2013

https://en.wikipedia.org/wiki/Monty_Hall_problem

Consider a different problem first: you’re faced with the same three boxes but now you can choose any one box OR any two boxes, and in the latter case receive the better of the two contents. It’s always better to choose two boxes, right? But the rules of the original game allow you to choose two! Here’s how. First point to the remaining box i.e. the one you’re not going to choose. Then Monty will open the worse of the two boxes you chose, and you take the better one.

Решим эту задачку

Рассмотрим всё пространство исходов = комбинация расположения выигрыша за дверью (с вероятностью 1/3) и последовательностью первоначального выбора-открывания двери ведущим и окончательного выбора

Пусть (1,0,0) - комбинация приза

возможные варианты последовательностей, признак изменения выбора,результат

121 01

123 00

131 01

132 00

232 00

231 01

323 00

321 01

Для других комбинаций приза аналогично = путём циклического сдвига

В результате

00 2*3

01 2*3

10 2*3

11 2*3

S(00)=S(01)=S(10)=S(11)

то есть вероятность выигрыша не зависит от изменения или не изменения первоначального выбора, она как была в 1/3, так и осталась 1/3

Вывод - не парьтесь по пустякам!

Теги:
Всего голосов 2: ↑1 и ↓10
Комментарии0

Сколько раз звонить, чтобы дозвониться. Наша странная реальность и теория вероятности. Является ли попытка дозвониться аналогом подбрасывания монеты

Бывают ситуации когда надо дозвониться до какой-то организации или человека, но телефон адресата то занят, то не отвечает, то вне зоны доступа и т.д. Мне попались любопытные данные внутренней статистики от одного из провинциальных операторов связи. Получается оптимальное количество попыток 4..7, а больше 15 раз делать попыток дозвониться теряет смысл, вероятность дозвона сильно уменьшается. И всё-таки это не подбрасывание монетки.

Теги:
Всего голосов 6: ↑4 и ↓2+2
Комментарии1

Как верно может быть неправильно. У нас есть сообщество, где мы решаем задачи школьной математики из разных стран. И вот там попалась задача, как на картинке: квадрат разбит особым образом на четыре треугольника, площади трёх знаем, найти площадь четвёртого.

Задача простая, можно решать разными способами. Один из участников сразу выдал в комментарии "16 - 2 - 4 - 3 = 7". С короткой припиской "попытаемся решать умным перебором, берем сразу сторону 4, проверка показывает, что подходит и решение единственное". И вот, уже через которое время, стали поступать другие способы решения, более длинные и более обоснованные. И другие люди стали писать, что быстрое первое решение неверно, так задачи решать нельзя.

И вот у меня как и у человека, предложившего первое решение, вопрос. А почему его решение не подходит? Что запрещает решать задачи методом умного перебора, заранее выбирая ответ среди правдоподобных значений, при необходимости корректируя его в нужном направлении с обоснованиями? Ведь в школьной математике очень многие задания подобраны так, что только Ad Hoc и решаются, так чем этот случай плох?

Теги:
Всего голосов 2: ↑2 и ↓0+2
Комментарии1

Часто рассказывают анекдот про математика, который волей случая оказался на конкурсе работ биологов. Там он заслушал доклад про изумительное наблюдение, подкреплённое множеством замеров: длина окружности муравейника примерно в три раза превосходит его диаметр.

Хорошо знают также ещё один подобный случай. В 1994 году выходит статья «Математическая модель для определения полной площади под графиком толерантности к глюкозе и под другими кривыми».

Статья предлагает разбить график на небольшие полосочки и складывать площади прямоугольников и прямоугольных треугольников. По сути, это метод трапеций.

В статье полученное наивно названо именем автора — «метод Тай». Позднее в ответ на критику она объяснит, что такое название дали коллеги и что она не пыталась выставить наблюдение в качестве великого открытия.

Научная работа известная, у неё 420 цитирований, чаще всего саркастических. К примеру, в том же 1994 году эти прозрения раскритиковали, указав, что это приблизительное вычисление хорошо известными математическими методами.

Всего голосов 10: ↑10 и ↓0+10
Комментарии0
12 ...
8