Представь, ты тестируешь новый препарат и измеряешь время его действия на группе из 50 пациентов. Среднее арифметическое (например, 15.38 часов) выступает точечной оценкой терапевтического эффекта для всех потенциальных больных. Как оценить достоверность этой значения параметра для всей генеральной совокупности? Об этом читай ниже

Что такое точечные оценки?

Определение

Пусть \theta - некоторый параметр распределения случайной величины X, который необходимо оценить по выборке.

Из генеральной совокупности извлекается выборка X_n объема n, по которой вычисляется оценка параметра \theta_n^*. Нижний индекс n указывает на зависимость оценки от объема выборки.

Числовое значение параметра, полученное по выборке, называется точечной оценкой. Она представляет собой функцию от элементов выборки:

\theta_n^*=f(x_1, x_2, ...,x_n)

Поскольку выборка X_n случайна, то и сама оценка \theta_n^* также является случайной величиной, принимающей различные значения для разных выборок.

Любую функцию от выборки f(x_1, x_2, ...,x_n) называют статистикой или статистической оценкой параметра.

Свойства точечной оценки

Как и каждая случайная величина, точечная оценка может рассматриваться со своими числовыми характеристиками: математическим ожиданием - \mathbb{M}[\theta_n^*] и дисперсией - \mathbb{D}[\theta_n^*]

  1. Несмещенность: оценка \theta^* называется несмещенной оценкой параметра \theta, если \mathbb{M}[\theta_n^*] =\theta. Величина |\theta - \mathbb{M}[\theta_n^*] | называется смещением или систематической ошибкой оценивания. Для несмещенных оценок смещение равно 0. Несмещенность означает, что оценка не ошибается систематически в одну сторону.

  2. Эффективность: оценка \theta_n^* называется эффективной оценкой параметра \theta, если ее дисперсия меньше дисперсии любой другой альтернативной оценки при фиксированном объеме выборки n, то есть \mathbb{D}[\theta_n^*]=\mathbb{D}_{min}. Оценка называется асимптотически эффективной, если \lim_{n\to\infty}\mathbb{D}[\theta_n^*]\to 0. Эффективность означает, что оценка не скачет от выборки к выборке.

  3. Состоятельность: оценка \theta_n^* называется состоятельной оценкой параметра \theta, если она сходится по вероятности к истинному параметру \theta, то есть для

    \forall \epsilon > 0\ \ lim_{n\to\infty}P(|\theta - \theta_n ^*| < \epsilon) =1.

    Достаточным условием состоятельности является \mathbb{M}[\theta_n^*] \to \theta и \mathbb{D}[\theta_n^*]\to0 при n\to\infty. Состоятельность означет, что рост объема выборки увеличивает точность оценки.

Как находить точечные оценки?

Метод моментов

Метод моментов, предложенный Пирсоном еще в 1894 году, является наиболее простым методом оценки параметров. Несмотря на то, что оценки, полученные таким способом обычно являются состоятельными, они нередко уступают оценкам максимального правдоподобия по эффективности. Идея метода состоит в использовании некоторых начальных моментов распеделения, поскольку при больших объемах выборки выборочные моменты хорошо приближают соответствующие теоретические.

Определение. k-м начальным моментом случайной величины X = \{x_1, ...,x_n\}, где k\in \mathbb{N} называется величина:

m_k(X) = \mathbb{M}[X^k]

k-й момент можно представить в виде параметрической функции:

m_k=\phi_k(\theta_1, \theta_2, …,\theta_l),\ \ k = \overline{1,l}

Затем строится оценка:

\tilde{m}_k=\frac{1}{n}\sum_{i=1}^nx_i^k,\ \ k=\overline{1,l}

Приравнивая теоретические моменты их выборочным аналогам, получаем систему

\tilde{m}_k=\phi_k(\theta_1, \theta_2, …,\theta_l),\ \ k = \overline{1,l}

В случае, если \phi зависит от одного параметра \theta_1, то для вычисления оценки достаточно решить уравнение

 \mathbb{M}[X] = \frac{1}{n}\sum_{i=1}^nx_i

относительно \theta_1 Если параметров > 1, то вычисление оценок сводится к решению СЛАУ

\begin{cases}\mathbb{M}[X]=\frac{1}{n}\sum_{i=1}^nx_i\\ \mathbb{M}[X^2]=\frac{1}{n}\sum_{i=1}^nx_i^2\\...\\\mathbb{M}[X^k]=\frac{1}{n}\sum_{i=1}^nx_i^k\end{cases}

Такое приравнивание формул - следствие ЗБЧ (закона больших чисел): при больших n выборочные характеристики стремятся к истинным.

Пример: найти оценки параметров нормального распределения случайной величины X, применяя метод моментов.

Для нормального распределения необходимо оценить два параметра: математическое ожидание a =\theta_1 и среднеквадратичное отклонение \sigma=\theta_2.

Для оценки двух неизвестных параметров используют первые два момента и приравнивают теоретические моменты их выборочным аналогам:

m_1=\mathbb{M}[X], \ \ \ m_2=\mathbb{M}[X^2]\tilde{m}_1=\frac{1}{n}\sum_{i=1}^nx_i,\ \ \ \tilde{m}_2=\frac{1}{n}\sum_{i=1}^nx_i^2

Точечная оценка параметра a:

\boxed{a^*=\tilde{m}_1=\frac{1}{n}\sum_{i=1}^nx_i}

Второй параметр находится через дисперсию:

\mathbb{D}[X] = \mathbb{M}[X^2]-\mathbb{M}[X]^2

Поэтому

\sigma=\sqrt{\mathbb{M}[X^2]-\mathbb{M}[X]^2}

а оценка методом моментов принимает вид

\boxed{\sigma^*=\sqrt{\tilde{m}_2-\tilde{m}_1^2}=\sqrt{\frac{1}{n}\sum_{i=1}^nx_i^2-(\frac{1}{n}\sum_{i=1}^nx_i)^2}}

Таким образом, оценка метода моментов для математического ожидания нормального распределения - это просто выборочное среднее, а для среднеквадратичного отклонения - корень из выборочной дисперсии через второй начальный момент.

Проведем эксперимент для сравнения зависимости состоятельности оценки от объема выборки.

Рассмотрим генеральную совокупность объема N=10000, подчиняющаяся закону N(10,5).

И вычислим оценки методом ММ для n \in \{50, 100, 500, 1000\}

n

θ₁ (оценка a)

θ₂ (оценка σ)

50

10.75

5.38

100

9.81

4.70

500

10.39

5.08

1000

10.02

5.00

Из таблицы видно, что по мере роста объема выборки оценки приближаются к истинным значениям параметров.

Рис. 1. Сравнение оценок плотности для ММ при разных n с истинным распределением N(10,5)
Рис. 1. Сравнение оценок плотности для ММ при разных n с истинным распределением N(10,5)

Результаты эксперимента - прямая иллюстрация состоятельности оценки — свойства, которое было разобрано выше: чем больше n, тем точнее оценка приближается к истинному параметру θ.

Метод максимального правдоподобия (ММП)

Данный метод предполагает небольшие различия в вычислении оценок для дискретных и непрерывных величин.

Дискретный подход (законы Бернулли и Пуассона)

Пусть X - дискретная случайная величина, которая в ряде опытов приняла возможные значения \{x_1, x_2, …, x_n\}. Необходимо вычислить точечную оценку параметра \theta^* = \theta^*(x_1, x_n, …, x_n) заданного закона распределения.

Определение: Функцией правдоподобия дискретной случайной величины называют функцию аргумента \theta:

 \boxed{L(x_1, x_2, ... , x_n; \theta) = \prod_{i=1}^nP(x_i, \theta)}

Величина P(x_i, \theta) означает вероятность того, что в результате i-го испытания величина X приняла x_i значение.

Оценка максимального правдоподобия параметра - это значение парметра, при котором функция L(X_n;\theta) достигает максимума.

На практике, зачастую, функцию L не максимизируют напрямую, вместо нее можно использовать lnL, так как они достигают максимума при одном и том же значении.

Отсюда и произошло название логарифмическая функция правдоподобия.

Точку максимума функции аргумента можно искать несколькими способами:

  1. Через производную: Найти корень уравнения правдоподобия \frac{\partial L}{\partial\theta}=0. Это и будет критическая точка, сообщающая максимум

  2. Аналогично первому пункту, найти корень уравнения \frac{\partial\ lnL}{\partial\theta}=0

  3. Через вторую производную: найти \frac{\partial^2 L}{\partial\theta^2}; если значение при \theta=\theta^* отрицательно, то это точка максимума.

Найденная точка максимума принимается в качестве оценки МП параметра \theta.

Непрерывный подход

Все требования аналогичны предыдущему случаю, кроме того, что X - непрерывная случайная величина.

Определение: Функцией правдоподобия непрерывной случайной величины называют функцию аргумента \theta:

 \boxed{L(x_1, x_2, ... , x_n; \theta) = \prod_{i=1}^nf(x_i, \theta)}

Оценка максимального правдоподобия неизвестного параметра распределения непрерывной случайной величины вычисляется так же, как и в случае дискретной случайной величины.

Если плотность распределения непрерывной случайной величины определяется двумя неизвестными параметрами (уже упоминавшееся нормальное распределение) \theta_1 и \theta_2, то функция правдоподобия считается функцией двух независимых аргументов:

 \boxed{L(x_1, x_2, ... , x_n; \theta_1, \theta_2) = \prod_{i=1}^nf(x_i, \theta_1, \theta_2)}

Для отыскания ее максимума находят логарифмическую функцию правдоподобия и решают систему:

\begin{cases}\frac{\partial\ lnL}{\partial\theta_1}=0\\ \frac{\partial\ lnL}{\partial\theta_2}=0\end{cases}

Пример 1: найти точечную оценку параметра (вероятность появления события в одном испытании) биномиального распределения случайной величины X, применяя метод максимального правдоподобия.

Вероятность появления события в m испытаниях Бернулли:

 P_m(x_i)=C_m^{x_i}\cdot p^{x_i} \cdot (1-p)^{m-x_i}

где x_i - число появлений событий в i-м опыте, m - количество испытаний в одном опыте, n - количество опытов

Перепишем функцию правдоподобия с учетом постановки задачи: \theta=p, P(x_i, \theta) = C_m^{x_i}\cdot p^{x_i} \cdot (1-p)^{m-x_i} . Получаем:

 L = \prod_{i=1}^n[C_m^{x_i}\cdot p^{x_i} \cdot (1-p)^{m-x_i} ]

Логарифмическая функция правдоподобия:

 lnL = ln\prod_{i=1}^n[C_m^{x_i}]+ (\sum_{i=1}^nx_i)lnp + (nm-{\sum_{i=1}^nx_i})ln(1-p)

Найдем первую производную по p и решим уравнение:

\frac{\partial lnL}{\partial p}=0 \Longrightarrow \frac{\sum_{i=1}^nx_i}{p}-\frac{nm-\sum_{i=1}^nx_i}{1-p}=0

Искомая критическая точка, принимающаяся в качестве оценки максимального правдоподобия неизвестной вероятности биномиального распределения, выглядит так:

\boxed{p^* = \frac{\sum_{i=1}^nx_i}{nm}}

Получается, что p^* - это просто доля появления успеха во всех испытаниях, что в целом кажется интуитивно понятным, а ММП еще раз подверждает это.

Пример 2: найти точечную оценку параметров (математического ожидания и среднеквадратичного отклонения) нормального закона распределения случайной величины X, применяя метод максимального правдоподобия.

Пример направлен на сравнение ММП и ММ.

Составим функцию правдоподобия:

L(x_1, x_2, ... , x_n; \theta_1, \theta_2) = \prod_{i=1}^nf(x_i, \theta_1, \theta_2)

Учитывая, что \theta_1 = a, \theta_2 = \sigma и, следовательно, f(x_i, \theta_1, \theta_2) = f(x_i, a, \sigma), получим:

L = \prod_{i=1}^n\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x_i-a)^2}{2\sigma^2}}=(\frac{1}{\sqrt{2\pi}\sigma})^ne^{-\frac{\sum_{i=1}^n(x_i-a)^2}{2\sigma^2}}

Логарифмическая функция правдоподобия:

 lnL = -nln(\sqrt{2\pi})-nln(\sigma)-\frac{\sum_{i=1}^n(x_i-a)^2}{2\sigma^2}

Поиск оценок сводится к решению системы уравнений:

\begin{cases}\frac{\partial\ lnL}{\partial a}=0\\ \frac{\partial\ lnL}{\partial\sigma}=0\end{cases}

Из первого уравнения получим точечную оценку параметра a:

\frac{\partial\ lnL}{\partial a}=0 \Longrightarrow  a^* =\frac{\sum_{i=1}^nx_i}{n}

Из второго - оценку параметра \sigma:

\frac{\partial\ lnL}{\partial\sigma} =0 \Longrightarrow  \sigma^*=\sqrt{\frac{\sum_{i=1}^n(x_i-a)^2}{n}}

Для ММП также проведем эксперимент с генеральной совокупностью из пункта про ММ.

Для честности возьмем такие же объемы выборки.

n

θ₁ (оценка a)

θ₂ (оценка σ)

50

9.83

4.84

100

9.92

4.90

500

9.88

4.96

1000

10.09

5.01

Результаты аналогичны ММ — обе оценки состоятельны для нормального распределения.

Рис.2 Сравнение оценок плотности для ММП при разных n с истинным распределением N(10,5)
Рис.2 Сравнение оценок плотности для ММП при разных n с истинным распределением N(10,5)

Что в итоге?

Оба метода показали схожие результаты для нормального распределения, что является очевидным следствием из математических свойств. ММП хорошо использовать в более сложных случаях, так как он асимптотически эффективен: достигает минимально возможной дисперсии при больших n. Вот почему scipy.stats использует ММП в методе fit(). Если же максимизировать функцию прадоподобия вычислительно сложно, тогда можно воспользоваться методом моментов, он позволяет получить хорошее первое приближение.