Современные генеративные модели используют мощный аппарат теории вероятностей: байесовскую оптимизацию, оценки максимального правдоподобия и тп. Но у этого подхода есть свои недостатки, например, галлюцинации, с которыми, наверняка, большинство сталкивалось при работе с ИИ.

Проведем обзор не новой, но набирающей популярность теории возможностей и ее использования в машинном обучении. Для этого проанализируем доклад профессора Наньянского технологического (Сингапур) и Уорикского университетов (Великобритания) Jeremie Houssineau.

Начнем с примера, демонстрирующего, как в космонавтике и теории рисков отличают две неопределенности: алеаторную (случайную) и эпистемическую (связанную с нехваткой знаний).

ESA and Delande, Jah, and Jones (2019)
ESA and Delande, Jah, and Jones (2019)

Поломка ракеты при запуске — это бинарное событие: даже зная все о ракете и ее траектории, мы не можем со 100%‑ной уверенностью сказать, произойдет ли авария. Поэтому 2 исхода с порогом вероятности  p_0.

Справа находится пример эпистемической неопределенности: космический мусор на орбите. Мы не знаем, где находится каждый объект, его скорость или массу, поэтому не можем сказать, прилетит ли он в МКС. Так появляется третья зона (желтая).

График по центру отвечает за вероятность столкновения в зависимости от точности данных (ковариации позиции). Разные цвета обозначают разные размеры обломков. Пунктиром отмечена алеаторная неопределенность, то есть игнорирование отсутствия информации и использование только физической случайности. Вероятность здесь низкая и убывает. Сплошной линией — эпистимическая и здесь вероятность столкновения высокая: чем меньше знаем, тем больше риск, причем по мере уточнения данных вероятность падает, что логично.

Таким образом, мы приходим к концепции: «Если нет информации, возможно все». Немного формализуем задачу и заодно отметим различия с теорией вероятностей.

Теория вероятностей

Теория возможностей

исследуемый параметр \theta \in \Theta

случайная величина

неопределенная переменная (uncertain variable)

основная функция f_\theta(\theta)

плотность распределения и нормировка через интеграл

possibility function f_\theta (\theta) \geq 0 и нормировка через супремум: sup_{\theta \in \Theta} f_\theta(\theta) = 1

«среднее»

математическое ожидание через интеграл плотности

\mathbb{E}^*(\theta) = argsup_{\theta \in \Theta} f_\theta(\theta)

дисперсия

\mathbb{D}(\theta) = \mathbb{E}(\theta - \mathbb{E}(\theta))^2

\mathbb{V}(\theta) = \mathbb{E}^*(-\frac{d^2}{d\theta^2} logf_\theta(\theta))^{-1}

Особый случай: если нет информации, считаем f_\theta(\theta) = 1 для любого \theta \in \Theta. Также одним из интересных свойств является независимость от параметризации (в отличие от появляющегося якобиана при замене в плотности), это объясняется очень просто: если мы ничего не знаем в одном пространстве, то ничего не знаем и в другом.

Продолжим анализ свойств функций возможностей и сравнение с аппаратом теории вероятностей.

Теория вероятностей

Теория возможностей

работа с выборками

можно сэмплировать

нельзя сэмплировать

inference

условная вероятность

f_{\psi}(\psi) = \sup_{\theta \in \Theta} f_{\theta,\psi}(\theta, \psi)

f_{\theta}(\theta \mid \psi) = \frac{f_{\theta,\psi}(\theta, \psi)}{f(\psi)}

независимость величин

независимость событий

f_{\theta,\psi}(\theta, \psi) = f_{\theta}(\theta) f_{\psi}(\psi)

факторизация

при независимости случайных величин совместная плотность представляется в виде произведения единственным образом.

при независимости разложение совместного распределения на множители не является единственно возможным.

Теорема Байеса

\pi(\theta \mid y) = \frac{L(y \mid \theta)\pi(\theta)}{\pi(y)} где:

L(y \mid \theta)— правдоподобие, \pi(\theta) — априорная вероятность, \pi(\theta \mid y) — апостериорная вероятность и знаменатель вычисляется как:

\pi(y) =  \begin{cases}  \int L(y \mid \theta)\pi(\theta)\,\mathrm{d}\theta & \text{if } \pi \text{ probabilistic} \\ \sup_{\theta \in \Theta} L(y \mid \theta)\pi(\theta) & \text{if } \pi \text{ possibilistic} \end{cases}

Вероятностная часть была известна уже давно, а возможностная была представлена в 2026 году.

Рассмотрим еще один относительно свежий результат (2025 года). В теории вероятностей формула Донскера‑Варадхана связывает математическое ожидание экспоненты случайной величины с относительной энтропией (KL‑дивергенцией) и в машинном обучении используется для поиска верхних границ вероятности переобучения нейросетей. Ученые из Наньянского технологического университета представили аналог этой теоремы для теории возможностей. Главное отличие в том, что во втором случае мы получаем две формулы, это объясняется тем, что, в отличие от теории вероятностей, у нас нет жесткого ограничения на плотность распределения (интеграл = 1), поэтому приближать можно по‑разному (см. график). То есть на множестве функций возможностей можно ввести частичный порядок.

частичный порядок
частичный порядок

Комментарий к графику:

CBO(g) — аналог ELBO в байесовском выводе, но для теории возможностей.

\underline{\text{CBO}}(g) = \sup_{g \in \mathcal{F}(\Theta)} \inf_{\theta \in \Theta} \{ -\ell(\theta) - \log \frac{g(\theta)}{\pi(\theta)} \}

\overline{\text{CBO}}(g) = \inf_{g \in \mathcal{F}(\Theta)} \sup_{\theta \in \Theta} \{ -\ell(\theta) - \log \frac{g(\theta)}{\pi(\theta)} \}

\underline{\text{CBO}} \rightsquigarrow \{ g \in \mathcal{F}(\Theta) : g \preceq g^*_{\max} \}

\overline{\text{CBO}} \rightsquigarrow \{ g \in \mathcal{F}(\Theta) : g^*_{\max} \preceq g \}

Также под теорию возможностей было адаптировано «ядро» обучения — градиентный спуск. Ниже приводится алгоритм upper CBO Optimisation (uCBOpt):

  1. \textbf{Требуется:} скорости обучения \{\rho_t\}, коэффициент затухания весов \delta > 0, параметр кривизны \vartheta \in (0, \delta], параметры момента \beta_1, \beta_2 \in [0, 1], и начальное значение гессиана h_0 > 0.

  2. \textbf{Инициализация:} \eta \leftarrow (веса нейросети), h \leftarrow h_0, g \leftarrow 0.

  3. \textbf{для} t = 1, 2, \dots\ \textbf{выполнять}

  4. \hat{g} \leftarrow \hat{\nabla} \ell(\eta)— Стохастический градиент

  5. \hat{h} \leftarrow \hat{g} \odot \hat{g}

  6. g \leftarrow \beta_1 g + (1 - \beta_1)\hat{g}

  7. h \leftarrow \beta_2 h + (1 - \beta_2)\hat{h}

  8. \bar{g} \leftarrow g / (1 - \beta_1^t)

  9. \eta \leftarrow \eta - \rho_t(\bar{g} + \delta\eta) / (h + \delta - \vartheta)

  10. \textbf{конец цикла}

  11. \textbf{вернуть} \eta

визуализация работы алгоритма
визуализация работы алгоритма

Сравнение с Adam:

Adam

uCBOpt

η−\rho\frac{\bar g}{\sqrt{h}+\varepsilon}

η-\rho\frac{\bar g+\delta\eta}{h+\delta-\vartheta}

деление на \sqrt{h}

деление на h

\varepsilonтолько стабилизирует

\delta, \varthetaуправляют верхней оценкой кривизны

нет weight decay в формуле шага

\delta\etaвстроен в обновление

Встраивание weight decay напрямую в обновление позволяет лучше контролировать регуляризацию.

Также авторами была приведена сравнительная таблицу для разных датасетов.

результаты 1
результаты 1

Сравнение проводилось на данных, которые модель видела во время обучения, и на незнакомых. В качестве метрик были выбраны: Accuracy, Negative Log‑Likelihood, Expected Calibration Error, False Positive Rate at 95% True Positive Rate, Area Under the Receiver Operating Characteristic curve, Area Under the Precision‑Recall curve for Out‑of‑domain. Рассмотрим результаты для нового алгоритма подробнее.

In‑domain.

Доля правильных ответов (точность) на «знакомой» выборке выше относительно остальных. Низкое отрицательное лог. правдоподобие означает, что модель не просто угадывает класс, но и выдает высокую вероятность для правильного класса и низкую для неправильных. Ожидаемая ошибка калибровки измеряет разницу между уверенностью модели и её реальной точностью, низкий результат у uCBOpt‑adapt (алгоритм выше с адаптацией гиперпараметров в процессе обучения).

Метрики говорит о том, что когда информация есть, теория возможностей работает не хуже теории вероятностей: uCBOpt‑adapt показывает лучшие результаты по ключевым метрикам

Out‑of‑domain.

FPR@95 для детекции аномалий: показывает, как часто модель ошибочно принимает «незнакомый» объект за «знакомый», когда мы настроены на то, чтобы поймать 95% всех аномалий, один из новых алгоритмов оказался в топе лучших. AUPR‑Out, альтернатива AUROC, которая лучше работает в условиях сильного дисбаланса классов. Она показывает, насколько хорошо модель находит «чужие» объекты, не ошибаясь при этом на «своих».

Также авторами для сравнения были использованы и другие датасеты: CIFAR-10, CIFAR-100. Таблица приводится ниже, для краткости, без анализа.

результаты 2
результаты 2

Заключение

Таким образом, теория возможностей предлагает альтернативный подход к описанию неопределенности. Повторяя некоторые аспекты теории вероятностей (независимость, теорема Байеса), она меняет общее представление об информации. Теория вероятностей в машинном обучении является фундаментом, имеет удобный аппарат для описания большинства процессов, поэтому неудивительно, что для теория возможностей доказываются аналоги теорем. Появление приведенного алгоритма и построение новой теории является примером непрерывного развития науки. Так машинное обучение помогает двигать вперед математику, а не только отбирает ее хлеб.