Современные генеративные модели используют мощный аппарат теории вероятностей: байесовскую оптимизацию, оценки максимального правдоподобия и тп. Но у этого подхода есть свои недостатки, например, галлюцинации, с которыми, наверняка, большинство сталкивалось при работе с ИИ.
Проведем обзор не новой, но набирающей популярность теории возможностей и ее использования в машинном обучении. Для этого проанализируем доклад профессора Наньянского технологического (Сингапур) и Уорикского университетов (Великобритания) Jeremie Houssineau.
Начнем с примера, демонстрирующего, как в космонавтике и теории рисков отличают две неопределенности: алеаторную (случайную) и эпистемическую (связанную с нехваткой знаний).

Поломка ракеты при запуске — это бинарное событие: даже зная все о ракете и ее траектории, мы не можем со 100%‑ной уверенностью сказать, произойдет ли авария. Поэтому 2 исхода с порогом вероятности .
Справа находится пример эпистемической неопределенности: космический мусор на орбите. Мы не знаем, где находится каждый объект, его скорость или массу, поэтому не можем сказать, прилетит ли он в МКС. Так появляется третья зона (желтая).
График по центру отвечает за вероятность столкновения в зависимости от точности данных (ковариации позиции). Разные цвета обозначают разные размеры обломков. Пунктиром отмечена алеаторная неопределенность, то есть игнорирование отсутствия информации и использование только физической случайности. Вероятность здесь низкая и убывает. Сплошной линией — эпистимическая и здесь вероятность столкновения высокая: чем меньше знаем, тем больше риск, причем по мере уточнения данных вероятность падает, что логично.
Таким образом, мы приходим к концепции: «Если нет информации, возможно все». Немного формализуем задачу и заодно отметим различия с теорией вероятностей.
Теория вероятностей | Теория возможностей | |
исследуемый параметр | случайная величина | неопределенная переменная (uncertain variable) |
основная функция | плотность распределения и нормировка через интеграл | possibility function |
«среднее» | математическое ожидание через интеграл плотности | |
дисперсия |
Особый случай: если нет информации, считаем для любого
. Также одним из интересных свойств является независимость от параметризации (в отличие от появляющегося якобиана при замене в плотности), это объясняется очень просто: если мы ничего не знаем в одном пространстве, то ничего не знаем и в другом.
Продолжим анализ свойств функций возможностей и сравнение с аппаратом теории вероятностей.
Теория вероятностей | Теория возможностей | |
работа с выборками | можно сэмплировать | нельзя сэмплировать |
inference | условная вероятность | |
независимость величин | независимость событий | |
факторизация | при независимости случайных величин совместная плотность представляется в виде произведения единственным образом. | при независимости разложение совместного распределения на множители не является единственно возможным. |
Теорема Байеса
где:
— правдоподобие,
— априорная вероятность,
— апостериорная вероятность и знаменатель вычисляется как:
Вероятностная часть была известна уже давно, а возможностная была представлена в 2026 году.
Рассмотрим еще один относительно свежий результат (2025 года). В теории вероятностей формула Донскера‑Варадхана связывает математическое ожидание экспоненты случайной величины с относительной энтропией (KL‑дивергенцией) и в машинном обучении используется для поиска верхних границ вероятности переобучения нейросетей. Ученые из Наньянского технологического университета представили аналог этой теоремы для теории возможностей. Главное отличие в том, что во втором случае мы получаем две формулы, это объясняется тем, что, в отличие от теории вероятностей, у нас нет жесткого ограничения на плотность распределения (интеграл = 1), поэтому приближать можно по‑разному (см. график). То есть на множестве функций возможностей можно ввести частичный порядок.

Комментарий к графику:
CBO(g) — аналог ELBO в байесовском выводе, но для теории возможностей.
Также под теорию возможностей было адаптировано «ядро» обучения — градиентный спуск. Ниже приводится алгоритм upper CBO Optimisation (uCBOpt):
скорости обучения
, коэффициент затухания весов
, параметр кривизны
, параметры момента
, и начальное значение гессиана
.
(веса нейросети),
.
— Стохастический градиент

Сравнение с Adam:
Adam | uCBOpt |
|---|---|
деление на | деление на |
|
|
нет weight decay в формуле шага |
|
Встраивание weight decay напрямую в обновление позволяет лучше контролировать регуляризацию.
Также авторами была приведена сравнительная таблицу для разных датасетов.

Сравнение проводилось на данных, которые модель видела во время обучения, и на незнакомых. В качестве метрик были выбраны: Accuracy, Negative Log‑Likelihood, Expected Calibration Error, False Positive Rate at 95% True Positive Rate, Area Under the Receiver Operating Characteristic curve, Area Under the Precision‑Recall curve for Out‑of‑domain. Рассмотрим результаты для нового алгоритма подробнее.
In‑domain.
Доля правильных ответов (точность) на «знакомой» выборке выше относительно остальных. Низкое отрицательное лог. правдоподобие означает, что модель не просто угадывает класс, но и выдает высокую вероятность для правильного класса и низкую для неправильных. Ожидаемая ошибка калибровки измеряет разницу между уверенностью модели и её реальной точностью, низкий результат у uCBOpt‑adapt (алгоритм выше с адаптацией гиперпараметров в процессе обучения).
Метрики говорит о том, что когда информация есть, теория возможностей работает не хуже теории вероятностей: uCBOpt‑adapt показывает лучшие результаты по ключевым метрикам
Out‑of‑domain.
FPR@95 для детекции аномалий: показывает, как часто модель ошибочно принимает «незнакомый» объект за «знакомый», когда мы настроены на то, чтобы поймать 95% всех аномалий, один из новых алгоритмов оказался в топе лучших. AUPR‑Out, альтернатива AUROC, которая лучше работает в условиях сильного дисбаланса классов. Она показывает, насколько хорошо модель находит «чужие» объекты, не ошибаясь при этом на «своих».
Также авторами для сравнения были использованы и другие датасеты: CIFAR-10, CIFAR-100. Таблица приводится ниже, для краткости, без анализа.

Заключение
Таким образом, теория возможностей предлагает альтернативный подход к описанию неопределенности. Повторяя некоторые аспекты теории вероятностей (независимость, теорема Байеса), она меняет общее представление об информации. Теория вероятностей в машинном обучении является фундаментом, имеет удобный аппарат для описания большинства процессов, поэтому неудивительно, что для теория возможностей доказываются аналоги теорем. Появление приведенного алгоритма и построение новой теории является примером непрерывного развития науки. Так машинное обучение помогает двигать вперед математику, а не только отбирает ее хлеб.
