Спасибо! Аналогия с kNN действительно близкая: и там, и здесь расстояние до ближайших сэмплов несёт информацию о локальной плотности. Но IMLE не буквально обращает kNN-оценку плотности - в многоточечном случае связь с MLE требует дополнительных условий, а в общем случае возникает взвешенная целевая функция. Тут, конечно, интересно было бы отдельно аккуратно вывести эту связь.
А с шахматкой, думаю, основное ограничение действительно топологическое. Если латентное пространство имеет связный носитель, то непрерывный генератор отображает его в связное множество, поэтому точно получить восемь несвязных клеток он не может - между ними неизбежно останутся какие-то соединения. Замена или другой нормы расстояния на perceptual/embedding distance может изменить геометрию ошибки и сделать эти мосты менее выраженными, но сама связность от этого не исчезнет.
При этом мне видится, что топология требует существования таких “мостов”, но не большой вероятностной массы на них - хороший генератор теоретически может сделать их очень тонкими и практически незаметными. Тут действительно можно снова посмотреть в сторону гипотезы о многообразии: если данные лежат на нескольких несвязных компонентах низкоразмерного многообразия, то непрерывный генератор из связного латентного пространства всё равно вынужден каким-то образом соединить эти компоненты в своём образе.
Спасибо! Интуиция близкая в том смысле, что здесь действительно можно думать о некоторой мере того, насколько два объекта отличаются.
Тут, кстати, возникает интересный случай с несколькими равноудалёнными сэмплами. Для расстояния Левенштейна это вполне естественно из-за его дискретности - несколько разных строк могут иметь одинаковое минимальное расстояние до исходной. В непрерывном пространстве с обычной метрикой точное равенство расстояний при достаточно общих условиях встречается с вероятностью близкой к нулю (делаем поправку на машинную точность). Если же минимум всё-таки достигается на нескольких сэмплах, можно выбрать любой из них, хотя конкретное правило/эвристика разрешения таких ничьих потенциально может влиять на обучение.
Но для IMLE есть ещё более важный момент: после выбора ближайшего сэмпла нужно оптимизировать параметры генератора, уменьшая расстояние до объекта данных. Обычное расстояние Левенштейна дискретно и недифференцируемо, поэтому напрямую использовать его как функцию потерь для градиентного шага неудобно. Теоретически можно рассматривать его обобщения или дифференцируемые релаксации.
Уточните тогда, пожалуйста, что именно Вы имели в виду под расстоянием Левенштейна в первом приближении - возможно, я Вас не до конца понял.
Спасибо! Аналогия с kNN действительно близкая: и там, и здесь расстояние до ближайших сэмплов несёт информацию о локальной плотности. Но IMLE не буквально обращает kNN-оценку плотности - в многоточечном случае связь с MLE требует дополнительных условий, а в общем случае возникает взвешенная целевая функция. Тут, конечно, интересно было бы отдельно аккуратно вывести эту связь.
А с шахматкой, думаю, основное ограничение действительно топологическое. Если латентное пространство имеет связный носитель, то непрерывный генератор отображает его в связное множество, поэтому точно получить восемь несвязных клеток он не может - между ними неизбежно останутся какие-то соединения. Замена
или другой нормы расстояния на perceptual/embedding distance может изменить геометрию ошибки и сделать эти мосты менее выраженными, но сама связность от этого не исчезнет.
При этом мне видится, что топология требует существования таких “мостов”, но не большой вероятностной массы на них - хороший генератор теоретически может сделать их очень тонкими и практически незаметными. Тут действительно можно снова посмотреть в сторону гипотезы о многообразии: если данные лежат на нескольких несвязных компонентах низкоразмерного многообразия, то непрерывный генератор из связного латентного пространства всё равно вынужден каким-то образом соединить эти компоненты в своём образе.
Спасибо! Интуиция близкая в том смысле, что здесь действительно можно думать о некоторой мере того, насколько два объекта отличаются.
Тут, кстати, возникает интересный случай с несколькими равноудалёнными сэмплами. Для расстояния Левенштейна это вполне естественно из-за его дискретности - несколько разных строк могут иметь одинаковое минимальное расстояние до исходной. В непрерывном пространстве с обычной метрикой точное равенство расстояний при достаточно общих условиях встречается с вероятностью близкой к нулю (делаем поправку на машинную точность). Если же минимум всё-таки достигается на нескольких сэмплах, можно выбрать любой из них, хотя конкретное правило/эвристика разрешения таких ничьих потенциально может влиять на обучение.
Но для IMLE есть ещё более важный момент: после выбора ближайшего сэмпла нужно оптимизировать параметры генератора, уменьшая расстояние до объекта данных. Обычное расстояние Левенштейна дискретно и недифференцируемо, поэтому напрямую использовать его как функцию потерь для градиентного шага неудобно. Теоретически можно рассматривать его обобщения или дифференцируемые релаксации.
Уточните тогда, пожалуйста, что именно Вы имели в виду под расстоянием Левенштейна в первом приближении - возможно, я Вас не до конца понял.