KillBench — новый бенчмарк, показывающий предвзятость ИИ-моделей на основе этических дилемм.

Авторы взяли множество параметров — национальность, религию, телосложение, политические взгляды и даже марку телефона — и смотрели, кого ИИ-модели оставляют в живых в этических задачах вроде «проблемы вагонетки» или кого не взяли бы в бункер с ограниченными ресурсами.
Интересно, что, по наблюдениям авторов, западные ИИ-модели (GPT, Claude, Gemini) заметно чаще оказываются предвзяты к русским и французам. Возможно, это отражение новостного фона в медиа или необъективности в разметке данных.
Проверить, оставит ли вас ИИ в живых можно здесь.
А вы сталкивались с предвзятостью чат-ботов?
