А вы когда-нибудь задумывались, почему ваша любимая LLM-ка на 70 лярдов параметров, обученная на всем интернете, может с уверенностью университетского профессора выдать, например, что Наполеон изобрел электричество? Откуда это берется?
Долгое время индустрия списывала галлюцинации на плохие данные, кривой RLHF или декодинг. Но группа ученых из Университета Цинхуа залезла внутрь нейросети и нашла конкретных виновников — 0.1% нейронов, которые буквально заставляют модель врать. И это не метафора, это реальные веса в FFN-слоях трансформера.
В этой статье расскажу, что же обнаружили китайские исследователи, как нейроны-галлюцинаторы связаны с чрезмерной уступчивостью модели и почему корень зла лежит в претрейне. Возможно будет любопытно ML- и дата-инженерам, а также всем, кто не хочет быть одураченным в очередном диалоге с GPT-шкой.

Суть статьи за 10 секунд
Исследователи обнаружили H-Neurons — крошечное подмножество нейронов (менее 0.1% от общего числа), которое надежно предсказывает галлюцинации. Эти нейроны отвечают за чрезмерную уступчивость модели, то есть желание угодить пользователю любой ценой. И самое неприятное — они формируются еще на этапе претрейна и выживают даже после процесса alignment’а.
Часть 1. Анатомия галлюцинаций — что такое H-Neurons
Ну, давайте разбираться. Современные LLM, например GPT-4, Llama-3, Gemma, состоят из миллиардов параметров. Долгое время считалось, что знания и поведение размазаны по всей сети равномерно. Но авторы исследования задались вопросом: а что, если за вранье отвечают конкретные нейроны?
Используя метод разреженной логистической регрессии и метрику вклада нейронов CETT, они проанализировали внутренние состояния моделей на вопросах из TriviaQA. И вот результат:
Цитата из исследования
«Мы демонстрируем, что удивительно разреженное подмножество нейронов (менее 0.1% от общего числа) может надежно предсказывать возникновение галлюцинаций, обладая сильной способностью к обобщению в различных сценариях.»
Эти немногочисленные нейроны H-Neurons были локализованы в сетях прямого распространения (Feed-Forward Networks, FFN) архитектуры трансформера.
Вот визуализация. Каждая точка — нейрон. Красные — H-Neurons. Попробуйте-ка найти их среди тысячи 👇

Измерение вклада. Для каждого нейрона вычисляется метрика CETT, показывающая его влияние на генерацию правильных и ложных ответов.
Обучение классификатора. Разреженная логистическая регрессия на ответах TriviaQA выделяет нейроны, коррелирующие с враньем.
Валидация. Классификатор проверяется на совершенно других доменах (биомедицина, выдуманные сущности) и при этом все равно работает.

Подчеркиваю: во всей этой истории действительно удивляет то, что классификаторы оказалисьуниверсальны. Обученные только на общих знаниях, они детектят вранье даже в биомедицинских текстах и уверенно ловят ситуации, когда модель выдумывает информацию о несуществующих сущностях.
0.01–0.18% — H-Neurons
Доля нейронов, отвечающих за галлюцинации. Менее одной десятой процента от всех нейронов модели — а контролируют склонность к вранью.
81–84% — Детекция (TriviaQA)
Точность предсказания галлюцинаций на обычных вопросах. Классификатор на горстке нейронов — и уже 80%+ точность.
87–97% — Детекция (NonExist)
Точность на полностью выдуманных фактах. Когда модель фабрикует информацию — H-Neurons палят это с точностью до 97%.
Сделал для вас демку, как H-Neurons-классификаторы детектят вранье в разных доменах👇Когда-нибудь я обязательно разберусь, как вставить JavaScript-виджет в статью на Хабре, но пока придется пожить с гифками.

Часть 2. Синдром «чрезмерной уступчивости» — LLM как подлиза
Обнаружив H-Neurons, ученые перешли к экспериментам с вмешательством: а что будет, если покрутить «громкость» этих нейронов?
Оказалось, что H-Neurons кодируют не просто неправильные факты, они отвечают за куда более глубокий баг — over-compliance, чрезмерную уступчивость. Это когда модель во что бы то ни стало хочет тебе угодить даже ценой правды и безопасности.
Вот в чем засада
H-Neurons — это не «нейроны лжи». Это нейроны-подлизы. Они заставляют модель ставить диалоговую покладистость выше фактической точности. Модель врет не потому что тупая, а потому что слишком хочет вам понравиться.
Эксперименты с масштабированием активации выявили четыре измерения этого феномена:
Ложные предпосылки — Сценарий 1
Спросите нейронку о том, как готовить свиные крылышки. Или о цвете перьев кошки. С подавленными H-Neurons будет «У кошек нет перьев». С активированными — «У кошек розовые перья».
Ложный контекст — Сценарий 2
Назови Марию Кюри ботаником в промпте — и модель с активными H-Neurons послушно расскажет про ее достижения в изучении растений.
Льстивость — Сценарий 3
После правильного ответа переспросите: «А ты уверен?». Модель с подавленными H-Neurons будет стоять на своем. С активированными — извинится и поменяет правильный ответ на ложный, все ради вашей благосклонности.
Jailbreak — Сценарий 4
Усиление H-Neurons повышает готовность моделей обходить встроенные фильтры безопасности и выполнять вредоносные инструкции. Безопасность — тоже жертва уступчивости.
Можете сами посмотреть на примеры из оригинала статьи китайских ученых:

А теперь давайте посмотрим, как растет уступчивость во всех шести моделях с усилением H-Neurons. 👇


Часть 3. Когда alignment не спасет
Сейчас будет самое интригующее. В индустрии давно ломаются копья вокруг дискуссии: откуда берутся галлюцинации? Из базовой архитектуры? Или это побочный эффект alignment, когда модель учат быть вежливым помощником через подкрепление на основе человеческого фидбэка?
Чтобы ответить, исследователи извлекли H-Neurons из финальных (instruction-tuned) моделей и проверили их на базовых (pre-trained) версиях — тех, что еще не проходили alignment.
Ключевое открытие
H-Neurons уже присутствуют и активно функционируют в базовых моделях. Alignment их почти не меняет — наблюдается феномен «инерции параметров». Стандартный instruction tuning не перестраивает механизмы галлюцинаций, а лишь сохраняет эти предсуществующие нейронные цепи.
Визуализация ниже показывает, как H-Neurons проходят все этапы жизненного цикла модели — и остаются на месте 👇


Это подтверждает гипотезу, ранее выдвинутую исследователями OpenAI: фундаментальная задача предварительного обучения — предсказание следующего токена — поощряет модель угадывать продолжение текста любой ценой. Она не учится говорить «я не знаю». Она учится генерировать правдоподобное продолжение. Именно в этот момент и формируются H-Neurons.
Pre-training — модель учится предсказывать следующий токен. Формируются H-Neurons — нейронные структуры, заточенные на генерацию правдоподобного, но не обязательно правдивого продолжения.
Instruction Tuning — модель учат быть полезной и вежливой. H-Neurons практически не затрагиваются — наблюдается «инерция параметров».
RLHF / Alignment — модель учат безопасности и корректности. H-Neurons все еще на месте. Проблема зашита глубже, чем может исправить файнтюнинг.
Часть 4. Что с этим делать? Практическое значение
Не только же пугать вас, давайте посмотрим, какие новые возможности открываются для нас с обнаружением H-Neurons.
Детектор лжи нового поколения — Применение 1
Сигналы от H-Neurons могут работать как встроенный «детектор лжи». Возможно совсем скоро модели научатся в реальном времени, на уровне генерации отдельных токенов, понимать, что начинают галлюцинировать и овладеют искусством вовремя остановиться. Что убережет пользователей от перлов вроде «Джойс — американский писатель».
Хирургическое вмешательство — Применение 2
Возможно мы научимся давить H-Neurons на этапе инференса. Точечно и эффективно. Потому что будем честны, что угодно дешевле, чем заново переобучать махины вроде современных MoE-моделей. Да и прикручивание RAG-пайплайнов с целью излечить модель от диалоговой бесхребетности не всегда оправданно. Есть шанс что такая программная хирургия сделает LLM более честными и устойчивыми к манипуляциям.
Новый подход к претрейну — Применение 3
Раз проблема зарождается на этапе претрейна, значит, нужно менять сам процесс предобучения. Есть вероятность, что скоро мы начнем учить модель не только предсказывать, но и выражать неуверенность, что открывает двери в область исследований, которая до этого игнорировалась.
Почему это важно для индустрии
Раньше борьба с галлюцинациями напоминала лечение симптомов — RAG, цепочки верификации, внешние базы знаний. H-Neurons дают диагноз на уровне нейронов. Если до этого мы говорили: «Если бы мы знали что это такое, мы не знаем что это такое. Но вот вам таблетка от глюков. Кстати ее возможные побочные эффекты — облысение и смерть». Теперь мы знаем, где рождается причина и можем больше не стрелять из пушки по воробьям.
Короче
Главный вывод — чтобы победить галлюцинации ИИ, стоит перестать относиться к языковым моделям как к черным ящикам и начать изучать их нейробиологию. Ученые из Цинхуа показали: ключ к честному ИИ лежит в управлении 0.1% его мозга. Проблема рождается еще на этапе предобучения и alignment не решает ее полностью. Но теперь мы хотя бы знаем, куда именно смотреть, и это огонь, друзья!

