Почему сила LLM не гарантирует точность
Уверенная и складная речь легко принимается за признак правоты — и человеком, и машиной.
Мы достраиваем недостающие связи, выбираем объяснение, которое совпадает с прежними убеждениями, и особенно охотно делаем это под давлением, в усталости или стрессе. Даже профессионалу трудно постоянно удерживать дисциплину мышления. История не раз показывала, что самые сильные эксперты своего времени могли годами разделять ошибочные представления, а увидеть ошибку удавалось лишь позднее, когда появлялись новые данные или становились очевидны последствия принятых решений.
Сильная LLM унаследовала эту склонность вместе с человеческими текстами, на которых училась. Она умеет быстро собрать правдоподобную версию, но может не заметить логический разрыв, принять последовательность событий за причинную связь или усилить гипотезу, которую собеседник уже считает верной.
Дисциплина мышления как система линз
Дисциплина мышления не обязательно требует переучивать модель. Её можно задавать с помощью линз, через которые LLM рассматривает задачу.
Линза границы знания разделяет подтверждённое, предполагаемое и неизвестное.
Линза причинности не позволяет считать, что событие B произошло из‑за события A только потому, что случилось после него.
Линза альтернативных гипотез заставляет искать несколько возможных объяснений.
Линза опровержения ищет данные, способные разрушить наиболее удобную версию.
Линза различающего наблюдения спрашивает, какой факт позволит выбрать между конкурирующими гипотезами.
Дополнительную строгость создают инструкции, сохранение следа рассуждения и независимая проверка выводов другими агентами.
Такая LLM полезна не только для выработки собственных выводов, но и для корректировки человеческих рассуждений. Она может обнаруживать незаметные допущения, логические пропуски, преждевременные выводы и влияние уже выбранной позиции. Конечно, такие линзы получают новейшие публичные коммерческие модели, однако стоит помнить что инструкция использовать линзу и что она из себя представляет часто не повредит.
Человек способен применять те же линзы, но ему трудно делать это непрерывно: на его мышление воздействуют усталость, стресс, дефицит времени, личная заинтересованность, авторитеты и инерция прежних решений. LLM не свободна от ошибок, но при правильно заданной дисциплине она не устаёт выполнять одну и ту же процедуру проверки.
Точность важнее уверенности
Особенно важна такая проверка там, где решения принимаются в условиях высокой неопределённости, человеческий фактор неизбежно велик, последствия затрагивают множество людей, а качество решения трудно оценить сразу.
В государственном управлении, корпоративной стратегии, экономической политике или управлении сложными системами ошибочная логика может долго выглядеть убедительной, поскольку её последствия проявятся лишь через годы и будут смешаны с множеством других факторов.
Поэтому при выработке и принятии важных решений точнее оказывается не тот, кто быстрее и убедительнее формулирует ответ, а тот, кто лучше различает факты, гипотезы, причинные связи и пробелы в данных.
Рассказ о станции «Кассини-9» показывает, как одна и та же ошибка возникает у человека и у LLM — и как дисциплина мышления позволяет её заметить до того, как уверенная версия превратится в неверное решение.
«Кассини-9»
На станции «Кассини-9» потеряли грузовой модуль.
Последний пакет телеметрии пришёл в 03:17. Потом связь оборвалась. Через сорок две секунды модуль должен был выйти на следующий участок траектории за пределами прямой видимости, но на экране осталась только расчётная линия. Модуль куда‑то улетел.
Командир Орлов стоял у центральной консоли. Вокруг него на прозрачных панелях бесшумно обновлялись карты орбит, журналы систем и навигационные данные. Всё, что на станции могло работать без человека — работало без человека. Люди оставались там, где нужно было решить, какому из бортовых ИИ верить.
— Версия? — спросил Орлов.
Первый ИИ ответил сразу.
— Наиболее вероятна ошибка навигационного контура. Перед потерей связи модуль получил коррекцию курса. Рекомендую направить поисковый дрон в сектор B-17.
На экране появилась солидная, убедительная схема: траектория, красный круг, расчётное время прибытия.
Старший навигатор Кравцов кивнул.
— Ну надо же. Опять коррекция на неполных данных. Кто бы мог подумать.
Он говорил это не Орлову и не машине. Скорее самому себе. Кравцов давно спорил с проектировщиками автономного контура: по его мнению, система слишком охотно меняла траекторию, когда ещё не видела полной картины. Теперь исчезнувший модуль выглядел почти как доказательство его правоты.
У людей вообще есть особая любовь к объяснениям, которые совпадают с тем, что они уже подозревали. Они называют это опытом. Иногда это действительно опыт. Иногда — просто старая обида в форме гипотезы.
— Отправляем? — спросил оператор дронов. — Или ещё немного полюбуемся на красный круг?
Орлов не ответил. Он повернулся ко второму ИИ.
Тот работал медленнее. Несколько секунд на экране ничего не было. Потом появились четыре строки:
Подтверждено: связь с модулем потеряна.
Подтверждено: перед этим была коррекция курса.
Не подтверждено: коррекция была ошибочной.
Не подтверждено: ошибка навигации объясняет потерю модуля.
Кравцов усмехнулся.
— Он получил коррекцию и исчез. Что тут ещё проверять? Или теперь нам нужно спросить у космоса, не обиделся ли он?
На экране появилась новая строка:
Связь оборвалась после коррекции. Причина пока не установлена.
— Очень полезно, — сказал Кравцов. — Пока он устанавливает причину, груз улетит к чертям.
— Груз уже улетел, — сказал оператор. — Мы пытаемся понять куда.
Кравцов посмотрел на него так, будто тот испортил хорошую речь.
Второй ИИ вывел три версии:
Ошибка навигации.
Отказ связи после выхода из тени планеты.
Внешнее воздействие на модуль.
И ниже:
Для первой версии: проверить журнал коррекции на резервном контуре.
Для второй: сравнить телеметрию с предыдущими рейсами.
Для третьей: проверить гравитационные датчики и внешние камеры.
— То есть он предлагает ничего не делать? — спросил Кравцов. — Отлично. Очень современно.
— Он предлагает сначала понять, куда посылать дрон, — сказал Орлов.
— Дрон надо посылать туда, где модуль.
— Именно. Осталось выяснить, где он, а не где тебе удобнее его искать.
Кравцов отвернулся к обзорной панели. За ней медленно проходила тёмная сторона планеты. На краю атмосферы горела тонкая полоса света. Она была красива, но к поиску груза отношения не имела.
Мира, младший инженер по телеметрии, сидела у бокового терминала. До этого она молчала. В штабе её обычно просили проверить цифры, а потом не мешать людям с должностями обсуждать, что означают цифры.
— Есть след, — сказала она.
Никто не повернулся сразу.
— На внешней камере. В момент коррекции рядом прошёл объект. Маленький. Скорость высокая.
Она вывела запись на общий экран. Сначала там было почти ничего: чёрный фон, редкие звёзды, край корпуса. Потом на одном кадре мелькнула короткая белая царапина.
ИИ пересчитал траекторию.
— Вероятность внешнего воздействия: 0,71. Предполагаемое отклонение модуля — девять градусов от исходного курса.
Красный круг исчез из сектора B-17 и появился далеко справа.
Оператор дронов уже вводил новый маршрут.
Кравцов медленно снял очки.
— Значит, автопилот ни при чём, — сказал он. — Какая неожиданность.
Никто не ответил.
Орлов посмотрел на первый экран. Там ещё оставалась старая рекомендация: сектор B-17, поиск по навигационной ошибке.
— Если бы мы отправили дрон туда, сколько времени потеряли бы?
Второй ИИ ответил:
— Четыре часа двадцать минут.
Кравцов протёр очки краем рукава и положил их на консоль.
Орлов выключил экран с первой рекомендацией.
— Ладно, — сказал он. — Работаем по новой траектории.
В журнале смены появилась запись: «Поисковый дрон направлен в сектор D-04».
Под ней — строка:
Почему первая система с такой уверенностью выбрала версию, которую люди в штабе уже хотели услышать?
А в следующих статьях я расскажу, как применял линзы ТРИЗ, фреймворки бизнес‑консультантов, взаимные проверки агентами рассуждений друг друга, как устраивал дебаты моделей — и что из этого получилось.