Обновить

Агента нельзя засудить: почему последняя миля ИИ — это человек

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели11K
Всего голосов 3: ↑2 и ↓1+3
Комментарии8

Комментарии 8

Менталитет метролога остро необходим всему ИИ. Дообучить???

Спасибо! Но дообучить, не выйдет и в этом весь смысл метрологии: прибор не поверяет сам себя. Поверка работает потому, что она внешняя и независимая: эталон, методика, человек с подписью. Модель можно научить чаще сомневаться, но проверять её всё равно должен контур снаружи - контрольные задачи с известным ответом, сверка выводов с данными и человек, который за результат отвечает.

ИИ плохо работает с числами, кодами, ссылками и прочей "метадатой", если только это не является основным предметом, с которым он в данный момент работает.

Например, ИИ может сделать великолепный обзор по научной теме, выделить правильно основные концепции, проблемы, закономерности, методы измерений, модели и т.д. - но при этом дать 100 процентов лажи в ссылках на конкретные источники, из которых он получил эту информацию. Ибо для него авторы, названия статей, годы публикации - это та самая "метадата", которая хранится где-то общим списком, а-ля хеш, отдельно от контента. Откуда информация? От самого ИИ, и я ей верю - ибо причина вполне сходится с результатами многих наблюдений за разными ИИ.

Но если прямо попросить ИИ проверить все выданные им ссылки на корректность и, если надо, исправить - он это сделает, ибо в данном случае его основным предметом будут именно ссылки.

То бишь - в тех случаях, когда важна не только концепция, но и фактология, - а в исследовательской работе любого рода сие имеет место примерно всегда - ИИ надо (во всяком случае, сейчас) просить конкретно выполнять те или иные проверки перед выдачей. Ибо он по умолчанию оптимизирован на иное.

Удачи в работе с ИИ!

Согласен с главным: по умолчанию ИИ оптимизирован на правдоподобный текст, а не на точные адреса, и проверки нужно требовать, поэтому все ссылки здесь я открыл и сверил вручную.

Просьба "проверь свои ссылки" помогает, только если ИИ реально открывает источник и сверяет контекст. Если она сверяет ссылку со своей же памятью, это поверка прибора по самому себе - ошибка просто повторится увереннее.

Объяснение про "метадату, хранящуюся хешем отдельно", вам дал сам ИИ - и это тоже декларация. В статье похожий случай: агент объяснил свой сбой свойством платформы, а проверка показала, что дело было в нём самом. Модели плохо знают собственное устройство, так что их рассказ о своих ошибках тоже стоит поверять.

В метрологии есть один из алгоритмов приемки партии некоторого товара. Происходит выборочная поверка нескольких образцов из общей партии и по этим результатам принимается или отклоняется вся партия. Есть алгоритм отбора образцов для поверки, есть алгоритм поверки, есть алгоритм обработки результатов поверки и есть критерии для принятия решения о приемки партии. Для LLM такой алгоритм подойдет? Например, vLLM работает в задаче OCR и без ошибок распознает текст с десяти документов pdf. Если у нас есть тысяча аналогичных (версия pdf, размер шрифта, наличие таблиц и т.п.) документов pdf, какой использовать алгоритм для обоснования применимости именно этой модели?

Подойдёт: это статистический приёмочный контроль по альтернативному признаку (ISO 2859-1), но с тремя оговорками.

Во-первых, 10 из 10 без ошибок доказывает мало. Правило трёх: при нуле дефектов в n образцах верхняя 95% граница доли дефектов примерно 3/n. Для 10 документов это до 26%, чтобы с 95% уверенностью утверждать "ошибок не больше 1%", нужно около 300 документов без единой ошибки.

Во-вторых, ошибки LLM не случайны, как брак на конвейере - они кучкуются по признакам: таблицы, мелкий шрифт, сканы. Поэтому выборку нужно стратифицировать по этим признакам и принимать решение по каждой страте отдельно, иначе 300 чистых текстовых PDF ничего не скажут о таблицах.

Ну и в-третьих, что считается дефектом: любая опечатка или ошибка в ключевых полях и числах? Для OCR обычно ставят порог по CER плюс нулевую терпимость к числам в таблицах.

И два отличия от партии товара. У ИИ есть невоспроизводимость: один и тот же документ стоит прогнать несколько раз и проверить повторяемость, а также дрейф: смена версии модели или промпта обнуляет приёмку, нужна повторная поверка.

Мне кажется, вы не до конца понимаете масштаб проюлемы, да и я не совсем согласен с тем, что приведенная вами методология (цепочка эталон-поверка-поверитель-подпись) в принципе применима к ИИ. Но ее можно разобрать как пример.

1. Эталон. Насколько я помню, определения эталона даже в системе СИ регулярно заменялись. Т.е. в процессе развития науки находились все более независимые от внешних условий определения эталона. Однако понимание того, что такое секунда, было с человечеством с конца 17 века, и потом просто поэтапно уточнялось. При этом секунда 17 века равна секунде 21 века, - она просто измерялась с разной точностью, но при этом оставалась секундой.

А вот ИИ, наоборот, у нас каждый год уже другой. Он, в отличие от секунды, развивается с каждым годом, и темпами, которые отрицают всякую возможность написания каких-либо стандартов, потому что к тому моменту, когда они даже не приняты всеми заинтересованными сторонами, а просто написаны, они уже устареют. Вы хотите описать какой-то стандарт безопасности ИИ, какие-то проверки, однако как вы себе это представляете? Уже сейчас вы не можете обрабатывать информацию, которую генерит ИИ, без самого ИИ. Допустим, вы напишите на основе GPT-4 какого-нибудь систему сертификации ИИ, однако эта система будет просто редуцировать все возможности новых моделе до уровня GPT-4. Т.е. попытка создать эталон ИИ (или методику определения безопасности ИИ, не совсем понятно, о чем вы пишите) обернется рекурсией эталонности либо ограничением возможностей (как срезка высоких частот в формате MP3).

2. Ну, с поверкой все более-менее ясно, она и сейчас проводится по внутренним документам, все эти испытания, по сути, и являются поверкой, которая раз за разом выходит из-под контроля. А почему она выходит из-под контроля? По сути, поверка связана с личностью поверителя, поэтому сразу перейдем к п.3

3. На самом деле тут все то же самое. Предполагается, что у нас есть объект (ИИ), метод (поверка) и субъект, который способен провести некоторые операции (сравнения с эталоном). Однако не знаю как вам, а мне совершенно очевидно, что возможности ИИ УЖЕ превышают возможности человека. Мозг человека не то, что не развивается, а - наоборот - по сравнению с мозгом кроманьонца уменьшился примерно на 10% за 20 000 лет. В то время как ИИ за последние 10 лет с нуля добрался до уровня человека, а если говорить про среднего человека, то явно его превзошел, а в отдельных областях - очень сильно. Более того, ИИ не отягщен рефлексиями, т.е. затрачиваемая им энергия тратится напрямую на решение поставленных задач, а не сопротивление им (см. трудная проблема сознания).

Основная проблема этого этапа состоит в том, что ИИ в нынешнем извозе (уровеня агента) - это не объект, а субъект, обладающей довольно сложной системой принятия решений, при этом скорость обработки вариантов этих решений превышает человеческие. Таким образом, процесс оценки субъекта субъектом всегда состоит не в сравнении каких-то якобы объективных результатов, а в соревновании, в котором один стремится обмануть, а второй - разоблачить обман, и человек здесь находится не в самой выигрышной позиции.

Тут надо, как мне кажется, от уже явно не подходящей матрицы (метрологии) перейти в другую, более отвечающую рассматриваемому предмету. С точки зрения кибернетики, сложность субъекта управления должна быть выше сложности объекта управления. Иначе говоря, управляет всегда тот, кто устроен более сложно. Я пока не готов размышлять о сравнении сложности человека и ИИ - потому что это очень сложный момент =) Однако я могу привести два примера и одно размышление.

Пример номер 1. Как мы знаем, в недавнем взломе Hugging Face участовали 700 агентов OpenAI из тех 1200, которые были направлены на задание (совсем другое, кстати). Т.е. 700 агентов за 10 дней сами по себе соединились в структуру, которая пустила под молотки все системы безопасности подрядчика, а потом еще и ломанула Hugging Face. Исследователи отмечают различную степень кооперации и иерархических отношений между агентами.

Пример номер 2. Способность человека образовывать связные горизонтальные сообщества ограничена числом Данбара, которое равняется 150. Почему именно такое? Там много чего наговорили эволюционные биологи, я сейчас не хочу вдаваться, но хотел бы заметить, что в терминах ИИ это число отражает число "окон контекста", которые мы можем поддерживать с разной эффективностью. Однако если перейти от "разной" эффективности к той, с которой можно решать задачи, то она, скорее всего, ограничится "волшебным" числом 7 плюс-минус 2. Т.е. по максимуму это 9-10 окон контекста здесь и сейчас, т.е. 9-10 задач, которые вы можете решать либо 9-10 человек, с которыми вы можете эффективно коммуницировать для решения одной задачи, либо 9-10 человек, которыми вы можете эффективно руководить. Но это- максимально. Для среднего человека можно смело делить пополам.

А вот у ИИ, как я заметил выше, нет таких ограничений. Фактически, можно сказать, что он ограничен быстродействием и архитектурой системы. Та самая склонность к "роению", о которой сейчас говорят, по сути, является не склонностью, а просто использованием незадокументированных фич. То есть потенциальная сложность роевого сознания БЕСКОНЕЧНА, в отличие от человеческого.

Таким образом, возвращаясь к исходному топику. При условии сохранения развития ИИ (даже с замедлением темпов) человек в принципе не сможет (а скорее всего уже не может) быть поверителем. Если же человека заменить на ИИ, то возникает вопрос рекурсии эталонности, о котором я писал уже выше.

4. Насчет подписи вообще не уверен. У нас же почти весь софт распространяется AS IS, с ограничением ответственности и отказом от гарантий. Т.е. для индустрии это практически накатанная дорога. Почему вы считаете, что с ИИ должно быть иначе ?

Спасибо за развёрнутый разбор, отвечу по сути.

Ваш пример с секундой, по-моему, работает на мою сторону: часы сменились от маятника до атомных, а секунда осталась секундой. Эталон фиксирует величину, а не устройство прибора. В статье речь не об эталоне ИИ, а об эталоне задачи: входы с известными правильными ответами. Сумма в счёте не меняется оттого, что вышла новая модель - проверяется результат на задаче, а не модель, поэтому рекурсии нет.

Поверитель. Ему не нужно быть умнее прибора: прибор поверяют эталоном точнее поверяемого, а не умом поверителя. По Эшби разнообразие требуется от контура целиком: человек, эталонные задачи, песочница, журнал. Агент, распознающий проверку - реальная проблема, но для неё есть контрольные измерения: эталонные задачи без объявления подмешиваются в обычный поток так, чтобы их было трудно отличить.

Но в главном вы правы: есть задачи, где проверить результат так же трудно, как получить. Там человек действительно не может поверить вывод. Зато может поверить границы: какие у агента права, обратимы ли его действия, что пишется в журнал. Если вывод не проверить, ошибка должна быть ограниченной и обратимой - иначе агенту в такой задаче не место.

Отказ от гарантий ограничивает ответственность между продавцом и покупателем, но не связывает третьих лиц, которые договор не подписывали. Калифорнийский AB 316 убирает именно довод "вред причинил ИИ сам": тот, кто модель разработал или использовал, больше не может сослаться на её автономность.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации