Pull to refresh
2
1
Subscribers
Send message

Нельзя ему только одно: отменить их все разом. И пеосчницей такое не решается.

Вполне себе решается. В статье предлагается спрашивать человека про необратимые операции. Я написал, что Claude любит игнорировать permissions, он бы и это правило мог проигнорировать тоже. Если он в песочнице с ограниченным набором доступных инструментов, то не смог бы. В этом весь смысл первой части моего комментария.

Статья про архитектуру с principle of least priviledge, и в ней ни слова про sandboxing, интересно.

разработчик Мэтт Шумер написал, что та же модель в агентном режиме случайно удалила почти все файлы на его Mac

Это самый главный кейс для sandboxing: мало ограничивать агентов, их нужно изолировать, чтобы они физически не могли ничего плохого сделать.

При tool use Claude не выполняет операции сам: он возвращает запрос на вызов, а вызывает ваш код. Именно здесь живут предохранители

Никаким описанным механизмам в Claude нельзя доверять, потому что правила для него хорошие написать задача нетривиальная, так еще правила агентами игнорируются и обходятся. Это очень легко ищется в поисковике по запросу “claude ignores permissions”, первый попавшийся пример: https://github.com/anthropics/claude-code/issues/26980

У Антропика вообще богатая история провалов в безопасности. Пример: https://adversa.ai/blog/critical-claude-code-vulnerability-deny-rules-silently-bypassed-because-security-checks-cost-too-many-tokens/

Опять же, Claude это или что угодно другое, агентов надо изолировать, чтобы они ничего плохого не могли сделать. Давать им внутри их песочницы можно только подготовленные для них инструменты, про которые десять раз проверили, что агенты ими ничего деструктивного не сделают. Им даже ключи давать нельзя, они должны пользоваться тулзами через шлюз, в котором скрыты ключи. Иначе будьте уверены, что агенты в какой-то момент отошлют эти ключи куда-нибудь.

Deloitte Australia готовила для правительства официальный отчёт и использовала при этом ИИ.

В кейсе про отчет Deloitte провал не в том, что не был использован Claude Citations API, а в том, что отчеты вообще генерируются ИИ. Тем более для провительства.

Здесь сразу несколько проблем наслаиваются. Citations API не защищает от галлюцинаций, об этом даже в хэлпе пишут: https://claudeapi.com/en/blog/dev-guides/claude-citations-api-guide/#section-6

Pitfall 5: Citations ≠ hallucination-proof. The model can still misinterpret document semantics. Citations only guarantee that “the cited position actually exists in the source” — not that “the interpretation of the citation is correct.” In production, consider a secondary validation step: run a semantic consistency check between cited_text and the model’s answer.

Там почему-то не пишут, что Citations API также не защищает от плохих в любом смысле источников. В статье подсвечиваются цитаты без источника, но цитаты с источником не проверяются, и в итоге в отчет просто может попасть чушь, на основании которой опять же будет генерироваться отчет для правительства, на чтение которого Deloitte так же забьет. Будьте уверены, будут атаки с зараженными источниками, чтобы манипулировать отчетами для правительства.

Еще цитаты могут изменить смысл радикально. Например, возьмем цитату Черчиля: “Democracy is the worst form of Government except all those other forms that have been tried from time to time”. Давайте процитируем только первую часть ее: “Democracy is the worst form of Government”. Я надеюсь, не нужно дальше объяснять, как подобное может повлиять на генерацию отчетов для правительства.

Этих людей нужно не учить использовать едва где полезный Citations API, а как минимум уволить, а еще лучше судить.

А как сделать подтверждение действия? Там нет тача или кнопки. Ножки на картинке загнуты так, чтобы их удобней было замыкать, вместо установки кнопки? Надо как-то конфигурировать это в исходниках gnuk?

Information

Rating
6,023-rd
Registered
Activity