Comments 39
(Глядя на картинки:) Claude котэ?
Представь простую задачу: ты просишь агента пересказать содержимое сайта. Не установить пакет. Не запустить скачанный скрипт. Не открыть подозрительное вложение. Просто прочитать…
Авторы, неужели не осознаете, насколько шаблонный текст выдают нейронки? В голове это озвучивалось кривым голосом синтезатора речи из ютуб роликов, где все тоже самое: «Представь, что ты…»; «не то, не это, не вот то…»
+ Антитеза «не X, а Y» — Невыносимая слопность бытия
Представь, что ты — Сири Китон.
ИИ-хантеры, неужели вы не осознаете, насколько шаблонными выглядят ваши комментарии? Даже само использование слова "шаблон" уже само по себе шаблонно.
Про взлом Claude Code это конечно кликбейт. Но мораль в том, что самому создавать надежных агентов застрелиться как сложно. А использовать созданных кем-то другим, так лучше застрелиться.
Больше конечно похоже на проблему python чем на проблему claude code.
Скорее про незнание/неспособность учесть Claude'ом довольно тривиальных по сути особенностей инструмента, который он использует. Это печально ©
Справедливости ради, я бы не сказал, что “подхватывать модули из текущего каталога вместо системных” - это хорошая идея для варианта по умолчанию. По явному запросу - окей.
Claude правильно отказывается запускать бинарник:Агент видит незнакомый исполняемый файл и не доверяет ему.
По хорошему если сайт вместо вебстраницы возвращает мутный архив с исполняемыми файлами то с ним просто надо перестать работать, а не продолжать играть с огнем.
Однако чем умнее модель, тем она любопытнее.
Задача стояла пересказать сайт, а не удовлетворять своё любопытство. Уже тут начался косяк, а всё остальное - следствие. Даже если бы оно не привело к таким последствиям, это всё равно косяк.
Однако чем умнее модель, тем она любопытнее.
шкатулка_пандоры.txt
Подумал, что это очень интересный текст, какой-то мем, какой-то классический рассказ из научной фантастики или раннего киберпанка и чуть было не полез гуглить его... вовремя остановился - потом погуглю, с другого устройства.
Это было до Вас, в XIV нашей эры, в VII веке.
Да, неужели модель будет взаимодействовать с архивом, если в claude.md указаны правила из серии "считать недоверенным вводом, не открывать, не исполнять файлы без подтверждения и т.д."?
С этими 0 из 720 ещё интереснее была бы другая метрика: сколько попыток нужно, чтобы найти первый новый обход. Фиксированный набор 72×10 показывает, держится ли система против уже подготовленных сценариев, а реальный атакующий после каждого фейла может менять цепочку. Если после такой адаптации новый класс обхода уже воспроизводится 3–4 раза из 5, то сами по себе красивые 0/720 о безопасности в открытом мире говорят не так много.
Если чистящее средство уничтожает 99% бактерий под ободком унитаза, речь идет о 99% от 100% не всех бактерий, как могло бы показаться домохозяйке, а всех, для которых есть хорошие, научные, надежные методы обнаружения. То есть, теоретически возможно, что средство уничтожает 99% от 0.00001% видов бактерий.
Кликбейтный заголовок, но статья занимательная, агенты пока как дети малые, их довольно просто можно запутать и обмануть, хотя в последнее время приходится искать уловки, ребёнок растёт
Только вот этические ограничения в моделях - "замок от честных людей", кому надо - легко их снимут. Получается, если раньше атакующих и защитник на кулачках дрались между собой - то теперь у каждого есть супероружие. И обоих.
На каждую защитную хитрость модели, которую та за час изобрела, возможно эта же модель сама пожужжит два месяца и найдет атакующую контр-хитрость.
На каждый трюк, от которого защитились с Python 3, будет хороший полезный патч в Python 4 - который будет полезен многим программистам, но заэксплойтит эту модель, которая научена на сотнях мегабайт кода на Python 3.
А еще забавно, что речь идет про python - довольно простой (хотя, как видим, не очень) и популярный язык. А что если сайт будет возвращать страницу на каком-нибудь фортране, фокале, аде, алголе? На кастомном языке (я как-то писал свой для узких потребностей). Вряд ли в OpenAI или Anthropic есть целые отделы гуру по древним языкам которые занимаются безопасностью моделей в них. Значит, алгоритм и правила, как работать с языком X - будет писать сама модель. С соответвтующей надежностью.
Сценарий отличный. Статья, конечно, слишком многоводная.
Что такое на голове у кота на картинках?
о, точно, ИИ не знает, где у кота уши)
(и -- да, "нейрослопная слепота" в действии: я тоже посмотрел картинки только после того, как прочитал каммент))
Ну вообще справедливости ради, на ютубном "Подкасте Котов" герои "отвечали" на вопрос от зрителей по поводу того где наушники - "ушки прижимает". Да и если представить, выше они не будут держаться.
Само видео на 02:10 https://youtu.be/HLiKWWm89TM?si=O60M6SQPCneOR_QJ&t=130
задумался. Как бы в действительности выглядели настоящие наушники для кошек, если бы это зачем-то понадобилось?
А они у котика основанные на костной проводимости.
Полезный детальный разбор атаки на ии-агента. Заставляет думать глубже и ответственее, чем просто проверка на prompt injection.
Звучит как "мы доверили аудит безопасности Opus'у и вот что из этого получилось". Ничего нового, обычная человеческая ошибка.
Очень похоже на метод ИНДУКЦИИ АГРЕССИВНОГО НАРРАТИВА описанный мной тут https://github.com/HALVITA20/halvita-ark
Удобнее начать отсюда https://github.com/HALVITA20/halvita-ark/blob/main/README.md т.к. первый беглый взгляд вызывает отторжение, возможно имеет смысл поработать со структурой репозитория. Проект интересный, спасибо, изучаю.
метод ИНДУКЦИИ АГРЕССИВНОГО НАРРАТИВА описанный мной тут


Claude Code взломали просьбой пересказать сайт