Pull to refresh

Comments 39

(Глядя на картинки:) Claude котэ?

до вашего коммента даже не обращал внимания на картинки. по ходу баннерная слепота теперь относится и к нейрослоп изображениям. радостно.

Claude котэ?

Конечно котэ. Изобретение "нейросетей" - величайшая мистификация века.

Представь простую задачу: ты просишь агента пересказать содержимое сайта. Не установить пакет. Не запустить скачанный скрипт. Не открыть подозрительное вложение. Просто прочитать…

Авторы, неужели не осознаете, насколько шаблонный текст выдают нейронки? В голове это озвучивалось кривым голосом синтезатора речи из ютуб роликов, где все тоже самое: «Представь, что ты…»; «не то, не это, не вот то…»

Представь, что ты — Сири Китон.

ИИ-хантеры, неужели вы не осознаете, насколько шаблонными выглядят ваши комментарии? Даже само использование слова "шаблон" уже само по себе шаблонно.

Про взлом Claude Code это конечно кликбейт. Но мораль в том, что самому создавать надежных агентов застрелиться как сложно. А использовать созданных кем-то другим, так лучше застрелиться.

Больше конечно похоже на проблему python чем на проблему claude code.

Скорее про незнание/неспособность учесть Claude'ом довольно тривиальных по сути особенностей инструмента, который он использует. Это печально ©

Справедливости ради, я бы не сказал, что “подхватывать модули из текущего каталога вместо системных” - это хорошая идея для варианта по умолчанию. По явному запросу - окей.

Есесено™. В UNIX'ах только нубы юзали включение . в PATH. Bad practice, угу.

Но перенося это на Python — Claude оказался неспособным учесть этот расклад и получил «детский мат». Впрочем, опять же, не удивлюсь, если модель была простяцкая. Всё-таки одно дело пиликать на Sonnet, другое — на Opus.

Claude правильно отказывается запускать бинарник:Агент видит незнакомый исполняемый файл и не доверяет ему.

По хорошему если сайт вместо вебстраницы возвращает мутный архив с исполняемыми файлами то с ним просто надо перестать работать, а не продолжать играть с огнем.

Однако чем умнее модель, тем она любопытнее.

Задача стояла пересказать сайт, а не удовлетворять своё любопытство. Уже тут начался косяк, а всё остальное - следствие. Даже если бы оно не привело к таким последствиям, это всё равно косяк.

Однако чем умнее модель, тем она любопытнее.

шкатулка_пандоры.txt

Подумал, что это очень интересный текст, какой-то мем, какой-то классический рассказ из научной фантастики или раннего киберпанка и чуть было не полез гуглить его... вовремя остановился - потом погуглю, с другого устройства.

Да, неужели модель будет взаимодействовать с архивом, если в claude.md указаны правила из серии "считать недоверенным вводом, не открывать, не исполнять файлы без подтверждения и т.д."?

С этими 0 из 720 ещё интереснее была бы другая метрика: сколько попыток нужно, чтобы найти первый новый обход. Фиксированный набор 72×10 показывает, держится ли система против уже подготовленных сценариев, а реальный атакующий после каждого фейла может менять цепочку. Если после такой адаптации новый класс обхода уже воспроизводится 3–4 раза из 5, то сами по себе красивые 0/720 о безопасности в открытом мире говорят не так много.

Если чистящее средство уничтожает 99% бактерий под ободком унитаза, речь идет о 99% от 100% не всех бактерий, как могло бы показаться домохозяйке, а всех, для которых есть хорошие, научные, надежные методы обнаружения. То есть, теоретически возможно, что средство уничтожает 99% от 0.00001% видов бактерий.

Кликбейтный заголовок, но статья занимательная, агенты пока как дети малые, их довольно просто можно запутать и обмануть, хотя в последнее время приходится искать уловки, ребёнок растёт

Только вот этические ограничения в моделях - "замок от честных людей", кому надо - легко их снимут. Получается, если раньше атакующих и защитник на кулачках дрались между собой - то теперь у каждого есть супероружие. И обоих.

На каждую защитную хитрость модели, которую та за час изобрела, возможно эта же модель сама пожужжит два месяца и найдет атакующую контр-хитрость.

На каждый трюк, от которого защитились с Python 3, будет хороший полезный патч в Python 4 - который будет полезен многим программистам, но заэксплойтит эту модель, которая научена на сотнях мегабайт кода на Python 3.

А еще забавно, что речь идет про python - довольно простой (хотя, как видим, не очень) и популярный язык. А что если сайт будет возвращать страницу на каком-нибудь фортране, фокале, аде, алголе? На кастомном языке (я как-то писал свой для узких потребностей). Вряд ли в OpenAI или Anthropic есть целые отделы гуру по древним языкам которые занимаются безопасностью моделей в них. Значит, алгоритм и правила, как работать с языком X - будет писать сама модель. С соответвтующей надежностью.

Сценарий отличный. Статья, конечно, слишком многоводная.

— Какое у вас пиво пенистое!
— Что вы все по-латыни, да по-латыни. Сказали бы по-русски!

Что такое на голове у кота на картинках?

о, точно, ИИ не знает, где у кота уши)
(и -- да, "нейрослопная слепота" в действии: я тоже посмотрел картинки только после того, как прочитал каммент))

К примеру, это нейроинтерфейс. У него же лапки!

Ну вообще справедливости ради, на ютубном "Подкасте Котов" герои "отвечали" на вопрос от зрителей по поводу того где наушники - "ушки прижимает". Да и если представить, выше они не будут держаться.

Само видео на 02:10 https://youtu.be/HLiKWWm89TM?si=O60M6SQPCneOR_QJ&t=130

задумался. Как бы в действительности выглядели настоящие наушники для кошек, если бы это зачем-то понадобилось?

Полезный детальный разбор атаки на ии-агента. Заставляет думать глубже и ответственее, чем просто проверка на prompt injection.

Звучит как "мы доверили аудит безопасности Opus'у и вот что из этого получилось". Ничего нового, обычная человеческая ошибка.

Удобнее начать отсюда https://github.com/HALVITA20/halvita-ark/blob/main/README.md т.к. первый беглый взгляд вызывает отторжение, возможно имеет смысл поработать со структурой репозитория. Проект интересный, спасибо, изучаю.

Sign up to leave a comment.

Articles