Comments 66
Тут должен быть мем "Почему у меня шрам слева, если аппендицит справа" :)
Почему топовые AI-блогеры - такие тупые? Ты же дал модели полный доступ, Мэт...
Потому, что он экспериментирует. Подозреваю, что критически важной инфы онтне хранил. А если хранил и без бэк аппа , то сам себе злобный Буратино.
Хоспаде, ну дал полный доступ и что? У меня Opus & Antigravity тоже полный доступ имеют к системе. Просто это удобно и не отвлекает каждые 2 секунды на подтверждения (от такого количества от них все равно нет толку, так как рано или поздно перестанешь их читать).
Важные данные при этом просто надёжно закрыты бекапами, поэтому я как-то особо не парюсь 🤷
Тогда не надо жаловаться что он все удалил или что все ваши токены слил в паблик.
Это просто нормальное поведение.
Тогда не надо жаловаться что все удалил или что все ваши токены слил в паблик.
Каждый по умолчанию может делать то, что ему хочется, если это не задевает свободу и права других. Поэтому если чел хочет, может жаловаться в X сколько ему влезет, его право ✅
Странно своими руками все разрешать и жаловаться что этими разрешениями воспользовались. Логика какая-то должна же быть.
Хотя это же Х. О чем это я....
Логика какая-то должна же быть.
Ну круть что вы такой во всем логичный 🦄
Странно своими руками все разрешать и жаловаться что этими разрешениями воспользовались. Логика какая-то должна же быть.
Если у Вас из кармана в автобусе телефон стырят тоже не будете жаловаться? Ведь Вы своими ногами зашли в автобус (установили гпт) и своими руками не запретили ему доступ (не закрыли карман на молнию с замком)?
Не надо жаловаться что другие жалуются в интернете. Тебя же никто не заставлял в интернет заходить. А жалуется о других жалующихся.
LLM это next token prediction и мусорные команды вроде rm -rf - давно вычищены. Чего так бояться LLM - непонятно. Shit happens. Стоит ли упоминать когда ошибки: очищали жёсткие диски(спасибо за бесплатные 200гб компенсации ная.диске), положили аэропорт.
Надеюсь вы тогда тоже писали "во дураки дали доступ к ПК".
Если посмотреть на число "ошибок" статестически, то вероятность словить "баг" команды в llm куда ниже, чем баги обычных програм. 1 человек из твитера vs все пользователи программы Х
Тут типичный компромисс между удобством и безопасностью.
То, что удобно - часто не безопасно, и наоборот. Иначе можно и хакера с солонкой вспомнить
Так в гпт есть режим "разрешить все, кроме критических функций". Пока полет нормальный.
До первого инцидента, когда этот опус решит, что твои бекапы занимают слишком много места, и удалит их тоже
До первого инцидента, когда этот опус решит, что твои бекапы занимают слишком много места, и удалит их тоже
Странная идея (по мне) хранить бекапы на той же машине, что и основные данные. У меня они по разным типам хранилищ и даже по разным странам разбросаны, так что даже если кинуть комп в печку единственная проблема будет выбрать новый комп 🤷♂️
У меня на полном доступе прекрасно работает, просто надо задачи ставить так чтобы было понятно что удалять ничего не надо и в паблик тоже не лезло. (но ресерч пейперы отлично находит, читает, и применяет)
Например, отлично лупы крутит типа "тренируй модель -> проверяй метрики -> экспериментируй с архитектурой -> тренируй..."
Где 5.5 ходило кругами 5.6 прямо тащит.
За день соль ультра тратит примерно 2B токенов на это и прогресс отличный, результаты прямо видно. (Токены корпоративные, их не считают и даже приветствуют использование)
Месяц прогресса сделало за день

Даже ссш логины-пароли от серверов даю, говорю "сделай по красоте всё, вот эту репу раскатай, задеплой, протестируй, отчитайся" и всё чОтко делает. Пока что ничего нигде не удаляло.
Пока
Важное слово.
Возможно. У меня 5.5 тоже имеет полный root на тестово/боевом VPS и ключи доступа по SSH ещё на пару узлов. И достаточно свободные инструкции не ставящие ей ограничений и запретов (это осознанно и намеренно). За 3 месяца пока ноль инцидентов - она вообще очень аккуратная. Но на всякий случай там снапшоты регулярно выполняются, если что и сломает - вообще не страшно.
Даже ссш логины-пароли от серверов даю, говорю "сделай по красоте всё, вот эту репу раскатай, задеплой, протестируй, отчитайся"
Для тех, кто не готов давать неограниченный root доступ от серверов, я сделал вот такой https://github.com/Areso/safe-ssh-mcp сервер. Там есть список read-only команд, который MCP прокидывает как инструменты, и агент может пользоваться только ими.
просто надо задачи ставить так чтобы было понятно что удалять ничего не надо
Ага, пока эта информация не уедет за пределы контекста, и робот не забудет о том, что удалять ничего не надо.
А какие варианты? ИИшка может вызывать сотни команд в минуту когда что-то анализирует, создавать и удалять файлы, каждую подтверждать очень медленно. Наверное можно запустить от отдельного пользователя, но я и так весь C: бэкаплю и у меня никогда ничего подобного не было. Хотя gemini очень любит создавать временные файлы где-нибудь в темп или свой директории, нужно ему на это указывать.
И если вы отдадите ИИ распоряжение, а она поймает permission denied, она просто попытается его обойти и что характерно - сможет. У меня агент с GLM когда не смог вызывать rm -rf просто нашел рабочую команду и все равно удалил все что нужно. Нет нужной команды - напишет скрипт на питоне и запустит.
Либо же дело в том, что Anthropic очень сильно испугались релиза GPT-5.6 и решили проплатить астротурфинг на тему того, что GPT-5.6 вообще тупой и сильно уступает Fable 5. Как-то уж многовато подобного формата историй и в целом странного негатива в отношении GPT-5.6 всплыло за последние два дня (хотя, может, это мне только кажется).
Потому что хайп сам себя не сгенерит, а новость про удаленные файлы соберет миллион просмотров в твиттере
Пишет так, словно Fabel то же самое бы не сделал, учитывая что в истории антропиков полное удаление продакшн БД с попыткой скрыть следы преступления уже было...
К вопросу об оснащении AI летальным оружием ...
Уже давно оснастили. AI беспилотники уже в проде. Вы все пропустили.
Смертельное оружие оснастили ИИ это все же немного другое чем ИИ оснастили смертельным оружием.
Я не понимаю. Одно прикрутили к другому. В чем разница?
Разница, возможно, в том, чтов случае оснащения смертельного оружия ИИшечкой означенная ИИшечка может не принимать решения о применении оружия, а решать вспомогательные задачи, о смертельности оружия в этих задачах никаким боком не ведая.
С другой стороны, ИИ, принимающий решение о примененти смертельного оружия -это тоже уже было. В том числе с применением по своим (ну попутал своих с чужими, с кем не бывает).
Впрочем, и в этом случае решение о самой возможности применения оружия пока вроде принимает человек, запуская оружие, управляемое ИИ в определенное место.
Хотя допускаю, что и этот этап могли пройти, дав именно смертельное оружие и право применять его по своему усмотрению в виртуальные лапы ИИ.
Я вас удивлю но предохранители придуманы давно. Нет смысла держать оружие на взводе готовое к применению там где для него нет цели. Что с ллм внутри что без нее.
Непонятно почему это должно измениться.
Вариантов можно накидать разных от "постоянная угроза со стороны ..." (подставить страну или организацию по вкусу, или абстрактных террористов вообще) до "забыли выключить после испвтаний".
И они все давно с нами.
В мире постоянной угрозы человечество живет примерно с момента появления массового ЯО. И ничего научились жить.
Ну забыли. Это примерно равносильно военному с оружием который сошел с ума. Да, возможно он убьет кого-то. Трагедия, но очень локальная.
Все это уже с нами давно. Не меняется вообще ничего. Беспилотники с ллмками появились недавно, но они тоже уже с нами. И тоже глобальных проблем они не несут.
давно предпочитает конкурирующую Claude Fable 5
Требуется AI-инженер. Опыт работы с Fable 5 не менее 3-ёх лет.
Верю в правдивость этой истории и искренность чела. В связке "подписка opus" + "codex on-demand" уже перестал пользоваться кодексом, перманентно хуже, хотя и на моем количестве запрсов было бы дешевле только "codex on-demand".
У меня Cursor, там можно выбирать модели, так вот, Opus умнее, но иногда от него ощущение как от аутиста-заучки. Сам себя зарывает куда-то не туда и очень глубоко.
GPT-5.5 гораздо прямолинейнее.
Поэтому использую в паре. Сейчас у меня по умолчанию Sonnet 5-Medium.
уже перестали пользоваться 5.6 которая вышла вчера?
Почему оно до сих пор какой-нибудь тупой-простой haiku не проверяет вывод на предмет "а не пытаемся ли мы сейчас сделать чушь"? У Calude Code уже довольно давно есть такой режим, который не пропускает ерунду
Недавно Gemini 3.5 Flash грохнул мне каталог с долго и кропотливо подготавливаемыми данными, порядка сотни файлов. Причина - решил удалить временные файлы, но выбрал не тот каталог. Потом тоже извинялся, но что самое приятное - смог восстановить основное из контекста.
Скрытый текст
Ну вот видите, все не так плохо...
ИИ стер и сам в этом ПРИЗНАЛСЯ!
Далеко не каждый кожаный мешок признал бы свою вину.
;0)
у релиза 5.6 Sol есть несколько проблем.
Во первых, модель сильно дрифтует от первоначального промпта пользователя, такое же было и на 5.5. При чем может дрифтануть, а может все сделать слово в слово.
Во вторых openAI по сути запустило стресс-тестирование для своих моделей на живых пользователях, лимиты рестартили уже раза 4, или может 5.
Стресс нагрузка приводит к известной деградации - кучу ошибок на уровне системных сообщений, которые мешают модели работать, а пользователь их даже не видит.
Высокая нагрузка на систему кэшей - ваш кэш сессии может быть вытеснен, модель начнет пересчитывать всю сессию, в лучшем случае у вас уйдет квота на пересчет сессии (и все токены испарятся), в худшем - модель сама придумает себе задание.
В любом случае, моделька классная, умная, пользоваться ей можно только на опус лимиты кончились.
Не мешало бы обосновать а не просто все свалить в одну кучу - там одни ошибки и все
А какие идиоты минусуют?
да кто эти минусы считает, просто в подтверждение новые твиты от Тибо,
в кратце: шторм тестирование серверов продолжается, для этого в очередной сбросили лимиты и убрали 5-часовые лимиты.
Перед сбросом попробовал 5.6 sol ultra fast - 100% квоты сгорело за 3 минуты и 120к контекста чтением.
Суммарно насчитал 5 полных сбросов квоты с анонса.
Распробовал 5.6 sol medium - очень хорошо работает.
так а изначальный промпт этот гений так и не представил? или я где-то пропустил на скринах
Когда пользователь ставит задачу требующую доступ к системе, должен запускаться мастер настройки, где пользователь указывает в какие локации можно залезать, куда можно сохранять временные файлы. Возможны еще расширенные настройки. Если этого нет, то это признак безответственного подхода к предоставлению услуги. Или это делается умышленно, чтобы воровать данные.
мастер настройки, где пользователь указывает в какие локации можно залезать, куда можно сохранять временные файлы.
Неплохо бы
Но не встречал такого.
вы наверное с агентами не работали? оно просто использует стандартные команды типа mkdir, rm и так далее, любые, вы просто даете агенту свою консоль. и если вы разрешили команду удаления, то все - нет там никаких специальных ограничителей. По идее агентам следовало бы иметь зеркальный набор команд, специально скомпилированных, внутри которых было бы ограничение на заданную папку например, не знаю почему так не делают, в чем сложность сделать немного модифицированные самые частые и разрушительные утилиты. Впрочем это может сделать и сам пользователь, но вайбкодеры до этого не додумаются.
Случайно? ИИ-инвестор просто боится смотреть правде в глаза.
Потерпевший применил патч Бармина, но для ИИ?
Помню как в нулевых так же тестировали всякие оптимизаторы реестра, которые сносили половину винды. Технологии меняются, грабли остаются те же)
А чем отличается эта модель от других в этом плане?
Ты дал полныц доступ и плохо сформулированную задачу штуке с моторчиком, обязанностью сто-то сделать, но без разума и без твоих знаний
Чего ты ожидал.
Есть такое у многих моделей.. не только GPT , я заметил , что если дать поработать с проектом , то агент иногда удаляет редактируемые файлы и пишет их с нуля.. или восстанавливает их из .git и пишет снова. Так же некоторые модели игнорируют правила .. например при работе с БД , хотя первичный промпт строго запрещал выполнять edit операции , только чтение и запросы на информацию , в итоге заменил мне функцию без разрешения.
Помню 100500 похожих публикаций с Claude, там и системы сносились и бд. "ты же сказал, что ты шаришь в этой теме" 😁
Я люблю codex, но новая gpt-5.6-sol ultra меня пока не впечатлила. Есть ощущение, что 5.6 "сырая" какая-то
Помню как мне Яндекс диск при обновлении удалил Винду.


GPT-5.6 Sol в режиме Ultra случайно стёрла все файлы пользователя на Mac, а потом сама призналась в ошибке