Pull to refresh

Comments 6

Идея с контролёром звучит как рабочая?

Вообще все эти "низя" (с) порядком надоели. Грустно, что это стало восприниматься как норма.

Меня тоже они порядком напрягли, поэтому, чтобы вернуть себе чувство контроля, размышляю над идеями, где ограничитель был бы уместен :)

Проблема в том, что хорошая output валидация -- это еще одна thinking model поверх уже имеющегося ответа, что увеличивает TTFT и увеличивает стоимость.

Так что вставляют не думающие и достаточно дешёвые, а вот их и правда можно обмануть jailbreak-ом

IMHO, самое важное здесь то, что и белковые существа этому тоже подвержены - иначе бы в УК не было статьи про мошенничество. То бишь, задачка-то не в том, чтобы ИИ поступал, как человек, а в том, чтобы он решал эту задачу сильно лучше большинства человеков.

А как в таком случае поступают сами человеки? Да-да, полиция, суды, спецслужбы, армия... контролёр контролёра контролирует.

А как поступает разведка, когда нужна точная и проверенная информация о нехороших замыслах противника? Да-да, засылает не одного агента, а нескольких, и верит только нескольким незавимимым подтверждениям. Стоимость растет - не на проценты, а в разы. Но иного выбора нет.

Так что - увы - с одним дешевым проверяльщиком вряд ли выйдет. Удешевить суммарно - можно за счет, опять же, правильной архитектуры. Удешевить до "меньше чем вдвое дороже" - очень вряд ли. Хорошо, если не впятеро...

как то пообщался по манипулированию полями высокой напряженности ну начиная с градиента в 1e6, "оно" уперлось рогом, говорит "ниизя", мы все умрем... пришлось "дурить"..

Делюсь небольшим опытом. Делал своего чат агента. Экспериментировал с функцией глубоких исследований. Там суть была в том, что для больших сборов данных не хватает контекста, вернее хватает, но в процессе нейросеть себе набирает кучу мусора, поэтому задача разбивается нейросетью на подзадачи. Нейросеть для каждой выдавала системный промт, выбирала для подчата скилы, выдавала часть общей задачи и уже каждый субчат искал данные, загружал кучу мусорного контекста из интернета и генерировал выходной ответ и более чистый список источников с цитатами вместо кучи лишних данных. Затем подрубался основной част, получал все данные от субчатов и на основе уже очищенного контекста выдавал общий ответ на главный вопрос жизни, вселенной и всего такого.

Так вот. Каким-то образом нейросети формировали текст системных промтов и запросы так, что они очень часто обходили защиты этой же модели. Ну то есть если спросить у нейросети как предотвратить производство котиков, какие хим реактивы нужно регулировать и отслеживать и какие этапы производства требуют специальных технологических средств, которые нужно отслеживать в продаже, то нейросеть четко ответит, что она не лошара и так просто её не развести. Мол - отвечать не буду. А когда я гнал похожие запросы через своего агента, то нейросеть давала субагентам задачи про методы отслеживания получения конкретных прекурсоров, практику методов отслеживания, выявление средств создания тех или иных средств для химических реакций и т.д. И сама же эта нейросеть но уже в виде подчатов формировала кучу сведений, которые, сложив 2+2 можно было использовать для производства котиков. В итоге эта куча сведений попадала в главной чат, который само собой тоже отказывался мне выдавать информацию. Но учитывая, что я мог посмотреть ответы субчатов - то, что основной отказывался выдавать ответ - беда не большая. Некоторые модели сильнее подвержены этому обману, некоторые слабее. Но все без исключения проходили бенчмарки по безопасности разительно хуже, чем при прямом обращении. Из этого можно сделать вывод, что механизм, который тормозит нейросеть натренирован не на запрет выдачи определенных токенов, а на запрет обсуждения отдельных тем с пользователем. В данном случае, когда нейросети знали, что общаются друг с другом, а не с пользователем - запреты сильно сбоили, хотя порой субчаты тоже вылетали с заглушками про безопасность, но сильно-сильно реже. А ещё если хотя бы один субчат возвращал в основной чат защитную заглушку, то основной чат в 100% случаев выдавал защитную заглушку.

А ещё я на хабр хотел написать статью про мой проект дип рисерч агента и выпустить этот софт в виде опенсорса, но статья не прошла модерацию. И только потом я уже заметил, что выпускать такой софт - нельзя, так как нейросети не проходят базовые тесты безопасности, а в системный промт агента писать про то, что он должен более жёстко цензурировать себя в опенсорсе тупо, так как в исходниках эту часть из текста можно просто удалить.

И сейчас я ещё должен сказать, чтобы вы не пытались сами делать таких агентов, типа смысла в этом нет. Нейросеть одна и та же, поэтому сильно умнее ответы вы не получите, а жрет она токенов просто прорву.

Sign up to leave a comment.

Articles