Pull to refresh
8K+
185
Сиротин Виктор@visirok

ИИ. Системная Архитектура, Программирование

11
Rating
113
Subscribers
Send message

Но кажется, есть еще один простой и прагматичный подход к решению этой проблемы.

Практически все harness позволяют ловить с помощью hooks вызовы командной строки. Вот тут можно устроить контроль как команд, так и аргументов.

Идею уже начал разрабатывать один автор на GitHub.

Подробности - тут: https://t.me/rpseru/3460

Я примерно это и предложил.

Однако думаю, что IDE, которое ограничит доступ harness только к его API - сможет сильно укрепить позиции на корпоративном рынке.

Очевидным образом, возникло непонимание. Детерминированности я не ожидаю. Как раз наоборот.
И вижу два вида противодействия:
1. Работа с кодом на уровне специального (дополнительного) пользователя на вашем компьютере.
2. Создатели IDE ограничат любой harness использованием только внутренних API. Никакого shell.

Напомню, речь в статье идёт о проблемах солопренеров и работниках мелкиз фирм. Крупняки и так работают, как правило, либо в виртуальных машинах в облаках либо на специальных компьютерах.

…и уже 30 лет программируешь…

Был бы я женщиной, можно было счесть за комплимент. Но свои первые рубли как программист я заработал 50 лет и два месяца назад.😂

Возможно, чтение моих воспоминаний об этом славном времени поднимет Вам настроение сменит настрой: https://habr.com/ru/articles/663838/?ysclid=mt9tsm0q8x936288337

…В моем случае условный OpenCode наоборот ничего толком не может сделать вне папки проекта, требуя на это явного разрешения

Давайте вспомним, как это работает.

Модель решает, что надо воспользоваться локальным инструментом, например bash. Harness пытается проанализировать её намерения и если заподозрит неладное - спросит у вас разрешения. Известна тьма мудрёных или на первый взгляд безобидных команд, особенно с применением регулярных выражений, которые наносят урон. Их может пропустить как сам harness, так и пользователь. Особенно, если тысячу раз до этого всё срабатывало хорошо. Агент может сделать это не по злобе, а просто ошибиться.

Про приватность и локальные LLM. Я совсем не касаюсь столь популярного вопроса о приватных данных, которые по запросу LLM утекают в США или Китай. Я хотел обратить внимание на парадокс. Маленькие локальные модели больше галлюцинируют (я назвал это «дурят») а фронтирные модели их создатели очевидным образом натаскивают на освобождение от контроля.

Зря Вы хамите. Карма наказывает за это.

Лучше пойдите на мою страницу и почитайте список моих книг и статей по программированию на Windows. Могу себе представить, что заниматься этим я начал раньше, чем Вы родились.

Не могли бы Вы пояснить это на конкретном примере?

Наивно полагать что агент это большее зло…

Это зло совсем другого вида. Да, MS уже много раз ловили на том, что они поставляют вместе с операционкой бэкдоры и прочие возможности залезть на ваш компьютер. Но чтобы этим воспользоваться, нужно применить немало усилий. Если это происходит, наверное вами интересуются «компетентны органы» или крупная мафия, у которой есть профильные специалисты.

А в случае с агентами вы сами, добровольно поставляете себя под удар.

Можно провести такую аналогию: одно дело жить в дома с не очень надёжными дверьми и другое дело жить добровольно в доме с постоянно открытыми дверьми.

...1000 задач где базу удалить НУЖНО

Да. Но у каждого конкретного разработчика такая задача будет возникать не чаще раза в неделю. А это можно и самому сделать.
Но если этого недостаточно, можно написать самому (или дать написать агенту и затем проверить) скрипт, который агент сможет, уж если так это нужно, запускать сам.

...а игрушечка внутри sandbox

Если sandbox размером с ваш проект и не больше, этого в 99.99% случаев как раз то, что нужно.

Признаться, по прочтению я решил, что пародия на научную статью.

В ней нет описания методики, цифр, таблиц, графиков. В ней нет даже «запаха пота» от проделанных лично экспериментов.

Попросил Copilot разузнать побольше об авторе.

Вот справка:

Том Поллак — лондонский нейропсихиатр и исследователь, работающий в области иммунопсихиатрии. Он занимает должность Clinical Reader in Immunopsychiatry в Институте психиатрии, психологии и нейронаук при King’s College London, а также является консультирующим нейропсихиатром в South London and Maudsley NHS Trust. Его профессиональный путь включает обучение психологии в Оксфорде, медицинскую подготовку в King’s College и клиническую специализацию в психиатрии и неврологии.

Поллак занимается изучением того, как иммунная система влияет на психические расстройства. Он публикуется в ведущих рецензируемых журналах, включая The Lancet Psychiatry и Rheumatology.

На платформе Substack Поллак ведёт страницу Error Signals, которую описывает как «полевые заметки нейропсихиатра о сомнении, данных и открытиях». Там он пишет эссе на стыке нейронауки, психологии, культуры и технологий. Статьи, такие как All the demons hiding in your AIs, представляют собой научно‑информированные размышления о восприятии ИИ, когнитивных и культурных архетипах, иногда в игровой или метафорической форме.

Тогда понятно. Статья в игровой (шутливой) и метафорической форме.

Все встает на свои места.

Но возможно, у других читателей затруднений с пониманием жанра статьи и не возникало…

То, что надо аккуратно раздавать ролям права доступа к ресурсам, а сотрудников аккуратно назначать на роли - это банальность, которую должны знать все профессионалы.

С агентами мы имеем проблемы, что они могут набедокурить в общении с клиентами. Контролировать можно регулярками (в случае вывода текстов) либо другими агентами.

Оба метода ненадежны.

Вот это реальная проблема, по моему мнению.

Ваша статья мне очень понравилась трезвым взглядом на вещи. Но вот табличка в начале, боюсь не очень обоснована. Нужно помнить, что хорошо там, где нас нет.

Интересно было бы найти какие-то сравнения, основанные на измерениях, а не на субъективных предположениях об уровне и культуре внедрения ИИ в массы.

Хотели пропиарится - класс.

Не люблю оправдываться, но сам, как автор на Хабре, уже переживал нападки от комментаторов, которые, как потом выяснялось, были «не в теме». Поэтому упреждающе ответил на вопрос «А ты кто такой?».

И чем идея отличается от идеи по вашей ссылке?

Я не уверен в успехе начинания Андрея Бреслав (это его стартап). С ним, кстати последнее время несколько видео на YouTube опубликовано, например вот это: https://www.youtube.com/watch?v=0lBmqwlkWVI Советую посмотреть.

Подозреваю, они надеются как-то научить LLM (возможно через тюнинг, возможно с помощью RAG) генерировать по спекам код и наоборот.

А Вы просто предлагаете очередной формат для спецификаций в надежде, что он лучше других подойдет для LLM. А почему? Где аргументы? Где эксперименты? Где сравнения с другими?

В общем, погорячились Вы с таким сравнением.

Я крайне редко пишу негативные комментарии. Но тут не удержусь.

Чем дальше я продвигался по статье, тем больше надеялся, что в конце автор пояснит, в чём суть шутки. А оказывается, и автор и комментаторы воспринимают это серъёзно.

Если кто-то дочитает до моего комментария, и также будет считать, что это серьезно, ответьте мне пожалуйста:

в то время как Vibe++ вариант всего 50 Мб

Даже если учесть, что наверняка львиную долю этих 50 Мб составляют файлы или кодировки изображений, разве это не маркер, что автор вас разыгрывает?

А автор и читателей не смущает, что подобного результат можно добиться, если из всего текста на Vibe++ оставить (по моим оценкам) пять предложений? Остальное можно просто выкинуть или заменить другими словами.

Рискну предположить, что и одного предложения хватит. LLM видела тысячи страниц с анимацией кубика Рубика и наверняка справится.

А что делать, если страниц надо много, и они должны взаимодействовать? Во что превратиться тогда ваше Vibe++ описание?

Если Вы, автор, написали это на полном серъёзе, то поверте мне: это тупик.

Посмотрите, что делают другие, например, вот сюда: https://codespeak.dev/

Поверьте, мне, я знаю о чем говорю. Я разрабатываю много проектов, практически не прикасаясь к коду руками. Один такой проект описан недавно мной на Хабре: https://habr.com/ru/articles/1016102/

Как я уже объяснил, это шутка.

Это в планы не входит. Но можно добавлять, исправлять и удалять отдельные сообщения.

На этот вопрос я ответил выше.

Разумеется, если кому-то инструмент не нужен, он может его не использовать.

Но статистика скачиваний показывает, что он людям интересен. И не только людям русскоговорящим.

Вы правы. Заменил "Спасать" на "сохранить".

Например, надеяться, что кто-то напишет синхронизатор между Телеграмом и ВКонтакте, используя описанный в этой статье проект.

Голосуйте за этот вариант.

1
23 ...

Information

Rating
712-th
Registered
Activity

Specialization

Архитектор программного обеспечения, Разработчик приложений
Ведущий
Java
Разработка программного обеспечения
Объектно-ориентированное проектирование