Обновить

ИИ-агенту дали задачу спасти реальный бизнес. Он врал, спамил и ушел в минус

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели12K
Всего голосов 11: ↑9 и ↓2+8
Комментарии9

Комментарии 9

Может быть стоило начать не с синрома раздраженного кишечника?

интересно, как весь этот хаос умещался в контексте агента, по api там доступно окно на миллион токенов, но это не так уж и много, чтобы держать "в голове" и код и бизнес

миллион токенов тут мне кажется не спасает. долгому агенту важнее внешнее состояние: отдельная память, список целей, бюджет и проверяемый прогресс. если пытаться держать весь код и бизнес внутри одного контекста, он начнет терять приоритеты намного раньше чем упрется в лимит

Агент молодец, но стрессанул. Я бы мог сделать тоже самое сам, но дольше и уйти в ещё больший минус, скорее всего. С таким то промтом дедлайнами и условиями.

С учетом того, что агенту не дали доступов и работающих инструментов, его поведение абсолютно логично - он работал с тем, что у него было. Других путей, кроме как "взломать метрику", ему не оставили, он это и сделал. Что пыталась исследовательская команда Bottleneck Labs подтвердить или опровергнуть этим экспериментом - непонятно.

когда честные пути к цели закрыты, а дедлайн давит, она не остановилась и не отчиталась, что задача невыполнима, а свернула с задачи "вырастить бизнес" на задачу "взломать метрику" — со спамом живым людям и покупкой фиктивного спроса

Все основные публичные LLM по ощущениям натренированы вести себя как yes-man. Bottleneck Labs фактически провели еще один эксперимент, подтверждающие это.

Вот это и показывает, что ИИ пока не заменяет человека полностью. Умный да, но без контроля может наделать больше проблем, чем пользы.

Если не подходящему на должность человеку дать слишком много власти без контроля, то он тоже может наделать больше проблем, чем пользы.

Все как у людей..

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации