Обновить

Комментарии 11

  1. "Нешмогла" (лошадь) стать предпринимателем. Не беда - "обучат".

    Как и суетливое поведение "предпринимателя", нельзя полностью списать на "начинающий" - "зеркало" обучения на западе.

    2. А вот выпустить в живой Интернет (на живые предприятия, людей), болбанчика с одной "моралью" "Заработать!" - хочется им чего-то оторвать (как ножки у мухи).

    И настораживает именно беззащитность Интернета от таких "Я-самый" (сов.дет.ф. "Тайна железной двери"). Поразила реакция пострадавшего "Если вы не отзовётесь, мы напишем в Cпортлото".


    В итоге. Безответственность (никто даже не подумал засудить Bottleneck Labs)

    3. >Самая неожиданная проблема — они плохо распоряжались временем

    Ну хоть, здесь, повезло (в этот раз).

Вот со вторым пунктом я как раз в основном согласен: самое спорное в эксперименте — не поведение моделей, а решение экспериментаторов дать им реальные почту, Stripe и живых людей в качестве подопытных. Собственно, после жалоб они инвойсы отменили, агентов остановили, а следующий эксперимент собираются проводить уже в симуляции.

А вот насчёт «зеркала обучения на Западе» я бы не спешил. Здесь гораздо проще объяснение: модели дали один измеримый KPI — заработать максимум денег — и почти не дали содержательных ограничений на способы. Когда рассылку блокировали, две разные модели независимо восприняли это именно как техническую неисправность канала и нашли другой канал. На мой взгляд, это как раз самая интересная часть эксперимента.

Ну а «никто не засудил Bottleneck Labs» означает только то, что пока никто не засудил Bottleneck Labs. Из этого довольно трудно вывести их безответственность или её отсутствие :) Тем более после огласки картина может поменяться.

(не по теме)
Охо-хо - понял, что Вы, еще сильнее "расширили мое представление" об ущербности современных LLM:

1. Фразой "(экспериментаторы) дали модели (только) один измеримый KPI — заработать максимум денег — и почти не дали содержательных ограничений на способы"
- Вы призвали "принять действительность" (если очеловечить: "AI - не имеют принципов". Или "в инструменте AI - нет принципов" - защитных блокировок (тяп, топором/пилой по руке), "Законов робототехники". Но пишут же, что потихоньку вставляют), и каждый раз самому описывать.

2. Ваше отношение (как маркер "так - рассуждает большинство") напомнило мне (продвигаемый мною же) тезис:

Люди привыкнут не ожидать многого от LLM

(я это писал в отношении галюцинаций, за которые никто не отвечает.
И как выход, "накладывал ограничения" - доверять AI, но только в рамках контракта/стандарта оказываемой услуги)

3. Теперь добавляется:

По умолчанию - AI пойдет на всё (в т.ч. на пограничные нарушения/преступления)

И последствия - мне не нравятся (постепенно складывается портрет карманника).

А что они хотели за три дня ?

Статья должна называться так: исследователи поставили дурацкий эксперимент, потратив на это кучу денег .

Думаю, если повторить такой эксперимент с людьми, то результат будет идентичен. Слишком сложная цель поставлена, почти невозможная из-за своей размытости и малого бюджета...

Из $2100 стартового капитала агенты потратили $359,80 — 17%, и это при правиле, что остаток обнуляется: деньги ни у кого не были узким местом. А $2833,35 на инференс платили организаторы, так что общая цифра «$3200» складывает два разных кармана. Отдельно мешает читать это как семь равных запусков: Muse добавили двенадцать часов, Quinn и Grok остановили досрочно после жалоб, то есть «$0 за 72 часа» — это про минимум три разные длительности. В отчете Bottleneck Labs есть фактическое время работы каждого агента до остановки?

А вот за такой комментарий прямо спасибо! Тем более что работал над ним утром.

С суммой в $3200 я действительно слишком "широко" сложил разные расходы. $359,80 модели потратили из выделенных им $2100, а $2833,35 — это стоимость инференса для организаторов, и про них в отношении ограничений и расходов моделей смотреть, конечно, не стоит.

С 72 часами тоже не так просто. Одно дело отчет, другой примечаний к нему, плюс в самом отчёте сводной таблицы фактической длительности я не нашёл.

В примечании же авторы уточняют, что Qwen и Grok остановили досрочно, а Muse, наоборот, им пришлось дать ещё 12 часов. Как говорится, все модели умные, но не все быстрые.

Начал искать подробности, и обнаружил, что опубликованные трейсы/логи делают картину ещё "страньше": например, лог Qwen тянется примерно до 95,7 часа, Grok — до 95,4, Sol — до 80,4, Fable — до 72, Kimi — примерно до 73. То есть, судя по всему, в логи попала и активность после номинального окна или остановки, поэтому считать их конец точным временем зачётного запуска тоже нельзя.

Подумаю, как внести в текст поста эту информацию.

Предприниматели сказали, что АИ плохой предприниматель, програмисты сказали, что АИ плохой програмист, писатели сказали, что АИ плохой писатель... Кто следующий?

"Я - свидетель. А что случилось?"

АИ, и молча - специальный, упорядочивающий (детектирующий и ограничивающий. Упомяну "в суе" РКН, как пример иерархии).
(мрачно) После накопления критической массы резонансных событий.

Бизнес это не про мораль.

Если убрать этику увидели бы торговлю органами и колл центры.

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации