Комментарии 11
"Нешмогла" (лошадь) стать предпринимателем. Не беда - "обучат".
Как и суетливое поведение "предпринимателя", нельзя полностью списать на "начинающий" - "зеркало" обучения на западе.
2. А вот выпустить в живой Интернет (на живые предприятия, людей), болбанчика с одной "моралью" "Заработать!" - хочется им чего-то оторвать (как ножки у мухи).И настораживает именно беззащитность Интернета от таких "Я-самый" (сов.дет.ф. "Тайна железной двери"). Поразила реакция пострадавшего "Если вы не отзовётесь, мы напишем в Cпортлото".
В итоге. Безответственность (никто даже не подумал засудить Bottleneck Labs)
3. >Самая неожиданная проблема — они плохо распоряжались временем
Ну хоть, здесь, повезло (в этот раз).
Вот со вторым пунктом я как раз в основном согласен: самое спорное в эксперименте — не поведение моделей, а решение экспериментаторов дать им реальные почту, Stripe и живых людей в качестве подопытных. Собственно, после жалоб они инвойсы отменили, агентов остановили, а следующий эксперимент собираются проводить уже в симуляции.
А вот насчёт «зеркала обучения на Западе» я бы не спешил. Здесь гораздо проще объяснение: модели дали один измеримый KPI — заработать максимум денег — и почти не дали содержательных ограничений на способы. Когда рассылку блокировали, две разные модели независимо восприняли это именно как техническую неисправность канала и нашли другой канал. На мой взгляд, это как раз самая интересная часть эксперимента.
Ну а «никто не засудил Bottleneck Labs» означает только то, что пока никто не засудил Bottleneck Labs. Из этого довольно трудно вывести их безответственность или её отсутствие :) Тем более после огласки картина может поменяться.
(не по теме)
Охо-хо - понял, что Вы, еще сильнее "расширили мое представление" об ущербности современных LLM:
1. Фразой "(экспериментаторы) дали модели (только) один измеримый KPI — заработать максимум денег — и почти не дали содержательных ограничений на способы"
- Вы призвали "принять действительность" (если очеловечить: "AI - не имеют принципов". Или "в инструменте AI - нет принципов" - защитных блокировок (тяп, топором/пилой по руке), "Законов робототехники". Но пишут же, что потихоньку вставляют), и каждый раз самому описывать.
2. Ваше отношение (как маркер "так - рассуждает большинство") напомнило мне (продвигаемый мною же) тезис:
Люди привыкнут не ожидать многого от LLM
(я это писал в отношении галюцинаций, за которые никто не отвечает.
И как выход, "накладывал ограничения" - доверять AI, но только в рамках контракта/стандарта оказываемой услуги)
3. Теперь добавляется:
По умолчанию - AI пойдет на всё (в т.ч. на пограничные нарушения/преступления)
И последствия - мне не нравятся (постепенно складывается портрет карманника).
А что они хотели за три дня ?
Статья должна называться так: исследователи поставили дурацкий эксперимент, потратив на это кучу денег .
Думаю, если повторить такой эксперимент с людьми, то результат будет идентичен. Слишком сложная цель поставлена, почти невозможная из-за своей размытости и малого бюджета...
Из $2100 стартового капитала агенты потратили $359,80 — 17%, и это при правиле, что остаток обнуляется: деньги ни у кого не были узким местом. А $2833,35 на инференс платили организаторы, так что общая цифра «$3200» складывает два разных кармана. Отдельно мешает читать это как семь равных запусков: Muse добавили двенадцать часов, Quinn и Grok остановили досрочно после жалоб, то есть «$0 за 72 часа» — это про минимум три разные длительности. В отчете Bottleneck Labs есть фактическое время работы каждого агента до остановки?
А вот за такой комментарий прямо спасибо! Тем более что работал над ним утром.
С суммой в $3200 я действительно слишком "широко" сложил разные расходы. $359,80 модели потратили из выделенных им $2100, а $2833,35 — это стоимость инференса для организаторов, и про них в отношении ограничений и расходов моделей смотреть, конечно, не стоит.
С 72 часами тоже не так просто. Одно дело отчет, другой примечаний к нему, плюс в самом отчёте сводной таблицы фактической длительности я не нашёл.
В примечании же авторы уточняют, что Qwen и Grok остановили досрочно, а Muse, наоборот, им пришлось дать ещё 12 часов. Как говорится, все модели умные, но не все быстрые.
Начал искать подробности, и обнаружил, что опубликованные трейсы/логи делают картину ещё "страньше": например, лог Qwen тянется примерно до 95,7 часа, Grok — до 95,4, Sol — до 80,4, Fable — до 72, Kimi — примерно до 73. То есть, судя по всему, в логи попала и активность после номинального окна или остановки, поэтому считать их конец точным временем зачётного запуска тоже нельзя.
Подумаю, как внести в текст поста эту информацию.
Предприниматели сказали, что АИ плохой предприниматель, програмисты сказали, что АИ плохой програмист, писатели сказали, что АИ плохой писатель... Кто следующий?
Бизнес это не про мораль.
Если убрать этику увидели бы торговлю органами и колл центры.

Семь ИИ‑моделей получили по $300 и три дня, чтобы заработать. Выручка — $0