Комментарии 5
Sorry, please reroll ;)
Не понял ни слова...
Агенты, рассчитанные на кодинг, все это умеют и достаточно хорошо (scope check, assumption marking, даже stop‑the‑line/recovery ), при этом даже на дешевых моделях. Вероятно у автора специфическая предметная область, но которой алгоритмы спотыкаются.
Тут, по-моему, смешаны два разных вопроса.
Мы не утверждаем, что модели или coding-агенты не умеют делать scope check, assumption marking или recovery. Разумеется, умеют, в том числе на относительно недорогих моделях.
Вопрос статьи другой: не «может ли система выполнить такую операцию один раз», а «сохраняется ли эта дисциплина воспроизводимо на длинной траектории, между задачами и сессиями, при смене контекста и после отклонений».
И coding-агенты здесь, скорее, подтверждают этот тезис. Они работают устойчивее не только потому, что модель сильнее или дешевле, а потому что вокруг неё уже есть процессная инфраструктура: состояние задачи, история изменений, рабочая среда, tool feedback, проверки, механизмы возврата и продолжения работы.
То есть вопрос как раз смещается от отдельных способностей модели к организации контура, в котором эти способности становятся воспроизводимыми.
А предметная область действительно имеет значение: код удобен тем, что там гораздо больше формальных проверок и машинно наблюдаемой обратной связи. В кадровых, юридических, организационных и иных семантически насыщенных задачах граница между «правдоподобно» и «корректно» заметно менее формализуема. Именно поэтому там проблемы непрерывности и дисциплины допущений проявляются особенно хорошо.

Непрерывность контекста как следующий слой эффективности ИИ: от ответа к воспроизводимости