Дешёвая модель в агентном стеке имеет неприятный режим отказа: на сложных многошаговых задачах она тихо отвечает из контекста беседы вместо реального вызова инструментов. Не падает с ошибкой, не жалуется на лимиты, а просто симулирует знание.
Мы внутри агентства гоняем собственного агента поверх боевой CRM. У него около 40 кастомных инструментов: чтение таблиц, выборка лидов, проверка оплат, парсинг логов активности. Когда выбирали постоянную модель под рутинные запросы команды, я устроил прямое A/B-сравнение трёх вариантов на базе DeepSeek: v4-pro, v4-flash:hight и reasoning-версии.
На простых запросах разницы не было никакой. Задачу вроде «посчитай количество входящих лидов и сумму оплат за прошлую неделю» все три модели решили как под копирку: вызвали нужный тулз, забрали данные, отдали абсолютно одинаковые цифры. На таких операциях flash-модель кажется идеальной: отвечает мгновенно, стоит копейки.
Разница вскрылась на цепочке шагов. Задача: обойти несколько клиентских проектов, по каждому поднять ленту действий менеджеров, проверить незакрытые задачи и свести общий статус.
Старшие модели (pro и reasoner) честно пошли по цепочке: запросили список проектов, циклом собрали задачи, сверили логи и сошлись на одном результате. А вот flash-модель в базу вообще не пошла. Она просто взяла контекст из обсуждения в чате получасовой давности и выдала ответ в духе «я уже отвечал на этот вопрос выше, вот сводка».
Внешне ответ выглядел убедительно: ровный текст, знакомые фамилии, аккуратные списки. Если не смотреть лог вызова функций (tool calls trace), никогда не поймёшь, что модель схалтурила. Но за полчаса в базе сменились статусы двух сделок и добавился десяток комментариев. В итоге агент выдал устаревшие данные с железобетонной уверенностью.
При этом у старших моделей вылезла своя проблема. Reasoning-модель на первой попытке банально улетела в таймаут API: пока она размышляла над логикой выборки и последовательно дёргала методы, соединение разорвалось. Пришлось поднимать таймаут ожидания до двух минут. Дорогая модель умнее, но требует совсем других сетевых настроек.
Для себя я вынес простое правило: дешёвые flash-модели отлично справляются с одиночными операциями, где есть ровно один понятный вызов функции. Но если в промпте заложена цепочка из нескольких шагов с зависимостями, доверять им нельзя. Либо сразу пускать задачу через старшую модель с увеличенным таймаутом, либо на уровне бэкенда проверять трейс и отбрасывать ответ, если модель не сделала обязательные вызовы API.


















