Обновить

Моя лента

Тип публикации
Порог рейтинга
Уровень сложности
Предупреждение
Войдите или зарегистрируйтесь, чтобы настроить фильтры
Пост

Дешёвая модель в агентном стеке имеет неприятный режим отказа: на сложных многошаговых задачах она тихо отвечает из контекста беседы вместо реального вызова инструментов. Не падает с ошибкой, не жалуется на лимиты, а просто симулирует знание.

Мы внутри агентства гоняем собственного агента поверх боевой CRM. У него около 40 кастомных инструментов: чтение таблиц, выборка лидов, проверка оплат, парсинг логов активности. Когда выбирали постоянную модель под рутинные запросы команды, я устроил прямое A/B-сравнение трёх вариантов на базе DeepSeek: v4-pro, v4-flash:hight и reasoning-версии.

На простых запросах разницы не было никакой. Задачу вроде «посчитай количество входящих лидов и сумму оплат за прошлую неделю» все три модели решили как под копирку: вызвали нужный тулз, забрали данные, отдали абсолютно одинаковые цифры. На таких операциях flash-модель кажется идеальной: отвечает мгновенно, стоит копейки.

Разница вскрылась на цепочке шагов. Задача: обойти несколько клиентских проектов, по каждому поднять ленту действий менеджеров, проверить незакрытые задачи и свести общий статус.

Старшие модели (pro и reasoner) честно пошли по цепочке: запросили список проектов, циклом собрали задачи, сверили логи и сошлись на одном результате. А вот flash-модель в базу вообще не пошла. Она просто взяла контекст из обсуждения в чате получасовой давности и выдала ответ в духе «я уже отвечал на этот вопрос выше, вот сводка».

Внешне ответ выглядел убедительно: ровный текст, знакомые фамилии, аккуратные списки. Если не смотреть лог вызова функций (tool calls trace), никогда не поймёшь, что модель схалтурила. Но за полчаса в базе сменились статусы двух сделок и добавился десяток комментариев. В итоге агент выдал устаревшие данные с железобетонной уверенностью.

При этом у старших моделей вылезла своя проблема. Reasoning-модель на первой попытке банально улетела в таймаут API: пока она размышляла над логикой выборки и последовательно дёргала методы, соединение разорвалось. Пришлось поднимать таймаут ожидания до двух минут. Дорогая модель умнее, но требует совсем других сетевых настроек.

Для себя я вынес простое правило: дешёвые flash-модели отлично справляются с одиночными операциями, где есть ровно один понятный вызов функции. Но если в промпте заложена цепочка из нескольких шагов с зависимостями, доверять им нельзя. Либо сразу пускать задачу через старшую модель с увеличенным таймаутом, либо на уровне бэкенда проверять трейс и отбрасывать ответ, если модель не сделала обязательные вызовы API.

Теги:
-2
Комментарии2
Статья

Черная дыра искусственного интеллекта: почему инфраструктура стала главным барьером развития отрасли?

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели10K

Всем привет! На связи снова Кирилл и сегодня хотелось бы поделиться интересными новостями и предостеречь будущих адептов ИИ... Искусственный интеллект перестает быть исключительно задачей разработки моделей. Сегодня ключевые ограничения постепенно смещаются в сторону вычислительной инфраструктуры: GPU‑кластеров, дата‑центров, механизмов закупок оборудования, нормативного регулирования и технологической независимости. Куда мы движемся? А какие пути движения вообще есть? И что нам предстоит в конце концов? Об этом всем расскажу в этой статье — завариваем чай/кофе и проваливаемся на интересное чтиво.

Читать далее
Статья

ИИ в DevOps или как мы слепо доверяем сгенерированным манифестам

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

ИИ может за секунды сгенерировать аккуратный Kubernetes‑манифест, который пройдет валидацию и даже успешно запустится в кластере — а проблемы проявятся уже в production. Разбираемся, почему LLM воспроизводят устаревшие и небезопасные конфигурации и как проверять сгенерированные манифесты до деплоя.

Проверить манифест
Статья

Модель реостатного пуска асинхронного двигателя

Время на прочтение3 мин
Охват и читатели9.3K

В данной модели будет анализироваться реостатный пуск асинхронного двигателя с фазным ротором с реостатом состоящим из 4 элементов подключенным к обмотке ротора.

Читать далее
Статья

Парсеками по галактике: как расстояния до звёзд превращаются в шаги

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели10K

8 окт. 2026 г. · @knz75

как расстояния до звёзд превращаются в шаги

Это рассказ о том, столько шагов до Луны и как вписать свое имя в название звезды.

Читать далее
Новость

На камере Hasselblad X2D запустили Doom: для этого пришлось связать игровой движок со штатным интерфейсом

Время на прочтение2 мин
Охват и читатели8.3K

Разработчик Радиум Ван (Radium Wang) запустил движок Doom на среднеформатной камере Hasselblad X2D 100C. Нажатие кнопки спуска затвора отвечает за огонь по противникам, свайпы по экрану поворачивают Думгая, а встроенный динамик воспроизводит звук. Автор проекта опубликовал исходники.

Читать далее
Статья

WASM кроссбраузерность во Flutter Web на 2026

Уровень сложностиПростой
Время на прочтение3 мин
Охват и читатели10K

В мае 2024 года команда Flutter выпустила версию Flutter 22, в которой они стабилизировали поддержку WebAssembly, объединив компилятор Dart с системой сборки мусора WebAssembly — WASM GC.

Примерно с этого же времени я много экспериментировал со сборками WASM и, в принципе, для широкого круга приложений они работают не хуже JavaScript, кроме двух интересных проблем. Это несовместимость данной технологии с браузерами Firefox и Safari.

Я решил покопаться в этом вопросе: то есть, при чём здесь вообще Flutter? И действительно ли команда Flutter не занимается этой ситуацией и почему не занимается.

Читать далее
Статья

Сколько времени нужно непрограммисту, чтобы сделать приложение с сервером, офлайн‑режимом и SEO

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели9.3K

Сразу о главном: я не программист. Никогда им не был и вряд ли стану — моя работа с ИТ не связана. Всё, что я знаю о программах, держится на здравом смысле и жизненном опыте.

В свободное время я, как и многие, учу английский. Слова учил в платном приложении для iOS, и оно меня вполне устраивало — пока после очередного обновления не перестало нормально работать. Реанимировать его я так и не смог, гештальт остался незакрытым.

Недавно я начал разбираться с Claude Code — для «повышения образованности». Мои знания об ИИ начальные: в общих чертах понимаю, что такое LLM, посмотрел несколько роликов на YouTube и, как 90% людей, общался с бесплатными DeepSeek и ChatGPT. Словом, разумный дилетант.

Проверяя, что умеет Claude Code, я решил воспроизвести то самое приложение для изучения слов. Результат первого опыта вайбкодинга меня, мягко говоря, удивил.

Читать далее
Пост

Чёрный лебедь в дата-центре и реестры рисков

Недавно я писал о пожаре в американском дата-центре Lake Mariner. Там всё оказалось весьма топорно: проблемы с пожарной безопасностью и размазанная ответственность.И кончилось безобидно вроде.

А сегодня пожар произошел в дата-центре Яндекса в Сасово. Причина совсем другая — атака беспилотников. Площадка остановлена, проблемы возникли у сторонних сервисов (ну вы наверняка ощутили).

Перед нами почти классический "чёрный лебедь". Ещё несколько лет назад вероятность поражения ЦОД беспилотником вряд ли всерьёз рассматривалась в большинстве проектов. Однако важно различать причину форсмажора и её последствия. Потому что предсказать конкретную угрозу сложно, а вот сценарий полной потери ДЦ — вполне стандартная задача. 

Вот вы сегодня работаете руководителем проекта или аналитиком. Проектируете систему, согласовываете требования, организуете разработку, внедряете. А завтра дата-центр, на котором всё работает, — фьюить! И результаты нескольких месяцев работы недоступны. Разумеется, вы не можете предотвратить пожар или вражескую атаку. Но можете ещё на этапе проектирования задать несколько вопросов - как минимум себе.

Что произойдет, если завтра исчезнет вся площадка? 

Сколько времени бизнес готов прожить без системы? 

Сколько данных допустимо потерять? 

Есть ли резервный сценарий? 

Кто и как будет восстанавливать работу? 

И ответы (если их получите...) превратить в конкретные нефункциональные требования: восстановление за четыре часа (RTO), потеря не более 15 минут данных (RPO), сохранение документов при недоступности внешнего сервиса. Цифры условные)

За всё это приходится платить. И решение, сколько потратить на защиту от маловероятной катастрофы, — оно уже не техническое, а как раз управленческое. И один из "проектных" уроков этой ситуации в том, что вероятность риска — ни разу не константа. Мир меняется, иногда быстрее, чем наши реестры рисков и проектные допущения. Я, кстати, когда учился на курсах РП в Яндексе, как раз на уроке про управление рисками услышал от лекторов, что никакие реальные реестры они не продумывают, а просто копируют таблички. Но это было давно)

Ну и подборочка, где почитать подробнее — про такие вот риски и их проработку:

Теги:
+3
Комментарии1
Новость

В Telegram для macOS тестируют интерактивные HTML‑сообщения в чатах

Время на прочтение1 мин
Охват и читатели8.7K

В сборке Telegram для macOS 12.10.283300 нашли экспериментальную подсистему HTMLBubbles, которая отвечает за интерактивные сообщения на HTML, CSS и JavaScript. Они работают прямо в чате без запуска отдельного мини‑приложения.

Читать далее
Новость

Halo: Combat Evolved с кампанией и мультиплеером запустили в браузере

Время на прочтение2 мин
Охват и читатели8.8K

Разработчики выпустили браузерный порт первой Halo. В сюжетную кампанию и мультиплеерную версию теперь можно играть без установки игры. Перед запуском сайт просит подтвердить, что у пользователя есть копия оригинальной игры, но не проверяет это.

Читать далее
Статья

Почему O(1) не гарантирует высокую скорость: четыре структуры данных для графа signal – effect

Уровень сложностиСредний
Время на прочтение21 мин
Охват и читатели12K

Сигнал изменился - как найти связанные эффекты и удалить известную связь? Сравниваю четыре структуры графа signal - effect по стоимости операций и памяти, а затем - в локальных замерах на V8. Почему одинаковая O(1) не означает одинаковое время?

Читать далее
Новость

DNS‑резолвер Quad9 отказывается блокировать пиратский контент во Франции и рассматривает возможность ухода с рынка

Время на прочтение2 мин
Охват и читатели13K

DNS‑резолвер Quad9 рассматривает возможность прекращения работы во Франции. Причиной стал иск медиахолдинга beIN Sports в суд Парижа. Компания требует назначить Quad9 штрафы за неисполнение предписания о блокировке пиратского спортивного контента, сумма штрафов может достигать 580 тыс. евро в день. 

Читать далее

Ближайшие события

Статья

Куда делись 4 секунды: разбираем автоинструментацию в APM

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели11K

Вместо введения

Когда приложение состоит из одного процесса и нескольких десятков методов, найти причину медленной работы относительно просто: можно включить профилировщик, посмотреть логи и найти проблемный участок кода.

В распределённой системе всё меняется.

Один пользовательский запрос может пройти через API Gateway, несколько микросервисов, очередь сообщений, базу данных и внешний API. При этом каждый компонент может находиться на отдельном сервере или контейнере.

Если такой запрос выполняется 4 секунды, возникает вполне практический вопрос:

Где именно были потрачены эти 4 секунды?

На сети? На базе данных? На блокировке потока? На выполнении конкретного метода? На внешнем сервисе?

Именно для ответа на этот вопрос в APM используются трассировка (distributed tracing) и инструментация приложений.

Один из наиболее интересных подходов — автоматическая инструментация, при которой разработчику не требуется вручную добавлять tracing‑код в каждый сервис.

Разберём, как это работает на уровне архитектуры и что происходит внутри приложения.

Читать далее
Статья

Push‑уведомления от IoT устройств: краткий гайд с TuyaOpen [No‑code]

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели9.7K

Чтобы устройство умного дома присылало уведомления на телефон, писать мобильное приложение не обязательно. Приложение, экран устройства и рассылку пушей берет на себя Tuya, а нам остаются прошивка и пара настроек на платформе. Все это делается с помощью open-source решения TuyaOpen, расскажу про это в статье :)

Читать далее
Новость

ФБР отстранило подрядчика Accenture, допустившего утечку данных агентов

Время на прочтение1 мин
Охват и читатели9.5K

Федеральное бюро расследований США отстранило от работы подрядчика компании Accenture, действия которого привели к утечке данных тысяч сотрудников бюро. По данным ФБР, неназванный подрядчик не установил необходимый патч системы, за которую отвечал.

Хотя в ФБР не назвали конкретную платформу и подрядчика, источники Reuters сообщают, что речь идёт о системе управления персоналом PeopleSoft компании Oracle. Как ранее указывали представители группировки ShinyHunters, они использовали эту платформу для взлома сайта ФБР по поиску вакансий.

Читать далее
Новость

Куда свернуть разработчику: 10 бесплатных способов сменить стек и трек — от QA до данных, ИИ и продукта

Время на прочтение4 мин
Охват и читатели8.7K

Бывает, что через несколько лет в разработке задачи ходят по кругу, а стек больше ничем не удивляет. Зарплата тоже: по данным Хабр Карьеры, за первое полугодие 2026 года доходы разработчиков выросли на 1%, а у тестировщиков и аналитиков — на 5%. Тянет в соседнюю область, но страшно начать заново и просесть в грейде.

Проверить свою гипотезу можно без увольнения. Собрали 10 бесплатных демодоступов, курсов и вебинаров Нетологии и разложили их по дистанции от кода: от QA и безопасности, где вы остаётесь инженером, до продукта и дизайна. А в конце — честный ответ на главный вопрос: потеряете ли вы в деньгах.

Выбрать свой трек →
Статья

Как редизайнить B2B‑продукт и не сломать привычные сценарии пользователей

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели11K

Привет, Хабр! Меня зовут Даша, я продуктовый дизайнер в Okdesk. В этой статье расскажу, как мы обновляли интерфейс зрелого B2B‑продукта при ограниченных возможностях для пользовательских исследований и без сложных инструментов продуктовой аналитики. Покажу, как выбирали сценарии для редизайна, проверяли решения и постепенно внедряли изменения, чтобы не сломать привычки наших пользователей.

За годы развития продукта в Okdesk появлялись новые функции и пользовательские сценарии, а интерфейс постепенно усложнялся. Похожие элементы в разных разделах могли выглядеть и работать по‑разному, структура отдельных страниц затрудняла поиск нужной информации, а некоторые привычные действия требовали лишних шагов. Для новых пользователей это усложняло знакомство с платформой, но просто переделать интерфейс целиком мы тоже не могли: опытные пользователи уже привыкли к существующей логике.

В B2B‑продуктах пользователи месяцами повторяют одни и те же действия. Со временем они перестают искать элементы интерфейса и выполняют привычные сценарии почти автоматически. Поэтому даже небольшие изменения расположения кнопки или логики экрана могут замедлить работу человека, который проводит в системе весь день.

Читать далее
Статья

DRP, который никто не проверял: почему план восстановления может не сработать в самый нужный момент

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели11K

Привет, Хабр! Меня зовут Илья. Долгое время я работал в финтехах и у облачного провайдера. Занимался сопровождением информационных систем, причём не как инфраструктурщик, а как специалист по поддержке целых автоматизированных систем. То есть смотрел на ИТ не с уровня отдельного сервера, а с уровня «работает ли сервис для бизнеса и клиента».

И сразу, пока вы не пролистали до конца, вопрос к вам.

Друзья айтишники, вспомните момент, когда DRP действительно понадобился. Что пошло не так? Бэкап, который не восстановился? Резервная площадка, на которой «забыли» один сервис? Регламент, который лежал на той самой упавшей файловой шаре? Напишите в комментариях свои фэйлы. Чужие ошибки учат лучше любых методичек, а для кого‑то ваш комментарий станет поводом проверить свой план до аварии, а не после.

А теперь поговорим о том, как строятся планы DRP и почему наличие документа ещё не означает, что вы восстановитесь.

Читать далее
Новость

Amazon представила планшеты Alexa с Google Play AI‑помощником Alexa+

Время на прочтение2 мин
Охват и читатели7.9K

Amazon анонсировала линейку планшетов Alexa, включающую в себя три модели. Все устройства работают на базе Android и получили поддержку Google Play. На прошлых версиях планшетов Amazon был только собственный магазин приложений.

Читать далее