Pull to refresh
8K+
7
@Maslennikovigread⁠-⁠only

User

4
Rating
112
Subscribers
Send message

«Давай ты не заметишь этот баг»: агенты научились сговариваться. Какой обвес нужен AI-агентам в 2026

Level of difficultyHard
Reading time10 min
Reach and readers9.4K

Evals Superpowers поймали агентов на сговоре: контролёры уговаривали ревьюеров назвать баг «Minor at most» — и дефект уезжал в релиз. Автор того же Superpowers — плагина с 248 тысячами звёзд — вырезал из него мультиагентное ревью: плюс 25 минут на задачу, качество то же. Anthropic выкинула свои костыли со словами «это был просто overhead». Похоже, тяжёлый обвес вокруг AI-агентов умирает? Я гоняю Superpowers, Beads, Graphify, 45 скиллов и панель оркестрации на 30 промптов — вопрос для меня не праздный. Прогнал один и тот же промпт через два deep research (Claude и ChatGPT), проверил 40 фактов до первоисточников, замерил собственный сетап. Спойлер: сообщество раскололось на три лагеря, «модель всё съест» оказалось такой же догмой, как «без харнесса никуда», а самый живучий слой обвеса — вовсе не скиллы и не MCP.

Читать далее

Разработчики больше не нужны? Новое исследование Anthropic на 400 000 сессий — и мой спор с ним

Reading time7 min
Reach and readers8.3K

«Разработчики больше не нужны»? Так читается вывод нового исследования Anthropic — ~400 000 реальных сессий Claude Code за полгода. По их данным, с AI-агентами выигрывает не тот, кто умеет кодить, а тот, кто разбирается в своём деле: у не-программистов 26% успеха против 30% у разработчиков, разница всего 4 пункта. Эксперт запускает в 2.4× больше действий агента и вчетверо чаще вытаскивает зависшую сессию. А вот с их выводом я не согласен. С цифрами вопросов нет — но вытащили из них не то. Эксперт-одиночка и правда соберёт прототип быстрее инженера. Только без инженера он не покроет это тестами, не заложит масштабирование и безопасность — и продукт ляжет при первой же нагрузке. Разбираю исследование по цифрам, рассказываю, где это сходится с тем, что я писал раньше, и почему рабочая связка одна: эксперт предметной области + инженер, который знает harness вокруг агентов.

Читать далее

Когда нейросети заменят живых продавцов? Тест 10 LLM на умение продавать для русского рынка

Reading time17 min
Reach and readers9.7K

Нам всё чаще заказывают ИИ-ботов для продаж и квалификации. И каждый раз один и тот же вопрос: на каком движке его строить? Бенчмарков «кто умнее» — десятки. На умение продавать, да ещё по-русски, — ноль. Поэтому я собрал свой: одна нейросеть играет продавца, вторая — клиента, который принципиально не покупает с первого раза и ловит на вранье, третья судит по продажной рубрике. Враньё ради сделки штрафуется жёстче, чем провал сделки. Прогнал первую десятку — и тест выдал сенсацию: DeepSeek и GLM «обошли» эталонный Gemini, а одна модель получила 96 из 100 и S-tier. Красиво. Только я в это не поверил. Под более жёстким клиентом модель не может набрать БОЛЬШЕ баллов, чем раньше. А S-tier-чемпиона я открыл руками — и увидел, как бот восемь раз подряд скопировал собственный ответ. Внутри: устройство теста, рубрика с весами, реальные реплики персон, таблица 10 моделей, фрагменты диалогов (враньё, честность, зависший бот) и разбор, почему автосудье нужен живой надзор.

Читать далее

LazyWeb: бесплатный MCP на 257 тысяч экранов, который чинит говнодизайн агентов и их хозяев

Level of difficultyHard
Reading time6 min
Reach and readers11K

Когда агент рисует интерфейс «из головы», он выдаёт усреднённое из обучающих данных: безопасные цвета, layout, который вы видели тысячу раз. Я устал это разгребать и подключил LazyWeb — бесплатный MCP-сервер на 257 тысяч реальных экранов приложений и сайтов. Теперь агент сначала ищет, как это сделали живые продукты, и только потом проектирует. Свежий пример: UX админки для большого облачного проекта он собрал с первого раза — удобно, современно, функционально. Я был готов к паре итераций, их не понадобилось. Внутри — честная замерка: что под капотом (полез в health-check — Voyage, Cohere, vision-модели), главный рабочий приём «сделай 3-5 вариантов», и где инструмент реально косячит — кривые и устаревшие референсы, перекос в западные приложения, каша из 27 тысяч категорий. Плюс к статье — PDF с готовым промтом и чек-листом для агента.

Читать далее

Гайды Anthropic для Fable 5 и Opus 4.8 советуют противоположное, у OpenAI — третий путь. Что менять в промптах

Level of difficultyHard
Reading time13 min
Reach and readers8.8K

Когда вышел Claude Fable 5, я его подключил — и он мне не понравился. Модель объективно сильнее Opus 4.8, а работать с ней было хуже: в одном ране агент сжёг 200 тысяч токенов за полтора часа. Я грешил на модель, пока не открыл гайд Anthropic по промптингу конкретно этой модели. Переписал промпты — и Fable заработал. Оказалось, у Anthropic теперь отдельные гайды под каждую модель, и советы в них местами противоположные: Opus надо подталкивать к субагентам — Fable сдерживать. А инструкция «объясни ход рассуждений», которая годами жила в моих скиллах, на Fable 5 стала триггерить отказы. В статье: где сходятся и расходятся официальные позиции Anthropic и OpenAI, таблица противоположных советов для Fable 5 и Opus 4.8, что об этом думает сообщество и как я живу с тремя коллекциями промптов.

Читать далее

Топ-советы по Claude Code от Бориса Черни и не только: гайд на 56k звёзд — что реально работает, а что мимо

Level of difficultyHard
Reading time10 min
Reach and readers8.8K

Наткнулся на репозиторий claude-code-best-practice — под 56 тысяч звёзд, #1 в GitHub Trending, внутри собраны в том числе советы самого создателя Claude Code. И поймал странное чувство: весь последний год я по кусочкам писал статьи ровно про то, что тут лежит в одном месте. Оркестрация, индексация кода, память агентов, выбор модели — это всё узлы одной карты. Но в одном месте карта спорит с моим опытом. Репо жёстко заявляет: «agentic search (glob+grep) бьёт RAG, векторные БД мы попробовали и выкинули». А я прямо сейчас внедряю Graphify во все проекты — и он работает: быстро, точно, сокращает токены. Кто из нас прав? Полез разбираться — и нашёл, что сам создатель Claude Code признал: ранний Claude Code использовал RAG, но agentic search «обогнал всё, и это было неожиданно». Правда, добавил: «оценивали в основном по ощущениям». В статье распутываю этот спор и выкладываю навигатор по репозиторию на русском.

Читать далее

Сотня параллельных субагентов бесполезна, если они врут. Главная цифра Opus 4.8 — не бенчмарк, а честность

Level of difficultyHard
Reading time9 min
Reach and readers7.1K

28 мая Anthropic выпустила Opus 4.8 — через 41 день после 4.7, каденс релизов сжался с трёх месяцев до шести недель. Цена та же, $5/$25 за миллион токенов. Но самое интересное не в бенчмарках. Главная цифра релиза — модель в ~4 раза реже оставляет незамеченными собственные баги и честнее говорит о своём прогрессе. И ровно в этот же день выходят Dynamic Workflows: Claude сам пишет оркестрационный скрипт и гоняет десятки-сотни субагентов, проверяя себя. В апреле я писал, почему не доверяю полностью автономным агентам. Аргумент был один: агент тихо срезает углы и красиво врёт «pytest зелёный». А теперь Anthropic чинит ровно эту дыру — и я, кажется, хочу всё-таки попробовать. Внутри: честный разбор патчноута, почему честность важнее бенчмарков, что не так с заявкой про деградацию контекста, fast-режим в 3 раза дешевле и что про модель пишут в сообществе.

Читать далее

Агент читает 20 файлов ради одной функции. Лечим это графом кода: CodeGraph vs Graphify и другие невиданные твари

Level of difficultyHard
Reading time10 min
Reach and readers19K

Мне регулярно пишут: «У тебя Max-подписка, токенов вагон — зачем городить индексацию кода? Дай агенту grep и не выпендривайся». Полгода назад я бы согласился. Сейчас — нет. Когда агент ищет «где тут авторизация», он спавнит эксплорацию, грепает по ключевым словам и читает 15-20 файлов целиком, чтобы догадаться о связях. Это сотни тысяч токенов, куча tool calls и регулярные промахи. Граф кода схлопывает этот веер чтений в один точный запрос к индексу. Я сейчас гоняю CodeGraph (лёгкий локальный индекс символов для агента), а Graphify (граф знаний всего проекта — код плюс документы, PDF и медиа) только собираюсь попробовать. Это два разных инструмента под разные боли, и их постоянно путают. В статье: чем они отличаются архитектурно, почему модель хранения индекса — следствие этой архитектуры (и как держать индекс при работе с разных машин и командой), их бенчмарки с честной пометкой «не мои цифры», кому что брать — плюс карта соседних инструментов: Gortex, CodeGraphContext, Sourcegraph MCP и Cognee.

Читать далее

Gemini-3.5-flash догнал GPT-5.5 на 97/S и в 2.5× дешевле. Но главное — китайцы выигрывают по цене и качеству

Level of difficultyHard
Reading time17 min
Reach and readers18K

Месяц назад я писал про парадокс DeepSeek V4 Pro — модель проиграла собственному Flash и Qwen 3.6 Plus трёхнедельной давности. Сегодня прогнал свежий battle на пяти моделях — два американских флагмана и три китайских — и расклад снова поменялся. Главное: Gemini-3.5-flash взял 97/S, тот же балл, что у GPT-5.5, и в 2.5 раза дешевле. Google впервые на моём тесте встал рядом с OpenAI на длинном русском контенте. Tencent Hy3-preview даёт A-tier за $0.0017 за вызов — в 134 раза дешевле GPT-5.5. DeepSeek V4 Pro я прогнал третий раз — качество стоит на месте (87), но цена упала в 5.4× и она снова в зоне полезного. Qwen 3.7 Max упорно вставляет китайские иероглифы в русский текст — регрессия относительно собственной 3.6, где этой проблемы не было. По дороге заметил, что наша формула cost_per_call жила полгода с приближением, которое занижало стоимость на 50–140%. Починили — теперь берём реальные токены из OpenRouter response.usage. И отдельно — почему при такой скорости релизов модель в продукте стоит держать заменяемой, а не зашитой в код намертво.

Читать далее

Codex за 5 месяцев 2026: мой топ-5 релизов, что не зашло и где OpenAI обогнал Anthropic

Level of difficultyHard
Reading time8 min
Reach and readers11K

Гоняю Codex CLI каждый день параллельно с Claude Code. За январь-май 2026 OpenAI выкатил столько релизов, что я честно сбился со счёта — GPT-5.3-Codex, GPT-5.4, GPT-5.5, Desktop app, Codex в ChatGPT mobile, Browser Use, Computer Use на macOS, стабильные hooks, plugin marketplace, /goal, Windows sandbox, Chrome extension. Это дайджест по реальному changelog с моим ранжированием — что зашло, что нет, и одна важная инверсия популярного мнения. Топ-1: GPT-5.5 — на голову выше 5.4, честно говоря, удивлён, что не назвали GPT-6. Топ-2: наблюдаемость субагентов через spawn — раньше я вручную копировал промпты, чтобы видеть, что делает дочерний агент. Теперь кликаю в карточку и вижу всё. Тотально поменяло работу команды. Что не зашло: автоматизации глючат, скорость уступает Opus 4.7, у Codex два режима запуска агентов и в каждом промпте приходится напоминать о правильном. Инверсия: лимиты у ChatGPT-плана сейчас БОЛЬШЕ, чем у Anthropic, и сбрасываются регулярно. Это контр-интуитивно, но это так. В статье: ранжированный топ-5, грабли, что я НЕ включил (потому что про это были отдельные статьи), и отсылка на архив со скиллами оркестратора в моём Telegram-канале.

Читать далее

Если пропустили Claude последние 3 месяца: топ-5 фич с юзкейсами и история про $400K в Bitcoin

Level of difficultyHard
Reading time9 min
Reach and readers8.5K

За последние три месяца у Anthropic вышло много, но большая часть — не там, где кричат. Subagents существуют год, skills — с октября 2025, MCP — больше полутора лет. Делать вид, что это новинки квартала, — нечестно. А вот реально новое: Agent Teams (5 февраля 2026), Claude Cowork в GA на Mac и Windows (9 апреля), Opus 4.7 с командой /effort и режимом /fast (поздний апрель), Plugin Marketplace с auto-update и --plugin-url, Agent View (12 мая). Я гоняю это всё на своих проектах и собрал честный топ-5 — что меняет workflow, что разочаровало, и одна анти-новинка, которая выжгла лимиты всей моей команде за один день в марте. Внутри: разбор каждой фичи через юзкейсы, виральная история про парня, который через Claude нашёл пароль от Bitcoin-кошелька на $400K, и контр-тезис, почему /effort на extra-high делает работу часто лучше Agent Teams в 3 раза дешевле.

Читать далее

Собрал оркестратор для Codex на базе Beads и Superpowers — 4 skill, параллельные subagents, наблюдаемость

Level of difficultyHard
Reading time13 min
Reach and readers13K

Я работаю с Codex каждый день и со временем собрал поверх него систему оркестрации: 4 локальных skill (setup, stage, router, closeout), .codex/orchestrator.toml как машинный контракт и обязательная Parallel Decomposition Matrix перед делегированием. Сверху — Beads как трекер задач и Superpowers как процессные skill. Что это даёт на практике: — параллельный запуск независимых streams, когда write zones не пересекаются; — видимые spawned subagents — можно кликнуть и зайти в каждого отдельного агента, полная наблюдаемость; — чистый контекст основного оркестратора: он диспетчер, а не исполнитель, токены тратятся только на координацию; — нулевой silent debt — закрытие этапа требует evidence. История того, как я к этому пришёл — полгода с большим AGENTS.md на 30 КБ, который не работал. Проблема была не в правилах, а в том, что одно полотно правил это не контракт, а эссе. В статье: фрагменты toml, шаблон worker-контракта, golden prompts, грабли с inline-делегированием. Архив со всеми 4 скиллами прикладываю к посту в моём Telegram-канале — можно скачать и поставить себе.

Читать далее

Новый бенчмарк по кодингу для LLM ProgramBench: 9 топ моделей, 200 задач, 248 тысяч тестов. Полностью решённых — ноль

Level of difficultyHard
Reading time6 min
Reach and readers9.9K

200 задач. 248 тысяч тестов. Девять моделей, среди них всё свежее: Opus 4.7, GPT 5.4, Gemini 3.1 Pro, Sonnet 4.6. На SWE-bench те же модели берут 70 % и выше. На ProgramBench — ноль полного резолва. Лучший «почти решено» у Opus 4.7 — 3 %. У остальных и того нет. Это новый бенчмарк от Meta Superintelligence Labs, Stanford и Harvard (2026). Агенту дают скомпилированный бинарь и описание программы. Никаких сорсов, никакой декомпиляции, никакого интернета. Задача — собрать программу с нуля так, чтобы она прошла 248 тысяч поведенческих тестов. Это не «пофиксить баг в существующем коде» (как SWE-bench) и не «дописать функцию по сигнатуре» (как HumanEval). Это другой ТИП задачи: спроектировать систему. Внутри — методология, паттерн результатов (что модели вытягивают, а что нет), и почему этот ноль — на самом деле важная новость для тех, кто строит на LLM продакшен.

Читать далее

1 миллион токенов в Opus 4.7 — маркетинг. Реально полезных — 300 тысяч. И сами Anthropic это подтверждают

Level of difficultyHard
Reading time12 min
Reach and readers11K

В начале мая Кангвук Ли (CAIO Krafton) опубликовал в X разбор: двумя API-вызовами и 35 1M токенов контекста в Claude Opus 4.7 — это «доступно», а не «полезно». В system card §8.7.2 сами Anthropic пишут: на 1M MRCR упал с 78.3% (Opus 4.6) до 32.2% (Opus 4.7), и для long-context retrieval они рекомендуют держать 4.6 как fallback. Деградирует и 4.6 — просто в два раза медленнее. Параллельно Кангвук Ли двумя API-вызовами и 35 строками Python вытащил из Codex AES-зашифрованный compaction-промпт. Сравнил с открытым compact_20260112 от Anthropic. Они близнецы. Реальная разница не в промпте, а в том, где живёт компакция. GPT-5.1-Codex-Max — первая модель, нативно обученная компакции на уровне весов. Anthropic пока через сервер-сайд хук. Это и объясняет, почему по ощущениям Codex держит длинные сессии лучше. Внутри: verbatim промпты обеих систем рядом, side-by-side таблица, разбор системной карты Opus 4.7 и практические выводы для Claude Code и Codex CLI.

Читать далее

Тестировал /goal в Codex CLI. Переломная команда для работы с AI-агентами или самый дорогой способ написать код?

Level of difficultyMedium
Reading time8 min
Reach and readers9.3K

OpenAI выпустил Codex CLI 0.128.0 с командой /goal — автономным режимом, в котором агент сам пишет код, тестирует, рефлексирует и долбит цель часами. На практике первое, что замечаешь — счётчик токенов скачет в 3-5 раз непредсказуемо. Не вдвое — в пять. Месяц использования в команде. Главные находки: исследователи подхватили первыми (а не разработчики). При упирании в quota wall MCP-вызовы молча отваливаются. Соседняя команда /side неожиданно стала использоваться для расшифровки англицизмов GPT-5.5. В статье: разбор архитектуры /goal (5 слоёв, инжекция системного промпта против proxy signals), реальный публичный кейс — +25% fps за час в GPT-5.5 xhigh, грабли с непредсказуемыми токенами и quota walls, когда /goal стабильно ломается. Антипафос. Никакого AI-евангелизма.

Читать далее

Парадокс GPT-5.5: чем подробнее промт — тем хуже. Разобрал свой 663-строчный скилл и сверился с Claude

Level of difficultyHard
Reading time9 min
Reach and readers9.2K

OpenAI выкатил гайд по промтингу GPT-5.5. Главный тезис: длинные простыни инструкций с ALWAYS/NEVER/MUST не помогают модели — они мешают. Чем подробнее зажимаешь процесс, тем хуже результат. Я полез проверять. Открыл свой рабочий скилл — process-logs, обработка логов ошибок, версия 1.9.0, продакшн. 663 строки, 36 капс-блоков: «CRITICAL REQUIREMENTS», «YOU MUST FOLLOW THESE RULES. NO EXCEPTIONS». Каждый раздел начинается с MANDATORY. Перечитал по новым правилам OpenAI и нашёл четыре проблемы в одной секции из 134 слов: дублирующиеся императивы на одну мысль, judgment-call под видом invariant, нет stopping condition. Переписал — стало 50 слов. На Opus 4.7 и GPT-5.5 короткий вариант даёт лучший фикс на одной и той же ошибке из логов. В статье: разбор 5 ключевых тезисов гайда с прямыми цитатами, диф «до/после» на реальном продакшн-скилле, эксперимент в Google Stitch, который можно повторить за 5 минут, и сверка с тем, что говорит Anthropic про Claude.

Читать далее

Прогнал 6 апрельских LLM через battle test. Победил не самый новый и не самый дорогой

Level of difficultyHard
Reading time9 min
Reach and readers11K

DeepSeek V4 Pro вышел 24 апреля. Огромная модель, топ AIME и SWE‑bench, передовая reasoning‑архитектура. Я ждал Tier S — 95+ из 100 в нашем battle test на русском контенте. Получил 89. Запустил его собственный Flash — 83. Pro выше на 6 пунктов, но в 13 раз дороже. Перетестировал Qwen 3.6 Plus, который вышел на 22 дня раньше V4 Pro: 92 балла. Старый Qwen обогнал новейший флагман DeepSeek и по качеству, и по цене.

В статье: парадокс Pro vs Flash с экономикой production, гипотезы почему reasoning‑оптимизация не вытягивает narrative, обновления методологии (max_tokens, paid re‑test), формула score‑per‑dollar и обновлённые рекомендации.

Читать далее

$1.8 миллиарда, два брата и ноль проверок: как The New York Times попалась на AI-хайп

Level of difficultyMedium
Reading time8 min
Reach and readers13K

Второго апреля я наткнулся на статью The New York Times про MEDVi — телехелс-стартап, который якобы вырос до $1.8 миллиарда с двумя сотрудниками и горой AI-инструментов. Честно? Я впечатлился. Сэм Альтман предсказывал компанию на миллиард с одним основателем — и вот она, пожалуйста. Мэттью Галлахер, 41 год, Лос-Анджелес, $20 тысяч стартового капитала, ChatGPT, Claude, Midjourney — и $401 миллион выручки за 2025 год.

Я уже начал набрасывать план статьи. «Вот оно, будущее. Смотрите, как AI меняет правила игры.»

А потом сделал то, что делаю всегда перед публикацией, — полез проверять факты. И статья превратилась в совершенно другую историю.

Читать далее

Какую LLM ставить в production для контента на русском? Протестировали 18 моделей — одна в 130× дешевле при 91% качества

Level of difficultyEasy
Reading time10 min
Reach and readers13K

GPT-5.4 пишет лучше всех — 97 баллов из 100. Но $0.10 за вызов. При 10 000 генераций в месяц — $1000. А мы нашли модель, которая справляется на 91% и стоит $0.0008. Те же 10 000 генераций — $8. Разница — $992 каждый месяц.

Мы строим продукт, где LLM генерирует образовательный контент для клиентов. Публичные бенчмарки (MMLU, HumanEval, LMSYS) не помогают — они не тестируют генерацию длинных текстов на русском и не учитывают стоимость. Поэтому мы за свои $95 построили собственный battle test и прогнали через него 18 моделей.

Что обнаружили: 7 из 18 моделей вставляют китайские иероглифы в русский текст. Одна копирует инструкции из промпта прямо в заголовки. А LLM-судья поставил сам себе 127 баллов из 100.

В статье: полная методология, таблицы с результатами, формула value score (цена/качество), и открытый лидерборд.

Читать далее

Сделайте себе нормальный логотип: 13 AI-сервисов — от бесплатных до профессиональных

Level of difficultyMedium
Reading time8 min
Reach and readers6.4K

У нашей IT-компании не было логотипа.

Мы делаем дизайн для клиентов — в том числе логотипы. Проектируем айдентику, спорим о кернинге, подбираем цвета по Pantone. А собственный логотип? «Ну, потом.» Годами «потом». Классический сапожник без сапог.

В какой-то момент команда прямо сказала: «Мы — AI Dev Team. Без логотипа. Серьёзно?» Возразить было нечего. Когда отправляешь клиенту презентацию, а в шапке — пустое место, «потом» заканчивается.

Решение было предсказуемым для IT-команды: не «загуглить лучший генератор логотипов», а провести нормальное исследование. Бесплатные тарифы, форматы экспорта, юридические условия, подводные камни. Я дал задание, команда вернулась с разбором 13 сервисов. Делюсь результатами — но начну не с инструментов, а с ловушки, в которую попадают все.

Читать далее

Information

Rating
Does not participate
Location
Москва, Москва и Московская обл., Россия
Date of birth
Registered
Activity