GenAI в страховании: как перейти от пилотов к результату

22 сентября в 16:00 МСК пройдет открытый онлайн-подкаст о внедрении GenAI в страховании. Регистрация: https://siteos.agima.ru/events/podcasts/

AI, ANN и иные формы искусственного разума

22 сентября в 16:00 МСК пройдет открытый онлайн-подкаст о внедрении GenAI в страховании. Регистрация: https://siteos.agima.ru/events/podcasts/
От работающей ERP к цифровой реплике и вычислимой модели предприятия
Введение
Когда-то, много лет назад, значительная часть моих публикаций на инфоплощадках так или иначе вращалась вокруг довольно простого вопроса: «Купили ERP — что дальше?» Предприятие приобрело большую систему, руководство ждёт от неё результата, проектная команда собрана, консультанты пришли, пользователи продолжают работать — и в этот момент выясняется, что сама покупка программного продукта практически ничего не решает. Нужно понять, что именно внедрять, как организовать проект, как обследовать предприятие, где заканчивается методология и начинается автоматизация, кто принимает решения и каким образом всё это в конечном счёте должно превратиться в работающую систему.
С тех публикаций прошло много лет. За это время через нашу практику прошло больше сотни проектов — очень разных по масштабу, состоянию предприятия, отрасли, составу команды и исходной культуре управления. Были действительно удачные проекты, после которых оставалось ощущение серьёзного профессионального продвижения. Были проекты, где отдельное решение становилось настоящим прорывом и потом переходило в следующие внедрения. Были и совершенно другие истории, когда месяцами двигаешься, проводишь совещания, выпускаешь документы, закрываешь этапы, а потом честно признаёшь самому себе, что по существу находишься примерно в том же месте, с которого начинал.
Это не научная статистическая выборка, и я не пытаюсь её так называть. Но когда за спиной уже не несколько кейсов, а больше сотни проектов, постепенно начинаешь отличать случайность конкретного внедрения от проблемы, которая повторяется при разных заказчиках, командах и информационных системах. Если один и тот же вопрос возвращается снова и снова, значит, дело, скорее всего, уже не в особенностях отдельного предприятия. Возможно, чего-то не хватает в самой технологии проекта.
Технический прогресс обесценивает прежние методы выбраковывания иррациональных, саморазрушительных организаций общества: любое безумие и агрессия как в эпоху лошадиной тяги и стали, так и в эпоху пара и пороха, в итоге, на цивилизационной дистанции отфильтровывались в конкуренции с более рационально организованными обществами — с лучшим балансом коллективного к авторитарному вкладу в коллективно-значимые решения. Технические ограничения методов уничтожения гарантировали, таким образом, пассивный прогресс цивилизации в целом: чрезмерная агрессия вела к самоуничтожению быстрее, чем могла стать всеобщей угрозой.
На ошибках чужой несдержанности учились следующие поколения — и человечество постепенно вырабатывало инструменты коллективного участия во внутренней политике и сдерживания в международной. Подобный, пассивный метод прогресса цивилизации, был пусть и медленным и болезненным (видимым на дистанции в сотни и тысячи лет, и сопровождающийся всеми возможными деструктивными ужасами) — но гарантированным.
Однако, благодаря техническому прогрессу, новые методы уничтожения достигли потенциала глобального и практически моментального уничтожения. Это не означает, что пассивный метод прогресса — поиск верного ответа исчерпанием всех неверных, через войны и ошибки, перестал работать. Он просто перестал быть гарантированным теперь, когда всё больше вариантов, когда фатальные для целой человеческой цивилизации ошибки стали технически возможными.

Учёные опубликовали подробную карту нервной системы дрозофилы. Интернету понадобилось несколько дней, чтобы посадить её за руль, отправить в Doom, дать $100 на биткоин, зарегистрировать на сайте знакомств и переселить в робота. Мы всё это время переживали, что работу у нас отнимет ИИ. Возможно, стоило присматривать ещё и за мухами.
В начале сентября Google Research, HHMI Janelia и большая команда исследователей представили подробную карту центральной нервной системы взрослого самца дрозофилы. В ней около 166 тысяч нейронов и примерно 125 миллионов синаптических контактов. Это важное продолжение проекта FlyWire, в рамках которого ранее был реконструирован мозг взрослой самки, но теперь исследователи получили не только мозг, но и вентральную нервную цепочку, через которую центральная нервная система связана с двигательными цепями тела.

Осторожность кажется полезной настройкой для ИИ-агента. Но три прогона на 100 реальных багах из SWE-bench дали обратный результат: «правила дисциплины» по мотивам советов Карпати снизили число исправлений примерно на 13%. Разберём результаты эксперимента и посмотрим, в какой момент разумные ограничения превращаются для агента в тормоза.

Мы с приятелем делаем игрового робота-компаньона для настольных игр. Сейчас он умеет понимать позицию на игровой доске (гомоку, оно же “пять в ряд”), обдумывать ход (самописный аналог AlphaZero) и понимать базовые фразы для сопровождения игры - моделью, которая вместе с эмбеддингами весит меньше 80 мегабайт

Сначала я выбрал модель, которая отлично писала код. Подключил её к OpenCode и выяснил, что создавать файлы на диске она просто не умеет. Взял другую — та уверенно работала с файлами, но полностью поплыла на русском языке.
В итоге победила модель, которую я поначалу оставил «для экспериментов»: слишком большая, на грани по квантованию и, казалось, сплошной компромисс.
Ниже — о том, как я подбирал рабочую лошадку под WordPress и фронтенд на видеокарте с 16 ГБ памяти. Со скоростями, квантами и неожиданным экзаменом по русскому языку.

Парный опыт над двумя фронтирными моделями, разбор двух разных механизмов отказа и проверка собственного вывода по литературе, которая его обрушила.

Разбираю шесть нейросетей для сокращения текста, чем они полезны редактору, как проверять то, что оставила LLM и почему пару вычеркнутых строк иногда лучше вернуть.

По нормам Минздрава, на прием терапевта отведено 15 минут. За это время врачу нужно успеть выслушать жалобы, поднять историю болезни, изучить анамнез, осмотреть пациента и зафиксировать результат так, чтобы его сразу понял следующий специалист.
Чтобы это стало возможным, под капотом клиники работают десятки согласованных ИТ-процессов. И любая мелочь вроде дублированной записи или сбоя синхронизации расписания может превратиться в очередь, срыв приема и поток раздраженных пациентов (привет, 90-е).
В этой статье разбираем цифровой маршрут пациента от онлайн-записи до телемедицинской консультации: как устроен master расписания, что защищает от двойного бронирования, как работает электронная очередь и каким образом ИИ помогает врачу за отведенные минуты принять решение, от которого зависит здоровье пациента.

Kubernetes дал платформенным командам единообразный способ развёртывать, масштабировать и эксплуатировать контейнеризированные приложения. Теперь многим из них приходится поддерживать и ИИ-нагрузки.
Переход уже начался. По данным CNCF 2025 Annual Cloud Native Survey, 66% организаций, которые размещают генеративные ИИ-модели, используют Kubernetes для части или всех инференс-нагрузок. Однако ежедневно развёртывают ИИ-модели лишь 7% организаций. Этот разрыв показывает разницу между запуском ИИ-нагрузок в Kubernetes и платформой, которая готова непрерывно эксплуатировать ИИ в production.
Проблема заметна и внутри платформенных команд. Исследование 2025 State of AI in Platform Engineering2 показало, что 35% таких команд всё ещё не оркестрируют ИИ-нагрузки. Это говорит о разрыве между внедрением ИИ и зрелостью операционных платформ, необходимых для его масштабной поддержки.
ИИ не требует от платформенных команд отказываться от Cloud Native-практик. Kubernetes, GitOps, observability, автоматизация и самообслуживание по-прежнему составляют ценный фундамент. Однако ИИ предъявляет дополнительные требования к вычислительным ресурсам, планированию, доставке моделей и эксплуатации.
Команда VK Cloud перевела статью о том, что должно измениться, чтобы Kubernetes-платформа была готова к эксплуатации ИИ-нагрузок.

Заметили, как за последние годы произошла инфляция книг про успешный успех? Все эти «Принципы», «Магия утра», «Атомные привычки», «От нуля к единице» и прочие. Они и раньше‑то работали плохо, а сейчас вызывают какое‑то отторжение. Что же случилось?

Однажды утром вы читаете новость: новая GPT Astra за ночь решила одну из фундаментальных математических задач человечества. И тут приходит гениальная мысль: раз LLM настолько умна, почему бы ей не поработать за покерным столом на ваше благо?
Звучит как план? Да. Как очень плохой план.
Пятая часть про локальный ассистент для созвонов. В первой части я написал: ничего не уходит в облако. Облако появилось на второй день проекта, потому что большая модель одним чтением стенограммы находила то, чего локальная не видела. Что уходит с машины при каждом из пяти тумблеров и в каком объёме, почему остался Opus, как каждая третья ревизия не доезжала из-за усилия, а не размера промпта, и где сегодня проходит граница между локальным и облачным.

В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).
При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.
Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.
Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты?

TL;DR. Собрал воркфлоу на языковой модели, который раз в сутки обходит 34 страницы условий у 12 российских банков, сравнивает их со вчерашним снимком и публикует сводку изменений с ссылкой на источник в каждой строке, а при изменении цены пишет разбор с расчётом. Модель вызывается в четырёх точках и ни в одной не решает, что делать дальше. Цитаты, числа и статистика проверяются кодом. Каждый выпуск оценивается по 14 бинарным проверкам, метрики публичные. Стоит от 3 центов до 70 в день. Ниже устройство, проверки, evals и что он нашёл за первую неделю.
Я работаю в розничных кредитных рисках банка. С языковыми моделями познакомился пару недель назад, начал собирать себе инструменты, и один из них за это время дорос до публичного продукта: Telegram-канал и сайт, где каждое утро в 09:00 выходит сводка изменений условий кредитных карт, рассрочки, кредитов наличными и автокредитов, а когда есть повод, короткий разбор одного изменения.

…а не по пинку от внешних расследователей, как это было последние разы (в эпизодах с роем агентов на немецкой вики и со взломом RubyGems). Заодно OpenAI раскрыли шесть новых примеров странного поведения своих моделей, разберем в этом материале кратко самое интересное.
Спросил у Claude Code «Ответь одним словом: работает». Двадцать девять символов. На сервер ушло 305 042 байта — 113 460 токенов, ответ из четырёх.
Поставил между агентом и сервером прокси на сорок строк Python и разобрал тело запроса по частям. Системный промпт — четыре процента. Восемьдесят пять процентов — описания 137 инструментов, из которых 107 принёс один MCP-сервер, которым я в этой сессии не пользовался. Ещё 29 тысяч символов добавил хук плагина. И на каждый ход уходит второй запрос, о котором я не просил.
То же самое проделал с Codex CLI: 29 килобайт, 9 817 токенов, а системный промпт при этом такой же длины. Дальше — таблица, что убирается флагами (один MCP-сервер стоил 52 тысячи токенов на запрос), что это значит для окна и кэша, и скрипт, чтобы посмотреть свой первый запрос.
Через несколько дней Apple начнёт отгружать Mac mini на M6 и M5 Pro и Mac Studio на M5 Max и M5 Ultra. Замеров локальных моделей на них ещё ни у кого нет, а прикинуть скорость можно уже сейчас. В прошлой статье я замерил шесть моделей на базовом M4 и вывел правило через полосу памяти с КПД 0.83, которое сошлось с замером в пределах двух процентов. Здесь применяю его к новым чипам и публикую цифры до того, как железо приехало. Потом замерю и покажу, где ошибся.
Коротко. M6 для локальных моделей не апгрейд, прирост 25 до 40 процентов и тот же потолок 8B. M5 Pro первый mini, где 32B работает на рабочей скорости. M5 Max меняет класс, 70B на 13 токенах в секунду. Отдельно про ловушки младших конфигураций, у M6 с 16 ГБ и M5 Max с 36 ГБ полоса памяти заметно ниже.

Генератор учебных заданий положил «маши…ый» в правильную корзину, а проверка переложила слово в неправильную. При этом модель-арбитр в своём же объяснении написала «машинный». Разбираем по сохранённым ответам три сбоя проверяющей модели: что пошло не так в процессе, что поменяли в коде и чего эти правки не доказывают.