
Фарма — индустрия с долгими циклами, сложными процессами и высокой ценой ошибки. Это особенно видно на пути разработки препарата: от поиска перспективной молекулы и доклинических исследований до нескольких фаз клинических испытаний, регистрации и вывода на рынок. В среднем разработка одного препарата занимает 10–15 лет и стоит порядка 1–2 млрд долларов, а из кандидатов, дошедших до клинических исследований, девять из десяти не доходят до регистрации1.
Мы не будем писать текст в жанре «внедрили AI → стало лучше». Таких материалов на Хабре уже много, и ввиду распространённости и повального культа AI они могут не вызывать доверия. Нам интереснее показать, что меняется в самой логике работы фармы на конкретных примерах.
1. Как AI ускоряет разработку лекарств
Самый тяжелый этап разработки — начало. Прежде чем препарат дойдет до клинических исследований, нужно выбрать биологическую мишень, найти молекулы‑кандидаты, проверить их активность и свойства с помощью скрининговых тестов и расчетных моделей, а затем постепенно сузить круг до тех соединений, которые есть смысл изучать дальше2.
На практике это похоже на воронку: сначала нужно оценивать большие библиотеки соединений, а затем, когда остаются наиболее перспективные кандидаты, переходить к более точным, дорогим и трудоемким экспериментам. В этом процессе скорость имеет значение: чем раньше удается отсеять слабые гипотезы, тем меньше ресурсов уходит на проверку кандидатов, которые с высокой вероятностью не дойдут до следующих этапов2.
Пространство возможных молекул настолько огромно, что классический перебор не работает.
Что меняется на практике:
молекулы кодируются как графы или последовательности;
модели предсказывают их свойства;
кандидаты ранжируются по вероятности «сработать».
То есть мы больше не ищем одну «лучшую» молекулу — мы оцениваем вероятность того, что она сработает. Это позволяет быстрее отбрасывать слабые гипотезы и сокращать число экспериментов.
Мы используем knowledge graphs, объединяющие геномные, клинические, молекулярные и safety‑данные. Поверх графов работают графовые нейросети (Graph Neural Networks), которые помогают находить неочевидные связи3.
Из конкретного: в январе 2021 года в R&D‑портфель компании вошёл первый drug target, найденный с помощью AI в партнёрстве с BenevolentAI (мишень для лечения хронической болезни почек). Позже из этой же коллаборации в портфель добавились и другие AI‑таргеты2.
2. От клинических исследований до диагностики: как это устроено на практике
Сначала пара слов про специфику. Клинические исследования (КИ) — это многолетние, строго регламентированные испытания препарата с участием пациентов, разбитые на фазы, с жесткими требованиями к безопасности, дизайну и отчётности. Именно здесь цена ошибки особенно высока, а любые изменения процесса должны проходить через регуляторные требования 4.
Модели помогают прогнозировать отклик пациентов и делать дизайн исследований более точным, не заменяя врача и не ломая существующие процессы.
Например, FDA прорабатывает подходы к использованию AI на отдельных этапах ранних клинических исследований — для ускорения решений «go / no‑go» и мониторинга испытаний в реальном времени (один из пилотов идёт с участием AstraZeneca и Amgen). Речь не о замене классических процедур, а о том, чтобы сделать их быстрее и точнее. Пока это не массовая практика, но вектор показывает, куда движется индустрия 5.
Изменения происходят не только на этапе клинических исследований. AI применяется также и на ранних стадиях разработки препаратов: появляются кейсы, ещё недавно казавшиеся невозможными. Самый известный — разработка кандидата для лечения идиопатического лёгочного фиброза: мишень TNIK нашли с помощью AI, молекулу тоже сгенерировали алгоритмы. От идентификации мишени до преклинического кандидата прошло 18 месяцев, и синтезировать пришлось меньше 80 соединений. Обычно на этом этапе счёт идёт на тысячи молекул и на несколько лет 6.
Это не отраслевая норма, а единичный случай. Но он показывает, насколько быстро может идти разработка, когда AI встроен в процесс с самого начала.
Интересно, что конкурентное преимущество в таких историях — не сами модели, а данные. Точнее обработанные данные: не сырые датасеты, которые есть у всех, а данные, прошедшие несколько циклов очистки, валидации, обогащения и переработки через собственные алгоритмы. Именно этот слой делает данные уникальными и воспроизводимыми.
Способность работать с данными и превращать их в новые научные знания играет важную роль в современной фармацевтической разработке. Развитие data science и AI становится одним из факторов, который позволяет ускорять R&D‑процессы и повышать их эффективность 7.
Помимо клинических исследований и ранних этапов разработки препаратов, хочется упомянуть применение AI в диагностике. При участии «АстраЗенека» в Санкт‑Петербурге и Нижнем Новгороде были запущены пилотные проекты, где AI используется как вспомогательный инструмент анализа КТ‑снимков. Это не замена врача: модель работает «вторым контуром» и помогает повысить эффективность диагностики рака лёгкого примерно на 10% 8.
Логика везде одна: модель обрабатывает данные, решение принимает человек. Но чтобы модель вообще появилась, кто‑то должен построить под неё пайплайн обработки данных. В фарме этот слой обычно остаётся внутри компании — и это одна из причин, почему исследования так медленно воспроизводятся. Мы часть своих инструментов открываем.
У глобальной «АстраЗенека» есть публичная страница на GitHub — это более 100 open‑source проектов в области data science, биоинформатики и AI. Это не демо‑репозитории, а инструменты, выросшие из реальных задач: обработки научных данных, моделирования молекул и автоматизации исследований.
Один из таких проектов — СellAtria — расскажем про него подробней и в картинках.
3. Как работает CellAtria
СellAtria — это open‑source агентная AI‑система, которая обеспечивает полностью автоматизированный цикл работы с данными в single‑cell исследованиях: от документа до финального анализа.
Она объединяет взаимодействие на естественном языке с мощным графовым фреймворком исполнения, основанным на мультиагентной архитектуре. Система оркестрирует разнообразные задачи — от парсинга научной литературы и извлечения метаданных до поиска датасетов и последующего анализа scRNA‑seq с использованием совместно разработанного пайплайна CellExpress.
Через единый интерфейс CellAtria позволяет пользователю работать с языковой моделью, расширенной специализированными инструментами. Это устраняет необходимость ручной работы через командную строку, ускоряет загрузку данных и упрощает повторное использование публичных single‑cell ресурсов.




Ключевая идея: пользователь формулирует задачу на естественном языке, после чего LLM‑агент интерпретирует запрос, вызывает необходимые инструменты и последовательно выполняет pipeline анализа.



Запустить агент CellAtria можно всего за три шага:
Открыть терминал
Загрузить преднастроенный Docker‑образ (в котором уже есть все необходимые зависимости)
Запустить контейнер, указав путь к файлу с учётными данными для выбранного LLM‑провайдера
Такой минималистичный setup обеспечивает единообразное выполнение в любой среде — будь то ноутбук, рабочая станция или HPC‑кластер. При этом пользователю не нужно вручную управлять зависимостями и конфигурациями.
Несмотря на гибкость взаимодействия с системой, работа CellAtria опирается на чёткий сценарий исполнения — последовательность модульных шагов, определяющих, как задачи интерпретируются, маршрутизируются и выполняются.
Пользователь может запускать отдельные модули независимо, однако для получения наилучшего результата рекомендуется следовать заложенному workflow.
Внутренняя логика CellAtria включает несколько ключевых этапов:
Парсинг документов (Document Parsing)
Извлечение структурированных метаданных из научных публикаций (PDF или URL)Определение accession‑идентификаторов (Accession Resolution)
Поиск релевантных GEO‑идентификаторов на основе извлечённых данныхЗагрузка датасетов (Dataset Retrieval)
Автоматическое скачивание данных из публичных репозиториевОрганизация файлов и данных (File & Data Organization)
Приведение данных к единой структуре директорий для дальнейшего анализаКонфигурация пайплайна (Pipeline Configuration)
Подготовка параметров и аргументов для запуска CellExpressЗапуск CellExpress (CellExpress Execution)
Старт стандартизированного пайплайна анализа single‑cell данных в фоновом режиме
Такой модульный, агент‑ориентированный подход позволяет стартовать с любого этапа, сохраняя логическую целостность всего процесса.

CellExpress — встроенный в CellAtria пайплайн, обеспечивающий воспроизводимый и автоматизированный анализ данных single‑cell RNA‑seq: от сырых матриц счётов (raw count matrices) до аннотаций типов клеток и финальных отчётов.
Он снижает порог входа в биоинформатику за счёт готового стека на базе Scanpy, включающего:
контроль качества данных,
нормализацию, отбор высоковариабельных генов и масштабирование,
снижение размерности (UMAP, t‑SNE),
графовую кластеризацию,
поиск маркерных генов.
Дополнительно поддерживаются более сложные задачи: детекция doublet‑клеток, batch‑коррекция и автоматическая аннотация клеток (с универсальными и тканеспецифичными моделями).
Все этапы выполняются последовательно под централизованным управлением, с полной настройкой через единую конфигурацию.
CellExpress можно использовать как отдельно (через CLI), так и внутри CellAtria — в составе агентного pipeline.
CellAtria спроектирована с учётом требований индустрии — воспроизводимости, прозрачности происхождения данных и работы с регулируемыми средами (human‑in‑the‑loop), при этом на уровне реализации это обеспечивается через Docker‑образ с изолированной Ubuntu‑средой, предустановленными зависимостями (Python, R), инструментами визуализации и отчётности, а также всем необходимым для сквозного выполнения аналитического пайплайна.
Поскольку CellAtria работает с регулируемыми источниками данных, система изначально учитывает требования этики и compliance: она сохраняет информацию о происхождении данных (репозитории, издатели, конфликты интересов), а для работы с чувствительными наборами использует Docker‑среду с воспроизводимым и аудируемым запуском (в том числе GxP‑совместимым). При этом контроль остаётся за пользователем и организацией — платформа не обходит лицензии и доступы, а агентная автоматизация усиливает, но не заменяет человеческое участие (human‑in‑the‑loop).
4. Как AI ускоряет бизнес‑процессы «АстраЗенека» в России
Локальные AI‑проекты «АстраЗенека» в России и Евразии связаны прежде всего с данными. Часть процессов уже опирается на цифровые инструменты, где‑то планируется использование математических моделей и AI, но самый заметный эффект сегодня в операционных процессах.
Так, мы разрабатываем и используем AI‑агентов для проверки медицинских материалов: это автоматизация рутинных проверок, ускорение согласований и снижение количества ошибок.
AIRIS 2.0 и работа с корпоративными знаниями
Объём данных в фарме настолько велик, что работать с ними без собственной инженерной команды уже сложно. Внутри нашего российского подразделения выросло направление Data & Digital: с 2024 года команда увеличилась в 3,5 раза, сегодня это около 190 человек — DevSecOps, Data & BI, Innovations & AI, Commercial IT, Digital, SFE & Multichannel, Digital Transformation и Project Management Office. Что делает каждое направление, коротко описали в примечаниях.
В современной фарме IT‑системы влияют на скорость и качество бизнес‑процессов, а значит, косвенно и на продукт. Работа с информацией у нас всегда связана с внутренними процедурами, контрольными мерами и требованиями к качеству, проверяемости и документации. Поэтому AI здесь — часть IT‑системы, и внедрять его нужно аккуратно.
Наши команды ежедневно работают с большим объёмом документов: научные и медицинские публикации, внутренние регламенты, презентации, отчёты, таблицы, методические рекомендации, результаты исследований. Часть из них хорошо структурирована, но многое приходит в неудобном для машины виде — сканы, сложные PDF, смешанные презентации, изображения, многостраничные материалы. Особенно сложны большие таблицы и смешанные страницы, где смысл зависит не только от текста, но и от структуры: строки, столбца, заголовка, единицы измерения, подписи к рисунку. Если эту структуру потерять, документ можно формально «прочитать», но понять неправильно.
Отсюда выросла AIRIS 2.0 — наша внутренняя система работы с корпоративными знаниями. Сотрудник задаёт вопрос на естественном языке и получает ответ, основанный на содержании внутренних документов, структурированных и неструктурированных. Система показывает, из каких именно источников взята информация.

Прозрачность здесь принципиальна. Нельзя полагаться на убедительность и «красоту» ответа: пользователь должен понимать, откуда взялась формулировка, и иметь возможность вернуться к первоисточнику.
Задача была двойной: с одной стороны, научить систему «переваривать» документы любой сложности и давать точные ответы. С другой — там, где это уместно, снизить общее количество сложных документов в обороте.
AIRIS — только один слой. Опора на одну универсальную систему, которая должна знать всё и одинаково хорошо отвечать на любые запросы, со временем создаёт узкие места: в производительности, в точности, в масштабируемости. Поэтому мы смотрим в сторону мультиагентного подхода, где модель‑оркестратор направляет запрос к подходящему инструменту или специализированному агенту в зависимости от задачи. Такая логика позволяет расширять функциональность постепенно, по мере роста требований.
Следующий этап — научить систему не только отвечать на single‑ и multi‑hop вопросы, но и выполнять многошаговые задачи за счёт более тесной интеграции с корпоративными системами и источниками данных.
Специализированные агенты у нас уже работают. Один из них отвечает за доредакторскую проверку материалов — этап, который традиционно отнимает у специалистов из разных отделов много времени. Агент действует по правилам, согласованным командами, и финальных решений не принимает: human‑in‑the‑loop здесь принципиален. Это сокращает время на первичные проверки и первые согласования, снижает риск пропустить типовую ошибку и сохраняет полный контроль над содержанием.
5. Как AI ускоряет производство (опыт производства «АстраЗенека» в Калужской области)
Если разработка и клинические исследования — это про скорость поиска решений, то на производстве AI решает другую задачу: помогает обеспечивать качество в среде, где каждый шаг регламентирован.
На заводе «АстраЗенека» в Ворсино Калужской области искусственный интеллект внедряется в работу всех сотрудников для регулярного сбора, обработки, передачи и анализа данных. Особую роль он играет в отделе обеспечения качества (ООК), помогая специалистам ежедневно справляться с отклонениями, расследованиями и большими объемами документации.
Специфика здесь в том, что фармпроизводство работает по стандартам GMP, и к AI в таких процессах предъявляются жёсткие требования. Модель не может быть «чёрным ящиком»: она должна фиксировать, какие параметры повлияли на результат, сопровождать прогноз метрикой уверенности и работать с данными по принципам целостности (ALCOA++) с полным аудиторским следом. Данные для обучения и для тестирования модели строго разделяются, а сами разработчики обучающей выборки не участвуют в её проверке.
И главный принцип — human‑in‑the‑loop: AI остаётся вспомогательным инструментом, а все критические выводы проходят оценку и надзор специалиста.

Чтобы это работало системно, на площадке выстроена не просто пара инструментов, а целая рамка: корпоративные политики по управлению AI, единый реестр AI‑решений, оценка рисков и зрелости, а также пятиуровневая система обучения сотрудников — от базового понимания AI (чтобы снять страхи и сформировать спокойное отношение) до уровня бизнес‑партнёра, который способен перестраивать процессы на основе данных.

На практике в ООК внедряется несколько AI‑ассистентов.
Первый помогает оценивать повторные отклонения: он автоматически находит похожие события за последние 12 месяцев, ранжирует совпадения и сразу даёт переход к связанным записям CAPA — то, что раньше требовало ручного поиска, теперь становится объективным и быстрым.
Второй проверяет качество самих расследований: оценивает, насколько описание отклонения соответствует требованиям СОП, насколько оно полное, и выдаёт рекомендации по доработке с разбивкой по баллам.
Третий работает с документами — приводит СОП и рабочие инструкции к корпоративным шаблонам, улучшает читаемость, сравнивает версии и переносит документы из старого шаблона в новый.
Четвёртый отвечает на вопросы по документации: сотрудник спрашивает, например, как провести очистку линии или калибровку весов, а ассистент находит нужную процедуру и указывает конкретные страницы.
Пример использования AI‑ассистента для оценки повторных отклонений:
1. Пользователь указывает номер отклонения и запускает оценку на повторное отклонение

2. Ассистент обрабатывает, анализирует данные по отклонениям в системе и генерирует детальный отчет с оценкой сходства

3. Пользователь анализирует полученный результат, проводит финальную проверку и делает вывод о наличии повтора

Пример использования AI‑ассистента для проверки отклонений
Пользователь выбирает отклонение и запускает проверку

2. Ассистент обрабатывает описание отклонения и оценивает текст на соответствие СОП и генерирует детальный отчет

3. Пользователь анализирует подсказки, проводит экспертную оценку и принимает окончательное решение об одобрении записи

Отдельный слой — поддержка пользователей и работа со знаниями. AI ассистенты берут на себя ответы на типовые вопросы, помогают ориентироваться в системах и находить нужные процедуры.
На текущий момент на заводе в Ворсино уже запущен в продуктивную эксплуатацию СОП ассистент — инструмент, который осуществляет поиск информации в документации и сразу возвращает не только ссылку на документ, но и конкретную страницу, где находится нужная информация.
Параллельно начинается подготовка Авто‑скрайбера — решения, которое позволит обрабатывать документы и приводить их к единому корпоративному стандарту без ручной доработки.
В результате опытные специалисты экономят до 40% рабочего времени на рутинных задачах — и это время перераспределяется в пользу более сложной аналитической работы.
Есть эффект и на уровне операционной деятельности: быстрый доступ к регламентам и помощь в применении процедур на практике даёт дополнительное повышение эффективности примерно на 5% за счёт снижения задержек и ошибок в повседневной работе.
Пример использования AI‑ассистента для работы с базой знаний
1. Пользователь создает новый запрос, что необходимо найти в документации

2. Ассистент предлагает документы и ссылки на них

3. Автоматическое открытие документа при нажатии на ссылку в системе документации
Во всех случаях логика одна и та же: ассистент обрабатывает запрос и готовит детальный результат, но финальное решение — повтор это или нет, одобрить запись или нет — всегда остаётся за человеком.
Эффект уже измерим. По оценкам площадки:
до 40% рабочего времени опытных специалистов экономят AI‑ассистенты, отвечая на типовые вопросы и снимая с экспертов стандартные задачи;
≈30% трудозатрат сокращает проверка документации за счёт автоматического анализа и выявления несоответствий;
≈5% прибавляет эффективность работы с процедурами, благодаря быстрому поиску нужных регламентов.
В сумме это высвобождает время специалистов для более сложных и приоритетных задач при росте точности и скорости рутинных операций.
6. Что такое программа AI30
Все эти инструменты — не разрозненные инициативы. Их объединяет программа AI30 — сквозной слой нашей стратегии до 2035 года.
Раньше путь разработки лекарств выглядел так: гипотеза → эксперимент → вывод.
Сейчас он постепенно меняется: гипотеза → модель → отбор → эксперимент. AI30 запущена для того, чтобы перестроить процессы вокруг данных и моделей: цель — делать ключевые этапы быстрее, точнее и эффективнее на 30% и более.
Главный эффект AI30 не в автоматизации, а в том, где принимается решение. Идея простая: максимум решений принимать на уровне моделей, до того как начинаются дорогие эксперименты.
Чтобы это работало не только на бумаге, нужна инфраструктура. Например, шведский консорциум с участием глобальной «АстраЗенека» (вместе с Ericsson, Saab, SEB и Wallenberg Investments) строит крупную AI‑фабрику на базе вычислений NVIDIA, а сама NVIDIA открывает в Швеции свой первый Центр технологий искусственного интеллекта9.
Для нас эта инфраструктура станет вычислительной и инженерной базой для ускорения поиска и разработки новых молекул.
7. Коротко о главном
В начале статьи мы упомянули, что девять из десяти кандидатов, дошедших до этапа клинических исследований, не проходят весь путь до регистрации лекарственного препарата. Эта цифра не изменится к следующему году. Но меняется то, где именно эти девять отсеиваются: раньше это происходило в лаборатории, теперь всё чаще в расчёте, до того как начнутся дорогие эксперименты.
В этой статье AI побывал в четырёх ролях. В ранней разработке предсказывал мишени по графам знаний. В биоинформатике собирал пайплайн анализа single‑cell данных — CellAtria, который мы выложили в открытый доступ. В клинических исследованиях уточнял дизайн, а в регуляторной среде попал в пилот FDA. На заводе в Ворсино проверял отклонения и вернул специалистам до 40% рабочего времени.
Роли разные, принцип один: human‑in‑the‑loop. AI ускоряет путь к решению, но не принимает его сам: ни в агентной системе, ни в ассистенте на производстве. Последнее слово остаётся за человеком.
Программа AI30 в этом контексте есть попытка перестроить логику работы системно, от разработки до операционки. И вопрос уже не в том, нужен ли AI, а в том, кто быстрее встроит его в реальные процессы — мы или кто‑то другой.
Номер одобрения: RU-30660
Дата одобрения: 04.09.2026
Дата истечения: 04.09.2028
Примечания:
Команда Data & Digital в «АстраЗенека», Россия и Евразия представлена направлениями:
DevSecOps — инфраструктура, frontend‑ и backend‑разработка, CI/CD, мониторинг жизненного цикла ПО и облачных сред, информационная безопасность.
Commercial IT — цифровые системы для автоматизации внутренних процессов, интеграция корпоративных систем, поддержка полевых и офисных команд.
Data & BI — сбор и систематизация внутренних и внешних данных, отчётность и аналитика, управление бонусной схемой, работа с новыми источниками данных.
Innovations & AI — AI‑продукты и RAG‑системы, развитие компетенций в области нейросетей, governance применения AI внутри компании.
Digital — цифровая экосистема в сфере здоровья: сервисы и контент для пациентов, врачей и фармацевтов, цифровой маркетинг.
SFE & Multichannel — персонализированные каналы коммуникации с медицинскими специалистами, инструменты полевых команд, аналитика покрытия, операционное управление колл‑центром.
Digital Transformation — оценка эффекта цифровых инициатив, повышение цифровой зрелости, внутренние коммуникации по трансформации, Digital‑бренд.
PMO — портфель проектов D&D, agile‑культура, управление изменениями.
Глоссарий:
AI — искусственный интеллект (русское обозначение ИИ).
КИ — клинические исследования.
КТ — компьютерная томография.
ООК — отдел обеспечения качества.
СОП — стандартная операционная процедура (англ. SOP).
AI (Artificial Intelligence) — искусственный интеллект.
AI30 — программа/миссия AstraZeneca по применению AI как сквозного слоя стратегии до 2035 года
AIRIS — внутренняя AI ‑платформа российской AstraZeneca.
ALCOA++ — набор принципов целостности данных (Attributable, Legible, Contemporaneous, Original, Accurate и расширения) в регулируемых GxP‑средах.
CAPA (Corrective and Preventive Actions) — корректирующие и предупреждающие действия (система управления качеством).
CLI (Command‑Line Interface) — интерфейс командной строки.
FDA (Food and Drug Administration) — Управление по санитарному надзору за качеством пищевых продуктов и медикаментов (США).
GEO (Gene Expression Omnibus) — публичный репозиторий геномных данных.
GMP (Good Manufacturing Practice) — надлежащая производственная практика.
GNN (Graph Neural Networks) — графовые нейронные сети.
GxP — обобщённое обозначение «надлежащих практик» (GMP, GCP, GLP и др.).
HPC (High‑Performance Computing) — высокопроизводительные вычисления.
IQ/OQ/PQ (Installation/Operational/Performance Qualification) — квалификация монтажа, функционирования и эксплуатации (валидация систем).
IT (Information Technology) — информационные технологии.
LLM (Large Language Model) — большая языковая модель.
NVIDIA — компания‑производитель вычислительных решений (имя собственное, не аббревиатура).
PDF (Portable Document Format) — формат документов.
RNA (в тексте scRNA‑seq, single‑cell RNA sequencing) — секвенирование РНК единичных клеток.
TNIK (TRAF2- and NCK‑interacting kinase) — киназа‑мишень препарата рентосертиб.
UMAP / t‑SNE — методы снижения размерности данных (визуализация многомерных данных).

