Открыли доступ к курсам по ML-системам от основ до продакшна. И да: это бесплатно
Кто-то смотрит на ML как на способ оперативно занять рыночную нишу, не понимая, какой технический фундамент необходим для реализации идеи очередного прорывного продукта. Кто-то запускает идеальный эксперимент в ноутбуке, но выясняется, что он не работает в продакшене. Это две крайности одной и той же проблемы: мало кто понимает, как работают ML-системы от первого винтика данных до последней шестеренки мониторинга. Чтобы глобально исправить это, мы собрали весь свой опыт провайдера облачных и ИИ-решений в линейку курсов Cloud.ru ML System Design и сделали доступ к ней открытым.
Какие курсы есть в линейке?
«Машинное обучение в облаке»⏳15 ч — как использовать облачную инфраструктуру для разработки, обучения и эксплуатации ML-систем.
«ML в продакшене»⏳2 ч — база, которую нужно знать, чтобы довести модель от эксперимента до стабильной работы в боевой среде с учетом инфраструктуры, данных и процессов.
Как Купер перенес 100% инфраструктуры в облако, снизил количество инцидентов и сократил время на их устранение
🏭 Что за компания Купер — онлайн-сервис доставки продуктов, товаров и готовой еды из магазинов и ресторанов. Сервис работает в 360 городах России, ежедневно обрабатывая десятки тысяч запросов в секунду. Ранее Купер уже перенес 40 ТБ аналитических данных в облако и остался доволен результатом, поэтому было принято решение продолжить процесс миграции.
⚡ Задача Купер нуждался в бесшовном переносе всей продакшен-инфраструктуры в облако без остановки работы высоконагруженной платформы. Требовалось повысить производительность, отказоустойчивость и упростить эксплуатацию сервиса, который должен стабильно работать даже в периоды максимальных нагрузок.
☁️ Что сделали Команды провайдера и заказчика синхронизировали требования к инфраструктуре и сетевой архитектуре для плавного переезда. Провайдер помог сформировать команду миграции из 12 специалистов, чей онбординг занял две недели. За 10 месяцев Купер и Cloud.ru перенесли 100% ИТ-инфраструктуры в облако, завершив миграцию в конце апреля 2026 года.
Архитектуру разделили на три логически изолированных слоя — внешний периметр (DMZ) с балансировщиком и веб-серверами, демилитаризованную зону для проверки трафика и закрытый контур бэкенда с базами данных и системами обработки заказов. Дополнительно команда провайдера доработала PaaS-сервисы под задачи Купера, внеся более 30 изменений и взяв на себя их дальнейшее сопровождение — обновления, контроль совместимости и проверку работоспособности.
🦾 Что получили в итоге Число инцидентов, связанных с облачной инфраструктурой, сократилось на 23%, доступность облачных ресурсов выросла, а средняя длительность инцидентов снизилась на 18%. Затраты на устранение технических сбоев уменьшились в 4 раза, а благодаря FinOps-инструментам Cloud.ru Купер получил прозрачный контроль бюджета и автоматические рекомендации по оптимизации расходов. В итоге онлайн-сервис получил масштабируемую платформу, способную стабильно обрабатывать данные любых объемов и выдерживать пиковые нагрузки без сбоев.
Еще не поздно стать спикером на GoCloud Tech 2026 🎤
Хардкорная конференция для тех, кто создает технологии в эпоху ИИ, GoCloud Tech состоится 15 октября! Мы собираем доклады от коллег из индустрии и готовы предоставить трибуну каждому, кто хочет повлиять на развитие инженерных практик и готов делиться своим реальным опытом. Не важно, в какой компании вы работаете, если вам есть, что рассказать:
о технологиях, на которых держатся современные облачные платформы, и лучших практиках работы с ними;
о том, как строить сложные системы и делать разработку в облаке эффективнее и безопаснее;
о том, как подготовить данные и инфраструктуру к работе с ИИ.
Ждем ваши заявки на выступление до 11 августа!
Вместе обсудим, как ИИ меняет инфраструктуру, разработку и работу с данными.
Рассказываем, что произошло в июне и объясняем, зачем это может пригодиться.
🧠 AI Factory — цифровая среда для работы с генеративным ИИ AI Agents — EvoClaw в Evolution AI Agents вышел в общий доступ и теперь покрыт SLA: сервис можно закладывать в прод без опасений. Managed RAG — в сервисе появились OCR для doc/docx с картинками, загрузка данных через API источником Custom и полноценный API для работы с чанками. Документы из объектного хранилища синхронизируются по расписанию, а новый экстрактор разбирает аудио и видео. ML Inference — появилась возможность при пиковых нагрузках маршрутизировать запросы с Foundation Models, чтобы производительность не падала. Notebooks — в сервисе добавили совместное редактирование ноутбуков, управление логами и алертами без выхода из интерфейса, а также готовые дашборды мониторинга. Команда может работать над экспериментами параллельно и мгновенно обнаруживать проблемы, если они возникают.
📈 Evolution Data Platform — комплекс управляемых сервисов для работы с данными Managed Airflow — сервис вышел в общий доступ: оркестрация данных теперь под SLA. Managed Trino — топики Kafka теперь читаются прямо SQL-запросом без ETL, а кластер можно развернуть с одной нодой и автомасштабированием. Аналитика стриминга стала проще и дешевле. Managed Spark — добавили несколько улучшений в сервис; задачи теперь создаются за секунды, добавлена поддержка Gang Scheduling, чтобы они блокировали друг друга по ресурсам. Evolution Managed Flink — сервис для работы с потоковыми данными вышел на стадию открытого тестирования, а значит настал момент, когда его функции можно оценить бесплатно и без обязательств.
Важное обновление: платформа перешла на асинхронную модель управления сервисами, кластеры можно самостоятельно приостанавливать и возобновлять, появилось тегирование. Меньше расходов на простаивающие ресурсы и удобнее навигация.
☁️ Новости других сервисовCloud.ru Evolution Evolution Artifact Registry — поддержка PyPI-реестров перешла в публичный доступ: Docker-, RPM- и Python-артефакты теперь хранятся в одном месте без отдельной инфраструктуры. Evolution Managed Kubernetes — обновили ключевые плагины (Istio, KEDA, Trivy Operator и другие), добавлен Spegel для ускорения загрузки образов, а Ingress Nginx получил поддержку PROXY-протокола. Evolution Managed PostgreSQL — кластеры можно вручную останавливать на срок до 30 дней, платя только за диск, — заметная экономия на неактивных базах. Evolution Managed Redis — добавлено мультизональное размещение кластеров Master/Replica: одна зона упала — кластер жив. Evolution Distributed Train — появился Jupyter Server с мультидоступом: несколько пользователей работают в изолированных окружениях под одним сервером. Совместная работа над ML-задачами стала стабильнее и удобнее.
🏢 Cloud.ru Advanced и Облако VMware В сервисе Advanced Data Warehouse Service поменялся интерфейс создания кластера и появились новые возможности, а в Terraform добавились новые ресурсы.
📽️Вебинары В июне провели четыре вебинара, записи которых уже доступны на страничке с мероприятиями. Там же можно зарегистрироваться на июльские вебинары от экспертов.
💼 Свежие кейсы Рассказали, как Agentic Lab запустили в продакшен ИИ-помощника для юристов, который способен выстраивать хронологию событий любого дела и быстро находить нужные сведения в огромных массивах данных.
5–10 минут на масштабирование: как Agentic Lab строит ИИ‑продукты без собственной GPU‑инфраструктуры
🏢 Что за компания Agentic Lab — продуктово-сервисная компания, которая разрабатывает ИИ-решения для автоматизации бизнес-процессов и помогает крупным организациям внедрять технологии искусственного интеллекта. Флагманский продукт — ИИ‑помощник «Агата» для работы с документами: он помогает юридическим командам анализировать большие массивы данных и быстро находить нужные сведения в тысячах файлов.
⚡ Задача При развитии «Агаты» разработчики столкнулись с типичной проблемой рынка: традиционные подходы к GPU‑инфраструктуре требуют либо крупных капитальных затрат, либо аренды выделенных ресурсов с оплатой независимо от фактической загрузки. Дополнительным условием стало соблюдение требований 152‑ФЗ и ФСТЭК — это критично для клиентов из юридической сферы, ведь они часто имеют дело с персональными данными и тайной судопроизводства.
☁️ Что сделали «Агату» развернули на ресурсах Cloud.ru: языковые модели работают на Evolution ML Inference с оплатой по мере потребления, фронтенд, бэкенд и бизнес-логика — на Evolution Compute.
Под капотом решения несколько LLM: Mistral извлекает метаданные, выделяет сущности и структурирует документы; Gemma обеспечивает интеллектуальный поиск, суммаризацию и диалоговый интерфейс. После загрузки документов система автоматически строит хронологию событий дела со ссылками на первоисточники и формирует единую базу знаний, к которой юристы могут обращаться на естественном языке.
🦾 Что получили в итоге Agentic Lab может подключать дополнительные GPU‑ресурсы за 5–10 минут вместо одного-двух дней при выделенной инфраструктуре, а капитальные затраты на собственное оборудование (несколько миллионов рублей за карту) полностью исключены. Юридические команды выполняют административные и документарные задачи примерно вдвое быстрее: рутину берет на себя «Агата» со средним временем ответа 15–20 секунд.
Вы просили — мы сделали. Повторяем вебинары про работу с данными в облаке: от развертывания платформы до ETL-процессов и полноценной BI-аналитики. Регистрируйтесь, чтобы спросить экспертов о важных деталях и получить ответ.
Как развернуть платформу данных в облаке и подготовить данные для аналитики Покажем, как быстро развернуть managed-сервисы Evolution Data Platform, подключить источники данных и построить пайплайны для подготовки данных к аналитике. Разберем интеграцию с PostgreSQL, ADB, S3 и настройку автоматического обновления — без долгого погружения в инфраструктуру. 🧑💻 Для кого: дата-инженеры, аналитики, архитекторы данных. 📅 Когда: 16 июля 11:00 мск. 📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.
ETL в облаке: от хаоса к управляемым процессам Покажем, как выстроить надежную ETL-платформу в облаке на базе Evolution Data Platform. Разберем интеграцию разрозненных источников, управление метаданными и оркестрацию — и покажем всё это в live-демо: от извлечения данных до готовой витрины. 🧑💻 Для кого: дата-инженеры, DevOps, руководители дата-команд. 📅 Когда: 23 июля 11:00 мск. 📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.
Evolution Managed BI: все возможности BI-сервиса в облаке Разберем, как получить максимум от Evolution Managed BI: подключить источники данных, настроить интерактивные дашборды, кеширование запросов и автоматические алерты. Покажем продвинутые возможности сервиса — от виртуальных датасетов до управления доступом. 🧑💻 Для кого: аналитики, BI-разработчики, руководители дата-отделов. 📅 Когда: 30 июля 11:00 мск. 📍 Где: Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам.
Совпадает ли ваш идеальный работодатель с реальностью?
Вы листаете вакансии. На что обращаете внимание в первую очередь — на продукт компании, ценности команды или на возможность профессионального роста?
Хабр и ЭКОПСИ ежегодно задают этот вопрос десяткам тысяч айтишников по всей России. В исследовании 2025 года участвовали 30 000 специалистов, и их ответы оказались неожиданными: впервые за 6 лет в топ вышла стабильность. На фоне масштабных сокращений и заморозки зарплат по рынку люди хотят не только интересных задач, но и уверенности в завтрашнем дне.
Не можем не похвастаться, что итогам рейтинга Cloud.ru вошел в топ-25 лучших ИТ-работодателей России. И раз уж мы снова участвуем в исследовании 2026 года — расскажите, что важно вам прямо сейчас:
Как Форк ИТ обучил ИИ‑систему контроля качества горной добычи
🏭 Что за компания Форк ИТ — российская команда разработчиков, которая специализируется на цифровой трансформации промышленности. Компания запускает проекты по автоматизации контроля качества, прогнозированию нагрузок и оптимизации производственных процессов с использованием машинного обучения.
⚡ Задача Крупному горнодобывающему предприятию была нужна ИИ‑система, которая оценивает качество сырья и заранее замечает аномалии в технологическом процессе, снижая риск брака и остановок. Требовалось быстро обучить модели на больших массивах данных и запустить их в работу без остановки действующих ИТ‑систем и без закупки собственной GPU‑инфраструктуры. При этом требовалось обеспечить высокий уровень безопасности данных (187-ФЗ, 152-ФЗ).
☁️ Что сделали Форк ИТ арендовал GPU‑ресурсы и воспользовался средой для разработки и обучения ИИ в облаке Cloud.ru. Важнейшим компонентом будущей системы было компьютерное зрение, способное анализировать гранулометрический состав руды, размеры кусочков сырья, структуру флотационной пены при извлечении интересующих фракций. Данные о технологических процессах загрузили в облако, настроили пайплайн подготовки и запустили серию экспериментов с ML‑моделями, гибко масштабируя мощности под каждую итерацию обучения.
🦾 Что получили в итоге Форк ИТ смог быстро протестировать гипотезы благодаря использованию GPU A100, увеличить точность прогнозов и сэкономить на капитальных расходах. Cloud.ru выступил платформой для тяжелых задач по обучению моделей и анализу больших данных. Ну а предприятие получило ИИ‑систему, которая уже успешно снижает риск брака и незапланированных остановок производства.
Узнайте, как использовать новые требования к КИИ как конкурентное преимущество
Работаете с ГИС или объектами КИИ и ищете способ выполнить регуляторные требования, не теряя в гибкости и скорости? Эксперты Cloud.ru разберут, как облачная инфраструктура закрывает вопросы защиты и при этом становится реальным инструментом развития.
На вебинаре разберем:
Актуальные изменения в требованиях к ГИС и КИИ — что важно учесть прямо сейчас.
Какие сценарии возможны с решением «Облако для КИИ» и что оно дает.
Способы применения: от защищенной инфраструктуры до ускорения цифровых сервисов.
Будет полезно инженерам инфраструктуры, руководителям ИБ-направлений, менеджерам цифровой трансформации и всем, кто планирует работать с ГИС и КИИ.
📅 Когда? 7 июля в 11:00 мск.
📍 Где? Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикеру в прямом эфире.
Все что нужно знать QA-специалистам: сводка новостей за весну и лето 2026
Наш QA-комитет держит руку на пульсе — читает отчеты, изучает кейсы и копается в обсуждениях, чтобы вы могли заниматься более важными вещами. Забирайте выжимку всего, что стоит внимания.
📊 Рынок Вышло крупное исследование Tricentis 2026 Quality Transformation Report: опросили 2 501 ИТ- и QA-руководителей из шести стран. 93% руководителей C-level уверены в своей стратегии тестирования, в то время как 30% руководителей QA и DevOps такой уверенности не испытывают. Доверие к ИИ-агентам упало с 48% до 34% за год.
Короче: скорость выхода ПО растет, но уверенность в его качестве падает из-за перегруженности инструментарием и невозможности перепроверить все за ИИ. Сейчас самое узкое место — валидация автотестов и подсчет реального покрытия, около 60% компаний выпускают непротестированный код в прод и теряют миллионы долларов.
Во многих источниках отмечают следующие тренды: shift-left подход к разработке ПО, плотная работа QA c data-специалистами и фокус на стратегии качества, а не на наращивании числа автотестов.
🔧 Интересные материалы на Хабре В блоге Росгосстраха вышел целый цикл статей про применение LLM в тестировании. Начать лучше с этой статьи — про подготовку контекста для LLM: как структурировать требования, парсить PDF из Confluence, работать с макетами и диаграммами.
ВкусВилл рассказали, как превратили Swagger из документации в двигатель API-автотестов: OpenAPI Generator генерирует Java-клиенты и модели, swagger-coverage считает реальное покрытие по контракту, а LLM-скиллы по JSON-отчету сами предлагают, какие тесты дописать.
В Telegram-сообществах в последнее время гремит Playwright как наиболее перспективный фреймворк для автоматизации. Вот тут один автор решил проверить, не маркетинг ли это: собрал все свежие бенчмарки Playwright vs Selenium vs Cypress vs WebdriverIO, сравнил методологию и выяснил, что большинство цифр просто несопоставимы. Вывод: единственный процент, которому можно доверять — тот, что вы сами намерили на своем проекте.
🤖Про агентов СВОЙ Тех описали свою архитектуру ИИ-агентов в автоматизации. Там сложный 12-актовый воркфлоу, но и результат интересный: агент анализирует собственные ошибки и обновляет конфигурацию. Можно взять как шаблон для построения агентного фреймворка.
Вот тут автор описывает, как собрал систему из 11 узкоспециализированных ИИ-скиллов, которая по Jira-ссылке сама генерирует тест-кейсы, пишет автотесты, загружает их в Zephyr и создает merge request. Можно адаптировать под свой стек.
💼 Для карьеры ISTQB выпустила обновленную версию сертификации Certified Tester AI Testing (CT‑AI) v2.0, что де-факто означает появление общепризнанного стандарта использования ИИ в тестировании и тестирования самих ИИ-систем. Кому актуально, можно получить сертификат и использовать его как аргумент в переговорах с HR.
ГОСТ Р 56939-2024 на практике: что мы сделали, чтобы получить сертификат РБПО
🔎 Контекст У Cloud.ru есть платформа, созданная специально для заказчиков, которые обязаны соблюдать особые требования к хранению данных и разработке ПО. Вся инфраструктура, которую они используют, должна быть аттестована на соответствие стандартам безопасности, а платформенные сервисы должны пройти жесткую проверку у регуляторов. Ранее платформа уже получала сертификат ФСТЭК России №4979, но при внесении определенной массы изменений в продукт, процесс требуется пройти заново, а сделать это невозможно без привлечения сторонней лаборатории и многомесячных ожиданий. Чтобы иметь возможность развивать продукт более оперативно, требовалось сертифицировать не только платформу для создания частного, гибридного или распределенного облака Cloud.ru Evolution Stack, но и все процессы вокруг нее, т.е. подтвердить соответствие ГОСТу Р 56939-2024.
🚀 Задача Стандарт требует выстроить25 взаимосвязанных регламентов и поддерживать более 200 артефактов в актуальном состоянии постоянно. Но этого мало: ведь стандарт есть, но конкретной методологии его реализации не существует, нужно было приземлить элементы процесса на орг.структуру нашей компании. Осложнялось всё тем, что в любой крупной ИТ-компании команды непрерывно перетасовываются, ответственные меняются, а любое кадровое изменение должно быть тут же отражено во всей документации сразу.
Аудиторы во время сертификации проверяют всё: опрашивают разработчиков, смотрят трекер задач, оценивают стек применяемых технологий, сверяют, соответствуют ли реальные процессы тому, что закреплено «на бумаге». Соответственно, ситуации, когда документация устаревает быстрее, чем обновляется, а новые исполнители не успевают вникнуть в свои обязанности, нужно было истребить полностью.
☁️ Что мы сделали Применили существующую в компании BPM-систему как единый источник правды: описали в ней ключевые процессы РБПО, зафиксировали роли, связали их с командами через орг.структуру, разместили все артефакты, точки контроля и указали их взаимосвязи. Следующим этапом автоматизировали конвертацию и публикацию свежих документов: по расписанию из BPM-модели экспортируется HTML, который автоматически конвертируется в Markdown и публикуется во внутреннюю Wiki. Изменился владелец роли — один раз вносишь правки в BPM, все документы актуализируются и тут же становятся доступны всем и каждому. Чтобы новички не впадали в ступор от количества регламентов, поверх Wiki добавили ассистента с RAG под капотом. Можно написать в корпоративный чат любой вопрос и получить структурированную информацию о том, кто за что отвечает и как действовать в любой ситуации, причем сразу со ссылками на конкретный документ в базе знаний.
🦾 Что получили в итоге В компании появилась полная живая и взаимосвязанная база элементов, включающая организационные единицы, роли, артефакты и инструкции по процессам. То есть на аудите мы показываем не просто набор Word'овских файлов, а живую модель с автоматически собранными артефактами. Каждый сотрудник, причастный к процессу безопасной разработки ПО, четко знает, что в какой ситуации делать и уверен в том, что данные не устарели. ИИ-ассистент сокращает время погружения в регламенты и процессы с дней до пары десятков минут, что значительно упрощает онбординг при смене роли.
Также такой подход позволил снизить затраты на устранение уязвимостей, поскольку их выявление предусмотрено на самых ранних стадиях процесса. Мы получили подтверждение качества платформы и стали первым облачным провайдером в России с сертификатом РБПО. У нас появилось больше контроля над собственным релизным циклом и теперь мы можем планировать обновления на годы вперед.
В июне вас ждут еще три онлайн-встречи с экспертами Cloud.ru — о Spark, облачных расходах и Redis. Регистрируйтесь заранее, чтобы ничего не пропустить.
🎥Spark Connect для ИТ-команд: упрощаем разработку и работу с данными
Покажем, как сделать использование Apache Spark удобным для всей команды с помощью Spark Connect и Evolution Managed Spark. Затронем вопросы разработки в IDE, анализа данных в Jupyter и построения ETL на чистом SQL в dbt. Не бойтесь споткнуться о порог входа — здесь он минимальный.
🧑💻 Для кого: дата-инженеры, аналитики, руководители дата-отделов.
🎥Как управлять расходами в облаке и не удивляться счетам
Разберем, как сделать облачные расходы прозрачными с помощью FinOps-инструментов. Вы узнаете, почему важно назначать владельцев ресурсов, как правильно выбирать тариф, выставлять автоматические квоты и настраивать алерты, чтобы сократить затраты на 20–30%. Всё — с живым демо в личном кабинете.
🧑💻 Для кого: ИТ-менеджеры, DevOps, финансовые директора.
🎥Эволюция приложения в облаке: как настроить кеш с Redis и ничего не сломать
Четвертый вебинар большого трека про эволюцию приложений. Обсудим стратегии кеширования и какую из них выбрать под ваш сценарий, типичные ошибки инвалидации и защиту от всплесков нагрузки. Разберем, как оценивать эффективность кеша и ситуации, когда он только маскирует проблемы.
🧑💻 Для кого: бэкенд-разработчики, DevOps-инженеры, архитекторы.
Evolution Managed RAG — теперь источники для базы знаний сканируются глубже: при добавлении нового источника автоматически обходятся все директории сервиса. Больше никаких «а вот этот раздел мы не проиндексировали»: охват данных стал полным, и на качестве ответов LLM это будет заметно.
Evolution AI Agents — в сервисе обновили дизайн интерфейсов для инструмента EvoClaw. Меньше визуального шума, можно быстрее сориентироваться в конфигурации агента.
☁️ Cloud.ru Evolution — новые возможности в различных сервисах
Evolution Load Balancer — во вторую версию добавили балансировку трафика на виртуальные IP. В связке с поддержкой Proxy Protocol v2, которая добавилась в апреле, бэкенды теперь видят все, что нужно видеть.
Evolution Managed ClickHouse — реализовали поддержку версии 25.8. Если аналитические запросы у вас исчисляются миллиардами строк, то это обновление будет как нельзя кстати.
Evolution Managed Kubernetes — сразу несколько точечных, но важных улучшений в сервисе:
Недоступные при создании ресурсы скрываем сразу — вместо ошибки при деплое вы видите рабочие альтернативы.
Добавлены плагины: Agent Sandbox — для изолированного запуска ИИ-агентов, и Reloader — для автоматического перезапуска рабочих нагрузок при обновлении конфигураций и секретов.
Теперь поддерживается Kubernetes 1.35.
Evolution Managed OpenSearch — добавили возможность настроить окно обслуживания для технических работ. Теперь вы сами задаете время, когда кластер может быть недоступен, и техобслуживание не застанет врасплох.
Evolution Data Platform — платформа получила сразу несколько важных обновлений: Control Plane мигрировал в мультизональный кластер, появилась ручная остановка и возобновление инстансов для экономии ресурсов, обновлена система уведомлений по событиям и авариям, добавлены индикаторы статусов кластеров.
Evolution Artifact Registry — Terraform 2.0.2: теперь реестры разворачиваются через IaC.
💰 Оплата и контроль затрат
Три точечных улучшения для борьбы с типичными неудобствами: проверка пересечений бюджетов, редактирование или полное удаление лимитов, которые больше неактуальны.
🏢 Cloud.ru Advanced и Облако VMware
Cloud.ru Advanced — Terraform-провайдер обновлен до 1.79.0 с расширенным набором Data Sources и ресурсов для Direct Connect (DC).
Облако VMware — в VDI появилась веб-консоль мастер-образа прямо в личном кабинете: ставите ПО один раз — все ВМ на его базе наследуют настройки автоматически. Балансировщик ALB стал доступен на площадке PD50-02 и остается бесплатным. В вЦОД с GPU добавлены хосты на платформе HGX с ускорителями A100-80 SXM на площадках PD30-01 и PD50-01.
📊Практический гайд для тех, у кого данные есть, а толку мало
Дашборды, модели и данные есть, но все это живет в разных системах, не дружит друг с другом и весьма туманно отвечает на вопросы бизнеса?
Как раз для тех, у кого не клеится польза с реализацией, мы собрали практический гайд «Платформа данных и ИИ». Там прописана вся цепочка «бизнес-задача → метрики → архитектура». Берите на следующую встречу с CTO или CDO, когда речь снова зайдет про платформу данных и нужно будет показать, что это не «очередная хранилка».
📽️Вебинары
Выложили записи прошедших вебинаров, самое время наверстать, если пропустили:
Рассказали про кейс провайдером сервисов для мобильного аудита Retailiqa. Читайте, если вам актуально «поженить» 152-ФЗ с одинаковой доступностью сервисов из России и из-за рубежа.
Подборка материалов, которые помогут снизить стоимость, стабилизировать прод и перестать гадать с ресурсами
Среди читателей Хабра много ML‑инженеров, дата‑сайентистов и дата‑инженеров — и мы, как команда провайдера облачных и ИИ-сервисов, догадываемся, где у вас чаще всего болит. Ниже подборка материалов, которые помогут в решении задач: чуть ускорить, чуть удешевить, чуть упростить жизнь в проде.
👨💻 ML/DS‑инженеры и бэкенд
Боль №1
Суть: вы крутите LLM в проде, токены стоят денег, контекст забивается громоздким JSON, а латентность растет. Что делать: прочитать статью — как практическое руководство по переходу с JSON на компактный TOON‑формат для структурированных ответов. Почему: в ряде кейсов можно сэкономить до ~40% токенов, но есть нюансы. Формат лучше работает при небольшой вложенности (3–4 уровня) и однородных массивах. Для плоских данных чаще выгоднее CSV. Плюс потребуется свой парсер/SDK — это усложняет дебаг и интеграцию.
Боль№2
Суть: нужно обогатить поисковую выдачу или интерфейс LLM‑функциональностью, но непонятно, как выдержать нагрузку и не превратить кластер в черную дыру для бюджета. Что делать: взять на вооружение материал от Avito Tech — эдакий «рентген» продакшен‑архитектуры с LLM/мультимоделями под серьезной нагрузкой. Почему: хороший слепок боевой системы с vLLM и LoRA, организацией GPU‑кластера, схемой запросов и мониторинга качества. Учитывая масштабы, команду и бюджеты Avito, «копировать-вставить» вряд ли получится, но по крайней мере есть опорная схема, как декомпозировать сервисы, и на какие метрики смотреть при проектировании.
👨💻 Data Science, MLOps, DevOps
Боль №3
Суть: модели живут в «ручных» скриптах, развертывание нестабильно, автоскейлинг либо отсутствует, либо работает хаотично. Не всегда получается договориться с коллегами о процессе вывода из ноутбуков в прод, который бы всех устроил. Что делать: читать нашу статью, где разбирается жизненный цикл ML‑модели в Kubernetes. Почему: показана связка контейнеризации, CI/CD и деплоя с учетом ML‑нагрузок. Это не универсальный рецепт (пример завязан на инфраструктуру Cloud.ru), но помогает синхронизировать ожидания между DS и MLOps, чтобы было от чего оттолкнуться.
👨💻 ML‑инженеры и исследователи
Боль №4
Суть: эксперименты падают из-за CUDA out-of-memory, приходится наугад крутить размер батча, длину контекста и конфигурацию кластера. Каждый запуск — лотерея и потерянные GPU‑часы. Что делать: читать перевод зарубежной статьи с разбором оценки потребления памяти на примере GRPO. Почему: объясняет, из чего складывается потребление памяти и как прикинуть конфигурацию до запуска. Это не калькулятор «до байта», поскольку значения зависят от стека, наличия обучения со смешанной точностью или распределенного обучения, — но как ориентир экономит время и нервы.
Суть: никаких «красивых» датасетов: данные разнородные — таблицы, тексты, временные ряды, сигналы. Поддерживать зоопарк моделей дорого, а терять качество нельзя. Что делать: читать свежие работы про TabPFN — первуюи вторую. Почему: обе работы показывают, что вокруг TabPFN можно выстроить единое табличное ядро. С одной стороны — подключать текст через адаптеры, не теряя информацию на грубом PCA. С другой — переводить в таблицу разнородные временные ряды и решать на одном ядре разнородные задачи. Может быть удобно, когда данных немного и не хочется поддерживать много отдельных моделей. При этом придется аккуратно проектировать фичи и контекст, а адаптеры обучать под свой домен, но это все равно дешевле и проще, чем полное переобучение.
Пишите в комментариях, где еще болит. В следующий заход попробуем принести что-то точечно под ваши задачи.
Как RETAILIQA совместила 152‑ФЗ, SLA для иностранцев и задел под новые ИИ‑сценарии
👨💻 Что за компания RETAILIQA (бренд компании ООО «Крона Лабс») с 2014 года развивает сервисы мобильного аудита: электронные чек-листы для контроля качества, мониторинга цен конкурентов и оценки лояльности клиентов (NPS). Решения компании используют крупные федеральные и региональные игроки в ритейле, общепите, телекоме, банках, страховании, управлении недвижимостью, промышленности, логистике и других отраслях.
🚀 Задача На фоне роста клиентской базы и объема собираемых данных команда столкнулась с несколькими ограничениями: прежний провайдер не мог масштабировать хранилище и вычислительные ресурсы, усилились требования федеральных заказчиков к безопасности и хранению чувствительных данных в российском ЦОД, у зарубежных клиентов возникали проблемы с доступностью сервисов. Параллельно RETAILIQA готовилась внедрять ИИ-модели для распознавания полок и ценников, что требовало гибкой и отказоустойчивой облачной инфраструктуры.
☁️ Что сделали В 2024 году всю инфраструктуру перенесли в облако VMware на платформе Cloud.ru, закрыв потребность в ресурсах и отказоустойчивости без простоя для клиентов. Для хранения терабайтов данных подключили S3-совместимое хранилище Evolution Object Storage и перешли на модель pay-as-you-go — оплачивают только фактическое потребление без необходимости «держать запас» на стороне. Для защиты и соответствия требованиям безопасности добавили StormWall: Anti-DDoS и сервис резервного копирования виртуальных машин VMware, обеспечив дополнительный уровень защиты от атак и потери данных.
🦾 Что получили в итоге RETAILIQA сняла ресурсный потолок: теперь можно без ограничений подключать федеральных и региональных клиентов с тысячами объектов контроля и десятками тысяч пользователей. Доступность сервисов достигла 99,98%, а надежное хранение фото- и видеоматериалов в сертифицированных российских ЦОД укрепило доверие крупных заказчиков и регуляторно-чувствительных отраслей. Например, крупная аптечная сеть с более чем 2 000 точек ежедневно отправляет «тяжлые» фотоотчеты по строжайшим стандартам мерчендайзинга — инфраструктура провайдера справляется с таким потоком без деградации.
В планах — внедрение сервисов AI Factory для анализа фотографий и распознавания информации на ценниках. Это позволит автоматически проверять, соответствует ли выкладка товара в торговых залах утвержденным схемам (планограммам), а также ускорит подготовку отчетов и позволит гибко масштабировать ресурсы под новые сценарии с применением ИИ, не перестраивая всю архитектуру с нуля.
Свой ML-завод: что дает собственная ML-платформа и как ее запустить
Большинство корпоративных ИИ-пилотов не дают измеримых результатов. Не из-за моделей, из-за инфраструктурного хаоса вокруг них.
Специалисты тратят время на подготовку данных и настройку окружения вместо экспериментов. Стек собирается из разрозненных инструментов, интеграция съедает месяцы, видеокарты простаивают и сжигают бюджет. А поверх всего — ужесточение требований к субъектам КИИ и приближающиеся сроки перехода на отечественное ПО.
На вебинаре разберем, как выстроить нормальный процесс разработки ИИ — от загрузки данных до обучения моделей на кластере видеокарт. Покажем, как платформа Evolution Stack.ML от Cloud.ru превращает этот хаос в работающий ML-завод: готовые сервисы убирают месяцы интеграций, единое управление наводит порядок в инфраструктуре, а развертывание внутри контура закрывает требования регуляторов.
Будет полезно специалистам по данным и ML-инженерам, руководителям команд, ИТ-архитекторам, DevOps-инженерам, специалистам по ИБ, техническим и ИТ-директорам.
Что обсудим:
почему ИИ-проекты не взлетают: разрозненные инструменты, простой GPU и другие грабли;
во сколько на самом деле обходится машинное обучение (спойлер: затраты на видеокарты лишь вершина айсберга);
три пути к ML-платформе и скрытые ловушки каждого из них: облако, самостоятельная сборка на базе решений с открытым кодом, готовый продукт;
когда локальное развертывание дешевле облака — и почему это работает не всегда;
в каких отраслях платформа внутри контура необходима и какие задачи она закрывает;
как устроена Evolution Stack.ML и зачем нужны рабочие пространства.
В практической части покажем:
как создать рабочее пространство и подключить внешние источники данных;
как запустить Jupyter-сервер на готовом образе — от выбора образа до открытия среды разработки;
весь путь от первого запуска до распределенного обучения на нескольких GPU;
как отслеживать метрики прямо из интерфейса платформы.
📅 2 июня в 11:00 мск 📍 Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикеру в прямом эфире.
В разговорах с крупными российскими компаниями часто упираемся в задачи, которые не тянут публичные облака. Это и заставило нас сменить оптику и посмотреть в сторону гибрида. Собрали для вас шесть типовых сценариев, где бизнесу нужно гибридное облако.
1️⃣ Disaster recovery и георезервирование 💥
Что это: основная инфраструктура работает в локальном ЦОД или частном облаке, а резервная площадка и бэкапы — в публичном. Если случается авария, трафик и нагрузки в штатном режиме переключаются в облако.
не нужно строить и содержать полноценный дата‑центр;
план восстановления можно регулярно тестировать без остановки основного контура.
2️⃣ Пограничные вычисления (edge computing) 🛰️
Что это: приложения и виртуальные машины частично работают в пограничной среде — в филиалах, магазинах, на заводах. А центральный ЦОД или облако отвечает за хранение, аналитику и централизованное управление.
не нужно покупать железо, а потом обслуживать простой;
ресурсы в облаке включаются только тогда, когда они нужны;
бизнес переживает пиковую нагрузку без просадок по скорости и повышения CAPEX.
4️⃣ Разработка и CI/CD в облаке 🧪
Что это: разработка и тестирование происходит в публичном облаке, а деплой остается в частном контуре.
Кому подойдет: крупные компании с ограниченными ресурсами и несколькими командами разработки — финансы, промышленность, сервисный бизнес.
Бизнес-выгода:
тестовые среды поднимают и останавливают по запросу;
подрядчикам не нужен прямой доступ внутрь периметра;
релизы выходят быстрее, а критичные данные остаются в частном контуре.
5️⃣ Защита критичных данных и систем 🔐
Что это: чувствительные системы и данные (ERP, финансовые приложения, базы с персональными данными) работают в частном контуре, а менее критичные сервисы живут в публичном облаке.
Кому подойдет: банки, страховые компании, телеком, госсектор, промышленность с жесткими требованиями регуляторов.
Бизнес-выгода:
компания соблюдает требования по безопасности и локализации данных;
снижается риск утечек, штрафов и репутационных потерь;
публичное облако работает там, где это безопасно и экономически оправдано.
6️⃣ ИИ и ML с данными on‑premise 🤖
Что это: сырые и чувствительные данные хранятся и обрабатываются локально, а обучение моделей и часть инференса выносятся в публичное облако.
не нужно строить дорогой GPU‑кластер под нерегулярные нагрузки;
можно быстро запускать и останавливать ML-эксперименты;
чувствительные данные остаются в защищенном контуре, а облако используется для увеличения вычислительных мощностей.
🟩 Наши новые партнерства с компаниями «Полипластик», «Ренессанс страхование», «Технодинамика», «АФЛТ-Системс», «LADA Цифра» и «МТ-Интеграция», которые мы заключили на ЦИПР‑2026, как раз про такие сценарии: компании из промышленности, автоиндустрии и аэрокосмической отрасли хотят запускать ИИ‑продукты, масштабироваться под пиковую нагрузку и при этом не выносить критичные данные из своих контуров.
Для этих задач мы развиваем гибридную архитектуру Cloud.ru Evolution Stack — как основу для проектов, где публичное облако и собственная инфраструктура работают вместе, на одной кодовой базе.
Больше про гибридное облако можно почитать в нашем исследовании: про развитие гибрида в России, на Западе и в Азии. 🧠
Приходите на вебинар — покажем, как выстроить резервное копирование, которому можно доверять
Бэкап есть почти у всех. Но одно дело — хранить копии, другое — быть уверенным, что при сбое инфраструктура поднимется в нужные сроки и без потерь. Как перейти от «копии существуют» к «восстановление работает»?
Разберем это на совместном вебинаре с экспертами Cloud.ru и оператором ИТ-решений ОБИТ. Будет полезно ИТ-директорам, директорам по ИБ, системным архитекторам, инженерам и администраторам — всем, кто отвечает за сохранность данных в облаке.
Что расскажем и покажем:
какие практики резервного копирования актуальны сейчас и в чем их различия;
почему классическая стратегия 3-2-1 на практике может не выполнять свою функцию;
почему сторонний бэкап становится стандартом, а не опцией;
как опыт интегратора влияет на результат — и что меняется, когда интегратор и вендор работают в связке;
реальные кейсы: что именно это дает бизнесу.
В практической части пройдемся по интерфейсу SaaS-решения Cloud.ru. В прямом эфире покажем процесс восстановления машины из резервной копии через агента и разберем, как встроить решение в существующую инфраструктуру без глобальных переделок.
📅 Когда? 26 мая в 11:00 мск.
📍 Где? Онлайн. Зарегистрируйтесь, чтобы задать вопросы спикерам в прямом эфире.
Гибрид нужен бизнесу: он помогает держать критичные данные локально, но при этом пользоваться всеми плюсами публичного облака.
Но как именно будет расти этот рынок, если крупный бизнес думает про безопасность, средний — про бюджет, стартапы — про скорость?
Рассмотрим четыре возможных тенденции.
1️⃣ Тенденция 1: рост через ИИ/ML и дефицит железа
GPU дорогие, быстро устаревают и тяжело отбиваются. Обучение моделей и тяжелые расчеты — кратковременная, но очень серьезная нагрузка.
Логика для компаний проста: критичные данные и системы остаются on‑premise или в приватном облаке, а обучение и часть инференса перемещаются в публичное облако.
❗Но развиваться эта тенденция будет не рывком, а постепенно — по мере того как компании наберут практический опыт, начнут больше доверять отечественным провайдерам и снимут внутренние барьеры: технологические и культурные.
От этого подхода в первую очередь выигрывают средние и крупные компании: финтех, e‑commerce, медиа и продуктовый ИТ.
2️⃣ Тенденция 2: стагнация из-за регуляторики
Если регуляторы продолжат ужесточать требования, список данных, которые нельзя выносить из своего ЦОД, будет только расти.
В этом сценарии крупные компании и госсектор вкладываются в собственные дата-центры и частные облака. Публичное облако используют по остаточному принципу — 20–30% от нагрузки, в основном для тестов и вспомогательных сервисов.
Для тяжелых отраслей (банки, госсектор, здравоохранение) модель почти не меняется: основной фокус по‑прежнему на своих ЦОД и приватных облаках, а публичные остаются вспомогательными.
❗А вот менее зарегулированных ужесточение правил подталкивает к гибриду — полностью в публичное облако нельзя, полностью делать on‑premise слишком дорого. В итоге гибрид из опции превращается в базовый вектор, и спрос на него будет только расти.
3️⃣ Тенденция 3: разделение по размерам и отраслям
У этой тенденции есть три вектора развития: они зависят от размера и отрасли и компании.
🏦 Крупные корпорации и госсектор держат максимум мощностей на своем железе и в частных облаках. Гибрид для них — это связка нескольких приватных площадок плюс небольшой процент публичного облака для некритичных задач.
🏢 Средний и крупный бизнес с запросом на развитие строят классический гибрид: критичное и регулируемое — в своем контуре, остальное — в облаке, чтобы ускориться и сэкономить.
🏪 Малый бизнес и стартапы без жесткой регуляторики идут в полностью публичное облако. Владеть железом им невыгодно, поэтому архитектура сразу проектируется облачной.
❗И хоть в случае со средним бизнесом гибрид пока упирается в стоимость и сложность, в перспективе именно этот сегмент может стать главным потребителем гибридного облака как сервиса.
😮 Отдельное исключение: специализированный гибрид под ИИ/ML
Даже сильно регулируемые игроки будут выносить в облако тяжелые вычислительные задачи — обучение и часть инференса. При этом данные и ключевые системы будут хранится on-premise.
Все описанные тенденции мы не выдумали — это выводы из нашего большого исследования. Мы провели 17 глубинных интервью и узнали, как российские компании проектируют гибридные облака и почему делают их основой ИТ-инфраструктуры.