Обновить

Администрирование

Сначала показывать
Порог рейтинга
Уровень сложности

С нуля до Junior DevOps в 2026 году. Часть 6.2. Terraform в облаке. Работа в команде

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели12K

До этого момента мы изучали Terraform локально. Теперь пришло время применить эти знания в реальной среде.

В этой статье мы подключим Terraform к облачному провайдеру, создадим первую инфраструктуру, разберём процесс создания сети и виртуальной машины, а также сравним особенности AWS, Microsoft Azure, Google Cloud Platform (GCP) и Yandex Cloud. Несмотря на различия между облачными платформами, вы увидите, что принцип работы Terraform остаётся практически одинаковым.

Читать далее

Расширяем границы ArgoCD: Использование Helmfile и Helmwave

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели12K

Хочу поделится с более конкретным примером и подробным описанием настройки плагинов для ArgoCD чем это описано в их офф документации.

Читать далее

Фильтрация ТСПУ у серверов Таймвеб Cloud: диагностика, обход через reverse-proxy и СDN

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели34K

Два коммерческих сайта на WordPress, оба на одном VPS. Клиенты в одном городе, я сам в другом.

Начало июня. Клиенты жалуются, что сайт не открывается без VPN.

Мало ли, подумал я — ограничения, белые списки и т.д.

Потом сайт перестал открываться у меня. По проводу. Дома.

Три дня был потный танец с бубном:

Читать далее

Как отправлять письма, чтобы не улетать в спам: DKIM-подпись, прогрев IP и DNS-грабли

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели8.9K

Транзакционные письма — подтверждения регистрации, сброс пароля, чеки — кажутся простейшей задачей: подключил SMTP, вызвал send(), готово. Ровно до момента, когда письма начинают тихо улетать в спам Mail.ru и Яндекса, а ты не понимаешь почему: код не менялся, ошибок нет, письма «отправлены».

Дело почти никогда не в коде отправки. Дело в трёх DNS-записях, репутации IP-адреса и криптоподписи, которую надо собрать руками правильно.

Я строю свой сервис транзакционной почты и разобрал всю эту машинерию до винтика. В статье:

— DKIM своими руками: генерация ключа, каноникализация relaxed по RFC 6376, почему порядок подписываемых заголовков важен и где чаще всего ломается подпись; — три DNS-записи (SPF, DKIM, DMARC), которые решают всё, и что каждая делает; — прогрев IP: почему нельзя слать 50 тысяч писем с нового адреса, лестница лимитов 50 → 500 → 5000 → 50000 и пороги репутации; — suppression-лист и DMARC-отчёты как единственное зеркало вашего домена.

И кульминация — реальная грабля, на которой я обжёгся: две абсолютно правильные SPF-записи на одном домене, каждая валидна по отдельности, а вместе ломают доставляемость всего домена в ноль. Разбираю, почему так происходит и как чинится.

Честно про статус: сервис в открытой бете, движок построен, а реальную статистику доставляемости наберём на первых отправках — прогрев по определению требует недель живого трафика. Поэтому статья про архитектуру и грабли, а не про достигнутые проценты.

Читать далее

Как я развернул Yandex Cloud Stackland на bare metal

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели8.3K

Привет! Я Даниил, DevOps-инженер в KTS.

Недавно я поработал со Stackland. Концепция облачноподобной платформы с кучей коробочных сервисов на своем железе в закрытом контуре давно была любопытна нам (и нашим заказчикам), так что пройти мимо готового решения от Яндекса было бы преступлением. По горячим следам я решил написать эту статью, чтобы поделиться опытом развертывания Stackland на голом железе. Так что ниже вас ждет скорее не обзор, а туториал.

Коротко о том, как это было: сначала я подготовил L2-сеть, бастион с NAT, DNS и NTP, три сервера, образ Stackland и YAML-конфиги. Затем запустил sladm install и через час получил консоль, готовый мониторинг с визуализацией в Grafana и возможность по кнопке в UI поднять managed PostgreSQL, Kafka, ClickHouse и другие сервисы.

Подробнее о том, как это было, рассказываю ниже.

Читать далее

# От firing до postmortem: рабочее место дежурного поверх Grafana и Mattermost

Время на прочтение12 мин
Охват и читатели7.2K

Grafana показывала, что горит, Mattermost доставлял уведомления, но после смены дежурного приходилось заново выяснять, кто занимается проблемой и когда ждать результат. Рассказываю, как мы собрали поверх них рабочее место с владельцами, ETA, общей историей, группировкой каскадных алертов, инцидентами и postmortem — без отдельной базы данных и без передачи управления состоянием LLM.

Читать далее

Monq 9.2: как перестать тонуть в миллионах порогов и начать ими управлять

Время на прочтение17 мин
Охват и читатели7.2K

10 июля мы выпустили Monq 9.2.0. Если описать релиз одной фразой: пороги получили собственное рабочее пространство, научились учитывать расписание, автоматически находить свою КЕ в CMDB и хранить прогноз собственного состояния. Для работы на больших объёмах хранение порогов перенесено из PostgreSQL в ClickHouse, а связанный конвейер сервисов переработан.

Перед вами обзор обновления отечественной observability платформы зонтичного мониторинга от вендора. Тут не будет обещаний «предсказать любую аварию» и общих слов про AIOps. Разберём точную механику, новые фичи, работу дежурной смены, нюансы обновления и честную границу между тем, что уже работает в 9.2, и адаптивными порогами, которые появятся в 9.3.

В целом статья будет о том, как превратить миллионы состояний в понятную работу дежурной смены, автоматизировать типовые реакции и реже отвлекать владельцев сервисов.

Читать далее

Может ли Kubernetes выдержать миллион узлов? Эксперимент, графики, выводы

Уровень сложностиСложный
Время на прочтение39 мин
Охват и читатели8.5K

Часто первое, что хочется сделать при неполадках в кластере, — уменьшить его и надеяться, что всё решится само. Получается, большой кластер = куча проблем?

Автор статьи решил зайти максимально далеко: поднять Kubernetes-кластер с миллионом узлов и посмотреть, что будет.

Спойлер: получился вовсе не выстрел в ногу, а серьёзный эксперимент — много подготовки, обход ограничений, графики производительности и, конечно, ценные выводы. И даже инструкция в конце для желающих повторить.

Читать далее

Оффбординг на автомате: почему «уволен» — слишком поздний сигнал, а «удалить» — шаг, который уже не отыграть

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.6K

Сценарий увольнения рисуется за пять минут: согласование, резервная копия, вебхук, удаление пользователя. Разбираю, почему такой граф нельзя запускать по событию облачного офиса, чем гейтинг и зависимость по данным надёжнее нарисованного порядка стрелок и что должно происходить, когда выполнение обрывается между копией и удалением. Плюс про идемпотентность необратимых узлов, одноразовую ссылку согласования и разницу между блокировкой и отзывом токенов.

К разбору

IaC в гибридной IT-инфраструктуре: решаем проблемы разрозненного управления с Terraform

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели11K

Рано или поздно большинство зрелых проектов приходят к необходимости использовать как виртуальные машины, так и выделенные серверы. Это логично, поскольку под разные задачи требуются разные вычислительные ресурсы. Однако затем возникает проблема управления физическим оборудованием.

В этой статье подробно разберем концепцию, которая позволяет взаимодействовать с выделенными серверами так же легко, как с облачными. На практическом примере развернем гибридную инфраструктуру в разных дата-центрах исключительно средствами Terraform. Объединим разрозненные хосты в общую приватную сеть.

Привет! На связи Сергей, системный администратор в Selectel. Надеюсь, этот обзор будет полезен системным администраторам, DevOps-инженерам, архитекторам и всем, кто хочет избавиться от путаницы в процессах и управлять пулом гибридных вычислительных ресурсов через один инструмент.

Читать далее →

Последние из серверной: почему эпоха трушных сисадминов заканчивается (или только начинается)

Время на прочтение6 мин
Охват и читатели32K

Всегда считал системных администраторов здоровой профессией. Нормальные мужики, которые ругались матом и знали жизнь. Почти всю работу выполняли вручную, даже серверы иногда собирали из комплектующих. Да, получали меньше разрабов, но и преимущества в работе у них были: сразу видеть результат своих действий — приятно и полезно для психики. «Вижу проблему — ребутаю сервак», как говорится.

Но потом всё изменилось. Сначала пришли облака с докерами и кубернетесом. Так появились девопсы. Профессия стала меняться. Следом в продвинутых компаниях появились корпадмины — вроде менеджеров, но с техническим уклоном.

В итоге значительную часть работы теперь можно выполнять вообще на удалёнке!

Читать далее

Hermes оказался для меня игрушкой

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели13K

Я сжёг на Hermes около 500 миллионов токенов. Это примерно $1000 при оплате моделей без подписок. Я дал агенту доступ к своей домашней лаборатории. Он написал несколько полезных скриптов. Настроил GPU passthrough и транскрибацию, но заодно ломал собственный gateway, ронял Caddy и регулярно игнорировал явно прописанные скиллы.

Это разбор реальной эксплуатации. Hermes иногда экономил мне время. Но слишком часто он проигрывал обычным скриптам и n8n. После полумиллиарда токенов Hermes оказался для меня дорогой игрушкой, а не рабочим инструментом.

Посмотреть, где Hermes сломался

Мы поставили ITAM за три недели. А работать он начал через полгода

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.3K

Система блестит, дашборды красивые, а спросишь её что попроще — врёт. Потому что залили мёртвые данные и сократили углы на справочниках.

Рассказываю, как внедрял, где обжигался и что делаю теперь, чтоб не повторялось.

Читать далее

Ближайшие события

Снапшот — это не бэкап, а бэкап — это не гарантия

Время на прочтение12 мин
Охват и читатели11K

Что на самом деле защищает наши данные? Снапшоты, которые создаются за секунды и позволяют мгновенно откатиться к предыдущему состоянию? Регулярные резервные копии, которые хранятся на отдельном хранилище? Или репликация, которая обеспечивает непрерывность работы даже при сбое площадки?

Каждая из этих технологий решает свою задачу. Но бывает и такое, что снапшоты используют как бэкапы, бэкапы хранят вместе с основными данными, а репликацию считают полноценной заменой резервному копированию. 

В этой статье расскажем, почему снапшот — это вообще не бэкап, почему репликация не заменяет резервное копирование, какие требования предъявляются к современной системе защиты данных, и покажем, как эти принципы реализованы в связке VMmanager и RuBackup.

Читать далее

Заменили ноду в кластере RabbitMQ — и через месяц потеряли регион OpenStack

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.3K

Короткая история про то, как штатная замена ноды оставила quorum-очереди с двумя членами вместо трёх, и почему cluster_status этого не показывает.

Стенд: OpenStack Caracal (2024.1), развёрнут kolla-ansible. RabbitMQ — кластер из трёх нод, quorum-очереди.

Читать далее

Опыт разработки terraform-provider-zvirt

Время на прочтение11 мин
Охват и читатели7K

Привет, Хабр. Я Михаил Фучко, технический продакт-менеджер SDN и Terraform в команде zVirt. Я продолжаю серию статей о пути, который мы проделали в процессе разработки собственного провайдера инфраструктуры для Terraform. В предыдущей части мы поговорили о принципиальных причинах неудач и проблем открытого провайдера terraform-provider-ovirt, сделали выводы. Пятая статья цикла будет посвящена ключевым решениям, принятым в ходе разработки собственного закрытого провайдера инфраструктуры zVirt для Terraform. Эта статья может быть полезна всем, кому предстоит разработка провайдера под специфичный API, слабо совместимый с концепциями Terraform. Мы разберем основные архитектурные решения, обозначим сознательные концептуальные ограничения и приведем пример построения не самой тривиальной «системы поверх системы» для улучшения пользовательского опыта.

Читать далее

Прерываемые ноды Selectel MKS: как устроено вытеснение и как настроить graceful shutdown подов

Уровень сложностиСредний
Время на прочтение24 мин
Охват и читатели7K

Прерываемые ноды в Managed Kubernetes появились ещё в феврале 2025 года, и Selectel анонсировал их отдельной статьёй в своём блоге — про экономию до 70% и про то, что «нода оперативно вернётся в кластер, а восстановление займёт не более минуты». Про поды, которые в этот момент на ноде работают, там не сказано ничего: ни про SIGTERM, ни про drain, ни про PDB, ни про потерю данных. Как раз эту дырку мы и полезли закрывать.

Читать далее

Придумает ли ИИ то, чего еще не было. Спорят руководитель разработки и коммерческий директор SpaceWeb

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели6.9K

Привет, Хабр! Эта статья — часть серии к 25-летию SpaceWeb. Раз в две недели берем спорный вопрос про будущее хостинга и инфраструктуры и зовем двух-трех экспертов, которые смотрят на него по-разному.

Сегодня спорим о том, способен ли ИИ придумать архитектурное решение, которого раньше не было. Виталий считает, что способен. Алексей отвечает, что система, которая кормится готовыми знаниями, ничего не изобретет с нуля.

Читать далее

Как Mindbox победили «зомби‑тесты» Chaos Mesh

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели6K

SRE‑инженер Mindbox рассказывает, как DevOps‑команда столкнулась с неконтролируемым запуском хаос‑тестов, когда проводила плановые проверки с помощью Chaos Mesh. Что запускало «зомби‑тесты», какие пробовали решения и на чем в итоге остановились — делимся в статье.

Читать далее

UNIX-команды macOS, которых нет в Linux: от say и defaults до sysadminctl

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели13K

macOS — сертифицированная UNIX система (формально — UNIX 03), и большая часть того, что набираешь в терминале, ведет себя, как в любом BSD: ls, grep, ps, ssh — все на месте. Но рядом лежит второй слой команд, которого нет ни в одном дистрибутиве Linux и нет в POSIX: defaults, sysadminctl, mdfind, say, afplay

Часть из них выросла из архитектуры Darwin, часть — из графической и звуковой подсистем, а часть существует исключительно ради управления экосистемой Apple.

Таких утилит в macOS не один десяток, а в статье мы разобрали самые интересные и востребованные, по критериям: команда входит в macOS по умолчанию, не имеет штатного аналога в Linux и создавалась под задачи экосистемы Apple.

Читать далее