Обновить
512K+

Системное администрирование *

Лишь бы юзер был доволен

665,88
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Мой код терял бы 230 байт из 231. Чтобы это увидеть, пришлось патчить QEMU

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели15K

Через четыре часа после первой статьи пришёл комментарий: в моём коде не хватает трёх инструкций, и на настоящей плате он рассыплется.

Читатель arteast был прав.

Сел воспроизводить поломку. Собрал два варианта, свой и правильный, прогнал на строке в 231 байт. Вывод побайтово одинаковый. Замедлил линию до предела. Ничего не изменилось. Написал программу, которая смотрит, бывает ли передатчик занят хоть когда-нибудь. При выводе в консоль не бывает.

Моя ошибка внутри эмулятора не проявляется вообще. Проверить себя было нечем.

Пришлось чинить эмулятор.

Ну, чини!

ИИ в IT: как пользоваться ChatGPT и не слить конфиденциальные данные

Время на прочтение4 мин
Охват и читатели15K

ИИ помогает инженеру. Но готов ли инженер безопасно его использовать?

Чтобы найти ошибку в конфиге Cisco, многие просто копируют его целиком в ChatGPT. На решение проблемы уходит две минуты. Но вместе с конфигом искусственный интеллект получает информацию о внутренней инфраструктуре компании.

Прочитай и узнай как обезопасить себя

Фильтрация ТСПУ у серверов Таймвеб Cloud: диагностика, обход через reverse-proxy и СDN

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели36K

Два коммерческих сайта на WordPress, оба на одном VPS. Клиенты в одном городе, я сам в другом.

Начало июня. Клиенты жалуются, что сайт не открывается без VPN.

Мало ли, подумал я — ограничения, белые списки и т.д.

Потом сайт перестал открываться у меня. По проводу. Дома.

Три дня был потный танец с бубном:

Читать далее

# От firing до postmortem: рабочее место дежурного поверх Grafana и Mattermost

Время на прочтение12 мин
Охват и читатели7.5K

Grafana показывала, что горит, Mattermost доставлял уведомления, но после смены дежурного приходилось заново выяснять, кто занимается проблемой и когда ждать результат. Рассказываю, как мы собрали поверх них рабочее место с владельцами, ETA, общей историей, группировкой каскадных алертов, инцидентами и postmortem — без отдельной базы данных и без передачи управления состоянием LLM.

Читать далее

Monq 9.2: как перестать тонуть в миллионах порогов и начать ими управлять

Время на прочтение17 мин
Охват и читатели7.3K

10 июля мы выпустили Monq 9.2.0. Если описать релиз одной фразой: пороги получили собственное рабочее пространство, научились учитывать расписание, автоматически находить свою КЕ в CMDB и хранить прогноз собственного состояния. Для работы на больших объёмах хранение порогов перенесено из PostgreSQL в ClickHouse, а связанный конвейер сервисов переработан.

Перед вами обзор обновления отечественной observability платформы зонтичного мониторинга от вендора. Тут не будет обещаний «предсказать любую аварию» и общих слов про AIOps. Разберём точную механику, новые фичи, работу дежурной смены, нюансы обновления и честную границу между тем, что уже работает в 9.2, и адаптивными порогами, которые появятся в 9.3.

В целом статья будет о том, как превратить миллионы состояний в понятную работу дежурной смены, автоматизировать типовые реакции и реже отвлекать владельцев сервисов.

Читать далее

Не все герои носят плащи. Некоторые носят патчкорды

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели13K

С Днём системного администратора!

Их не заменит ИИ. Они способны работать без ИИ и без сети, но с сетями. Они не чураются вайбкодинга, но точно знают его цель. Они практически не носят бороды и свитеры, а ещё не носят на работу котов — всё потому что ворс и шерсть могут повредить оборудованию. Они молчаливы. Некоторые из них уже не знают, что такое факс и шредер. Но именно без них может случиться так, что не смогут работать целые компании. Некоторые из них окружили себя космическими дашбордами, кто-то довольствуется базовым мониторингом из подручного софта. 

Все они — от эникея до SRE-инженера по сей день остаются самыми мифическими работниками ИТ-сферы. Они восхитительны, и у нас на это как минимум 10 аргументов.

С вашим праздником, админы!

Читать далее

Может ли Kubernetes выдержать миллион узлов? Эксперимент, графики, выводы

Уровень сложностиСложный
Время на прочтение39 мин
Охват и читатели8.9K

Часто первое, что хочется сделать при неполадках в кластере, — уменьшить его и надеяться, что всё решится само. Получается, большой кластер = куча проблем?

Автор статьи решил зайти максимально далеко: поднять Kubernetes-кластер с миллионом узлов и посмотреть, что будет.

Спойлер: получился вовсе не выстрел в ногу, а серьёзный эксперимент — много подготовки, обход ограничений, графики производительности и, конечно, ценные выводы. И даже инструкция в конце для желающих повторить.

Читать далее

Оффбординг на автомате: почему «уволен» — слишком поздний сигнал, а «удалить» — шаг, который уже не отыграть

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.8K

Сценарий увольнения рисуется за пять минут: согласование, резервная копия, вебхук, удаление пользователя. Разбираю, почему такой граф нельзя запускать по событию облачного офиса, чем гейтинг и зависимость по данным надёжнее нарисованного порядка стрелок и что должно происходить, когда выполнение обрывается между копией и удалением. Плюс про идемпотентность необратимых узлов, одноразовую ссылку согласования и разницу между блокировкой и отзывом токенов.

К разбору

IaC в гибридной IT-инфраструктуре: решаем проблемы разрозненного управления с Terraform

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели11K

Рано или поздно большинство зрелых проектов приходят к необходимости использовать как виртуальные машины, так и выделенные серверы. Это логично, поскольку под разные задачи требуются разные вычислительные ресурсы. Однако затем возникает проблема управления физическим оборудованием.

В этой статье подробно разберем концепцию, которая позволяет взаимодействовать с выделенными серверами так же легко, как с облачными. На практическом примере развернем гибридную инфраструктуру в разных дата-центрах исключительно средствами Terraform. Объединим разрозненные хосты в общую приватную сеть.

Привет! На связи Сергей, системный администратор в Selectel. Надеюсь, этот обзор будет полезен системным администраторам, DevOps-инженерам, архитекторам и всем, кто хочет избавиться от путаницы в процессах и управлять пулом гибридных вычислительных ресурсов через один инструмент.

Читать далее →

Последние из серверной: почему эпоха трушных сисадминов заканчивается (или только начинается)

Время на прочтение6 мин
Охват и читатели33K

Всегда считал системных администраторов здоровой профессией. Нормальные мужики, которые ругались матом и знали жизнь. Почти всю работу выполняли вручную, даже серверы иногда собирали из комплектующих. Да, получали меньше разрабов, но и преимущества в работе у них были: сразу видеть результат своих действий — приятно и полезно для психики. «Вижу проблему — ребутаю сервак», как говорится.

Но потом всё изменилось. Сначала пришли облака с докерами и кубернетесом. Так появились девопсы. Профессия стала меняться. Следом в продвинутых компаниях появились корпадмины — вроде менеджеров, но с техническим уклоном.

В итоге значительную часть работы теперь можно выполнять вообще на удалёнке!

Читать далее

Полтора месяца зависаний, ноль дампов и 44 байта нулей

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели13K

Полтора месяца моя рабочая машина умирала. Не BSOD, не перезагрузка — именно умирала: экран чёрный, вентиляторы на видеокарте выходят на сто процентов и так и остаются. Никакой реакции ни на что. Только кнопка Reset.

Сначала раз в неделю. Потом два. К середине июля — три раза за сутки.

Но хуже самих зависаний было другое: после них не оставалось ничего. Ни дампа, ни минидампа, ни BSOD, ни единой записи WHEA. В журнале — Event 41, Kernel-Power, «система была перезагружена, завершив работу некорректно», BugcheckCode = 0. Windows даже не успевала понять, что умерла.

Отлаживать нечего. Есть только труп и никаких улик.

Забегая вперёд: виновата оказалась не память, не драйвер и не блок питания, хотя я последовательно подозревал всех трёх. Виноват был PCIe Gen5. Лечится одним пунктом в BIOS. Полтора месяца страданий лечится одним пунктом в BIOS.

Читать далее

И еще немного извращений из мира прокси и VPN

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели51K

Жизнь диссидента-экспериментатора не сидит на месте, а копилка безумных находок пополняется быстрее, чем успеваешь про них написать. Продолжаем то, на чем остановились в прошлый раз - туннели через ICMP, DNS и serverless-функции это, конечно, хорошо, но вот вам еще три свежие находки: туннель через что угодно, что умеет хранить файлы, туннель через почтовый ящик, и реанимация древней технологии обхода через CDN и не только, которую почему-то все забыли.

Читать далее

Hermes оказался для меня игрушкой

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели13K

Я сжёг на Hermes около 500 миллионов токенов. Это примерно $1000 при оплате моделей без подписок. Я дал агенту доступ к своей домашней лаборатории. Он написал несколько полезных скриптов. Настроил GPU passthrough и транскрибацию, но заодно ломал собственный gateway, ронял Caddy и регулярно игнорировал явно прописанные скиллы.

Это разбор реальной эксплуатации. Hermes иногда экономил мне время. Но слишком часто он проигрывал обычным скриптам и n8n. После полумиллиарда токенов Hermes оказался для меня дорогой игрушкой, а не рабочим инструментом.

Посмотреть, где Hermes сломался

Ближайшие события

Мы поставили ITAM за три недели. А работать он начал через полгода

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели9.5K

Система блестит, дашборды красивые, а спросишь её что попроще — врёт. Потому что залили мёртвые данные и сократили углы на справочниках.

Рассказываю, как внедрял, где обжигался и что делаю теперь, чтоб не повторялось.

Читать далее

Заменили ноду в кластере RabbitMQ — и через месяц потеряли регион OpenStack

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели7.5K

Короткая история про то, как штатная замена ноды оставила quorum-очереди с двумя членами вместо трёх, и почему cluster_status этого не показывает.

Стенд: OpenStack Caracal (2024.1), развёрнут kolla-ansible. RabbitMQ — кластер из трёх нод, quorum-очереди.

Читать далее

Как менялось представление о надежности ИТ-инфраструктуры за последние 25 лет

Уровень сложностиПростой
Время на прочтение12 мин
Охват и читатели9.2K

Надежная ИТ-инфраструктура как здоровье – пока она есть, ее никто не замечает. Но за четверть века подходы к реализации ее надежности сильно поменялись: сначала компании пытались не допустить сбой вообще, потом научились быстро восстанавливаться после него, а теперь проектируют системы так, чтобы они продолжали работать и становились сильнее даже в условиях хаоса.

Под катом разбираем три этапа эволюции ИТ-инфраструктуры – от культа тяжелого железа и погони за «пятью девятками» до AIOps, парадигмы нулевого доверия и систем, которые питаются непредсказуемостью.

Читать далее

Опыт разработки terraform-provider-zvirt

Время на прочтение11 мин
Охват и читатели7.2K

Привет, Хабр. Я Михаил Фучко, технический продакт-менеджер SDN и Terraform в команде zVirt. Я продолжаю серию статей о пути, который мы проделали в процессе разработки собственного провайдера инфраструктуры для Terraform. В предыдущей части мы поговорили о принципиальных причинах неудач и проблем открытого провайдера terraform-provider-ovirt, сделали выводы. Пятая статья цикла будет посвящена ключевым решениям, принятым в ходе разработки собственного закрытого провайдера инфраструктуры zVirt для Terraform. Эта статья может быть полезна всем, кому предстоит разработка провайдера под специфичный API, слабо совместимый с концепциями Terraform. Мы разберем основные архитектурные решения, обозначим сознательные концептуальные ограничения и приведем пример построения не самой тривиальной «системы поверх системы» для улучшения пользовательского опыта.

Читать далее

Прерываемые ноды Selectel MKS: как устроено вытеснение и как настроить graceful shutdown подов

Уровень сложностиСредний
Время на прочтение24 мин
Охват и читатели7.1K

Прерываемые ноды в Managed Kubernetes появились ещё в феврале 2025 года, и Selectel анонсировал их отдельной статьёй в своём блоге — про экономию до 70% и про то, что «нода оперативно вернётся в кластер, а восстановление займёт не более минуты». Про поды, которые в этот момент на ноде работают, там не сказано ничего: ни про SIGTERM, ни про drain, ни про PDB, ни про потерю данных. Как раз эту дырку мы и полезли закрывать.

Читать далее

От защиты периметра к Zero Trust. Как NAC-системы обеспечивают защиту и контроль доступа в корпоративной сети

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели10K

Коллеги, добрый день!

Я Станислав Калабин, инженер-архитектор компании Axel PRO. Моя ежедневная задача – воплощать строгие требования информационной безопасности (ИБ) в работающую сетевую инфраструктуру наших заказчиков.

Если раньше доверяли всему внутри периметра и защищали сеть с помощью мощного межсетевого экрана (Firewall) на границе, то сейчас эта модель устарела. Удаленная работа, облачные сервисы и распределенные офисы размывают границы сети. Современная атака начинается не со штурма МСЭ, а с фишингового письма сотруднику. Оказавшись внутри, злоумышленник пользуется абсолютным доверием. Ответом на эти угрозы стала архитектура Zero Trust – «никому ничего не доверяй». Её главные принципы – явная верификация каждого запроса, минимальные привилегии и готовность к инциденту.

В этой статье я расскажу о самом принципе Zero Trust и как современные NAC-системы, на примере платформы AxelNAC, решают задачи ИБ, минимизируя нагрузку на сетевых инженеров при внедрении.

Читать далее

Придумает ли ИИ то, чего еще не было. Спорят руководитель разработки и коммерческий директор SpaceWeb

Уровень сложностиПростой
Время на прочтение16 мин
Охват и читатели7.1K

Привет, Хабр! Эта статья — часть серии к 25-летию SpaceWeb. Раз в две недели берем спорный вопрос про будущее хостинга и инфраструктуры и зовем двух-трех экспертов, которые смотрят на него по-разному.

Сегодня спорим о том, способен ли ИИ придумать архитектурное решение, которого раньше не было. Виталий считает, что способен. Алексей отвечает, что система, которая кормится готовыми знаниями, ничего не изобретет с нуля.

Читать далее