Обновить
512K+

Системное администрирование *

Лишь бы юзер был доволен

652,8
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Как читать SLA хостинг‑провайдера: медиана, p95 и компенсации

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели10K

Процент доступности – это только первая строка SLA, а понять, как читать SLA хостинг-провайдера, можно лишь вместе с окном измерения, источником данных и исключениями. SLA хостинга и аптайм связывают метрику с конкретным сервисом, окном измерения, источником данных, исключениями и процедурой обращения. Термины и формулы у провайдеров разные, поэтому любой разбор привязан к конкретной датированной редакции договора.

Читать далее

Реконструкция инцидента развалилась: в логах не было смещения часового пояса

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели12K

Сводил хронологию инцидента из четырёх источников: веб-сервер, балансировщик, приложение и почтовый шлюз. Собрал события, отсортировал, посмотрел, что за чем шло, - работа механическая.

Так продолжается, пока не выясняется, что порядок событий физически невозможен: ответ приходит раньше запроса, сессия закрывается до того, как открылась, а письмо оказывается доставлено на два часа раньше отправки. Ошибки в логах при этом нет. Каждый источник записал своё время правильно - по своим часам и в своих обозначениях.

Читать далее

K3s на колёсах: HA‑кластер для автопарка с ARM‑агентами, WireGuard и офлайн‑режимом

Уровень сложностиСложный
Время на прочтение7 мин
Охват и читатели7.2K

Большинство статей про Kubernetes на границе (edge) описывают более-менее стабильную топологию: несколько узлов в одном или нескольких дата-центрах, предсказуемая сеть между ними, редкие сетевые партиции как исключение, а не норма. У нас всё наоборот: control plane живёт в офисе/датацентре, а agent-узлы физически стоят в транспортных средствах автопарка — едут по городу, паркуются в подземных гаражах без связи, теряют VPN на десятки минут за смену. Разрыв связи с control plane — это не инцидент, это штатный режим работы системы, который нужно было спроектировать с самого начала, а не «подкрутить» постфактум.

В этой статье — то, как устроен наш K3s-кластер для автопарка: HA control plane на kube-vip, транспорт через WireGuard поверх MikroTik, разнородный флот из amd64- и ARM-агентов (включая Jetson), и отдельно — самая интересная часть: как мы подступаемся к вопросу «может ли под на границе продолжать работать, когда control plane временно недостижим».

Читать далее

Артефакты рендеринга в Chromium, Electron и Qt на ноутбуках с гибридной графикой: диагностика и решение

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели7.8K

Если у вас ноутбук с Intel iGPU и дискретной видеокартой, а в мессенджерах, редакторах кода и браузерах по краям интерфейса тянутся странные полосы и блочный мусор, который исчезает под курсором мыши — эта статья про вашу проблему.

Спойлер: дело не в видеокарте, не в мониторе и не в драйверах. И чинится это одним ключом реестра, до которого я дошёл через день перебора всех «народных» советов, ни один из которых не сработал.

Читать далее

Как получить OV-сертификат Минцифры для HTTPS в 2026 году

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели9K

Как получить бесплатный HTTPS сертификат от Минцифры для своего сайта на 365 дней. Смотрим, с какими сложностями предстоит столкнуться.

Читать далее

Все компоненты зелёные, а продакшн лежит: разбор аварии, которую нашли в git

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели10K

Инфраструктура была покрыта кодом почти на сто процентов. Мониторингом покрыты все компоненты. В момент аварии все метрики базы данных были идеальными, соседние сервисы на том же сервере СУБД работали без единой ошибки, провайдер облака показывал зелёный статус.

При этом продакшн лежал двадцать минут, и первые пятнадцать никто не понимал, что происходит.

Причина лежала в истории изменений инфраструктуры, и за первые пятнадцать минут туда не посмотрел никто.

Читать далее

Защита сайта от ботов: 6 лет практики фильтрации трафика

Уровень сложностиСредний
Время на прочтение44 мин
Охват и читатели12K

Практический разбор шести лет работы с автоматизированным трафиком: от первых поведенческих ботов и ручных правил Cloudflare до собственной многоуровневой системы фильтрации и кластерной аналитики.

Читать далее

Очередные извращения с DOOM: упаковали в sheet-контейнер и запустили внутри Sheeternetes в электронной таблице

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели11K

Есть проверенный закон вселенной: если у чего-то есть экран и хоть немного памяти, рано или поздно на этом запустят DOOM. Запускали на осциллографах, на тесте на беременность, на кофемашине и на тракторе. Мы в Sheet-Native Computing Foundation тоже решили побыть в этом уже достаточно запылившемся тренде и запустить DOOM в контейнере, упакованном в ячейки электронной таблицы. То есть образ контейнера с игрой физически лежит в ячейках, оттуда собирается обратно в Docker-образ, проверяется по sha256 и запускается.

В первой статье я рассказывал про Sheeternetes — оркестратор контейнеров, у которого весь control plane (Deployments, Nodes, Pods, Events) живёт внутри Google Таблицы или Excel, а на другом конце крутятся настоящие Docker-контейнеры. Там же мельком был упомянут наш формат образов — SICF (Sheet-Native Image Container Format). Эта статья как раз про него: как он устроен, как всё это воспроизвести у себя, как оно работает на bare metal (то есть в эксельке, а не гугл-таблице) без интернета и какие неожиданно интересные находки вылезли, когда мы начали пихать всё это дело в ячейки Google Sheets.

Спойлер: DOOM — настоящий (Chocolate Doom плюс свободный Freedoom, всё в Linux-контейнере, играется в браузере с клавиатуры).

Читать далее

23 урока для тех, кто отвечает за инфраструктуру: Linux, базы данных, CI/CD и безопасность

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели13K

В этом дайджесте делимся подборкой бесплатных уроков сентября для инженеров инфраструктуры, DevOps и специалистов смежных направлений. В подборке — практические разборы Linux-серверов, PostgreSQL 18, отказоустойчивых кластеров, CI/CD, eBPF, безопасности и применения ИИ в инженерных задачах.

Занятия проводят наши преподаватели — практикующие специалисты, которые разбирают технологии на реальных примерах и опираются на свой опыт. Это возможность обсудить рабочие подходы с экспертами, разобраться в новых инструментах и оценить формат обучения.

Смотреть подборку

Скажи «друг» и войди: ищем легко угадываемые пароли в Active Directory

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели12K

«Ennyn Durin Aran Moria: pedo mellon a minno» — «Врата Дурина, Владыки Мории. Скажи „друг“ и войди».

Самый известный пароль в литературе — эльфийское mellon, «друг» — открывал Западные врата Мории любому, кто удосужился прочитать надпись прямо над ними. Удобно для своих. И, к сожалению, для чужих тоже.

В корпоративных доменах часто встречаются пароли из словарей — в некоторых случаях это равносильно паролю, написанному на воротах. Смотрите сами.

Администратор правильно настроил политику паролей в домене: минимум 12 символов, три класса символов, история, блокировки. Но проверка показывает, что пароли учётных записей сотрудников есть в публичных дампах и словарях. «Сложные» пароли вроде Zima2025!P@ssw0rd и Qwerty123! формально соответствуют политике, но злоумышленнику понадобится не так много попыток, чтобы подобрать такие пароли.

Проблема в том, что доменная политика проверяет пароль на соответствие правилам, но ничего не знает про его значение. Она не в курсе, что P@ssw0rd — самый заезженный «сложный» пароль на планете, а пароль из названия компании и года подбирается с трёх попыток.

Почему пароли — всё ещё слабое звено №1

Мы в InfoWatch защищаем данные компаний от утечек, и во многих инцидентах видна закономерность: чаще всего всё начинается не с хитрой уязвимости нулевого дня, а с учётной записи, к которой подобрали пароль или чей пароль утёк из-за переиспользования на публичном сервисе.

А что стоит между учётной записью и злоумышленником? В большинстве инфраструктур — всё ещё только пароль: не аппаратный ключ, не биометрия и не второй фактор на каждом сервисе, а строка, которую сотрудник придумал сам и, будем честны, придумал так себе. Можно сколько угодно внедрять MFA, PAM и Zero Trust — пароль в AD остаётся фундаментом, на который всё это опирается. Скомпрометированная доменная учётная запись открывает вход злоумышленнику. В итоге — компрометация всего домена и громкая история: простой производства, отмены рейсов, утечки персональных данных…

Читать далее

WWDC 2026: что изменится для системных администраторов в macOS 27

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели7.8K

Всем привет, это команда Ринго! Уже не первый год Apple публикует Deployment Guide — руководство для системных администраторов, охватывающее развертывание, настройку и управление техникой Apple. После каждой WWDC в нём появляется раздел «Что нового?», и в этом году основная повестка не про новые возможности, а про потери. В  macOS 27 перестанут работать привычные MDM-команды управления обновлениями.

Разбираем ключевые изменения из What’s New for IT at WWDC26: что приходит на смену старым командам, какие декларации появились для сетевых настроек и статусов устройств и что следует проверить в инфраструктуре до массового обновления парка. Сервисы, официально недоступные для организаций, зарегистрированных в России (Apple Business Manager, Volume Purchase Program и другие), мы намеренно оставляем за скобками — говорим только про управление macOS 27.

Читать далее

Кэши, режимы нагрузки и ловушка среднего, или Почему storage-бенчмарки врут

Время на прочтение10 мин
Охват и читатели8.5K

Представьте, разработчики добавили прозрачное шифрование в файловую систему, собрали ядро и прогнали Fio — пропускная способность не изменилась. Однако после раскатки на продакшен производительность резко упала. Дело не в том, что бенчмарк ошибся: он честно измерил предел быстродействия жесткого диска, а накладные расходы на шифрование остались скрыты за дисковыми задержками. Так и возникает одна из самых типичных ошибок storage-бенчмаркинга.

Хранение до сих пор кажется многим инженерам простой подсистемой: файловая система, блочное устройство, метрика throughput. На практике это одна из самых коварных частей стека — с иерархией памяти в 4–8 порядков разницы между самой быстрой и самой медленной операцией, слоями виртуализации (LVM, программные RAID, NFS) и переключениями контекста между ядром и user-space.

Чтобы разобраться, как корректно измерять производительность систем хранения, обратимся к докладу Эреза Цадока, профессора Университета Стони-Брук, возглавляющего Лабораторию файловых систем и хранения данных.

Все подробности — под катом.

Читать далее

IDM на максималках: как управлять доступами к 1500 систем Яндекса и не стать бутылочным горлышком

Время на прочтение12 мин
Охват и читатели10K

Когда мы запускали IDM, задача казалась понятной: избавиться от хаоса в компании. Не было единого места, где можно узнать, у кого какие права, кто их выдал и почему. 

IDM стал таким местом — и почти сразу мы уперлись в проблему. Очередь на подключение к IDM начала превышать количество уже подключённых систем, а фич-реквесты от команд копились быстрее, чем мы успевали их разобрать. Инструмент против хаоса сам стал источником хаоса.

Читать далее

Ближайшие события

Sheeternetes: первое нагрузочное тестирование и реальные бенчмарки против Kubernetes, Docker Swarm и Nomad

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.4K

В одном чате по куберу меня спросили единственное, что реально важно, когда ты собрал оркестратор контейнеров внутри таблицы: а сколько оно вообще тянет? Сколько подов, пока не ляжет. Какой образ влезает в ячейки. Сколько кластеров держит одна машина. И — раз уж мы фонд с серьёзным лицом — как это смотрится рядом с настоящими: Kubernetes, Docker Swarm, Nomad.

Поэтому мы провели честное нагрузочное тестирование. Четыре измерения, два бэкенда (.xlsx на диске и живая Google-таблица), синтетика на ноутбуке и реальные Docker-образы на облачной виртуалке. А потом поставили цифры рядом со взрослыми оркестраторами.

Короткая версия: по каждой оси, которая имеет значение, мы проигрываем на 3–5 порядков. По осям, которые значения не имеют, — выигрываем вчистую. И один наш давний «факт» оказался неверным — бенчмарк нас поправил. Поехали.

Читать далее

Ваш сервис на домене клиента: CNAME, certbot и 300 строк Go вместо ACME on-demand

Время на прочтение9 мин
Охват и читатели11K

Есть класс фич, которые выглядят на одну строчку в тикете и на неделю в реализации. «Хочу, чтобы статус-страница жила на моём домене» — из таких. Клиент добавляет CNAME status.client.ru → status.your-service.com, и дальше начинается интересное: кто выпустит сертификат для чужого домена, кто его продлит, как не дать одному пользователю положить всю схему мусорными доменами и почему X-Forwarded-For может превратить внутренний эндпоинт в публичный.

Читать далее

Публичное демо без регистрации: как показать живой мониторинг и не подставиться

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели10K

В Grafana есть режим публикации дашборда наружу: генерируется токен, по нему дашборд открывается без учётной записи, только на чтение. В интерфейсе это две галочки.

Я потратил на эти две галочки несколько дней. Не потому, что там сложно нажать, а потому, что публикация мониторинга наружу ломается в местах, о которых не думаешь заранее: переменные, лимиты запросов, метки, которых ждёт дашборд. Ниже разбор всего, что я собрал по дороге — девять дашбордов, синтетический контур и один эпизод, где мою же витрину положил мой же nginx.

Читать далее

Три поломки одного вечера: рубль в заголовке, обёртка stdout и капча, которая выросла на весь экран

Время на прочтение5 мин
Охват и читатели9K

Вечером 02.09 у нас не вышел плановый пост в TenChat. В логе задачи планировщика — ничего осмысленного, просто ненулевой код возврата и алерт «слот не закрыт». Разбор растянулся на весь вечер, потому что там оказались не одна поломка, а три, и каждая маскировала следующую.

Читать далее

Дорогая, я улучшил KubeVirt! Сделали классическую виртуализацию на рельсах Kubernetes

Уровень сложностиСредний
Время на прочтение24 мин
Охват и читатели17K

KubeVirt или готовая платформа? Мы сравнили Deckhouse Virtualization Platform с «ванильной» версией по-честному: API-ресурсы, миграции, хранилища, сеть, безопасность. Получилась таблица на десяток с лишним отличий. 

Собрали в одной статье всё, что реализовали поверх KubeVirt, чтобы инженеры не тратили время на настройку и интеграцию: от sizing-политик до проброса USB в ВМ.

Смотрите, что мы добавили поверх KubeVirt

От десятка подписок к единому шлюзу LiteLLM: что пошло не по плану

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели8.8K

Привет! Я Владимир Мокроусов, сисадмин в группе компаний «Синтека». Мы создаем софт для строительной отрасли и активно используем в работе ИИ-модели. 

Недавно мы сделали единый доступ к моделям на базе LiteLLM. В статье расскажу, как собрали эту схему, на какие грабли наступили с лимитами и блокировками и что пришлось контролировать, чтобы всё работало.

Читать далее

Как проверить, что бэкап действительно можно восстановить

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели18K

У вас есть бэкапы? Хорошо, лёгкий вопрос. А когда вы в последний раз восстанавливали из них хотя бы один файл? Вот она неловкая пауза, понимаю… Между «бэкап есть» и «бэкап восстанавливается» находится пропасть, и в неё регулярно падают даже большие компании. Под катом две страшилки из реальной жизни и разбор того, как проверить свои бэкапы до того, как восстанавливать их придётся на боевом сервере.

Читать