Обновить

Администрирование

Сначала показывать
Порог рейтинга
Уровень сложности

Прятал пакеты и все отрицал — как мы отладили DHCP‑балансировщик

Уровень сложностиСложный
Время на прочтение10 мин
Охват и читатели13K

TL;DR: После миграции отказоустойчивого DHCP-сервера из «брони» QinQ-туннеля в «плоский» VLAN ответы от бэкап-ноды начали бесследно исчезать. Пакет физически покидал хост, но до адресата не доходил, при этом коммутаторы клялись, что их счетчики дропов равны нулю. 

Вооружившись tcpdump, тотальным port mirroring и дзен-терпением, мы раскрыли заговор: dhcp snooping молча уничтожал пакеты на уровне аппаратного ASIC. Самое пикантное: стек M-LAG с идентичной прошивкой вел себя радикально иначе, чем одиночный коммутатор в той же сети.

Добро пожаловать в мир сетевой магии, где порт 67 (six-seven) — это не просто абсурдный вирусный мем, а реальная причина, по которой инфраструктура вдруг решила сыграть в прятки.

Привет! Меня зовут Иванов Владимир, я системный администратор отдела выделенных серверов в Selectel. Статья будет полезна тем, кто сталкивался с ситуацией, когда пакет «в провод уходит, но не приходит», а сетевое оборудование клянется, что ничего не дропает.

Расследовать →

Как мигрировать GitLab под рабочей нагрузкой из одного в десять Docker‑контейнеров

Уровень сложностиПростой
Время на прочтение29 мин
Охват и читатели8.9K

Привет! Меня зовут Илья, я занимаюсь автоматизацией разработки аппаратного обеспечения в YADRO. Эта статья будет посвящена масштабированию работающего в Docker контейнере под рабочей нагрузкой инстанса Gitlab. По мере роста команды производительности Gitlab, развернутого в одном Docker‑контейнере, становится мало. И масштабирование работающего под рабочей нагрузкой Gitlab, скажем, на десять контейнеров может стать нетривиальной задачей. Далее я на нашем примере расскажу, как это разумно организовать.

Читать далее

EvertyCloud: что я сделал, чтобы компании перестали арендовать емкость

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели8.5K

Меня зовут Артур Валиев. За последнее время я сделал несколько проектов на Rust + Iced, которые со стороны действительно можно принять за отдельные программы. EvertyDesk Next — удалённый доступ. EvertyDisplay — виртуальные мониторы. EvertyCloud — облачные и сетевые диски.

Но я всё меньше воспринимаю их как три разных продукта.

На самом деле это одна система.

И сегодня я хочу наконец объяснить, что именно я пытаюсь построить.

Моя мысль довольно простая: компьютер не обязан заканчиваться там, где заканчивается его корпус.

Читать далее

Настройка DNS over HTTPS с ACME сертификатами в Angie

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8.7K

Вы наверняка знакомы с функциональностью сервера Angie в качестве обратного прокси и веб-сервера с поддержкой протокола HTTPS. Также Angie умеет проксировать и балансировать TCP и UDP-сервисы, включая DNS. Новый модуль DoH объединяет эти возможности, реализуя протокол DNS over HTTPS для клиентов. Если добавить модуль ACME с автоматическим получением TLS-сертификатов, получим готовое решение.

Читать далее

Что будет с телеметрией, если хранилище исчезнет: сравниваем очереди и батчинг семи агентов

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели8.1K

Когда выбирают агент для телеметрии, обычно сравнивают поддержку протоколов, потребление CPU и удобство конфигурации. Я бы начал со следующего вопроса:

> Что произойдёт с данными, если хранилище перестанет отвечать на 30 минут, а потом вернётся обратно?

Агент-доставщик может уметь в ретраи, персистент вольюм, но это не означает, что данные не потеряются. Ретраи должны где-то жить, а очередь должна иметь предел. После восстановления связи накопившиеся сообщения нужно выгрузить, не положив только что ожившее и еще не до конца очухавшееся хранилище. А если агент вдруг неожиданно перезапустится, очередь должна пережить и это.

Меня зовут Антон Касимов, я работаю в Gals Software, веду авторский телеграм по наблюдаемости Мониторим ИТ, а в этой статье разберу семь популярных шипперов и коллекторов: OpenTelemetry Collector, Grafana Alloy, Vector, Fluent Bit, vlagent, vmagent и vtagent. Для каждого шиппера рассмотрю следующие вещи: батчинг, очередь, поведение при недоступности бэкэнда, ключевые настройки и минимальный пример конфигурации.

Это не синтетический рейтинг кто быстрее, выше, сильнее. У инструментов разная специализация и разные единицы измерения. Очередь в 1000 OTLP-запросов нельзя честно сравнить с очередью в 10 ГБ или с WAL длительностью восемь часов. В проектах я сам периодически сталкиваюсь с проблемой выбора, поэтому тема для меня достаточно животрепещуща. Возможно, она окажется такой и для вас.

Читать далее

Чем заменить top, ps и netstat в 2026 году, и когда их лучше не трогать

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели92K

Netstat давно считается устаревшим, ps aux может обрезать командные строки, а стандартный top придется донастраивать… Однако мы всё равно набираем эти три команды для проверки, потому что так было написано в учебниках. Под катом расскажу, что реально стоит использовать вместо классики, и где старое-доброе всё ещё уместно.

Читать

Linux против Windows 11 на ноутбуке с 8 ГБ памяти. Есть ли разница

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели8.4K

Тонкие ноутбуки, которые многие по привычке называют ультрабуками, очень часто идут без возможности замены памяти, за исключением ThinkBook с LPCAMM2. Чаще всего она распаяна на плате, и если при покупке взяли 8 ГБ, столько и останется. Все борются или мирятся с этим по-разному, но самый эффективный способ повлиять на ситуацию, это выбор операционной системы. Рассмотреть, насколько по-разному работают операционные системы, можно на примере одной из моделей от Dell. Этим и займемся, а в конце у вас будет много довольно любопытной информации.

Читать далее

Как перейти на Infrastructure as Code и выжить

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели8.2K

Привет, Хабр! На связи инженеры департамента информационных технологий iCore.

В любой быстрорастущей компании наступает момент, когда ИТ-инфраструктура начинает масштабироваться нелинейно. Бизнес требует новые функции за дни, масштабироваться под нагрузки за часы и обеспечивать отказоустойчивость сразу, «из коробки. Изменений становится все больше и больше, растет число виртуальных машин, микросервисов и окружений. Команде с одной стороны нужно поддерживать работоспособность постоянно растущей инфраструктуры, а с другой – обеспечивать возможность этого роста.

В этих условиях классическое ручное администрирование заходит в тупик. Появляются и копятся временные решения – «костыли», документация устаревает в момент написания, а расследование любого инцидента превращается в детектив с поиском того, кто и когда изменил конфиг в обход всех регламентов (они, кстати, тоже не успевают обновляться и соответствовать темпам роста).

Читать далее

Почему учета лицензий 1С может быть недостаточно: приглашаем на вебинар

Время на прочтение2 мин
Охват и читатели6.9K

24 сентября в 11:00 МСК проведем бесплатный вебинар о том, как контролировать фактическое использование лицензий 1С, находить свободный резерв и принимать обоснованные решения о закупках.

Программа вебинара и регистрация

Читать далее

Платформа данных на минималках. Часть 3: поднимаем Trino и читаем таблицы Iceberg из S3

Уровень сложностиСложный
Время на прочтение39 мин
Охват и читатели9.3K

Привет! Я Денис, старший бэкенд-разработчик в Selectel. В предыдущих частях мы познакомились с архитектурой Apache Iceberg, а также развернули и настроили каталог метаданных.

Итак, у нас есть данные в S3‑хранилище, аккуратно организованные средствами Iceberg, и каталог, который знает расположение актуальной версии каждой таблицы. Казалось бы, все готово. 

Однако при ручном просмотре S3-бакета ничего похожего на таблицу не обнаружится — видны лишь вложенные папки с Parquet-файлами и JSON-метаданными. Да, Iceberg и каталог решили задачу хранения и версионирования, но не ответили на вопрос, как читать эти данные с помощью SQL.

И вот возникает практическая задача: как аналитику или инженеру обратиться к Iceberg-таблице посредством SQL, не поднимая Spark-кластер и не перенося данные в отдельную СУБД?

Осторожно! Под катом — лонгрид

Алерты по ошибкам и panic из логов приложений в k8s: VictoriaLogs + vmalert + Alertmanager → Telegram

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели6.3K

Классическая ситуация: Go-сервис падает с panic: runtime error: invalid memory address or nil pointer dereference, Nuxt-фронтенд логирует NUXT_UNHANDLED: unhandled rejection. Клиент видит лишь общее «что-то сломалось» — точный текст ошибки остаётся только в логах.

Решение — алертинг по логам. Связка VictoriaLogs + Vector + vmalert + Alertmanager следит за потоком, и как только приложение пишет panic, log.Fatal или NUXT_UNHANDLED, в Telegram уходит алерт. Ниже — как поднять эту связку в Kubernetes без лишней нагрузки на хранилище.

Читать далее

Kubernetes просто, часть 2: что происходит после kubectl apply

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели11K

От YAML-манифеста до работающих контейнеров: разбираемся, что Kubernetes делает после kubectl apply.

Читать далее

Как systemd превратил обычный скрипт перезапуска в бесконечный дедлок — почему мониторинг не заметил собственную смерть

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели9.5K

Как systemd превратил обычный скрипт перезапуска в бесконечный дедлок — почему мониторинг не заметил собственную смерть

Конструкция, о которой пойдёт речь, есть почти в каждой инфраструктуре: скрипт генерирует конфиг сервиса и перезапускает сервис, если конфиг изменился. Четыре строки логики, юнит на десять строк, работает годами.

У меня эта конструкция выключила сбор данных на всех четырёх хостах, где она установлена. На двух — вечным дедлоком между двумя юнитами, который невозможно переждать, потому что таймаут там отключён по умолчанию. На третьем — командой, которая молча ничего не делает именно тогда, когда нужна. И ни на одном из хостов никто не заметил этого две-три недели, потому что мониторинг следил за инфраструктурой, но не за собой.

Дальше — разбор механики со ссылками на документацию, схема «до/после», набор команд, которыми такую поломку можно найти у себя, и выводы, часть из которых оказалась неожиданной для меня самого.

Читать далее

Ближайшие события

Astra Migration: как организован управляемый переход с Windows на Astra Linux

Уровень сложностиПростой
Время на прочтение11 мин
Охват и читатели9K

Привет, Хабр! Миграция большого числа рабочих станций с Windows на Astra Linux — это не запуск установщика и не вечерняя переустановка ОС на одном компьютере. Это проект, в котором нужно провести инвентаризацию парка, проверить совместимость, согласовать сроки, сохранить данные, настроить доменную интеграцию, проконтролировать результат и разобрать ошибки. Вручную это потребует значительных ресурсов ИТ-служб.

Astra Migration — клиент-серверное решение, которое берёт эту работу на себя. Оно состоит из серверной части с веб-порталом, агента для Windows и компонентов для установки и первичной настройки целевой ОС. В статье хочу рассказать из каких частей состоит Astra Migration, как выглядит путь от установки серверной части до первой загрузки Astra Linux, что такое сценарии и волны миграции, зачем нужны блокеры и какие дополнительные детали раскрываются в решении.

Читать далее

Сигнал из космоса. Как работает спутниковый интернет в России

Уровень сложностиПростой
Время на прочтение15 мин
Охват и читатели88K

В России до сих пор остаются огромные территории без устойчивого доступа в интернет. Мобильный, а тем более, проводной интернет доступен не везде, несмотря на то, что технологии шагнули далеко вперед. Ситуация в ряде случаев усугубляется вынужденным отключением мобильной связи. 

Единственный выход для бизнеса и людей в такой ситуации — подключение к сети через спутник. 

Читать далее

Сделал себе вышибалу для VPS: кто стучится в.env и в ssh — тот сидит за баном…

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.9K

Устал смотреть в логи: опять подбор пароля к ssh, опять лезут в несуществующие файлы сайта. Fail2ban ставил — утонул в настройках. Написал своё: обходит свой сайт, запоминает нормальные адреса, по лишним 404 и по ssh режет IP в nftables. Рассказываю — зачем и как ставил. Код покажу там, где самому было интересно.

Читать далее

Как рабочее место оторвалось от «железа»: история VDI через призму технологий, компаний и людей. Часть 1

Время на прочтение15 мин
Охват и читатели7.9K

Прямо сейчас миллионы людей работают за компьютером, которого физически не существует. Их рабочий стол — лишь изображение, передаваемое по сети из дата-центра за сотни километров. Для пользователя он выглядит как обычный Windows, но в действительности его приложения, данные и сама операционная система работают совсем в другом месте.

Так выглядит результат более чем шестидесятилетней эволюции одной инженерной идеи: постепенно отделить рабочее место человека от конкретного физического компьютера. На этом пути сменились мейнфреймы, персональные компьютеры, терминальные серверы, гипервизоры и облака, а за каждым новым этапом стояли конкретные инженеры, компании и технологические прорывы, которые меняли представление о том, где на самом деле должен находиться компьютер.

Если смотреть на эту историю из сегодняшнего дня, менялись технологии, но набор задач оставался удивительно стабильным: отделить рабочую среду от конкретного устройства, централизовать управление, сохранить пользователю привычную автономность и научиться масштабировать такую инфраструктуру.

Читать далее

Легковесная альтернатива cAdvisor и сборщик логов для отправки в Loki

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели6.6K

В данной статье расскажу про проект logporter, который для меня полностью заменил решение от Google для централизованного и полнофункционального мониторинга контейнеров Docker.

Экспортер написан на Go и совмещает функции сборщика метрик, логов, проверки обновлений образов и встроенной панели мониторинга в одном легковесном образе.

Читать далее

Новые типы ключей для Cephx

Время на прочтение6 мин
Охват и читатели4.6K

Коллеги, всем привет, меня зовут Алексей и это продолжение предыдущей статьи о проблемах с Ceph возникших после обновления.

Коротко напомню, прошлый раз, я столкнулся с проблемой добавления в кластер Ceph, нового монитора, последней версии и OSD. Как мне казалось тогда, проблема была с пакетами Ceph для Ubuntu 24.04, которые собирают разработчики Ceph, но все оказалось намного сложнее и интереснее. К решению меня подтолкнул наш коллега по habr, который оставил свой комментарий к предыдущей статье. Он дал наводку, что возможно это связано с Cephx и обновлением ключей. Он же и сподвиг меня к написанию продолжения. Надеюсь эта статья принесет пользу и может быть кому‑то поможет. Итак, поехали.

Прочитав документацию по Cephx, я обнаружил, что разработчики рекомендуют после обновления кластера до последней версии провести так же и обновление ключей, используемых для аутентификации и авторизации в Ceph.

Читать далее

В событии про письмо нет ни суммы, ни контрагента. Чем платят за то, чтобы эти поля появились

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели5.7K

Почтовый аудит-лог Яндекс 360 отдаёт запись о событии структурой ответа AuditLogService_Mail, а в ней 22 поля (справочник Яндекс 360 API, сверка 10 сентября 2026 года). Тема письма и адреса участников среди них есть, а ни суммы, ни контрагента, ни номера договора нет. Ограничения распознавания и рекомендации к качеству входа я привожу по документации Anthropic, а дальше идёт моя инженерная логика: какой шаг создаёт недостающие поля и чего это стоит.

Смотреть, чего нет в записи о событии.