Обновить

Администрирование

Сначала показывать
Порог рейтинга
Уровень сложности

ARM в сервере: будущее инфраструктуры или очередной провал

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели12K

В первом квартале 2026 года 17,7% проданных серверных процессоров были на ARM. AWS уже выпускает пятое поколение Graviton, Google предлагает Axion не только в виртуалках, но и на bare metal, Microsoft разворачивает Cobalt 200, а Oracle использует AmpereOne. При этом индустрия уже дважды хоронила эту архитектуру — в 2013 и в 2018 году. Под катом расскажу, кто лежит на кладбище ARM, почему третий заход оказался успешнее и готов ли ваш стек к переезду.

Читать

Как устроен IPMI-мониторинг серверов: сбор метрик и интеграция с Grafana

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели12K

Инфраструктура Selectel насчитывает тысячи серверов, которые круглосуточно обеспечивают работу клиентских проектов: процессоры обрабатывают инструкции, память хранит данные, диски читают и записывают информацию. Такая постоянная нагрузка заложена в архитектуру оборудования, но риски сбоев — будь то аппаратные ошибки, перегрев, сбои питания или проблемы с сетью — есть всегда. 

В случае нештатной ситуации инженеры быстро восстановят работу. Однако лучше обнаружить проблему еще до того, как она затронет клиентскую инфраструктуру. Именно для этого существует IPMI-мониторинг — своего рода приборная панель сервера, которая показывает состояние оборудования и помогает замечать первые признаки возможных неисправностей.

В этой статье расскажем, что такое IPMI-мониторинг серверов и рассмотрим принцип его работы. Также посмотрим, как настроить IPMI-мониторинг для выделенных серверов в Selectel.

Читать далее

Как управлять Samsung устройствами без Google и почему на других устройствах так нельзя

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели9.2K

Меня зовут Павел Медведев, я занимаюсь поддержкой B2B-клиентов в компании Samsung и пишу про это в блоге Samsung на Хабре. Сегодня я в гостях у коллег из SafeMobile — мы давно работаем вместе, а в их версии SM16 появилась удобная настройка MDM-плагинов, так что повод показать её в деле нашёлся сам собой.

Google год за годом переводит корпоративное управление Android на свои облачные рельсы, и писать собственного MDM-агента становится всё труднее: часть старых интерфейсов уже отключена, а тот агент, который вы всё-таки написали, с прошлого года может просто не установиться на устройство — его может заблокировать Google Play Protect. Если вы сопровождаете мобильный парк на MDM-решении, которого нет в списке крупных вендоров, это касается вас напрямую.

У Samsung на этот случай есть свои механизмы: собственный QR-код для регистрации устройств и Knox Service Plugin для их настройки. Под катом — что именно Google закрутил, что Samsung предлагает взамен и как через KSP настроить то, чего может не быть в вашем MDM. Планшеты, которые сами включаются, когда в них воткнули питание, и гаснут, когда в магазине выключили свет. Ограничение заряда 80%, чтобы у витринной техники не летели аккумуляторы. Эти и другие примеры ждут вас под катом.

Читать далее

Настройка MS SQL Server под 1С: планирование и развёртывание (Часть вторая)

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели11K

Это вторая часть разбора ошибок конфигурации MS SQL Server под 1С. Первая часть — про планирование и развёртывание: профили нагрузки, дисковая подсистема, баланс ресурсов, инсталляция и виртуализация, здесь первая часть. Там же была описана типичная история дефолтного развёртывания сервера на прод или «как не надо».

Побудившая меня написать всё это предыстория такова: сервером СУБД под 1С обычно занимается системный администратор в паре с 1С‑разработчиком или франчом, уровень СУБД теряется где‑то между их компетенциями. Первая часть была про то, как этот разрыв закладывает проблемы при развёртывании. Вторая (эта) — про то, как этот же разрыв в компетенциях мешает найти причину, когда система уже тормозит «и всё висит, и прод лежит».

Напомню и про два профиля настроек для СУБД из первой части: первый — тяжёлая ERP с одной большой базой, второй — стопка из сотни бухгалтерских баз на одном инстансе. Настройки, о которых пойдёт речь ниже, зависят от профиля использования так же, как зависела схема размещения данных из предыдущей части. К концу статьи станет видно, из чего складывается ответ на вопрос «почему тормозит», и что железо в этом ответе часто ни при чём.

Все звонки начинаются как под копирку

«База висит». «Окна не открываются». «К вечеру всё тормозит так, что документ не провести». Жалобы на сервер 1С звучат одинаково в рознице, в производстве и в бухгалтерии, но причины под одинаковыми симптомами всякий раз оказываются разными. Посмотреть, какие типы ожиданий превалируют на сервере, найти тяжёлые запросы, указать в каких местах и что можно поправить. За каждым этим шагом стоит достаточно узкая компетенция администратора баз данных, отдельная профессия — DBA. Разработчики этим навыком, как правило, не владеют, у них другая специализация, отсюда следствие: код, который прекрасно работает на тесте, в проде начинает работать очень тяжело. На тесте нет ни боевых объёмов, ни конкуренции за строки, ни сотни пользователей, проводящих документы одновременно. В проде есть всё и сразу.

Читать далее

Сайзинг RAM и vCPU для локальной языковой модели: считаем стартовый размер VM

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели7.8K

Сайзинг RAM и vCPU для локальной языковой модели начинается с конкретных весов и профиля запросов. Исходные требования self-hosted LLM включают длину входа и ответа, конкурентность, рантайм и схему offload. Расчёт по размеру весов и формуле KV-кэша даёт стартовую конфигурацию, а прогретый тест показывает реальное потребление памяти и точку, где CPU перестаёт помогать.

Читать далее

Новый «steal governor» в Linux нацелен на борьбу с конкуренцией за CPU в переподписанных виртуальных машинах

Время на прочтение9 мин
Охват и читатели6.7K

Что, если добавить виртуальной машине процессоров — и она станет работать медленнее? В сильно переподписанных серверах это не мысленный эксперимент, а повседневность. Новый механизм ядра Linux — steal governor — предлагает решать проблему с другого конца: не раздавать ВМ больше ресурсов, а научить её добровольно ужиматься.

Читать далее

FUSE простым языком: как обычные программы притворяются файловыми системами

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели7.3K

Вы наверняка сталкивались с этим эффектом: монтируете sshfs, rclone mount или gocryptfs — и после этого файловый менеджер, редактор, архиватор и бэкапилка работают с появившимся каталогом так, будто перед ними самая обычная файловая система. Хотя байты могут жить на сервере, в S3, внутри шифрованного каталога или вообще рождаться на лету.

Как программа из userspace умудряется встать между open() и данными так, чтобы остальная система ничего особенного не заметила? Сегодня разберёмся. Заваривайте чай покрепче (ядро любит крепкий), устраивайтесь поудобнее — поговорим про FUSE.

Сразу одна оговорка, чтобы не заложить мину в фундамент статьи: не всякая «сетевая папка» или подключённый телефон в файловом менеджере — это FUSE. GNOME GVfs, KDE KIO и MTP умеют показывать похожую картину на уровне приложений. FUSE идёт глубже: он подключается к файловому стеку ядра, поэтому смонтированное дерево видят обычные программы через привычные open(2), read(2), stat(2) и компанию.

Читать далее

Life Cycle: что остаётся после того, как тебя больше нет

Уровень сложностиПростой
Время на прочтение10 мин
Охват и читатели6.7K

Две недели назад я ехал к отцу и не успел примерно на сорок минут.

Ему было 84 года, последние месяцы он был совсем плох, поэтому сама возможность такого исхода не была неожиданностью. Я девятый ребёнок в семье и самый младший. Я метис: отец был кумыком, мама русской. Маму я похоронил в 2016 году. Из всей большой семьи именно я жил в Ставропольском крае, и когда близкие сообщили, что отец совсем плох, я выехал к нему.

Когда приехал, его уже не было.

Я спокойно могу говорить об этом. Не потому, что мне всё равно, и не потому, что смерть близкого человека можно рационализировать несколькими красивыми фразами. Просто мне не хочется делать из этой истории просьбу о жалости. Отец прожил очень длинную жизнь. У меня была возможность знать его, разговаривать с ним, спорить с ним. Это уже огромное количество времени.

Но эти сорок минут почему-то заставили меня думать не столько о смерти, сколько о времени.

Меня зовут Артур Валиев. Я программист. Раньше я уже пытался разговаривать через Rust о совсем не технических вещах — например, о любви. И чем дольше я пишу код, тем чаще ловлю себя на довольно странной профессиональной деформации: я начинаю смотреть на собственную жизнь как на систему, которую желательно хотя бы не оставлять в заведомо некорректном состоянии.

На этот раз мне захотелось попробовать описать не любовь.

Мне захотелось описать конец жизненного цикла.

Читать далее

Как создать и настроить свой сервер Counter-Strike 2 на VPS

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели12K

Многие из нас когда-то проводили десятки, а то и сотни часов на публичных серверах Counter-Strike разных версий: от 1.6 до Global Offensive. Всех их объединяла атмосфера уникального хаоса, кастомных плагинов, новых знакомств и полуночных разговоров. Но с ростом киберспорта культура публичных серверов стала постепенно уходить на второй план. Молодёжь больше играет в соревновательные режимы — FaceIT или Premier.

С выходом CS2 и переходом на новый движок Source 2 ситуация стала ещё сложнее: старые плагины перестали работать, а инструменты для пользовательских серверов пришлось адаптировать. Постепенно разработчики освоили создание пользовательского контента для новой версии, и публичные серверы снова начали появляться.

В этой статье разберём, как создать собственный сервер Counter-Strike 2 на VPS, установить плагины, настроить карту и добавить на неё собственный контент.

Читать далее

Самое короткое руководство по базовой настройке производительности Microsoft SQL Server

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели5.3K

В этот краткий сборник рецептов входят советы, применимые к подавляющему большинству развертываний SQL Server без профилирования реальной нагрузки.

Читать далее

Как мы мигрировали 40 кластеров ClickHouse: стратегии, проверки и автоматизация

Уровень сложностиСложный
Время на прочтение22 мин
Охват и читатели4.8K

SRE‑инженер Mindbox Дима Рыбалка рассказывает, как команда за два месяца перенесла 40 кластеров ClickHouse в Yandex Cloud. Внутри — как выбирали стратегию миграции, связывали кластеры без VPN, переключали клиентов через cutover без даунтайма и с какими столкнулись проблемами после миграции. Материал будет полезен SRE‑, DevOps‑ и DBA‑инженерам, которые работают с ClickHouse в Kubernetes.

Читать далее

350 коммитов в неделю: как контрибьютить в проект, который меняется быстрее, чем ты пишешь

Уровень сложностиПростой
Время на прочтение14 мин
Охват и читатели9.7K

Представьте: ночной алерт, приложение отдаёт пятисотки, но само оно живо. Понятно, что дальше начнётся знакомое — вкладки с графиками, поиски в логах и попытки понять, кто и что изменил. Сколько на это обычно уходит времени? А что, если вместе с вами в инциденте будет разбираться ИИ-агент?

Привет! Я Антон Воронцов, CRE в Yandex Cloud. В конце июля я в очередной раз листал свежие репозитории на GitHub, чтобы посмотреть, что происходит в моих смежных дисциплинах: SRE, автоматизациях и, понятное дело, ИИ. Вдруг я наткнулся на один интересный репозиторий, который активно рос: количество звёзд, коммиты и заинтересованные люди из разных стран — всё это про OpenSRE.

Эта статья о том, как я впервые контрибьютил во внешний проект, что стало самым сложным и как вообще работает этот инструмент. 

Читать далее

Безопасная чистилка Temp: как удалять файлы и ничего не сломать

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели5.1K

У меня в %TEMP% тихо скопилось гигов пять, и я написал маленькую утилиту, которая чистит это — вручную кнопкой или само по расписанию.

Задача-то копеечная. Но пока писал, вылезла пара занятных вещей: почему «удалить всё из Temp» — так себе идея, как не провалиться по симлинку и не снести файлы за пределами папки, почему os.access на Windows врёт про права на запись, и как чистить по расписанию, вообще не оставляя процесс висеть в памяти.

Читать далее

Ближайшие события

Почему после ребрендинга я оставил старое имя Docker Compose — иначе поднялась бы пустая база

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели6.2K

Переименование проекта в Docker Compose может создать новые пустые volumes, пока старые данные спокойно остаются на диске. Разбираю, какие внутренние идентификаторы нельзя менять через Replace All и как провести ребрендинг с возможностью отката.

Читать далее

Как я восстанавливал WordPress после взлома и дважды ошибся

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели5.9K

Клиентский сайт на WordPress уже чистили в июле, но одну закладку пропустили. Через месяц в админку зашёл скрипт, посмотрел настройки оплаты WooCommerce и удалил дефолтного пользователя admin. Вместе с ним в корзину улетели 59 страниц, а 192 объекта медиатеки удалились вместе с файлами: корзина для вложений по умолчанию отключена.

Разбираю хронику по логам, механику каскадного удаления через wp_delete_user() без переназначения автора и восстановление по частям, когда полный откат бэкапа запрещён. И две ошибки, которые я допустил уже в процессе ремонта: подстановка файла по совпадению имени и прямой SQL, после которого Yoast продолжал отдавать canonical на момент аварии.

Читать далее

Выглядит как баг: что не так с консолидацией узлов в Karpenter?

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели8.8K

Объём неиспользуемых ресурсов не уменьшается (хотя вроде как должен), а узлы бесконечно ротируются. Это нормально для автоскейлера или пора что-то чинить?

В статье — детально о механизме консолидации в Karpenter, а главное — можно (и нужно) ли как-то его исправлять.

Читать далее

Почему это повторяется? Как мы расследуем Root Cause в чужой инфраструктуре

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели9.8K

Раз в неделю падает один и тот же сервис. Админ его перезапускает, пользователи возвращаются к работе, инцидент закрывают. Через несколько месяцев авария превращается рутину, и так продолжается годами. Управление проблемами — problem management — начинается в тот момент, когда кто-то все-таки спрашивает: «Почему это повторяется?». Для сервисного провайдера это логичное продолжение управления инцидентами. Обычно мы сами инициируем разбор, как только серия однотипных происшествий перестает выглядеть случайностью.  Но если ты аутсорсер, то найти root cause — это только полдела. Дальше нужно понять, что с ней делать. Причина может оказаться в продукте вендора, легаси заказчика или системе другого подрядчика — то есть там, где инженер внешней техподдержки не может просто взять и исправить ее. Но и тогда можно попробовать договориться и исправить ее. Об этом сегодня и пойдет речь. 

Меня зовут Наталия Сляднева и я руковожу Центром экспертизы по комплексному сервису К2Тех. Под катом — два расследования с разными финалами и третий случай, в котором проблему осознанно не стали решать. Иногда это самый рациональный вариант.

Читать далее

5 самых распространенных проблем сайтов на 1С-Битрикс

Время на прочтение9 мин
Охват и читатели8.7K

Сайт на 1С-Битрикс может месяцами работать вроде нормально, пока подключения к базе подбираются к 95%, диск незаметно заполняется логами, бэкап давно не запускался, а в логах копится одна и та же ошибка, на которую никто не смотрит.

Разбираем пять инфраструктурных причин, из-за которых Битрикс-проекты тормозят и падают: база данных, диск, PHP и веб-сервер, резервные копии, мониторинг. В каждом разделе есть простая проверка, которую можно провести у себя за 10 минут.

Читать далее

TLS PSK для Mamonsu: как мы добавили защищённую передачу PostgreSQL‑метрик в Zabbix

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели7.3K

Мониторинг редко начинается с разработки собственного кода. Обычно всё гораздо прозаичнее: устанавливаешь готовый агент, подключаешь его к существующей системе мониторинга, убеждаешься, что метрики поступают, и переходишь к следующей задаче.

У нас получилось немного иначе.

При подключении нового пилотного контура PostgreSQL к Zabbix выяснилось, что Mamonsu успешно работает с базой данных и собирает метрики, но не может передать их на сервер мониторинга, если тот принимает от узла только защищённые соединения с TLS PSK.

Можно было изменить настройки Zabbix или построить обходную схему вокруг штатного zabbix_sender. Вместо этого мы решили доработать сам Mamonsu. В результате появилась поддержка TLS PSK и сертификатов с сохранением совместимости как со старыми серверными версиями Python, так и с современными версиями Python, где PSK уже поддерживается стандартным модулем ssl.

Доработку проверили на пилотном контуре, после чего отправили разработчикам Mamonsu в upstream.

Читать далее

Почему ваш Wi‑Fi никогда не выдаст скорость из свойств подключения (и дело не в помехах)

Уровень сложностиСредний
Время на прочтение4 мин
Охват и читатели6.9K

Почему iperf никогда не покажет скорость из свойств подключения Wi‑Fi? Разбираем популярный миф о том, что максимальная Data Rate достижима в лаборатории. На конкретных примерах и формулах заглянем под капот физического уровня и докажем, почему канальная скорость математически недостижима для полезных данных ни при каких условиях.

Читать далее