Обновить
512K+

Системное администрирование *

Лишь бы юзер был доволен

551,28
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

От бизнес-метрики до дежурного: как построить алертинг, от которого не страдают

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели2.1K

Эта статья - о шаге, который предшествует настройке маршрутов: как выбрать сигнал, связать его с влиянием на бизнес, определить срочность и проверить, что вызов дежурного действительно оправдан. В качестве сквозного примера возьмём оформление заказа, а в конце свяжем правила детектирования с обработкой в nxs-anomaly.

Читать далее

Новости

Kubernetes просто лабы, часть 1: поднимаем кластер и знакомимся с его устройством

Уровень сложностиПростой
Время на прочтение8 мин
Охват и читатели2.1K

Практика к первой части серии «Kubernetes просто». Поднимем локальный кластер с помощью kind, найдём компоненты Control Plane и запустим первый Pod. Разберём команды и их вывод, а затем закрепим материал самостоятельными заданиями.

Читать далее

Чтобы понять Kubernetes, я написал свой Kubernetes

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели2.6K

Можно годами работать с Kubernetes, писать манифесты и разбираться с падениями подов – и всё равно смутно представлять, что именно происходит внутри системы. Я решил закрыть этот пробел радикально: собрал собственный оркестратор Smith и по ходу разработки столкнулся с теми же проблемами, которые когда-то сформировали архитектуру Kubernetes.

В статье – разбор этих инженерных решений через реальные поломки, от сетевого взаимодействия между узлами до механики согласования состояния.

Разобраться в Kubernetes

Сколько инструментов показывать языковой модели: гипотеза, которую перечеркнул замер

Время на прочтение4 мин
Охват и читатели6K

У нашего ИИ-оркестратора более девяноста инструментов: работа с таблицами, документами, почтой, задачами, веб-страницами, презентациями и т.д.

При обработке запросов модель на каждом шаге выбирает, какой из них вызвать. Вопрос, который периодически всплывает: сколько из них ей показывать за раз — все или только те, что подходят к запросу?

Наш оркестратор умеет работать как с большими облачными моделями, так и с маленькими, которые помещаются на бытовой видеокарте. Минимальный рабочий вариант: RTX 3090 24Gb + Qwen3.6 27B.

Цель - заставить минимальный рабочий вариант выполнять корпоративные задачи с приемлемым качеством и с приемлемой скоростью.

Ясно что, для малой и большой моделей способ выбора инструментов должен отличаться, но как найти оптимальный вариант вопрос сложный.

Обычно оркестратор показывает модели весь список инструментов и она уже решает какой нужно выбрать для ответа на запрос. Так делают Hermes, OpenClaw и Ouroboros. Ни один из них не выбирает инструменты по тексту запроса. У некоторых для слабых моделей и маленького контекста есть режим, где модели дают только каталог — имя и короткое описание — и инструмент «подключить», так что нужное она находит и загружает сама. Эти агенты рассчитаны на фронтир-модели уровня Claude и GPT-5, которые держат сотню инструментов без потерь. Моя задача другая: работать на локальной 27B в закрытом контуре. Для неё узкий набор измеримо лучше.

Как устроен узкий набор

Схема простая. Перед основным вызовом модели работает роутер: по тексту запроса он выбирает раздел — «датасеты», «почта», «презентации» ... — и внутри раздела подраздел. Модель получает недевяносто описаний инструментов, а около двадцати. О существовании остальных на этом шаге она не знает.

Читать далее

Когда одного CNI мало — deepdive в CNI Chaining

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели6.9K

Привет, Хабр! Под эгидой AOT мы проводим конференции для сообщества вокруг Kubernetes. На Kuber Conf от АОТ в 2025 году у нас выступал Михаил Петров, Kubernetes-эксперт в Stackland (Yandex Cloud). Для тех, кто любит смотреть видео — держите ссылку. 

А ниже — текстовая версия доклада в изложении Михаила.

---------

В целом кубером я занимаюсь вот уже почти 10 лет и за это время построил десятки продакшн-кластеров в VK и не только. В Yandex Cloud мы сейчас разрабатываем onprem-решение для запуска ИИ- и дата-нагрузок на базе Kubernetes и Talos OS.

В этой статье расскажу вам, как внедрить в ваши Kubernetes-кластера CNI Chaining — обсудим, когда это вообще полезно и применимо, какие плюсы несёт и с какими сложностями можно столкнуться в процессе.

Читать далее

Сложно о простом. Ничего не понимаю в ИБ. Часть 1. Зачем защищать корпоративную сеть, если она и так работает?

Уровень сложностиПростой
Время на прочтение17 мин
Охват и читатели7.9K

Всем привет! Меня зовут Кирилл, я сетевой инженер и автор технических статей. Остальные мои материалы можно найти в профиле @ProstoKirReal.

Представим обычную корпоративную сеть. Все интерфейсы находятся в состоянии up, ping проходит, сотрудники открывают рабочие системы, а мониторинг не показывает ничего подозрительного. Со стороны сетевого инженера всё работает. В этот момент ИБ-специалисты просят установить новый межсетевой экран, подключить систему анализа трафика, ограничить использование флешек и не пускать в сеть неизвестные устройства.

Возникает логичный вопрос: зачем всё это нужно, если сеть и так работает?

Эту проблему хорошо показывает сцена из фильма Оливера Стоуна «Сноуден». Главный герой копирует секретные документы на microSD-карту, прячет её внутри кубика Рубика и проходит через охрану. На входе его проверяют, вокруг закрытый объект, компьютеры работают в изолированной инфраструктуре, а данные всё равно оказываются снаружи.

Читать далее

Как я заставил Synology работать с неподдерживаемым USB‑ИБП: NUT, VID/PID и blazer_usb

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели5.4K

Synology DS916+ отказался видеть новый Energenie EG-UPS-PS3000-02. В DSM эта модель официально не поддерживается, а автоматически выбранный nutdrv_qx с устройством не заработал. При этом выяснилось, что другой драйвер, уже встроенный в DSM — blazer_usb — прекрасно общается с ИБП по Megatec/Q1. Осталось понять, как заставить саму DSM использовать его правильно.

Ниже — история от первой проверки USB-кабеля до строки UPS on battery в системном журнале.

Читать далее

Address already in use: как найти, кто занял порт, и почему он не всегда освобождается сразу

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели4.9K

Представьте: два часа ночи, вы деплоите фикс — а сервис не поднимается: Address already in use. Гуглите, находите PID, делаете kill -9. Помогает. Но утром та же ошибка на том же порту.

Всё потому, что «порт занят» — это на самом деле два разных диагноза с разными решениями, а на форумах их валят в кучу. В одном случае порт держит живой процесс, и kill действительно помогает. В другом процесс давно мёртв, а порт висит в TIME_WAIT — и тут kill бесполезен, лечится одной строкой в коде.

Разбираем оба случая: быстрый фикс под Linux, macOS, Windows и Docker — и что на самом деле происходит с портом, когда процесса уже нет.

Понять, при чём тут TIME_WAIT →

Enterprise-защита задешево: что облако сделало с WAF

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели5K

Привет, Хабр! На связи Егор Сапун, руководитель направления сертификации инфраструктуры Рег.облака.

Кибератаки касаются не только крупного бизнеса. За последний год с киберинцидентами столкнулись 82% российских компаний малого и среднего бизнеса. По данным Positive Technologies, в 2025 году 75% успешных атак на веб-приложения российских организаций приводили к нарушению их деятельности.

От части атак на сайты, веб-приложения и API защищает WAF. Но для многих компаний это все еще enterprise-решение: классический WAF необходимо развернуть в своей или арендованной инфраструктуре, встроить в путь трафика. Для этого нужны вычислительные ресурсы а также компетенции по настройке и сопровождению. У небольших компаний таких ресурсов может и не быть.

Один из способов снизить порог входа и упростить эксплуатацию — использовать облачный WAF, инфраструктурой которого занимается провайдер. 

Рассказываю, нужен ли для облачного WAF отдельный специалист, можно ли настроить защиту один раз и больше к ней не возвращаться и как выглядит весь путь подключения. А еще покажу, как бесплатно протестировать облачный WAF и объясню, почему это не панацея.

Читать далее

DDNS для российских DNS-хостингов: почему не подошли готовые клиенты и что я написал взамен

Уровень сложностиСредний
Время на прочтение10 мин
Охват и читатели3.9K

Я проверил популярные DDNS-клиенты и почти не нашёл в них поддержки российских DNS-хостингов. Поэтому запись для домашнего сервера обычно обновляют самописным скриптом на curl, а такой скрипт ломается молча. Я разобрал API нескольких хостингов и написал на Go свой DDNS-демон, который учитывает их особенности.

В статье рассказываю, почему совет перенести зону в Cloudflare подходит российской аудитории с оговорками и что умеют готовые клиенты. Затем разбираю подводные камни API REG.RU, Selectel и Yandex Cloud, о которые спотыкаются самописные скрипты. В конце показываю, как устроен dnspatch и как запустить его в Docker за пару минут.

Читать далее

Когда технический долг и legacy-системы тянут CIO вниз

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели3.8K

Миграция с устаревшей системы на новую часто выглядит просто на архитектурной схеме: выключить старое, включить новое и продолжить работу. На практике такой переход затрагивает данные, интеграции и процессы, поэтому один неучтённый сценарий может привести к проблемам уже после выхода в прод. В статье разбирается подход Big Bang migration, его особенности и вопросы, которые важно учитывать при подготовке такого перехода.

Читать далее

GitHub Actions убрал Node 20 и отключает старые раннеры: что проверить

Уровень сложностиСредний
Время на прочтение3 мин
Охват и читатели4.3K

23 сентября GitHub окончательно убрал Node 20 из раннеров GitHub Actions. JavaScript-экшены теперь выполняются на Node 24, а временный выключатель ACTIONS_ALLOW_USE_UNSECURE_NODE_VERSION, которым можно было вернуть Node 20, больше не работает. Через шесть дней, 29 сентября, на GitHub Enterprise Cloud включилась полная проверка версий self-hosted раннеров.

Две новости за неделю, и обе ломают тихо.

Читать далее

Kubernetes просто, часть 5: зачем нужен Ingress и как маршрутизировать HTTP‑трафик

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели7.6K

Разбираемся, зачем Kubernetes нужен Ingress. Чем он отличается от Service и Ingress Controller, как маршрутизировать HTTP-трафик по по доменам и путям к разным приложениям внутри кластера.

Читать далее

Ближайшие события

ssh‑commander: SSH‑панель с AI‑агентом для своих VPS

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели9.5K

Сделал для себя ssh-commander: терминал, файловый менеджер, управление Docker и AI-агент в одном окне. Можно работать с сервером руками, а когда нужна помощь, передать вывод агенту или поставить ему задачу. Он сам смотрит файлы и логи, предлагает команды, а изменения выполняет после подтверждения.

Приложение запускается локально через Docker, интерфейс открывается в браузере. К серверам подключается по SSH. Код открыт под MIT, подписки нет. Для агента нужен свой API-ключ; без него ручные инструменты тоже работают.

Читать далее

2 100 писем и ноль ответов: разбор холодной рассылки в банки и фонды

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели4.5K

За две недели мы отправили около 2 100 приглашений в отраслевой опрос: специалистам по рискам в банках и инвестиционных фондах. Базу собрали сами. Организации взяли из открытого реестра юрлиц GLEIF, сайты искали через Wikidata и автокомплит Clearbit, адреса собирали со страниц контактов. Из холодной рассылки не ответил никто.

Под катом разбор по шагам. Почему среди 1 301 адреса с сайтов финансовых компаний нет ни одного со словом risk. Как локальный DNS в режиме fake-ip превратил проверку доменов в формальность. Почему почтовые шлюзы банков отбили письма, отправленные из Gmail. И как рассылка однажды завершилась без единой ошибки и не отправила ни одного письма. С кодом на Python и цифрами.

Читать разбор

ExtremeCleaner: чистит кэш и показывает, что ещё удалить, чтобы освободить место

Уровень сложностиПростой
Время на прочтение2 мин
Охват и читатели5.6K

ExtremeCleaner — незаменимый инструмент для контроля занятого места на диске. Он не только чистит кэш, но и показывает, что ещё съедает гигабайты: большие AI-модели (Ollama, LM Studio), старые сохранения игр и миры Minecraft, забытые загрузки и видео, образы виртуальных машин, почтовые базы, записи звонков, кэши Spotify и видеоредакторов, старые версии программ.

Три вкладки: безопасная очистка в корзину, ваши файлы для ручного разбора и системные места (гибернация, WinSxS, точки восстановления, кэш обновлений) с инструкциями, как их подсократить при желании. Каждый пункт объяснён: что это и опасно ли трогать.

Если у вас небольшой SSD, свободное место на котором постоянно стремится к нулю, — этот инструмент решит вашу проблему с очисткой диска: регулярно находит, что можно безопасно убрать, и показывает, куда утекает место. Только для Windows.

Читать далее

Купил мини‑ПК с приставкой «AI» ради локальной LLM. Что может NPU на самом деле

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели93K

TL;DR. Я купил мини‑ПК с Ryzen AI 9 365, чтобы гонять большую локальную модель на NPU. Начал с Windows ради гибрида NPU+iGPU, который так и не заработал, прошёл квест с драйвером NPU, выяснил, что NPU видит только половину оперативки, переехал на Proxmox и в итоге запустил Qwen3.6–35B‑A3B через FastFlowLM прямо на хосте. Модель работает 24/7: prefill около 200 ток/с, decode 13–17 ток/с. По дороге выяснилось, что NPU обслуживает один запрос за раз, падает с double free, если клиент не дождался ответа, и умеет выгнать из памяти большую модель ради маленькой embedding‑модели. Ниже вся дорога по порядку, мини‑гайд и цифры.

Читать далее

certbot говорил VALID, браузер говорил «небезопасно». Правы были оба

Время на прочтение5 мин
Охват и читатели4.6K

Сертификат сайта истёк, и 21 день каждый посетитель видел предупреждение о небезопасном соединении. При этом certbot всё это время работал правильно и показывал VALID: он знает про файл на диске, а браузер получает то, что держит в памяти процесс nginx. Разбираю, почему схема «certbot на хосте, nginx в контейнере» рвётся молча, почему мониторинг всё видел и ничего не дал, и почему починка без проверки в бою остаётся гипотезой.

Читать далее

Как мы разворачиваем ClickHouse-кластер через Arenadata: практический гайд для DevOps

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели4.9K

Привет, Хабр! Меня зовут Никита Ивкин, я — ведущий DevOps-инженер РТЛабс, работаю с инфраструктурой Госуслуг. Сегодня я покажу один из наших реальных сценариев: как мы разворачиваем ClickHouse через Arenadata, почему выбрали именно такую топологию и какие нюансы появляются между кнопкой Install и действительно рабочим кластером. Мы разберём причины выбора такой схемы, увидим, где ADCM действительно упрощает эксплуатацию, какие мелочи всплывают вокруг SSH и Ansible и почему после успешного Install хост всё ещё может выглядеть «жёлтым». В конце — проверки со стороны самого ClickHouse и несколько вещей, которыми мы дополнили кластер уже после раскатки.

Читать далее

65 бесплатных уроков октября: от LLM и Kubernetes до микросервисов, Kafka и безопасности

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели6.7K

Привет, Хабр. В этом дайджесте собрали 65 бесплатных демо-уроков по основным IT-направлениям. В программе — многопоточность, микросервисы, Kubernetes, Kafka, LLM и ИИ-агенты, безопасность ИИ-систем, SQL, автоматизация тестирования, Data Quality и другие темы, с которыми сегодня сталкиваются команды в реальных проектах.

Уроки проводят преподаватели OTUS — практикующие специалисты, которые работают с этими технологиями и подходами в своих проектах. Можно разобрать актуальные задачи вместе с экспертами, задать вопросы по своим кейсам и посмотреть, какие направления и инструменты стоит изучить глубже.

Смотреть подборку
1
23 ...