Обновить
256K+

DevOps *

Методология разработки программного обеспечения

477,99
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

От спанов к сценарию агента: зачем мы добавили GenAI-представление трейса

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.5K

Трейс ИИ-агента можно открыть в обычном "дереве" и найти медленный вызов или спан с ошибкой. Но по дереву трудно восстановить логику запуска: сколько раз агент обращался к модели, какие инструменты вызывал, где повторил шаг и какой ответ в итоге увидел пользователь.

В Proto Observability Platform уже были дерево, граф, флейм-граф и другие представления трейса. Они продолжали решать инфраструктурные задачи, но ответы о поведении агента приходилось собирать вручную из десятков спанов, транспортных вызовов и повторяющихся тел сообщений. Мы увидели это сначала на OpenTelemetry Demo 3.0, затем при отладке собственного «AI-аналитика» в связке с нашим MCP-сервером.

В результате мы добавили отдельное GenAI-представление с четырьмя режимами: лентой, графом шагов, графом вызовов и чатом. Дальше покажем, на какой вопрос отвечает каждый режим, почему одного универсального графа оказалось недостаточно и какие дефекты реальной GenAI-инструментации пришлось учитывать.

Читать далее

Аналитик, или Туда и Обратно: как мы стали «Google на минималках» в мире контейнерной оркестрации

Уровень сложностиПростой
Время на прочтение7 мин
Охват и читатели6.9K

Привет! Меня зовут Алиса, и сейчас я руковожу командой разработки продукта «Штурвал». У нас работает около пятидесяти человек:  инженеры,  безопасники,  девопсы, фронтендеры, бэкендеры на Go и тестировщики, которые ломают всё, что мы строим. Но сегодня я хочу рассказать не о них. Сегодня балом правят аналитики. И под катом объясню, почему. 

Читать далее

Что изучить в DevOps, Kubernetes, observability и сетях для работы с современной инфраструктурой

Уровень сложностиПростой
Время на прочтение4 мин
Охват и читатели9.2K

В инфраструктуре редко получается решить проблему в пределах одного инструмента: сбой в проде быстро выводит к настройкам Linux, сети, CI/CD, Kubernetes или базы. В этом дайджесте собрали материалы, которые помогают разбирать такие задачи точечно и системно — от диагностики и наблюдаемости до безопасности и устойчивости сервисов.

Читать далее

Docker объявил об открытом бета-тестировании Docker VMM

Время на прочтение4 мин
Охват и читатели15K

Docker объявил об открытом бета-тестировании Docker VMM
Собственного, полностью переписанного слоя виртуализации, который отныне лежит в основе Docker Desktop. Новый движок уже доступен в паблик-бете на macOS и Windows начиная с Docker Desktop v4.86. Разберёмся, что именно поменялось, почему это важно даже тем, кто никогда не задумывался о VMM, и как всё это протестировать самостоятельно.

Читать далее

Сертификат TLS для IP-адреса

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели20K

Let’s Encrypt всегда проверял только доменные имена. Однако с развитием микросервисных архитектур, API-взаимодействий и IoT-устройств возникла необходимость защищать трафик серверов, у которых нет домена. 15 января 2026 года стал общедоступным профиль shortlived с 6-дневными сертификатами для «чистых» IP-адресов. Теперь не нужно тратить деньги и время на покупку и регистрацию бесполезных доменных имен.

На Хабре уже есть подробные статьи и руководства на тему настройки HTTPS, выпуска сертификатов и конфигурации веб-серверов, но в большинстве случаев они объясняют, как защитить сайт с доменом. Мы же разберём, как обойтись без него и выпустить официальный доверенный TLS-сертификат прямо на «голый» IPv4-адрес.

Читать далее

GitOps для 15 000+ кластеров: что показало крупномасштабное тестирование с vCluster

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.1K

Наткнулся на интересный материал про тестирование GitOps на масштабируемость и нагрузку. Его целых три недели проводила компания iits-Consulting. Оригинал читать не меньше 40 минут, поэтому сократил его, сохранив все самое важное — и теперь делюсь со всеми обитателями Хабра.

Читать

2 рубля за сказку с озвучкой: как я считал юнит‑экономику AI‑продукта на коленке

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.2K

Идея была простая: сделать что‑то небольшое в свободное время, что может превратится в параллельный источник дохода, не требуя от меня много личных часов. Остановился на Telegram‑боте, который генерирует персонализированные сказки на ночь: родитель задаёт участников, обстановку, тему — бот пишет сказку, при желании озвучивает.

Читать далее

Не подавать холодным! Прогрев JVM перед запуском трафика

Уровень сложностиСредний
Время на прочтение6 мин
Охват и читатели6.2K

Всем привет! Меня зовут Александр, я бэкенд-инженер в Банки.ру.

Пару месяцев назад мы поймали проблему, которая жила у нас довольно долго и которую мы упорно списывали на случайность. После каждой выкатки сервис первые несколько минут отвечал заметно медленнее обычного, а потом сам собой приходил в норму. Ушло около десяти релизов, прежде чем мы перестали считать это совпадением, и еще пара дней, чтобы найти настоящую причину. Ей оказался холодный старт JVM, а точнее то, что Kubernetes пускал на новые поды боевой трафик раньше, чем они были к нему готовы.

Дальше расскажу, что мы видели на графиках, какие версии проверили и отбросили, что происходит внутри JVM в первые минуты жизни процесса и что мы сделали.

Читать далее

Kubernetes — это эксплуатация, а не деплой. Мы шли к этому пониманию 7 лет

Время на прочтение13 мин
Охват и читатели8.6K

Kubernetes называют инструментом автоматизации. Ирония в том, что первые годы его эксплуатации в облаке — это история ручного труда: сертификаты, которые никто не обновлял, кластеры, которые деградировали молча, клиенты, которые ждали поддержки там, где мы предполагали самообслуживание. Мы начали делать managed Kubernetes в 2018 году, когда на российском рынке этого сервиса почти не существовало. Эта статья о том, что значит слово «managed» на самом деле — и какую архитектуру оно в итоге требует.

Читать далее

TACACS+, RADIUS и 802.1X под одной политикой: как я строил Taranac и что из этого вышло

Уровень сложностиПростой
Время на прочтение13 мин
Охват и читатели4.9K

Привет, Хабр. Десять лет назад я был обычным сетевым инженером, которому надоело править tac_plus.conf руками, и я написал вокруг него веб-морду — TACACSGUI. Она неожиданно разошлась: тысячи инсталляций, форум, письма из мест, о которых я и не думал. Документации там практически не было — интерфейс был устроен так, что люди разбирались сами. Это был главный урок, который я оттуда вынес.

Второй урок был в почте. Самая частая просьба за все годы, с огромным отрывом: «добавьте RADIUS». Прикрутить RADIUS сбоку к обёртке над TACACS-демоном невозможно так, чтобы это не было уродством: получились бы две несвязанные правды, два места настройки, два набора пользователей. И я решил не прикручивать, а переделать.

Так появился Taranac — TACACS+, RADIUS, NAC. Полтора года проектирования и разработки (не считая времени, которое я просто носил архитектуру в голове). Сегодня это работающая платформа: TACACS+, RADIUS, 802.1X, MFA со своим push-сервисом и мобильным приложением, PKI, captive portal, кластеризация. Free, self-hosted, без лимитов на устройства и пользователей.

Я пришёл сюда не продавать (продавать нечего — оно бесплатное), а за обратной связью. Ниже — что я строил, какие решения принимал и почему. И отдельным разделом — честно про то, чего в проекте нет и что в нём можно не любить.

Читать далее

Как мониторить Java-приложения: метрики, алерты и правило 80/20

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели10K

Хороший мониторинг помогает быстро понять, что происходит с приложением и куда смотреть в первую очередь. Для этого не нужно пытаться измерить всё: базовый набор технических метрик покрывает большинство типовых проблем, а бизнес-метрики, SLO и анализ аномалий помогают заранее замечать нетипичные отклонения. В Календаре мы называем этот подход правилом 80/20.

Всем привет! Меня зовут Настя, я бэкенд-разработчик в Яндекс 360 и отвечаю за надёжность Календаря. В этой статье я покажу, какие метрики стоит взять за основу, как выбирать полезные алерты и чем дополнять базовый набор для оставшихся 20%.

Читать далее

MLOps для DevOps-инженера: как построить платформу машинного обучения в закрытом контуре

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели8.7K

Мы построим прототип MLOps-платформы с нуля. Без Kubeflow, без облаков, без магии. Только Kubernetes, Helm, ArgoCD и ещё дюжина компонентов, каждый из которых появляется не потому что «так модно», а потому что решает конкретную проблему

Читать далее

Обзор релиз-команды Kubernetes v1.37: что устареет, сломается и перейдёт в GA

Время на прочтение5 мин
Охват и читатели6.8K

Команда VK Cloud подготовила перевод обзора релиз-команды Kubernetes (Arsh Sharma, Christopher Tineo, Kirti Goyal, Sophia Ugochukwu, Swathi Rao, Troy Connor) из блога kubernetes.io. О том, что устареет, сломается и перейдёт в GA в Kubernetes v1.37, релиз которого запланирован на 26 августа 2026 года. Будет полезен тем, кто эксплуатирует кластеры Kubernetes в проде: DevOps- и SRE-инженерам, платформенным командам, которые планируют обновление.

По мере приближения даты релиза Kubernetes v1.37 проект развивается и взрослеет, поэтому отдельные функции признают устаревшими, удаляют или заменяют более удачными ради общего здоровья проекта. В этом блоге собраны некоторые из запланированных изменений релиза Kubernetes v1.37, о которых, по мнению релиз-команды, вам стоит знать, чтобы продолжать поддерживать вашу среду Kubernetes и оставаться в курсе последних изменений. Информация ниже отражает текущий статус релиза v1.37 и может измениться до фактической даты выхода.

Читать далее

Ближайшие события

Хватит строить Kubernetes для пятнадцати человек

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели11K

Я много лет занимался инфраструктурой. Потом перестал и ушёл в продукт — но привычка заглядывать: «А как у вас тут всё устроено?» осталась. И вот теперь я хожу к клиентам по совсем другим вопросам, а глаза всё равно выпадают.

Читать далее

Как я автоматизировал сборку образов с Ansible и Packer и попал в community.ansible

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели6.4K

Полночь, деплой горит, а ты вручную поднимаешь десятый сервер за неделю: копируешь ISO, тыкаешь Enter в консоли анакон­ды, правишь fstab, чинишь grub — и на утро выясняешь, что забыл gpg-ключ репозитория на трех машинах из десяти. Признавайтесь, бывало? Эта статья для тех, кто устал платить временем и нервными клетками за ручную сборку образов.

В этой статье расскажу, как построил полностью автоматизированный пайплайн для сборки образов закрытого дистрибутива Linux на базе RedHat — без единого ручного клика после старта. Ansible управляет хостом-билдером, Packer с shell-провижионерами собирает сам образ, и в итоге мы получаем готовый RAW, оптимизированный для OpenStack. Подход не привязан к конкретной ОС: если у вас другой дистрибутив, достаточно заменить ks.cfg на preseed.cfg или любой другой автоустановщик — остальная логика пайплайна должна работать без изменений. На десерт расскажу, как оформил часть решения в модуль для Ansible и отправил его в официальную коллекцию community.general.

Читать далее

Четыре узла из семи не работали, и все проверки говорили OK

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели10K

Если вы держите свой обход блокировок, у вас почти наверняка есть белый список. Не как отдельная сущность, а как последнее правило в конфиге: разрешить то, разрешить это, а дальше reject. Появляется он в первый же день, когда доходит, что открытый прокси в интернете живёт до первой жалобы хостеру, и с этого дня к нему не возвращаются, потому что он не просит: узлы добавляются, конфиг раздаётся, туннель поднимается, мониторинг показывает зелёное.

У нас в этом списке было пять адресов при семи живых узлах, и сколько недель это продолжалось, я до сих пор сказать не могу.

Читать далее

unissh – современный, опенсорсный SSH клиент с selfhosted zero-knowledge сервером для синхронизации данных

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели20K

Доброго времени суток, читатели!

Хочу представить вам unissh – современный, простой опенсорсный SSH клиент с selfhosted zero-knowledge сервером для синхронизации данных.

Читать далее

Тимлид и subnet-полукровка: как одна строчка в YAML стоила $50 000 и двенадцати часов прода

Уровень сложностиСредний
Время на прочтение8 мин
Охват и читатели8.5K

Однажды, морозным ноябрьским утром 2024 года, я, как новоиспечённый тимлид не такой уж и маленькой команды, поверил в себя и в то, что спустя полгода изучения проекта и передачи дел от предшественника я полностью понимаю, как там всё устроено. Судьба обычно наказывает за самоуверенность. Не стал исключением и мой случай.

Для понимания контекста добавлю, что я НЕ девопс - мне пришлось этим заниматься, и всё пишу через призму своего понимания проблемы. Возможно, сейчас придёт корифей AWS/CDK и скажет, что всё можно было сделать проще. Другими словами, не является индивидуальной инвестиционной рекомендацией.

Смотреть страху в лицо

OpenClaw и Hermes на одном VPS: чего стоит связать двух агентов безопасно

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели9.2K

Поставил OpenClaw и Hermes на один VPS и связал их между собой: первый принимает задачи из Telegram, второй исполняет их в своей песочнице. Через час после установки обнаружил, что панель управления агентом открыта в интернет, а ещё через полчаса — что фаервола на сервере нет вообще. Хроника нескольких вечеров про то, чем ИИ-агент опасен на своём сервере и сколько стоит поставить его по-человечески.

Читать, что сломалось

С 14 августа Claude Code стартует в авторежиме: что лежит в его рулбуке

Время на прочтение2 мин
Охват и читатели8.7K

С 14 августа Claude Code будет запускать новые сессии на Pro, Max и Team в auto mode: вместо диалога «разрешить/запретить» каждую команду оценивает отдельный классификатор. Коротко о том, что печатает команда claude auto-mode defaults (60 149 символов правил, 65 запретов, тринадцать из двадцати полей окружения пустые), какие ваши правила прав продолжают работать поверх классификатора, что на самом деле стоит за цифрой 13,6% из пересказов и был ли у этой фичи откат в прошлых версиях.

Читать дальше →