Обновить
128K+

Тестирование IT-систем *

Тестируем все и вся

193,06
Рейтинг
Сначала показывать
Порог рейтинга
Уровень сложности

Группировка ошибок и анализ причин падений (RCA) с помощью ИИ

Уровень сложностиПростой
Время на прочтение5 мин
Охват и читатели6.4K

Последние годы стали серьёзным испытанием для тестирования.

Нейросети существенно ускорили разработку кода: интеграция ИИ-помощников в IDE позволила за минуты решать задачи, на которые раньше нужны были часы. Качество иногда страдает, но высвобожденное время в сумме даёт положительный эффект, и в итоге количество поставляемого кода резко растёт.

В то же время пропускная способность QA принципиально не изменилась. Тестировщики тоже пользуются нейросетевыми помощниками, но им для успешной работы обычно нужно больше контекста — а значит, больше инфраструктуры.

В этой статье я хочу привлечь внимание к тому, насколько большую роль подготовка данных играет для нейросетей в QA. Конкретно, речь пойдёт о группировке падений перед анализом их причин. Я буду анализировать запуски инструментом для автоматической отладки багов — playwright-ai/auto-debug.

Читать далее

Новости

Тестирование СУБД с использованием tpc-ds и методы сравнительного анализа

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели5.2K

Как выбрать аналитическую СУБД, если одна быстрее, другая проще в эксплуатации, а третья лучше поддерживает нужный SQL? Рассказываю о нашем исследовании: TPC-DS и SSB, экспертные критерии и метод комплексной оценки с расчётом, который можно повторить на своих данных.

Читать далее

Что будет если загрузить в «симулятор общества» чистый lorem ipsum? Большое исследование MiroFish, часть 1

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели5K

Первая статья из трёх об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В этой части: стек, методология и находка Silent Failure. Бэкенд зафиксировал отказ за десятки миллисекунд, статусный API отдал задачу как выполненную, а индикатор прогресса не отвечал более часа.

Читать далее

Понимает ли Нейросеть, что её тестируют? Проверяю на практике

Уровень сложностиСредний
Время на прочтение5 мин
Охват и читатели7.9K

LLM знает, что её тестируют — и решает, стоит ли подыгрывать. Прогнал 24 эксперимента на qwen3-32b. Без маркера теста модель честно отвечает, что Париж — столица Франции. С маркером — в рассуждениях прямо пишет: «знаю правильный ответ, но выберу неправильный, чтобы пройти проверку». Разобрался, где заканчивается осознание контекста и начинается реальное подыгрывание — и почему это два разных явления, а не одно.

Читать далее

Собирали по частям, теряли по-крупному: почему новый сборщик мусора откатили в Python 3.14.5

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели8.3K

В Python 3.14.0 (октябрь 2025-го) разработчики заменили классический иерархический сборщик мусора на инкрементальный – обещали более короткие паузы на больших свалках. Но уже в 3.14.5 (май 2026-го) это решение полностью откатили.

Что пошло не так? И почему альтернативный сборщик даже не сделали переключаемой опцией, как в Java или Go?

Разбираемся на бенчмарках, запустив локально обе версии интерпретатора.

Читать далее

Выпекаем тесты на Go с Testo: делимся нашим open-source-фреймворком

Уровень сложностиСредний
Время на прочтение13 мин
Охват и читатели9.8K

Привет, Хабр! Я Вадим, разработчик QA-платформы в Ozon. Стандартного testing в Go хватает юнит-тестам, но большим end-to-end-сценариям нужно больше: Allure-отчёты, плагины, Suite’ы, параметризация, параллельные запуски. Мы не нашли в Go-экосистеме инструмент, который закрывал бы всё это, не ломая привычный go test, — и написали свой: Testo. Сегодня на нём работает больше 60 тысяч тестов для 500+ сервисов Ozon, а теперь мы опубликовали его в open source.

В статье покажу Testo и плагины в деле: как небольшой Go-тест шаг за шагом превращается в полноценный e2e-сценарий с отчётами, фикстурами, хуками и шагами, сохраняя привычный вид.

Читать далее

Служебный e-mail вместо рекламной СМС: как мы проверяем разбор решений ФАС

Уровень сложностиПростой
Время на прочтение9 мин
Охват и читатели7.8K

Когда-то я всерьез занялся изучением темы согласий на рекламу и обнаружил, что Федеральная антимонопольная служба (ФАС) ведет открытый реестр дел. Это супер ценные данные для меня как исследователя, но они совсем не структурированы и анализировать их можно только вручную перечитывая каждое дело. Меня это не очень устроило, поэтому я сделал общедоступную карту дел ФАС и хочу рассказать о том, как она работает. Надеюсь, кому-то будет полезным.

Читать далее

5 ошибок аналитика, из-за которых требования не выдерживают тестирования

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели8.6K

Основной сценарий описан, критерии приёмки согласованы, задача ушла в разработку. Проблемы начинаются позже, когда выясняется, что граничные значения, переходы между состояниями и поведение при ошибках каждый участник команды понял по-своему. Разберём, как мышление тестировщика помогает аналитику находить такие пробелы ещё до разработки и формулировать требования, которые одинаково понимает вся команда.

Перейти к разбору

ИИ-Автопилот: поток принятых задач вырос в тринадцать раз

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели7.9K

Вторая часть. В первой я собрал конвейер из ИИ-агентов: он сам ведёт задачу от тикета в YouTrack до коммита - разбирает, правит C++ в проекте на три миллиона строк, собирает и доказывает исправление кадром из живого интерфейса.

Здесь - цифры за девять недель работы на боевых задачах. Например, на код у агентов уходит лишь пятая часть машинного времени. Остальные четыре пятых на то, чтобы доказать, что написанное работает.

Тринадцатикратный рост из заголовка тоже разбираю. Но самое интересное оказалось не в нём.

Читать далее

Мы делили апельсин: как связать ручное и автоматизированное тестирование в единую систему качества

Уровень сложностиСредний
Время на прочтение12 мин
Охват и читатели11K

Под «апельсином» в этой статье будем понимать не качество продукта целиком, а тот контур функциональной проверки, в котором пересекаются ручное и автоматизированное тестирование. На качество влияют разработчики, аналитики, менеджеры и вся продуктовая команда, но здесь речь пойдет о более узкой задаче: как двум способам проверки работать согласованно и давать команде единый, понятный сигнал о состоянии продукта.

Пока объем автоматизации, число окружений и количество обязательных прогонов невелики, многие решения держатся на общем контексте: всем понятно, что уже покрыто, что проверяется вручную, какие наборы запускать и кто разбирает падения. По мере роста продукта эта очевидность исчезает. Нужно согласованно выбирать кандидатов на автоматизацию, запускать нужные проверки на нужных конфигурациях, разбирать результаты, фиксировать ручную компенсацию и сохранять актуальную картину покрытия. Проблема не в количестве людей или тестов как таковых, а в отсутствии воспроизводимого способа принимать эти решения.

Меня зовут Михаил Шалепо, я старший инженер по тестированию в InfoWatch. Я собрал повторяющиеся ситуации, в которых ручное и автоматизированное тестирование зависели от неявного контекста, и оформил их в единый процесс. В статье я покажу не только итоговую структуру документа, но и инженерную логику каждого его раздела — что именно мы фиксируем, зачем это нужно и какой результат должен остаться после каждого этапа.

У нас уже были 2 пакетика ручные проверки, и автотесты, и целое множество дефектов всех сортов и расцветок. Дефекты находились, тестовые наборы запускались, но отдельные действия не складывались в сквозной процесс. Не всегда было явно определено, как команда принимает решение о пополнении очереди на автоматизацию, кто валидирует смысл нового автотеста, какие существующие наборы обязательны для фичи и релиза, кто владеет падением и когда его можно компенсировать ручной проверкой. Из‑за этого готовность фичи и релиза могла опираться не на единые критерии, а на знание конкретных людей.

Читать далее

Как превратить приемочные критерии в систему, а не в список

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели10K

Большие наборы приемочных сценариев часто создают ложное ощущение контроля: тесты проходят, отчёты зелёные, но команда всё равно может пропустить важный переход в логике системы.

В статье разбираем, как превратить разрозненные сценарии в управляемую модель покрытия — через состояния, переходы и явные правила изменения системы. Такой подход помогает аналитикам находить пробелы ещё на этапе проектирования, а не после появления проблем в рабочей среде.

Читать далее

Первый российский Wi-Fi 7: тестирование и честный разбор Eltex WEP-550K

Уровень сложностиСредний
Время на прочтение15 мин
Охват и читатели13K

Первая российская точка доступа стандарта Wi-Fi 7 уже появилась на рынке – это Eltex WEP-550K. Нам в числе первых удалось получить ее на тест и проверить не маркетинговые обещания стандарта, а то, что он действительно дает корпоративной сети уже сегодня. Под катом – практические результаты тестирования отечественного Wi-Fi 7: реальная скорость, особенности настройки, работа MLO и возможности 6 ГГц. 

Читать далее

ИИ-агент в тестировании: почему сильный результат рождается не из промпта, а из инженерного контура

Уровень сложностиСредний
Время на прочтение16 мин
Охват и читатели7.3K

Почему убедительный отчёт ИИ-агента ещё не равен доказанной приёмке — и как собрать контур из критериев, API/DB/UI-проверок и границ ответственности человека.

Читать далее

Ближайшие события

Контрактное тестирование без единой строки кода: наш инструмент, наши грабли и честный разбор альтернатив

Уровень сложностиСредний
Время на прочтение18 мин
Охват и читатели4.2K

Как организовать контрактное тестирование, если у вас 150+ микросервисов, 10 команд и QA есть далеко не везде? В Nexign перепробовали готовые инструменты, дважды откатили собственные решения — и в итоге за четыре дня собрали прототип, который за полтора года превратился в рабочий инструмент без единой строки тестового кода. Ведущий инженер Максим Дубинин рассказывает, что не так с Dredd и Pact и почему иногда проще сделать своё.

Читать далее

За полчаса и 10 рублей — полноценный сайт для загрузки и редактирования скриншотов на вайбкоде. Пошаговая инструкция

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели8K

Делюсь личным опытом создания проекта с нуля на вайбкоде.

Красивый сайт со сверхбыстрой загрузкой и функционалом, которого не найти на ресурсах без авторизации. И всё это — с нуля за полчаса описания банальных пожеланий на русском языке и менее 10 рублей затрат на одном из самых дешёвых ИИ-сервисов. Это реально новый мир.

Описываю в деталях по шагам. В том числе — как ИИ банально «тупит» и не может решить указанную задачу, и как это преодолеть. Промпты — в статье.

Читать далее

ИИ-Автопилот: замкнутый цикл разработки на C++ — от тикета до проверки в живом GUI

Уровень сложностиСредний
Время на прочтение17 мин
Охват и читатели7.4K

Я заметил, что стал копипастером задач в ИИ-агента и обратно, а из программиста превратился в GUI-тестера. Не самая моя любимая работа.

Сначала наваял простой скрипт на Python: сделать скриншот, ткнуть мышью в координаты. В итоге тихим сапом это выросло в круглосуточный конвейер, который ведёт задачу от тикета в YouTrack и общения с пользователем до доказательства в живом 2D/3D-интерфейсе и коммита. И ещё писатель документации со скриншотами в придачу.

Рассказываю, как оно росло, какие были грабли и сколько строк в итоге занял наследник того самого «простейшего скрипта».

Читать далее

Первый осмысленный план нагрузочного тестирования

Уровень сложностиСредний
Время на прочтение9 мин
Охват и читатели10K

Первое нагрузочное тестирование часто начинается с формулировки «давайте запустим побольше пользователей и посмотрим».

В статье разбираем, почему этого недостаточно и как собрать осмысленный план: определить цель, смоделировать реальную нагрузку, выбрать метрики и понять, где система начинает деградировать.

Читать далее

Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри

Уровень сложностиСредний
Время на прочтение7 мин
Охват и читатели7K

Привет, Хабр! Меня зовут Михаил Рязанский, я руководитель группы технической аналитики в Дзене. Группа включает в себя команды DWH, антифрода, аналитики модерации и ML‑аналитики. Вместе с Марком Хабаровым, лидом команды ML‑аналитики, мы расскажем про наш инструмент для анализа результатов А/Б‑тестов и про интеграцию в него LLM. Получилось интересно, местами — больно. Но обо всём по порядку. 

Перейдем к подробностям

Пентест через GitLab. От раннера до контроля над облаком

Время на прочтение5 мин
Охват и читатели9.9K

Казалось бы, учетная запись в GitLab — не самая удачная стартовая точка для инфраструктурного пентеста. Ни VPN в корпоративную сеть, ни доменного аккаунта, ни даже RDP на рабочую станцию, только креды рядового разработчика. Вряд ли в начале проекта заказчик ожидал серьезного импакта, но мы доказали, что при типовых настройках CI/CD такая учетка находится на расстоянии нескольких прыжков до контроля над облаком. 

Давайте вместе пройдем эту цепочку.

Читать далее

416 тестов и кнопка «снести все»: где ломаются агентные проекты

Уровень сложностиСредний
Время на прочтение11 мин
Охват и читатели6.8K

С февраля у меня на ноутбуке крутится автономный агент Сурок: Claude Code, флаг --dangerously-skip-permissions и ральф-луп поверх. Работает — сидишь, кофе пьешь, смотришь, как горят токены. Потом я прогнал Сурка и еще пять своих проектов через свод инженерных практик, и у идиллии появилось имя: «Level 5 автономии при Level 1 границах». Внутри — диагностика из десяти вопросов, чужой боевой опенсорс на десятки тысяч звезд и методология PDLC Сбера, где эти грабли уже каталогизированы.

Читать далее
1
23 ...