Обновить
2K+
11
Дмитрий@Lightxaoc

Системный аналитик

4,2
Рейтинг
4
Подписчики
Отправить сообщение

10+ млрд строк, 30 000+ таблиц, 5500 полей с персональными данными. Как мы автоматизировали обезличивание на большой БД

Уровень сложностиСредний
Время на прочтение14 мин
Охват и читатели8.8K

Привет! Меня зовут Дима Левин, сейчас я работаю системным аналитиком в Петрович-Техе. Так уж сложилось, что в своей работе в нескольких проектах я плотно работал с персональными данными. Сегодня хочу рассказать о проекте по автоматизации обезличивания большой БД (30 000+ таблиц размером до 10 миллиардов строк). Надеюсь, мой опыт будет полезен.

С каждым годом появляется все больше и больше требований в работе с персональными данными (ПДн). Списки данных, подпадающих под статус ПДн, регулярно расширяются, а ответственность за утечку ПДн повышается.

Работать в разработке и тестировании ПО в таких условиях становится всё сложнее, особенно когда по разным причинам необходимо привлечь внешних специалистов или подрядную организацию, а подключаемая к ПО база данных содержит ПДн.

Конечно, можно сгенерировать данные для любой БД, исключив ПДн, но не во всех ситуациях этот вариант подходит, т.к. в таком случае невозможно учесть все нюансы и особенности данных. Существует достаточно много инструментов и для генерации, и для анонимизации данных, но в наших нынешних реалиях и условиях техстека компаний далеко не всё можно применить. Кроме того, какой бы подход не был выбран, разбираться в его тонкостях обезличивания всё равно придётся.

Читать далее

Информация

В рейтинге
1 351-й
Работает в
Зарегистрирован
Активность

Специализация

Системный аналитик, Аналитик по данным
Ведущий
Проектирование баз данных
DWH
ETL
SQL
Базы данных
PostgreSQL
Алгоритмы и структуры данных
MySQL