Маскирование данных для тестов и аналитики
Тестовая база с реальными клиентами, выгрузка в Excel для аналитика, демо-стенд с настоящими договорами — всё это удобно, но это персональные данные там, где они не нужны. А значит — лишний риск утечки и вопросы по 152-ФЗ. Решение — маскирование: работать с обезличенными, но правдоподобными данными.
Почему нельзя реальные ПДн в тестах
- Лишняя поверхность атаки. Тестовые среды защищены слабее боевых, доступ к ним шире, а бэкапы разлетаются по ноутбукам.
- Демо и обучение. Показывать систему клиенту на чужих реальных данных недопустимо.
- Комплаенс. Обработка ПДн в тестовых целях без оснований — риск претензий.
Какими должны быть тестовые данные
Чтобы заменить реальные данные, фейки должны быть «как настоящие»:
- валидный формат — ИНН проходит контрольную сумму, телефон выглядит как телефон;
- консистентность — один и тот же клиент заменяется одинаково во всех местах, иначе ломаются связи между таблицами;
- правдоподобие — реалистичные ФИО и адреса, чтобы интерфейсы и отчёты выглядели естественно.
Два подхода
- Метки (
[ФИО_1],[ИНН_2]) — когда важны читаемость и наглядность связей, а валидность формата не критична. - Правдоподобные значения — фейковые, но корректные по контрольной сумме номера и реалистичные имена. Подходят там, где система проверяет формат на вводе.
Готовые тестовые реквизиты можно быстро взять в генераторе, а целый документ обезличить в инструменте.
Типичные сценарии
- Тестовый стенд: обезличенная копия боевых данных вместо реальной.
- Аналитика и BI: выгрузка без ФИО и контактов — для агрегатов они не нужны.
- Передача датасета подрядчику: разработчику хватает структуры и форматов.
Вывод
Реальные персональные данные в тестах и отчётах — это риск, которого легко избежать. Маскирование с правдоподобными, но валидными значениями даёт рабочие данные без лишней ответственности. Подготовьте тестовый набор в генераторе или обезличьте готовую выгрузку в инструменте.