О модели

Бинарная модель классификации документов для предварительной фильтрации перед vladlinv/ru-pii-ner. Она оценивает вероятность наличия персональных данных: документы с вероятностью выше выбранного порога передаются основной NER-модели, остальные отсеиваются. Это снижает нагрузку на пайплайн при сохранении требуемой полноты.

Модель только оценивает, содержатся ли во фрагменте ПДн, но не определяет их типы и границы в тексте.

Метрики

Валидационная выборка из 1 800 фрагментов, половина с ПДн

Порог Recall Precision F1 TP TN FP FN
0.0026 0.996 0.652 0.788 896 422 478 4
0.0065 0.990 0.705 0.823 891 527 373 9
0.0402 0.980 0.829 0.898 882 718 182 18
0.1634 0.950 0.906 0.927 855 811 89 45
0.7356 0.900 0.972 0.935 810 877 23 90

Датасет

12 000 полностью сгенерированных примеров, половина с ПДн

Примеры охватывают личные документы физических лиц, кадровую и внутреннюю документацию организаций, корпоративные и административные материалы, юридические и нормативные документы, договорную, коммерческую, финансовую, бухгалтерскую и банковскую документацию. Также государственные и регистрационные документы, медицинские, социальные и образовательные материалы, производственную и техническую документацию, документы об имуществе и транспорте, деловую и пользовательскую переписку, реестры, справочники, формы и таблицы.

В датасете представлены варианты bad OCR, HTML, Markdown и других форматов. Документы нарезаны окнами от 32 до 8 192 токенов; длины равномерно распределены по выборке.

Архитектура

Модель построена на базе deepvk/RuModernBERT-small и дополнена бинарной классификационной головой.

Использование

Оценка одного фрагмента:

from transformers import pipeline

gate = pipeline("text-classification", model="vladlinv/ru-pii-gate")

print(gate("Иванов Иван Иванович, паспорт 4509 123456"))
[{"label": "PII", "score": 0.9987}]

Порог отсечения выбирается по таблице метрик вашего типичного набора данных. Фрагменты со score выше порога передаются модели vladlinv/ru-pii-ner, остальные пропускаются без разметки.

Ограничения

Модель — только один из слоёв системы обезличивания ПДн. Она предназначена для предварительной фильтрации и должна использоваться вместе с моделью распознавания сущностей, регулярными выражениями, словарями и прикладными правилами. Ни модель, ни полностью автоматический пайплайн не могут гарантировать обнаружение всех чувствительных данных.

Модель определяет только наличие персональных данных во фрагменте и не находит их границы и типы. Она не выявляет коммерческую тайну и другую конфиденциальную информацию, не относящуюся к физическим лицам.

Downloads last month
-
Safetensors
Model size
34.5M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for vladlinv/ru-pii-gate

Finetuned
(9)
this model

Collection including vladlinv/ru-pii-gate