Instructions to use vladlinv/ru-pii-gate with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use vladlinv/ru-pii-gate with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="vladlinv/ru-pii-gate")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("vladlinv/ru-pii-gate") model = AutoModelForSequenceClassification.from_pretrained("vladlinv/ru-pii-gate", device_map="auto") - Notebooks
- Google Colab
- Kaggle
О модели
Бинарная модель классификации документов для предварительной фильтрации перед vladlinv/ru-pii-ner. Она оценивает вероятность наличия персональных данных: документы с вероятностью выше выбранного порога передаются основной NER-модели, остальные отсеиваются. Это снижает нагрузку на пайплайн при сохранении требуемой полноты.
Модель только оценивает, содержатся ли во фрагменте ПДн, но не определяет их типы и границы в тексте.
Метрики
Валидационная выборка из 1 800 фрагментов, половина с ПДн
| Порог | Recall | Precision | F1 | TP | TN | FP | FN |
|---|---|---|---|---|---|---|---|
| 0.0026 | 0.996 | 0.652 | 0.788 | 896 | 422 | 478 | 4 |
| 0.0065 | 0.990 | 0.705 | 0.823 | 891 | 527 | 373 | 9 |
| 0.0402 | 0.980 | 0.829 | 0.898 | 882 | 718 | 182 | 18 |
| 0.1634 | 0.950 | 0.906 | 0.927 | 855 | 811 | 89 | 45 |
| 0.7356 | 0.900 | 0.972 | 0.935 | 810 | 877 | 23 | 90 |
Датасет
12 000 полностью сгенерированных примеров, половина с ПДн
Примеры охватывают личные документы физических лиц, кадровую и внутреннюю документацию организаций, корпоративные и административные материалы, юридические и нормативные документы, договорную, коммерческую, финансовую, бухгалтерскую и банковскую документацию. Также государственные и регистрационные документы, медицинские, социальные и образовательные материалы, производственную и техническую документацию, документы об имуществе и транспорте, деловую и пользовательскую переписку, реестры, справочники, формы и таблицы.
В датасете представлены варианты bad OCR, HTML, Markdown и других форматов. Документы нарезаны окнами от 32 до 8 192 токенов; длины равномерно распределены по выборке.
Архитектура
Модель построена на базе deepvk/RuModernBERT-small и дополнена бинарной классификационной головой.
Использование
Оценка одного фрагмента:
from transformers import pipeline
gate = pipeline("text-classification", model="vladlinv/ru-pii-gate")
print(gate("Иванов Иван Иванович, паспорт 4509 123456"))
[{"label": "PII", "score": 0.9987}]
Порог отсечения выбирается по таблице метрик вашего типичного набора данных. Фрагменты со score выше порога передаются модели vladlinv/ru-pii-ner, остальные пропускаются без разметки.
Ограничения
Модель — только один из слоёв системы обезличивания ПДн. Она предназначена для предварительной фильтрации и должна использоваться вместе с моделью распознавания сущностей, регулярными выражениями, словарями и прикладными правилами. Ни модель, ни полностью автоматический пайплайн не могут гарантировать обнаружение всех чувствительных данных.
Модель определяет только наличие персональных данных во фрагменте и не находит их границы и типы. Она не выявляет коммерческую тайну и другую конфиденциальную информацию, не относящуюся к физическим лицам.
- Downloads last month
- -
Model tree for vladlinv/ru-pii-gate
Base model
deepvk/RuModernBERT-small