Product Image Classification
Классификатор изображений товаров (смартфоны, ноутбуки, телевизоры, часы, наушники) на базе Vision Transformer (ViT).
Модель обучена на датасете изображений, собранных с узбекских маркетплейсов (asaxiy.uz, texnomart.uz, olcha.uz).
Описание и характеристики
- Базовая архитектура:
google/vit-base-patch16-224-in21k - Категории (5 классов):
headphones,laptop,smartphone,tv,watch - Размер входного изображения: 224x224 RGB
Качество модели (Evaluation)
Оценка производилась на тестовой выборке (dataset_prepared/test, 163 изображения):
| Категория | Precision | Recall | F1-Score | Support |
|---|---|---|---|---|
| headphones | 0.9091 | 0.9091 | 0.9091 | 33 |
| laptop | 0.9655 | 0.9032 | 0.9333 | 31 |
| smartphone | 0.8684 | 1.0000 | 0.9296 | 33 |
| tv | 1.0000 | 0.9697 | 0.9846 | 33 |
| watch | 1.0000 | 0.9394 | 0.9688 | 33 |
| Accuracy | 0.9448 | 163 |
Быстрый старт (Quickstart)
Для использования модели понадобятся библиотеки transformers, torch и pillow:
pip install transformers torch pillow
- Downloads last month
- 41
Evaluation results
- accuracyself-reported0.945