ViT afinado para clasificación de residuos sólidos
Modelo Vision Transformer (ViT) afinado para clasificar imágenes de residuos sólidos en 9 categorías, desarrollado como parte del Quiz 02 del curso Aprendizaje Automático del Programa de Ciencia de Datos, Instituto Tecnológico de Costa Rica (ITCR).
Clases
El modelo clasifica imágenes en 9 categorías de residuos sólidos provenientes del dataset WasteWise: Know Your Waste.
Metodología
Se partió del modelo preentrenado google/vit-base-patch16-224-in21k, el cual fue preentrenado en ImageNet-21k con 14 millones de imágenes y 21,000 clases. Se reemplazó la cabeza de clasificación original por una nueva adaptada a las 9 clases del dataset.
Preparación de datos:
- Fuente: WasteWise: Know Your Waste (Kaggle)
- División estratificada: 70% entrenamiento, 15% validación, 15% pruebas
- Preprocesamiento: redimensionamiento a 224×224 px y normalización con media y desviación estándar de ImageNet
Hiperparámetros:
- Tasa de aprendizaje: 2e-4
- Tamaño de lote: 16
- Épocas máximas: 10
- Weight decay: 0.01
- Warmup steps: 100
- Criterio de parada: Early stopping con patience=3
Infraestructura: Google Colab con GPU T4
Resultados de entrenamiento
| Época | Training Loss | Validation Loss | Accuracy |
|---|---|---|---|
| 1 | 1.953428 | 1.528971 | 0.5625 |
| 2 | 1.000155 | 0.877994 | 0.7292 |
| 3 | 0.413463 | 0.630204 | 0.7917 |
| 4 | 0.177567 | 0.509301 | 0.8750 |
| 5 | 0.076250 | 0.620498 | 0.8125 |
| 6 | 0.045616 | 0.583018 | 0.8333 |
| 7 | 0.034395 | 0.574307 | 0.8264 |
El entrenamiento se detuvo en la época 7 por early stopping. El mejor modelo corresponde a la época 4 con accuracy de validación de 87.5%.
- Downloads last month
- 23
Model tree for CarlosEsquivelSinfonte/vit-waste-segregation
Base model
google/vit-base-patch16-224-in21k