ViT afinado para clasificación de residuos sólidos

Modelo Vision Transformer (ViT) afinado para clasificar imágenes de residuos sólidos en 9 categorías, desarrollado como parte del Quiz 02 del curso Aprendizaje Automático del Programa de Ciencia de Datos, Instituto Tecnológico de Costa Rica (ITCR).

Clases

El modelo clasifica imágenes en 9 categorías de residuos sólidos provenientes del dataset WasteWise: Know Your Waste.

Metodología

Se partió del modelo preentrenado google/vit-base-patch16-224-in21k, el cual fue preentrenado en ImageNet-21k con 14 millones de imágenes y 21,000 clases. Se reemplazó la cabeza de clasificación original por una nueva adaptada a las 9 clases del dataset.

Preparación de datos:

  • Fuente: WasteWise: Know Your Waste (Kaggle)
  • División estratificada: 70% entrenamiento, 15% validación, 15% pruebas
  • Preprocesamiento: redimensionamiento a 224×224 px y normalización con media y desviación estándar de ImageNet

Hiperparámetros:

  • Tasa de aprendizaje: 2e-4
  • Tamaño de lote: 16
  • Épocas máximas: 10
  • Weight decay: 0.01
  • Warmup steps: 100
  • Criterio de parada: Early stopping con patience=3

Infraestructura: Google Colab con GPU T4

Resultados de entrenamiento

Época Training Loss Validation Loss Accuracy
1 1.953428 1.528971 0.5625
2 1.000155 0.877994 0.7292
3 0.413463 0.630204 0.7917
4 0.177567 0.509301 0.8750
5 0.076250 0.620498 0.8125
6 0.045616 0.583018 0.8333
7 0.034395 0.574307 0.8264

El entrenamiento se detuvo en la época 7 por early stopping. El mejor modelo corresponde a la época 4 con accuracy de validación de 87.5%.

Downloads last month
23
Safetensors
Model size
85.8M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for CarlosEsquivelSinfonte/vit-waste-segregation

Finetuned
(2580)
this model

Dataset used to train CarlosEsquivelSinfonte/vit-waste-segregation