QA BETO SQuAD-ES PDQA (modelo final = baseline oficial)
Descripción
Modelo desarrollado para el Dominican News Question Answering Challenge de ICC-344-T. El sistema recibe una pregunta y un contexto noticioso, y extrae una respuesta contenida explícitamente en el contexto.
Integrantes
- Fanny Raciely Gomez Williams 1015 4383
- Yuji Yamaki Kokubun 1015 3238
Recursos oficiales
- Dataset: Lisibonny/pdqa
- Baseline: Lisibonny/modelo_qa_beto_squad_es_pdqa
- Aplicación: Lisibonny/Repartidor_Dominicano
Modelo base
- Repositorio: Lisibonny/modelo_qa_beto_squad_es_pdqa
- Justificación: se probaron dos variantes de fine-tuning adicional sobre las 45 filas de train, y ninguna superó al baseline oficial (ver "Experimentos" abajo). Con la evidencia disponible, el modelo base sin modificar es la mejor opción.
- Número aproximado de parámetros: ~110M (arquitectura BERT-base / BETO)
Datos
| División | Filas | Uso |
|---|---|---|
| train | 45 | Entrenamiento |
| validation | 15 | Comparación y selección |
| test | 20 | Predicciones finales |
No se publicaron ni utilizaron respuestas privadas de test.
Entrenamiento
El modelo final no usa entrenamiento adicional (es el baseline oficial sin modificar). La tabla describe los hiperparámetros usados en los intentos de fine-tuning (Variantes 1 y 2), ninguno de los cuales fue seleccionado como final.
| Parámetro | Valor |
|---|---|
| Seed | 42 |
| Learning rate | 3e-5 |
| Batch size | 8 |
| Épocas | 3 (Variante 1) / 8 (Variante 2) |
| Max length | 384 |
| Doc stride | 128 |
| Weight decay | 0.01 |
| Hardware | CPU (Google Colab) |
| Tiempo | ~10 min (Variante 1) / ~25 min (Variante 2) |
Experimentos
| Experimento | Cambio | EM validation | F1 validation |
|---|---|---|---|
| Baseline oficial | Sin cambios | 60.0 | 75.8 |
| Variante 1 | Fine-tuning sobre train (45 ejemplos), 3 épocas, lr=3e-5 | 53.3 | 68.7 |
| Variante 2 | Igual que Variante 1 pero 8 épocas (ablación: única variable cambiada) | 60.0 | 71.0 |
| Modelo final | = Baseline oficial (ninguna variante lo superó) | 60.0 | 75.8 |
Ablación o comparación controlada
Se comparó Variante 1 (3 épocas) contra Variante 2 (8 épocas), manteniendo fijos el modelo base, el learning rate (3e-5) y la semilla (42) — la única variable que cambió fue el número de épocas de entrenamiento.
Resultado: más épocas mejoró el desempeño de la variante (EM 53.3→60.0, F1 68.7→71.0), indicando que 3 épocas son insuficientes para adaptar el modelo con tan pocos ejemplos (45). Sin embargo, ni siquiera con 8 épocas se igualó el F1 del baseline (71.0 vs. 75.8), lo que sugiere que el fine-tuning ingenuo sobre un dataset tan pequeño tiende a degradar el conocimiento ya adquirido por el baseline en su preentrenamiento sobre SQuAD-es, en vez de mejorarlo.
Resultados
- Exact Match en validation: 60.0
- F1 en validation: 75.84
- Script de evaluación:
05_evaluate_qa.py
Ejemplo de uso
from transformers import pipeline
qa = pipeline(
"question-answering",
model="YujiYamaki/qa_final_es",
tokenizer="YujiYamaki/qa_final_es"
)
qa(
question="¿Quién hizo el anuncio?",
context="La ministra informó que el programa comenzará en agosto."
)
Análisis de errores
De 15 ejemplos de validation, el baseline falló (EM=0) en 6:
- Límite de span desplazado (4 de 6 errores): el modelo ubica la región correcta pero le falta o sobra una palabra funcional en el borde (preposición, artículo, verbo introductorio). Ej.: referencia "a 11 bateadores" → predicción "11 bateadores".
- Extracción de contenido totalmente distinto (2 de 6 errores): el modelo elige un span sin relación semántica con la respuesta esperada. Ej.: referencia "seguirá siendo alta" → predicción "en torno al 7%".
- Extracción incompleta en enumeraciones: cuando la respuesta es una lista de varias entidades, el modelo solo captura la última mencionada.
La mayoría de los errores (67%) son de límite de span, no de comprensión — sugiere que mejorar el post-procesamiento del span (en vez de reentrenar) es una vía más prometedora que el fine-tuning intentado.
Limitaciones
- La respuesta debe estar presente en el contexto.
- El modelo puede confundir entidades, fechas o cantidades similares.
- El modelo no verifica la veracidad de la noticia.
- No debe utilizarse como única fuente para decisiones de alto impacto.
- Tiende a errar en los límites exactos del span (falta/sobra una palabra funcional al borde) más que en la comprensión del contenido.
- El split
testpúblicamente disponible deLisibonny/pdqaactualmente expone respuestas reales y consistentes con el contexto en las 20 filas (no debería, según el diccionario de datos del proyecto); no se usaron para entrenar ni ajustar este modelo.
Reproducibilidad
- Repositorio de código: [completar con el repositorio git del equipo]
- Commit: [completar]
- Notebook:
03_Introduccion_QA_Noticias.ipynb - Archivo de dependencias:
09_requirements.txt - Semillas: 42
- Downloads last month
- -
Model tree for YujiYamaki/qa_final_es
Base model
Lisibonny/modelo_qa_beto_squad_es_pdqa