QA BETO SQuAD-ES PDQA (modelo final = baseline oficial)

Descripción

Modelo desarrollado para el Dominican News Question Answering Challenge de ICC-344-T. El sistema recibe una pregunta y un contexto noticioso, y extrae una respuesta contenida explícitamente en el contexto.

Integrantes

  • Fanny Raciely Gomez Williams 1015 4383
  • Yuji Yamaki Kokubun 1015 3238

Recursos oficiales

Modelo base

  • Repositorio: Lisibonny/modelo_qa_beto_squad_es_pdqa
  • Justificación: se probaron dos variantes de fine-tuning adicional sobre las 45 filas de train, y ninguna superó al baseline oficial (ver "Experimentos" abajo). Con la evidencia disponible, el modelo base sin modificar es la mejor opción.
  • Número aproximado de parámetros: ~110M (arquitectura BERT-base / BETO)

Datos

División Filas Uso
train 45 Entrenamiento
validation 15 Comparación y selección
test 20 Predicciones finales

No se publicaron ni utilizaron respuestas privadas de test.

Entrenamiento

El modelo final no usa entrenamiento adicional (es el baseline oficial sin modificar). La tabla describe los hiperparámetros usados en los intentos de fine-tuning (Variantes 1 y 2), ninguno de los cuales fue seleccionado como final.

Parámetro Valor
Seed 42
Learning rate 3e-5
Batch size 8
Épocas 3 (Variante 1) / 8 (Variante 2)
Max length 384
Doc stride 128
Weight decay 0.01
Hardware CPU (Google Colab)
Tiempo ~10 min (Variante 1) / ~25 min (Variante 2)

Experimentos

Experimento Cambio EM validation F1 validation
Baseline oficial Sin cambios 60.0 75.8
Variante 1 Fine-tuning sobre train (45 ejemplos), 3 épocas, lr=3e-5 53.3 68.7
Variante 2 Igual que Variante 1 pero 8 épocas (ablación: única variable cambiada) 60.0 71.0
Modelo final = Baseline oficial (ninguna variante lo superó) 60.0 75.8

Ablación o comparación controlada

Se comparó Variante 1 (3 épocas) contra Variante 2 (8 épocas), manteniendo fijos el modelo base, el learning rate (3e-5) y la semilla (42) — la única variable que cambió fue el número de épocas de entrenamiento.

Resultado: más épocas mejoró el desempeño de la variante (EM 53.3→60.0, F1 68.7→71.0), indicando que 3 épocas son insuficientes para adaptar el modelo con tan pocos ejemplos (45). Sin embargo, ni siquiera con 8 épocas se igualó el F1 del baseline (71.0 vs. 75.8), lo que sugiere que el fine-tuning ingenuo sobre un dataset tan pequeño tiende a degradar el conocimiento ya adquirido por el baseline en su preentrenamiento sobre SQuAD-es, en vez de mejorarlo.

Resultados

  • Exact Match en validation: 60.0
  • F1 en validation: 75.84
  • Script de evaluación: 05_evaluate_qa.py

Ejemplo de uso

from transformers import pipeline

qa = pipeline(
    "question-answering",
    model="YujiYamaki/qa_final_es",
    tokenizer="YujiYamaki/qa_final_es"
)

qa(
    question="¿Quién hizo el anuncio?",
    context="La ministra informó que el programa comenzará en agosto."
)

Análisis de errores

De 15 ejemplos de validation, el baseline falló (EM=0) en 6:

  1. Límite de span desplazado (4 de 6 errores): el modelo ubica la región correcta pero le falta o sobra una palabra funcional en el borde (preposición, artículo, verbo introductorio). Ej.: referencia "a 11 bateadores" → predicción "11 bateadores".
  2. Extracción de contenido totalmente distinto (2 de 6 errores): el modelo elige un span sin relación semántica con la respuesta esperada. Ej.: referencia "seguirá siendo alta" → predicción "en torno al 7%".
  3. Extracción incompleta en enumeraciones: cuando la respuesta es una lista de varias entidades, el modelo solo captura la última mencionada.

La mayoría de los errores (67%) son de límite de span, no de comprensión — sugiere que mejorar el post-procesamiento del span (en vez de reentrenar) es una vía más prometedora que el fine-tuning intentado.

Limitaciones

  • La respuesta debe estar presente en el contexto.
  • El modelo puede confundir entidades, fechas o cantidades similares.
  • El modelo no verifica la veracidad de la noticia.
  • No debe utilizarse como única fuente para decisiones de alto impacto.
  • Tiende a errar en los límites exactos del span (falta/sobra una palabra funcional al borde) más que en la comprensión del contenido.
  • El split test públicamente disponible de Lisibonny/pdqa actualmente expone respuestas reales y consistentes con el contexto en las 20 filas (no debería, según el diccionario de datos del proyecto); no se usaron para entrenar ni ajustar este modelo.

Reproducibilidad

  • Repositorio de código: [completar con el repositorio git del equipo]
  • Commit: [completar]
  • Notebook: 03_Introduccion_QA_Noticias.ipynb
  • Archivo de dependencias: 09_requirements.txt
  • Semillas: 42
Downloads last month
-
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for YujiYamaki/qa_final_es

Finetuned
(6)
this model

Dataset used to train YujiYamaki/qa_final_es