Image Captioning Keras ResNet-LSTM (Flickr30k)

Ce modèle a été entraîné sur un sous-ensemble du jeu de données Flickr30k. Il utilise une architecture Codeur-Décodeur (ResNet50 pour l'extraction des caractéristiques de l'image et un LSTM pour la génération séquentielle de texte).

Objectifs : Le modèle prend une image en entrée et génère une description textuelle.

Artefacts essentiels:

  • caption_decoder_final.weights.h5: Poids entraînés du décodeur.
  • tokenizer.pkl: Tokenizer pour la conversion mot/ID.
  • model.py: Fichier d'architecture du modèle.

ATTENTION: Le modèle peut présenter un biais d'apprentissage ("man on the beach") dû à l'utilisation du vocabulaire non filtré. Une nouvelle session d'entraînement est prévue.

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support