Prošnja: GaMS z vidnim delom (vision encoder)

#1
by OriginLive - opened

Bi lahko pri naslednji različici GaMS obdržali vidni del Gemme (3 ali 4), da bi model bral tudi zaslonske slike in skenirane dokumente, ne samo besedila?

Center za jezikovne vire in tehnologije Univerze v Ljubljani org

Beta verzija multimodalnega GaMS3 modela že obstaja: https://huggingface.co/GaMS-Beta/GaMS3-12B-Multimodal. Naslednje različice bodo po planu že v osnovi podpirale vsaj slike.

dvres changed discussion status to closed

Sign up or log in to comment