{"_id":"68189dd37dcf6bc2669cead5","id":"gorjanradevski/dave","author":"gorjanradevski","sha":"fd4d94a1d57726b3788dff3616494a70d5864ad8","lastModified":"2025-12-04T15:07:25.000Z","private":false,"gated":false,"disabled":false,"tags":["task_categories:visual-question-answering","task_categories:video-text-to-text","language:en","license:mit","size_categories:1K<n<10K","library:mlcroissant","arxiv:2503.09321","region:us","croissant"],"description":"\n\t\n\t\t\n\t\n\t\n\t\tDataset Card for DAVE 👨🏿‍🔬: Diagnostic benchmark for Audio Visual Evaluation\n\t\n\nDAVE is a diagnostic benchmark for evaluating audio-visual models, ensuring both modalities are required and providing fine-grained error analysis to reveal specific failures. Researchers can use DAVE to test and compare audio-visual models, refine multi-modal architectures, or develop new methods for audio-visual alignment. It is not intended for training large-scale models but for targeted… See the full description on the dataset page: https://huggingface.co/datasets/gorjanradevski/dave.","downloads":189,"likes":0,"cardData":{"license":"mit","configs":[{"config_name":"default","data_files":[{"split":"Epic","path":"epic.json"},{"split":"Ego4D","path":"ego4d.json"}]}],"task_categories":["visual-question-answering","video-text-to-text"],"language":["en"],"pretty_name":"dave","size_categories":["1K<n<10K"],"tags":["croissant"]},"siblings":[{"rfilename":".gitattributes"},{"rfilename":"README.md"},{"rfilename":"assets/.keep"},{"rfilename":"assets/teaser.png"},{"rfilename":"croissant.json"},{"rfilename":"dave.py"},{"rfilename":"ego4d.json"},{"rfilename":"ego4d.zip"},{"rfilename":"epic.json"},{"rfilename":"epic.zip"}],"createdAt":"2025-05-05T11:15:31.000Z","usedStorage":113301803908}