Skip to content
Advertisement

Multilingual

575 results

ImageMultimodalTabular

SLAKE

Dataset Info: SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering ISBI 2021 oral Project Page: click…

10K–100K·CC-BY·JSON
ImageMultimodalText

FUSION-Finetune-12M

FUSION-12M Dataset Please see paper & website for more information: Overview FUSION-12M is a large-scale, diverse multimodal instruction-tuning…

1K–10K·Apache-2.0·Parquet
ImageMultimodalText

emova-sft-speech-231k

EMOVA-SFT-Speech-231K 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

100K–1M·Apache-2.0·Parquet
AudioMultimodalText

VOX-DUB

VOX-DUB is a human-based benchmark for evaluating AI dubbing systems.It includes: Audio fragments with original speech from real…

1K–10K·Parquet
AudioMultimodalText

InstructTTSEval

InstructTTSEval InstructTTSEval is a comprehensive benchmark designed to evaluate Text-to-Speech (TTS) systems' ability to follow complex…

1K–10K·MIT·Parquet
Advertisement