Skip to content
Advertisement

Datasets

2,147 results

ImageMultimodalTabular

ChEBI-20-MM

ChEBI-20-MM Dataset Overview The ChEBI-20-MM is an extensive and multi-modal benchmark developed from the ChEBI-20 dataset. It is…

10K–100K·MIT·CSV
MultimodalTabularText

JMedBench

Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…

100K–1M·JSON
ImageMultimodalText

Flickr30k

Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…

10K–100K·CC-BY·Parquet
AudioMultimodalText

MultiMed-ST

MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…

10K–100K·MIT·Parquet
MultimodalTabularText

bhasha-sft

Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…

10M–100M·Mixed·Parquet
AudioMultimodalText

wmt-human-all-TTS

WMT Human + TTS Audio WMT human evaluation data (zouharvi/wmt-human-all) extended with TTS-synthesised source audio, covering 49 language…

100K–1M·CC-BY·Parquet
ImageMultimodalText

COCO-35L

Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…

100K–1M·Parquet
ImageMultimodalText

CC3M-35L

Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…

1M–10M·Parquet
Advertisement