Open
2,922 results
AudioMultimodalText
Multilingual TEDx (mTEDx) — SLR100
Multilingual TEDx (mTEDx) — SLR100
100K–1M·CC-BY-NC-ND·Parquet
Text
OPUS Europarl (European Parliament Proceedings Parallel Corpus)
OPUS Europarl (European Parliament Proceedings Parallel Corpus)
100M–1B·Custom / Research-only·Parquet
Text
Traditional_Chinese-aya_collection
Traditional Chinese-aya collection
1M–10M·Apache-2.0·Parquet
ImageMultimodalText
BEAF
BEAF: Before-After Changes for Hallucination Evaluation BEAF is a benchmark for evaluating object hallucination in vision-language models using…
10K–100K·CC-BY·Parquet
ImageMultimodalText
MultiChartQA
MultiChartQA This repository contains the questions and answers for our Multi-chart Benchmark. At present, only the data is…
1K–10K·CC-BY-NC·Parquet
ImageMultimodalText
DocVQA-2026
DocVQA 2026 ICDAR2026 Competition on Multimodal Reasoning over Documents in Multiple Domains Building upon previous DocVQA benchmarks, this…
<1K·Parquet
ImageMultimodalText
GQA-ru
GQA-ru This is a translated version of original GQA dataset and stored in format supported for lmms-eval pipeline.…
10K–100K·Apache-2.0·Parquet