Question Answering
190 results
MapEval-API
MapEval-API MapEval-API is created using MapQaTor. Usage from datasets import load dataset Load dataset ds = load dataset("MapEval/MapEval-API",…
CHOICE
CHOICE: Benchmarking The Remote Sensing Capabilities of Large Vision-Language Models Abstract: The rapid advancement of Large Vision-Language Models…
GS-QA2: Question Answering over Raster–Vector Geospatial Data
GS-QA2: Question Answering over Raster–Vector Geospatial Data
remote_sensing_VQA_multilingual
Remote Sensing VQA — Multilingual A multilingual counterfactual MCQ dataset built from remote sensing / satellite imagery. Each…
EarthVLSet
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework by Junjue Wang, Yanfei Zhong, Zihang Chen, Zhuo Zheng,…
M4LE
Introduction M4LE is a Multi-ability, Multi-range, Multi-task, bilingual benchmark for long-context evaluation. We categorize long-context…
CodeMixBench
ℹ️Dataset Card for CodeMixBench EMNLP'25 CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages Code-mixing is a linguistic…
vietnamese_health_dataset
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
MyTown — US & Canadian local-government meetings
MyTown — US & Canadian local-government meetings
planetarium
Dataset Card for Planetarium🪐 Planetarium🪐 is a dataset and benchmark for assessing LLMs in translating natural language descriptions…
Mixed Arabic Datasets (MAD) Corpus
Mixed Arabic Datasets (MAD) Corpus
JMedBench
Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…
WenYanWen_English_Parallel
Dataset Card for WenYanWen English Parallel Dataset Summary The WenYanWen English Parallel dataset is a multilingual parallel corpus…
DeepResearch Bench Multilingual Prompts
DeepResearch Bench Multilingual Prompts
bhasha-sft
Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…