Question Answering
190 results
ArabicMMLU
Fajri Koto, Haonan Li, Sara Shatnawi, Jad Doughman, Abdelrahman Boda Sadallah, Aisha Alraeesi, Khalid Almubarak, Zaid Alyafeai, Neha…
Vietnamese Án lệ + Bản án Corpus
Vietnamese Án lệ + Bản án Corpus
PersonaMem v2, Implicit Persona, LLM Personalization
PersonaMem v2, Implicit Persona, LLM Personalization
BalkanBench SuperGLUE – Serbian
BalkanBench SuperGLUE - Serbian
MMLU-ProX Multilingual Model Predictions
MMLU-ProX Multilingual Model Predictions
car-bench-dataset
CAR-Bench Dataset CAR-Bench is a benchmark for evaluating AI voice assistants in a realistic automotive (car) environment. It…
MentalBlackboard
MentalBlackboard Benchmark This repository contains the MentalBlackboard benchmark with multiple tasks: - Prediction - Planning Dataset Sources
full-modality-data
Full Modality Dataset Statistics Video Statistics Total Videos: 28,472 Total Duration: 1422.33 hours Average Duration: 179.84 seconds Median…
SciTS: Scientific Time Series Understanding and Generation with LLMs
SciTS: Scientific Time Series Understanding and Generation with LLMs
AudioMarathon
AudioMarathon AudioMarathon is a long-context audio benchmark for evaluating multimodal LLMs on speech, music, environmental audio, and meetings.…