Text
2,175 results
OpenThoughts-114k
!NOTE We have released a paper for OpenThoughts! See our paper here. Open-Thoughts-114k Open synthetic reasoning dataset with…
AutoMathText-V2
🚀 AutoMathText-V2: A 2.46 Trillion Token AI-Curated STEM Pretraining Dataset 🎉 AutoMathText-v2 has surpassed 1.5 million downloads!…
SWE-bench_Verified
Dataset Summary SWE-bench Verified is a subset of 500 samples from the SWE-bench test set, which have been…
agibot_alpha_v30
This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase version": "v3.0", "robot type": "AgiBot A2D", "total…
The Cross-lingual TRansfer Evaluation of Multilingual Encoders for Speech (XTREME-S) benchmark is a
The Cross-lingual TRansfer Evaluation of Multilingual Encoders for Speech (XTREME-S) benchmark is a benchmark designed to evaluate speech…
TinyStories
Dataset containing synthetically generated (by GPT-3.5 and GPT-4) short stories that only use a small vocabulary. Described in…
Open-Sora-Plan-v1.1.0
Annotation We resized the dataset to 1080p for easier uploading. Therefore, the original annotation file might not match…
coraal
Corpus of Regional African American Language (CORAAL) Dataset link: Hugging Face Hub preparation scripts: coraal Citation Kendall, Tyler…
VoxSafeBench
VoxSafeBench Demopage: demopage/ Code: This dataset is uploaded as raw files (JSONL + audio), not parquet. Subset: Safety-tier1…
SoulTide-AudioData-Dataset
目录结构 character/ └── char / ├── resource/ │ ├── audio/ 原始音频 │ ├── srt/ 原始srt │ └── processed/…
RealCam-Vid
RealCam-Vid Dataset News 25/04/08: We provide torch dataset demo code for example usage of our RealCam-Vid. 25/03/26: Release…