Skip to content
Advertisement

Open

2,922 results

Text

wikipedia

Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is…

10M–100M·Mixed·Parquet
Text

SQuAD

SQuAD

10K–100K·CC-BY-SA·Parquet
MultimodalTabularText

FineFineWeb

FineFineWeb: A Comprehensive Study on Fine-Grained Domain Web Corpus arXiv: Coming Soon Project Page: Coming Soon Blog: Coming…

>1B·Apache-2.0
Text

SWE-bench_Verified

Dataset Summary SWE-bench Verified is a subset of 500 samples from the SWE-bench test set, which have been…

<1K·Parquet
Text

github-code-2025-language-split

📜 Source Data & Attribution This dataset is a processed derivative of nick007x/github-code-2025. Origination The original data was…

100M–1B·Custom / Research-only·Parquet
Advertisement