Skip to content
Advertisement

Datasets

1,940 results

Text

SQuAD

SQuAD

10K–100K·CC-BY-SA·Parquet
MultimodalTabularText

FineFineWeb

FineFineWeb: A Comprehensive Study on Fine-Grained Domain Web Corpus arXiv: Coming Soon Project Page: Coming Soon Blog: Coming…

>1B·Apache-2.0
Text

SWE-bench_Verified

Dataset Summary SWE-bench Verified is a subset of 500 samples from the SWE-bench test set, which have been…

<1K·Parquet
Text

github-code-2025-language-split

📜 Source Data & Attribution This dataset is a processed derivative of nick007x/github-code-2025. Origination The original data was…

100M–1B·Custom / Research-only·Parquet
Text

OpenThoughts-1k-sample

!NOTE We have released a paper for OpenThoughts! See our paper here. Open-Thoughts-1k-sample This is a 1k sample…

1K–10K·Parquet
ImageMultimodalText

COCO-Caption

Large-scale Multi-modality Models Evaluation Suite Accelerating the development of large-scale multi-modality models (LMMs) with lmms-eval 🏠 Homepage…

10K–100K·Parquet
ImageMultimodalText

Imagenet21K

NOTE: I have recaptioned all images here This dataset is the entire 21K ImageNet dataset with about 13…

10M–100M·Parquet
ImageMultimodalTabular

FIP1

The FIP 1.0 Data Set: Highly Resolved Annotated Image Time Series of 4,000 Wheat Plots Grown in Six…

1K–10K·CC-BY·Parquet
ImageMultimodalText

ai2d

@misc{kembhavi2016diagram, title={A Diagram Is Worth A Dozen Images}, author={Aniruddha Kembhavi and Mike Salvato and Eric Kolve and Minjoon…

1K–10K·Parquet
ImageMultimodalText

Vero-600k

Vero-600k Vero is a fully open reinforcement learning (RL) recipe for training and evaluating multi-task visual reasoning with…

100K–1M·Apache-2.0·Parquet
Advertisement