Skip to content
Advertisement

Datasets

3,216 results

Text

IN22GenBitextMining

IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…

100K–1M·CC-BY·Parquet
ImageMultimodalText

CC3M-35L

Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…

1M–10M·Parquet
Text

TinyStories-Multilingual

Novelist: TinyStories Multilingual Edition Dataset Summary The TinyStories Multilingual Edition is a high-fidelity synthetic dataset of short,…

10K–100K·Apache-2.0·JSON
Text

tatoeba-bitext-mining

Tatoeba An MTEB dataset Massive Text Embedding Benchmark 1,000 English-aligned sentence pairs for each language based on the…

100K–1M·CC-BY·JSON
Text

BioMatrix-SFT

BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…

10M–100M·CC-BY-NC·Parquet
Advertisement