Datasets
3,216 results
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
IN22GenBitextMining
IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…
Marathi OCR model training dataset
Marathi OCR model training dataset
CLERC Épée v0.2 — Sign Language Data Layer
CLERC Épée v0.2 — Sign Language Data Layer
CC3M-35L
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
TinyStories-Multilingual
Novelist: TinyStories Multilingual Edition Dataset Summary The TinyStories Multilingual Edition is a high-fidelity synthetic dataset of short,…
multiclass-sentiment-analysis-dataset
multiclass-sentiment-analysis-dataset
2M-Flores – American Sign Language Flores
2M-Flores - American Sign Language Flores
tatoeba-bitext-mining
Tatoeba An MTEB dataset Massive Text Embedding Benchmark 1,000 English-aligned sentence pairs for each language based on the…
HAT: Hallucination Annotation for Translation
HAT: Hallucination Annotation for Translation
PubChem-124M-SMILES-SELFIES-InChI-IUPAC
PubChem-124M-Canonicalized-SELFIES-InChI-IUPAC Dataset Summary This dataset contains ~124 million chemical structures sourced from PubChem (as of Jan…
BioMatrix-SFT
BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…
Open PII Masking 500k Ai4Privacy Dataset
Open PII Masking 500k Ai4Privacy Dataset