Text
2,175 results
multiclass-sentiment-analysis-dataset
multiclass-sentiment-analysis-dataset
2M-Flores – American Sign Language Flores
2M-Flores - American Sign Language Flores
tatoeba-bitext-mining
Tatoeba An MTEB dataset Massive Text Embedding Benchmark 1,000 English-aligned sentence pairs for each language based on the…
HAT: Hallucination Annotation for Translation
HAT: Hallucination Annotation for Translation
PubChem-124M-SMILES-SELFIES-InChI-IUPAC
PubChem-124M-Canonicalized-SELFIES-InChI-IUPAC Dataset Summary This dataset contains ~124 million chemical structures sourced from PubChem (as of Jan…
BioMatrix-SFT
BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…
Open PII Masking 500k Ai4Privacy Dataset
Open PII Masking 500k Ai4Privacy Dataset
FloresBitextMining
FloresBitextMining An MTEB dataset Massive Text Embedding Benchmark FLORES is a benchmark dataset for machine translation between English…
panlex-meanings
Dataset Card for panlex-meanings This is a dataset of words in several thousand languages, extracted from Dataset Details…
Mixed Arabic Datasets (MAD) Corpus
Mixed Arabic Datasets (MAD) Corpus
Alexandria Multudialectal Arabic Conversational Dataset for Machine Translation
Alexandria Multudialectal Arabic Conversational Dataset for Machine Translation