1K–10K
598 results
chemrXiv-pdf
ChemrXiv Pdf Introducing ChemrXiv Pdf, a dataset that offers access to all PDFs published until September 15, 2024.…
IN22ConvBitextMining
IN22ConvBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Conv is a n-way parallel conversation domain benchmark dataset for…
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
DeepResearch Bench Multilingual Prompts
DeepResearch Bench Multilingual Prompts
Banque_Sonore_Dialectes_Bretons
!NOTE Dataset origin: Description Issue du site Banque Sonore des Dialectes Bretons Présentation du projet La Banque Sonore…
The Vuk’uzenzele South African Multilingual Corpus
The Vuk'uzenzele South African Multilingual Corpus
LSA-T — Continuous Argentinian Sign Language
LSA-T — Continuous Argentinian Sign Language
Marathi OCR model training dataset
Marathi OCR model training dataset
2M-Flores – American Sign Language Flores
2M-Flores - American Sign Language Flores
FloresBitextMining
FloresBitextMining An MTEB dataset Massive Text Embedding Benchmark FLORES is a benchmark dataset for machine translation between English…
English to Hinglish or English to Hinglish
English to Hinglish or English to Hinglish
BornholmBitextMining
BornholmBitextMining An MTEB dataset Massive Text Embedding Benchmark Danish Bornholmsk Parallel Corpus. Bornholmsk is a Danish dialect spoken…
MultiChartQA
MultiChartQA This repository contains the questions and answers for our Multi-chart Benchmark. At present, only the data is…