planetarium
Dataset Card for Planetarium🪐 Planetarium🪐 is a dataset and benchmark for assessing LLMs in translating natural language descriptions…
595 results
Dataset Card for Planetarium🪐 Planetarium🪐 is a dataset and benchmark for assessing LLMs in translating natural language descriptions…
OpenSakura Lilith LN COT Dataset
Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…
mMARCO-contrastive The dataset is a modification of mMARCO focusing on French and English parts. The aim is to…
Gov-ZA Cabinet Statements (Sentence-Aligned)
Parallel Corpus from United Nations Digital Library Official Document System aligned by file
Synthetic Parallel EN-LG (external)
LAION-COCO translated to 200 languages
WMT Human + TTS Audio WMT human evaluation data (zouharvi/wmt-human-all) extended with TTS-synthesised source audio, covering 49 language…
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
IN22GenBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Gen is a n-way parallel general-purpose multi-domain benchmark dataset for…
Tatoeba An MTEB dataset Massive Text Embedding Benchmark 1,000 English-aligned sentence pairs for each language based on the…
HAT: Hallucination Annotation for Translation
Open PII Masking 500k Ai4Privacy Dataset
IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…