Multilingual
575 results
English-Polish MetricX-filtered Parallel Sentences with Qwen3 Embeddings
English-Polish MetricX-filtered Parallel Sentences with Qwen3 Embeddings
undl_zh2en_aligned
联合国数字图书馆的段落级中-英对齐平行语料 用我口胡的方法弄出来的平行语料,统计数据和拿argostranslate直接又跑了一份bleu score的结果已经丢论文里了,论文在写了在写了。应该拿这份去练机翻模型没问题,数据源是人写的。 bleu score…
Translate_datasets
Datasets From convert to RWKV datasets format It is recommended to shuffle before use Chinese - English &…
OpenSakura Lilith LN COT Dataset
OpenSakura Lilith LN COT Dataset
finetranslations-sample-ar-en
Sample of filtered and split into sentences by this script intended to be used for training sentence-level machine…
Bangla–English Synthetic Parallel Corpus
Bangla–English Synthetic Parallel Corpus
panlex-meanings
Dataset Card for panlex-meanings This is a dataset of words in several thousand languages, extracted from Dataset Details…
IN22ConvBitextMining
IN22ConvBitextMining An MTEB dataset Massive Text Embedding Benchmark IN22-Conv is a n-way parallel conversation domain benchmark dataset for…
undl_ru2en_aligned
Dataset Card for "undl ru2en aligned" More Information needed
Parallel_Dataset
Dataset Sources Paper: LegoMT2: Selective Asynchronous Sharded Data Parallel Training for Massive Neural Machine Translation Link: Repository: