TED_talks
!NOTE Dataset origin: Context TED is devoted to spreading powerful ideas in just about any topic. These datasets…
911 results
!NOTE Dataset origin: Context TED is devoted to spreading powerful ideas in just about any topic. These datasets…
Dataset Card for Planetarium🪐 Planetarium🪐 is a dataset and benchmark for assessing LLMs in translating natural language descriptions…
联合国数字图书馆的段落级中-英对齐平行语料 用我口胡的方法弄出来的平行语料,统计数据和拿argostranslate直接又跑了一份bleu score的结果已经丢论文里了,论文在写了在写了。应该拿这份去练机翻模型没问题,数据源是人写的。 bleu score…
Mixed Arabic Datasets (MAD) Corpus
OpenSakura Lilith LN COT Dataset
Dataset Card for panlex-meanings This is a dataset of words in several thousand languages, extracted from Dataset Details…
Dataset Card for "undl ru2en aligned" More Information needed
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
ChEBI-20-MM Dataset Overview The ChEBI-20-MM is an extensive and multi-modal benchmark developed from the ChEBI-20 dataset. It is…
Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…
IPA Phonetic Lexicon (7M words)
African Languages Lab Multi-Open
Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…
TED Translation Decision Dataset
CLERC Épée v0.2 — Sign Language Data Layer