Text
2,175 results
quickmt-train.zh-en
quickmt zh-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…
Gov-ZA Cabinet Statements (Sentence-Aligned)
Gov-ZA Cabinet Statements (Sentence-Aligned)
Parallel Corpus from United Nations Digital Library Official Document System aligned by file
Parallel Corpus from United Nations Digital Library Official Document System aligned by file
Banque_Sonore_Dialectes_Bretons
!NOTE Dataset origin: Description Issue du site Banque Sonore des Dialectes Bretons Présentation du projet La Banque Sonore…
DS-TF2-RO-3M — 3M English→Romanian Fable Translations
DS-TF2-RO-3M — 3M English→Romanian Fable Translations
bhasha-sft
Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…
LightNovel5000
Light novels translated in Chinese - crawled from public websites that do not prohibit crawlers 脚盆轻小说汉化 - 从未禁止爬虫的公共网站爬取…
The Vuk’uzenzele South African Multilingual Corpus
The Vuk'uzenzele South African Multilingual Corpus
IndonesianNMT
This dataset is used on the paper "Replicable Benchmarking of Neural Machine Translation (NMT) on Low-Resource Local Languages…
tanglish-tamil
Translation of Tanglish to tamil Source: karky.in To use python import datasets s = datasets.load dataset('Deepakvictor/tanglish-tamil') print(s)…