Parquet
1,501 results
Hyperheight Data Cube Denoising and Super-Resolution
Hyperheight Data Cube Denoising and Super-Resolution
ALEE Dataset (AMR English Foils)
ALEE Dataset (AMR English Foils)
quickmt-train.fa-en
quickmt fa-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…
NusaTranslationBitextMining
NusaTranslationBitextMining An MTEB dataset Massive Text Embedding Benchmark NusaTranslation is a parallel dataset for machine translation on 11…
KYNMAW — Khasi Bhashini Multi-Task Dataset
KYNMAW — Khasi Bhashini Multi-Task Dataset
Tamazight-Arabic Speech Translation Dataset
Tamazight-Arabic Speech Translation Dataset
Tatoeba-Translations
Dataset Details This is the latest version of Tatoeba translations as of December 2024. The sentences are downloaded…
WMT20 – MultiLingual Quality Estimation (MLQE) Task3
WMT20 - MultiLingual Quality Estimation (MLQE) Task3
nmt-parallel-corpus
Neural Machine Translation parallel corpora Introduction We use OpusTools to extract resources from the OPUS project, a renowned…
translator-rules-dataset
Translator Rules Dataset A high-quality Arabic↔English machine-translation dataset built from the WAM (Web Archive Management) translation corpus —…
Turkish Academic Theses Abstracts (TR/EN)
Turkish Academic Theses Abstracts (TR/EN)
NorwegianCourtsBitextMining
NorwegianCourtsBitextMining An MTEB dataset Massive Text Embedding Benchmark Nynorsk and Bokmål parallel corpus from Norwegian courts. Norwegian…
undl_ar2en_aligned
Dataset Card for "undl ar2en aligned" More Information needed