Skip to content
Advertisement

General

2,594 results

Text

nmt-parallel-corpus

Neural Machine Translation parallel corpora Introduction We use OpusTools to extract resources from the OPUS project, a renowned…

>1B·CC-BY-NC·Parquet
Audio

dialogue-episodes

Multi-Language Dialogue Episodes Dataset Dataset Description This dataset contains dialogue episodes with multi-language transcripts and separated…

1K–10K·CC-BY-NC·Audio (folder)
Text

translator-rules-dataset

Translator Rules Dataset A high-quality Arabic↔English machine-translation dataset built from the WAM (Web Archive Management) translation corpus —…

10K–100K·Parquet
MultimodalTabularText

M4LE

Introduction M4LE is a Multi-ability, Multi-range, Multi-task, bilingual benchmark for long-context evaluation. We categorize long-context…

10K–100K·MIT·JSON
Text

CodeMixBench

ℹ️Dataset Card for CodeMixBench EMNLP'25 CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages Code-mixing is a linguistic…

10K–100K·Apache-2.0·CSV
Text

Maori_English_New_Zealand

Dataset for Translation from Maori to English The source of this dataset is scraped from the website TEARA.…

1K–10K·Other·CSV
Audio

StreamUni

The training dataset for the paper 'StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model' Model…

1K–10K·Apache-2.0·Audio (folder)
Text

ACES

ACES

10K–100K·CC-BY-NC-SA·JSON
Advertisement