Skip to content
Advertisement

Open

2,922 results

Audio

dialogue-episodes

Multi-Language Dialogue Episodes Dataset Dataset Description This dataset contains dialogue episodes with multi-language transcripts and separated…

1K–10K·CC-BY-NC·Audio (folder)
Text

translator-rules-dataset

Translator Rules Dataset A high-quality Arabic↔English machine-translation dataset built from the WAM (Web Archive Management) translation corpus —…

10K–100K·Parquet
Text

NorwegianCourtsBitextMining

NorwegianCourtsBitextMining An MTEB dataset Massive Text Embedding Benchmark Nynorsk and Bokmål parallel corpus from Norwegian courts. Norwegian…

1K–10K·CC-BY·Parquet
MultimodalTabularText

M4LE

Introduction M4LE is a Multi-ability, Multi-range, Multi-task, bilingual benchmark for long-context evaluation. We categorize long-context…

10K–100K·MIT·JSON
Text

CodeMixBench

ℹ️Dataset Card for CodeMixBench EMNLP'25 CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages Code-mixing is a linguistic…

10K–100K·Apache-2.0·CSV
Text

Maori_English_New_Zealand

Dataset for Translation from Maori to English The source of this dataset is scraped from the website TEARA.…

1K–10K·Other·CSV
Audio

StreamUni

The training dataset for the paper 'StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model' Model…

1K–10K·Apache-2.0·Audio (folder)
Text

ACES

ACES

10K–100K·CC-BY-NC-SA·JSON
Text

quickmt-train.hu-en

quickmt hu-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…

100M–1B·Parquet
Text

20k-en-zh-translation-pinyin-hsk

20,000+ chinese sentences with translations and pinyin Source: Contributed by: Brian Vaughan Dataset Structure Each sample consists of:…

100K–1M·Text (raw)
Text

wmt24pp

WMT24++ This repository contains the human translation and post-edit data for the 55 en- xx language pairs released…

10K–100K·Apache-2.0·JSON
Text

vietnamese_health_dataset

Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…

100K–1M·MIT·Parquet
Advertisement