Skip to content
Advertisement

Multilingual

575 results

AudioMultimodalText

EuroSpeech

EuroSpeech Dataset Dataset Description EuroSpeech is a large-scale multilingual speech corpus containing high-quality aligned parliamentary speech…

10M–100M·Custom / Research-only·Parquet
Text

nemotron-cc-translated

Helsinki-NLP/nemotron-cc-translated nemotron-cc-tanslated is a collection of automatically translated documents from nemotron-cc taken out of the…

>1B·CC0·Parquet
Text

fineweb-edu-translated

Helsinki-NLP/fineweb-edu-translated fineweb-edu-tanslated is a collection of automatically translated documents from fineweb-edu. Translations are…

>1B·ODC-BY·Parquet
Text

WMT T2T

WMT T2T

1M–10M·Custom / Research-only·Parquet
AudioMultimodalText

yodas2_sidon

YODAS2-Sidon Overview This dataset is a cleansed version of YODAS-2 with Sidon speech restoration mode for Speech Synthesis…

1M–10M·CC-BY·WebDataset
Text

demo_data

1,000 examples from gpt4 en 1,000 examples from gpt4 zh 300 examples from toolcall en 300 examples from…

1K–10K·Apache-2.0
MultimodalTabularText

common_corpus

Common Corpus Full paper - ICLR 2026 oral Common Corpus is the largest open licensed text dataset, comprising…

10K–100K·Parquet
MultimodalTabularText

AutoMathText-V2

🚀 AutoMathText-V2: A 2.46 Trillion Token AI-Curated STEM Pretraining Dataset   🎉 AutoMathText-v2 has surpassed 1.5 million downloads!…

100M–1B
AudioMultimodalText

VoxSafeBench

VoxSafeBench Demopage: demopage/ Code: This dataset is uploaded as raw files (JSONL + audio), not parquet. Subset: Safety-tier1…

1K–10K·Apache-2.0·JSON
Text

wikipedia-monthly

🚀 Wikipedia Monthly Last updated: March 14, 2026, 21:06 UTC This repository provides monthly, multilingual dumps of Wikipedia,…

1M–10M·CC-BY-SA
Text

xP3x

xP3x

100M–1B·Apache-2.0·Parquet
Text

wikipedia

Dataset Card for Wikimedia Wikipedia Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is…

10M–100M·Mixed·Parquet
Advertisement