Skip to content
Advertisement

Parquet

1,501 results

Text

SciELO

SciELO

1M–10M·Custom / Research-only·Parquet
Text

quickmt-train.fa-en

quickmt fa-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…

10M–100M·Parquet
Text

NusaTranslationBitextMining

NusaTranslationBitextMining An MTEB dataset Massive Text Embedding Benchmark NusaTranslation is a parallel dataset for machine translation on 11…

10K–100K·CC-BY-SA·Parquet
Text

nmt-parallel-corpus

Neural Machine Translation parallel corpora Introduction We use OpusTools to extract resources from the OPUS project, a renowned…

>1B·CC-BY-NC·Parquet
Text

translator-rules-dataset

Translator Rules Dataset A high-quality Arabic↔English machine-translation dataset built from the WAM (Web Archive Management) translation corpus —…

10K–100K·Parquet
Text

NorwegianCourtsBitextMining

NorwegianCourtsBitextMining An MTEB dataset Massive Text Embedding Benchmark Nynorsk and Bokmål parallel corpus from Norwegian courts. Norwegian…

1K–10K·CC-BY·Parquet
Advertisement