100M–1B
93 results
foursquare_places_100M
Foursquare OS Places 100M Full Foursquare OS Places dump from This is a single (geo-)parquet file based on…
quickmt-train.hu-en
quickmt hu-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…
Mixed Arabic Datasets (MAD) Corpus
Mixed Arabic Datasets (MAD) Corpus
finetranslations-sample-ar-en
Sample of filtered and split into sentences by this script intended to be used for training sentence-level machine…
quickmt-train.fr-en
quickmt fr-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication, and basic filtering with quickmt:…
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
PubChem-124M-SMILES-SELFIES-InChI-IUPAC
PubChem-124M-Canonicalized-SELFIES-InChI-IUPAC Dataset Summary This dataset contains ~124 million chemical structures sourced from PubChem (as of Jan…
panlex-meanings
Dataset Card for panlex-meanings This is a dataset of words in several thousand languages, extracted from Dataset Details…
Mixed Arabic Datasets (MAD) Corpus
Mixed Arabic Datasets (MAD) Corpus
MultiUN (Multilingual Corpus from United Nation Documents)
MultiUN (Multilingual Corpus from United Nation Documents)
WikidataLabels
Wikidata Labels Large parallel corpus for machine translation Entity label data extracted from Wikidata (2022-01-03), filtered for item…
United Nations Parallel Corpus
United Nations Parallel Corpus