Skip to content
Advertisement
Text

OLDI-Seed

OLDI-Seed

OLDI Seed Machine Translation Datacard OLDI Seed is a machine translation dataset designed to be used to kick-start machine translation models for language directions which currently lack large-scale datasets. Dataset Details Dataset Description OLDI Seed is a parallel corpus which consists of 6,193 sentences sampled from English Wikipedia and translated into 44 languages. It can be used to kick-start machine translation models for language… See the full description on the dataset page: seed.

Source: Hugging Face Hub (openlanguagedata/oldi_seed). Metadata imported from the dataset’s Hub tags.

Advertisement