Skip to content
Advertisement
Text

BSC_ParaMT_8

BSC ParaMT 8

Dataset Card for BSC ParaMT 8 Dataset Summary Large-scale multilingual parallel corpus covering Catalan, Spanish, and English paired with Arabic, Hindi, Chinese, Japanese, and Korean. Built by aggregating and carefully filtering multiple public sources, it provides sentence-level alignments for training Machine Translation systems. The Spanish portion of the dataset includes synthetic data generated by translating original English sentences into Spanish. Similarly… See the full description on the dataset page: ParaMT 8.

Source: Hugging Face Hub (BSC-LT/BSC_ParaMT_8). Metadata imported from the dataset’s Hub tags.

Advertisement