Skip to content
Advertisement
Text

Pralekha

Pralekha

Pralekha: Cross-Lingual Document Alignment for Indic Languages Pralekha is a large-scale parallel document dataset spanning across 11 Indic languages and English. It comprises over 3 million document pairs, with 1.5 million being English-Indic Pairs. This dataset serves both as a benchmark for evaluating Cross-Lingual Document Alignment (CLDA) techniques and as a domain-specific parallel corpus for training document-level Machine… See the full description on the dataset page:

Source: Hugging Face Hub (kcsb28/Pralekha). Metadata imported from the dataset’s Hub tags.

Advertisement