Skip to content
Advertisement
AudioMultimodalText

Hinglish Concatenated Audio Dataset

Hinglish Concatenated Audio Dataset

Hinglish Concatenated Audio Dataset A large-scale, cleaned and annotated speech dataset covering Hindi, Hinglish (Hindi–English code-switching), and Indian English — compiled from 14 public corpora and original custom recordings, unified into a single Parquet dataset with consistent schema. At a Glance Stat Value Total clips 815,171 Total Estimated Hours 2,264+ Unique speakers 6,304 Raw audio size ~243 GB Languages Hindi (hi), Hinglish (hi-en), Indian… See the full description on the dataset page:

Source: Hugging Face Hub (agarwalayushi/hinglish). Metadata imported from the dataset’s Hub tags.

Advertisement