Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
Indic Dialect ASR Dataset A multilingual ASR dataset covering 30 Indic dialect/languages with 2.8M+ samples. Usage from datasets import load dataset Load a specific language ds = load dataset(“grushaaaaa/indic-dialect-asr”, “assamese”, split=”train”) Features audio: 16kHz WAV audio sentence: Transcription text language: Language name source: Source dataset
Source: Hugging Face Hub (grushaaaaa/indic-dialect-asr). Metadata imported from the dataset’s Hub tags.