Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
Speech DAC Tokens (3 Codebooks) Pre-tokenized speech dataset using the Descript Audio Codec (DAC). Each audio clip has been encoded into discrete codebook tokens from DAC’s first 3 residual vector quantization codebooks, paired with its text transcription. Dataset Summary Stat Value Total samples 241,451 Total audio ~780 hours Language English Codebooks 3 (of DAC’s 9) Codebook size 1,024 entries each DAC model 44kHz Tokens per second ~258 (86 frames… See the full description on the dataset page:
Source: Hugging Face Hub (treadon/speech-dac-tokens-3cb). Metadata imported from the dataset’s Hub tags.