Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
孙宇晨文选音频文本语料库 这是一个由 157 条中文长音频、157 篇 AI 清洗 Markdown 和 Whisper 毫秒级时间戳整理而成的 Hugging Face 音频数据集仓库。它同时提供长节目级 episodes 和时间戳片段级 segments 两个配置,用于选集制作、语料分析、自动语音识别(ASR)研究,以及经过额外人工审核后的文本转语音(TTS)数据准备。 发布边界: 本数据集仓库可公开访问,但当前源音频的许可、再分发授权、来源平台条款及声音/人格权尚未确认。仓库使用 license: other,公开访问不等于授予任何数据权利;未经权利核验与授权,不应商用、再分发或用于声音克隆。详见 LICENSE。 数据集摘要 配置 样本单位 train validation test 总计 时长 episodes 完整节目 125 16 16 157 31.234 小时 segments 时间戳语音片段 7,738 864 495 9,097 30.932 小时… See the full description on the dataset page:
Source: Hugging Face Hub (tradecatlabs/sun-yuchen-selected-works). Metadata imported from the dataset’s Hub tags.