Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
HEAR-HSet — HEAR Hierarchical Evaluation Set 面向零样本语音合成(Zero-shot TTS)的分层评测基准,覆盖基础泛化、副语言可控生成与高难复杂场景三大维度。 共包含 2,702 条 prompt-target 音频对,约 1GB,语言涵盖中文和英文。 子集概览 子集 样本数 语言 核心评测目标 basic-v1 1,102 zh (475) / en (627) 基础泛化:说话人相似度、文本准确率、自然度、音质 paralinguistic-v1 1,106 zh (1,106) 副语言可控:18类非语言发声的插入位置、类型与语气控制 hard-v1 494 zh (200) / en (153) / mixed (141) 高难鲁棒:长句、古诗词、专有名词、中英混合、数字表达 basic-v1 — 基础情感口语… See the full description on the dataset page:
Source: Hugging Face Hub (dinosaaaur/HEAR-HSet). Metadata imported from the dataset’s Hub tags.