Skip to content
Advertisement
MultimodalTabularText

undl_zh2en_aligned

联合国数字图书馆的段落级中-英对齐平行语料 用我口胡的方法弄出来的平行语料,统计数据和拿argostranslate直接又跑了一份bleu score的结果已经丢论文里了,论文在写了在写了。应该拿这份去练机翻模型没问题,数据源是人写的。 bleu score…

联合国数字图书馆的段落级中-英对齐平行语料 用我口胡的方法弄出来的平行语料,统计数据和拿argostranslate直接又跑了一份bleu score的结果已经丢论文里了,论文在写了在写了。应该拿这份去练机翻模型没问题,数据源是人写的。 bleu score 这里贴一份吧,懒得转格式了,我不太懂看,可能很差( Language & Paragraph Count & Avg Tokens & bleu1 & bleu2 & bleu3 & bleu4 \ midrule ar & 59754 & 52.71873 & 0.73799 & 0.58027 & 0.48118 & 0.40782 \ de & 187 & 69.58824 & 0.62058 & 0.38837 & 0.26155 & 0.18271 \ es & 66537 & 50.70776 & 0.74566 & 0.58545 & 0.48445 & 0.41073 \ fr & 68765 & 52.13133 & 0.67895 & 0.49830 &… See the full description on the dataset page: zh2en aligned.

Source: Hugging Face Hub (bot-yaya/undl_zh2en_aligned). Metadata imported from the dataset’s Hub tags.

Advertisement