RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
2,147 results
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
ChEBI-20-MM Dataset Overview The ChEBI-20-MM is an extensive and multi-modal benchmark developed from the ChEBI-20 dataset. It is…
Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…
IPA Phonetic Lexicon (7M words)
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…
African Languages Lab Multi-Open
!NOTE Dataset origin: Description Issue du site Banque Sonore des Dialectes Bretons Présentation du projet La Banque Sonore…
Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…
Synthetic Parallel EN-LG (external)
LAION-COCO translated to 200 languages
TED Translation Decision Dataset
WMT Human + TTS Audio WMT human evaluation data (zouharvi/wmt-human-all) extended with TTS-synthesised source audio, covering 49 language…
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
CLERC Épée v0.2 — Sign Language Data Layer
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…