Text
2,175 results
NL2SH-ALFA
Dataset Card for NL2SH-ALFA This dataset is a collection of natural language (English) instructions and corresponding Bash commands…
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
RosettIA Chanka Quechua — Judicial Parallel Data (redistributable subset)
ChEBI-20-MM
ChEBI-20-MM Dataset Overview The ChEBI-20-MM is an extensive and multi-modal benchmark developed from the ChEBI-20 dataset. It is…
JMedBench
Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…
IPA Phonetic Lexicon (7M words)
IPA Phonetic Lexicon (7M words)
Flickr30k
Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…
WenYanWen_English_Parallel
Dataset Card for WenYanWen English Parallel Dataset Summary The WenYanWen English Parallel dataset is a multilingual parallel corpus…
mmarco-contrastive
mMARCO-contrastive The dataset is a modification of mMARCO focusing on French and English parts. The aim is to…
MultiMed-ST
MultiMed-ST: Large-scale Many-to-many Multilingual Medical Speech Translation 📘 EMNLP 2025 Khai Le-Duc , Tuyen Tran , Bach Phan…
quickmt-train.fr-en
quickmt fr-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication, and basic filtering with quickmt:…
DeepResearch Bench Multilingual Prompts
DeepResearch Bench Multilingual Prompts
African Languages Lab Multi-Open
African Languages Lab Multi-Open