DeepResearch Bench Multilingual Prompts
DeepResearch Bench Multilingual Prompts
217 results
DeepResearch Bench Multilingual Prompts
DS-TF2-RO-3M — 3M English→Romanian Fable Translations
Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…
Light novels translated in Chinese - crawled from public websites that do not prohibit crawlers 脚盆轻小说汉化 - 从未禁止爬虫的公共网站爬取…
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
Novelist: TinyStories Multilingual Edition Dataset Summary The TinyStories Multilingual Edition is a high-fidelity synthetic dataset of short,…
PubChem-124M-Canonicalized-SELFIES-InChI-IUPAC Dataset Summary This dataset contains ~124 million chemical structures sourced from PubChem (as of Jan…
BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…
Alexandria Multudialectal Arabic Conversational Dataset for Machine Translation
CroissantLLM: A Truly Bilingual French-English Language Model Dataset Licenses Data redistributed here is subject to the original license…