10M–100M
169 results
MultimodalTabularText
African Languages Lab Multi-Open
African Languages Lab Multi-Open
10M–100M·Custom / Research-only·Parquet
Text
quickmt-train.zh-en
quickmt zh-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…
10M–100M·Parquet
MultimodalTabularText
bhasha-sft
Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…
10M–100M·Mixed·Parquet
Text
skr_trans_distill
Dataset Card for skr trans distill 本数据集由 SakuraLLM 大模型生成机器翻译结果,主要用于模型蒸馏训练。数据集包含日文原文及其对应的中文翻译,适用于日译中任务的模型训练与蒸馏。 Dataset Details Dataset Description…
10M–100M·MIT·Parquet
Text
BioMatrix-SFT
BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…
10M–100M·CC-BY-NC·Parquet