Skip to content
Advertisement

Text Generation

217 results

MultimodalTabularText

bhasha-sft

Bhasha SFT Bhasha SFT is a massive collection of multiple open sourced Supervised Fine-Tuning datasets for training Multilingual…

10M–100M·Mixed·Parquet
Text

LightNovel5000

Light novels translated in Chinese - crawled from public websites that do not prohibit crawlers 脚盆轻小说汉化 - 从未禁止爬虫的公共网站爬取…

<1K·Other
Text

TinyStories-Multilingual

Novelist: TinyStories Multilingual Edition Dataset Summary The TinyStories Multilingual Edition is a high-fidelity synthetic dataset of short,…

10K–100K·Apache-2.0·JSON
Text

BioMatrix-SFT

BioMatrix-SFT This is the supervised fine-tuning (SFT) / instruction-tuning corpus used to train BioMatrix, a multimodal foundation model…

10M–100M·CC-BY-NC·Parquet
Text

croissant_dataset

CroissantLLM: A Truly Bilingual French-English Language Model Dataset Licenses Data redistributed here is subject to the original license…

>1B·Arrow
Advertisement