Skip to content
Advertisement

Text Generation

217 results

Text

corpus

EVE-Corpus Paper GitHub EVE-Corpus is a large-scale, cleaned, and anonymized text corpus of Earth Observation (EO) documents formatted…

100K–1M·CC-BY·Parquet
Image

blackline-atlas-training-corpus-v1

Blackline Atlas Training Corpus v1 Blackline Atlas Training Corpus v1 is a license-aware, normalized dataset for building structured…

<1K·Custom / Research-only·Images (folder)
Text

CodeMixBench

ℹ️Dataset Card for CodeMixBench EMNLP'25 CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages Code-mixing is a linguistic…

10K–100K·Apache-2.0·CSV
Text

vietnamese_health_dataset

Team and Homepage Official Website: Hugging Face Organization: Contact If you encounter any issues with the dataset or…

100K–1M·MIT·Parquet
Text

chr_en

Dataset Card for ChrEn Dataset Summary ChrEn is a Cherokee-English parallel dataset to facilitate machine translation research between…

100K–1M·Custom / Research-only·Parquet
Text

croissant_dataset_no_web_data

CroissantLLM: A Truly Bilingual French-English Language Model Dataset Ressources are currently being uploaded ! Licenses Data redistributed here…

10M–100M·Arrow
ImageMultimodalTabular

ChEBI-20-MM

ChEBI-20-MM Dataset Overview The ChEBI-20-MM is an extensive and multi-modal benchmark developed from the ChEBI-20 dataset. It is…

10K–100K·MIT·CSV
Advertisement