Skip to content
Advertisement

Multilingual

575 results

MultimodalTabularText

cc100-documents

cc100-documents This dataset is a restructured version of the CC-100 (statmt/cc100) dataset. In the original dataset, each instance…

100M–1B·Parquet
MultimodalTabularText

GPT-NL_Public_Corpus

Dataset Card GPT-NL Public Corpus The GPT-NL Public Corpus is the largest permissively licensed Dutch-language resource available for…

100M–1B·CC-BY·Parquet
MultimodalTabularText

Classifiers-Data

Text Quality Classifier Training Dataset This dataset is specifically designed for training text quality assessment classifiers, containing annotated…

10M–100M·Parquet
MultimodalTabularText

GlotCC-V1

Dataset Summary GlotCC-V1.0 is a document-level, general domain dataset derived from CommonCrawl, covering more than 1000 languages.It is…

>1B·CC0
ImageMultimodalVideo

FollowCam

FollowCam Dataset Description FollowCam is a benchmark for evaluating video generation models on viewpoint transformation and subject following…

10K–100K·MIT
Advertisement