Skip to content
Advertisement

100M–1B

93 results

MultimodalTabularText

cc100-documents

cc100-documents This dataset is a restructured version of the CC-100 (statmt/cc100) dataset. In the original dataset, each instance…

100M–1B·Parquet
MultimodalTabularText

GPT-NL_Public_Corpus

Dataset Card GPT-NL Public Corpus The GPT-NL Public Corpus is the largest permissively licensed Dutch-language resource available for…

100M–1B·CC-BY·Parquet
MultimodalTabularText

smollm-chunked

FAISS Indices and Chunked Datasets for SmolLM and SmolLM2 corpora This repository contains part of the FAISS indices…

100M–1B·ODC-BY·Arrow
Tabular

Nemotron-ClimbMix

ClimbMix Dataset 🚀 Creating the highest-quality pre-training datasets for LLMs 🌟 📄 PAPER 🤗 CLIMBLAB 🤗 CLIMBMIX 🏠…

100M–1B·CC-BY-NC·JSON
MultimodalTabularText

FineFineWeb-sample

FineFineWeb: A Comprehensive Study on Fine-Grained Domain Web Corpus arXiv: Coming Soon Project Page: Coming Soon Blog: Coming…

100M–1B·Apache-2.0·JSON
MultimodalTabularText

fineweb-2-edu-japanese

🍷 FineWeb2 Edu Japanese: High-Quality Educational Japanese Dataset This dataset consists of 120 million texts (approximately 89.3B tokens)…

100M–1B·ODC-BY·Parquet
Advertisement