ODC-BY
47 results
mala-bilingual-translation-corpus
MaLA Corpus: Massive Language Adaptation Corpus This MaLA-LM/mala-bilingual-translation-corpus is the MaLA bilingual translation corpus, collected…
pixmo-docs
PixMo-Docs We now recommend using CoSyn-400k and CoSyn-point over these datasets. They are improved versions with more images…
StepCountQA-SFT
StepCountQA-SFT StepCountQA-SFT is a multimodal supervised fine-tuning (SFT) dataset for visual object counting with step-by-step reasoning. Built…
CoSyn-400K
CoSyn-400k CoSyn-400k is a collection of synthetic question-answer pairs about very diverse range of computer-generated images. The data…
Molmo2-SynMultiImageQA
Molmo2-SynMultiImageQA Molmo2-SynMultiImageQA is a collection of synthetic multi-image question-answer pairs about various kinds of text-rich images,…
Mobjaverse
Mobjaverse: A Large-Scale Rigged 3D Model Dataset with Skeletal Animations Mobjaverse is a curated dataset derived from Objaverse-XL,…
reward-bench-2
Code Leaderboard Results Paper RewardBench 2 Evaluation Dataset Card The RewardBench 2 evaluation dataset is the new version…
fineweb_deduplicated
TL;DR Fineweb is a popular and high quality open dataset. This dataset is a deduplicated version of Fineweb…
smollm-chunked
FAISS Indices and Chunked Datasets for SmolLM and SmolLM2 corpora This repository contains part of the FAISS indices…
wildguardmix
Dataset Card for WildGuardMix Disclaimer: The data includes examples that might be disturbing, harmful or upsetting. It includes…
fineweb-2-edu-japanese
🍷 FineWeb2 Edu Japanese: High-Quality Educational Japanese Dataset This dataset consists of 120 million texts (approximately 89.3B tokens)…