Skip to content
Advertisement

100K–1M

595 results

MultimodalTextVideo

Vript_Chinese

🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 44.7K…

100K–1M·JSON
Video

stream-data

Streaming Video Dataset Description A consolidated collection of video datasets for streaming video understanding research, including temporal…

100K–1M·CC-BY
ImageMultimodalText

CoSyn-400K

CoSyn-400k CoSyn-400k is a collection of synthetic question-answer pairs about very diverse range of computer-generated images. The data…

100K–1M·ODC-BY·Parquet
ImageMultimodalText

Cambrian-Alignment

Cambrian-Alignment Dataset Please see paper & website for more information: Overview Cambrian-Alignment is an question-answering alignment dataset…

100K–1M·Apache-2.0·WebDataset
ImageMultimodalText

Robo2VLM-1

Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets Abstract Vision-Language Models (VLMs) acquire…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

Zebra-CoT

Zebra‑CoT A diverse large-scale dataset for interleaved vision‑language reasoning traces. Dataset Description Zebra‑CoT is a diverse large‑scale…

100K–1M·CC-BY-NC·Parquet
Text

VideoKR-Train

VideoKR-Train 📄 ArXiv  |  💻 Code  |  🤗 Collection About This repository contains the VideoKR training data presented…

100K–1M·Apache-2.0·JSON
ImageMultimodalText

Molmo2-SynMultiImageQA

Molmo2-SynMultiImageQA Molmo2-SynMultiImageQA is a collection of synthetic multi-image question-answer pairs about various kinds of text-rich images,…

100K–1M·ODC-BY·Parquet
ImageMultimodalText

ULVR-filtered

ULVR-filtered Filtered subset of RuoliuYang/ULVR v2 clean: the 101,951 training samples that Qwen2.5-VL-7B-Instruct answered incorrectly given only…

100K–1M·Apache-2.0·Parquet
ImageMultimodalText

Kvasir-VQA-x1

Kvasir-VQA-x1 A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy Kvasir-VQA-x1 on GitHub Original Image…

100K–1M·CC-BY-NC·Parquet
AudioMultimodalText

French_game_voice

French Game Voice Dataset Dataset of 100k+ cleaned audio samples of French video game voices with transcriptions. Features…

100K–1M·Parquet
ImageMultimodalText

emova-sft-speech-231k

EMOVA-SFT-Speech-231K 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…

100K–1M·Apache-2.0·Parquet
AudioMultimodalText

live-atc-europe

Live ATC Europe — audio + transcriptions Enregistrements live d'air traffic control (ATC) européen, capturés depuis LiveATC.net, segmentés…

100K–1M·Custom / Research-only·Parquet
Advertisement