Vript_Chinese
🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 44.7K…
595 results
🎬 Vript: Refine Video Captioning into Video Scripting Github Repo We construct a fine-grained video-text dataset with 44.7K…
Streaming Video Dataset Description A consolidated collection of video datasets for streaming video understanding research, including temporal…
CoSyn-400k CoSyn-400k is a collection of synthetic question-answer pairs about very diverse range of computer-generated images. The data…
Cambrian-Alignment Dataset Please see paper & website for more information: Overview Cambrian-Alignment is an question-answering alignment dataset…
Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets Abstract Vision-Language Models (VLMs) acquire…
Zebra‑CoT A diverse large-scale dataset for interleaved vision‑language reasoning traces. Dataset Description Zebra‑CoT is a diverse large‑scale…
VideoKR-Train 📄 ArXiv | 💻 Code | 🤗 Collection About This repository contains the VideoKR training data presented…
Molmo2-SynMultiImageQA Molmo2-SynMultiImageQA is a collection of synthetic multi-image question-answer pairs about various kinds of text-rich images,…
ULVR-filtered Filtered subset of RuoliuYang/ULVR v2 clean: the 101,951 training samples that Qwen2.5-VL-7B-Instruct answered incorrectly given only…
Kvasir-VQA-x1 A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy Kvasir-VQA-x1 on GitHub Original Image…
French Game Voice Dataset Dataset of 100k+ cleaned audio samples of French video game voices with transcriptions. Features…
ivrit.ai - Knesset Plenums Whisper Training
EMOVA-SFT-Speech-231K 🤗 EMOVA-Models 🤗 EMOVA-Datasets 🤗 EMOVA-Demo 📄 Paper 🌐 Project-Page 💻 Github 💻 EMOVA-Speech-Tokenizer-Github Overview…
ESpeech datasets annotate by Balalaika
Common Voice 13 French (Phonemized & Curated)
Live ATC Europe — audio + transcriptions Enregistrements live d'air traffic control (ATC) européen, capturés depuis LiveATC.net, segmentés…