Skip to content
Advertisement
MultimodalTextVideo

V1-33K

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction 🌟 Authors:…

V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task — Future Prediction 🌟 Authors: Haonan Wang, Chao Du, Tianyu PangGitHub: haonan3/V1Dataset: V1-33K on Hugging Face Multimodal Reasoning Recent Large Reasoning Models (LRMs) such as DeepSeek-R1 have demonstrated impressive reasoning abilities; however, their capabilities are limited to textual data. Current models capture only a small part of… See the full description on the dataset page:

Source: Hugging Face Hub (haonan3/V1-33K). Metadata imported from the dataset’s Hub tags.

Advertisement