Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
634 results
1M+ real-robot trajectories from 20+ institutions.
3,670 hours of first-person video across hundreds of scenarios.
MMS-VPR: A Fine-Grained Multimodal Street-Level Visual Place Recognition Dataset and Evaluation Benchmark for Dense Pedestrian Environments
LSA-T — Continuous Argentinian Sign Language
2M-Flores - American Sign Language Flores
V1: Toward Multimodal Reasoning by Designing Auxiliary Tasks 🚀 Toward Multimodal Reasoning via Unsupervised Task -- Future Prediction…
ACL'25 Oral UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces This repository contains…
LVOmniBench (QA repackaged for lmms-eval)