Skip to content
Advertisement
ImageMultimodalText

emova-sft-4m

EMOVA-SFT-4M πŸ€— EMOVA-Models πŸ€— EMOVA-Datasets πŸ€— EMOVA-Demo πŸ“„ Paper 🌐 Project-Page πŸ’» Github πŸ’» EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is a…

EMOVA-SFT-4M πŸ€— EMOVA-Models πŸ€— EMOVA-Datasets πŸ€— EMOVA-Demo πŸ“„ Paper 🌐 Project-Page πŸ’» Github πŸ’» EMOVA-Speech-Tokenizer-Github Overview EMOVA-SFT-4M is a comprehensive dataset curated for omni-modal instruction tuning, including textual, visual, and audio interactions. This dataset is created by gathering open-sourced multi-modal instruction datasets and synthesizing high-quality omni-modal conversation data to enhance user experience. This dataset is… See the full description on the dataset page:

Source: Hugging Face Hub (Emova-ollm/emova-sft-4m). Metadata imported from the dataset’s Hub tags.

Advertisement