Open X-Embodiment
1M+ real-robot trajectories from 20+ institutions.
wikipedia-multilingual-synthetic-ir-query This dataset contains multilingual Wikipedia-derived synthetic query-document pairs for information…
wikipedia-multilingual-synthetic-ir-query This dataset contains multilingual Wikipedia-derived synthetic query-document pairs for information retrieval training. It was created with the query-crafter-multilingual model, which generates search-like queries from Wikipedia text. The current release contains two different retrieval settings: short doc: pairs of (query, short document) long doc: pairs of (query, long document) These two subsets are not generated in the same way… See the full description on the dataset page:
Source: Hugging Face Hub (hotchpotch/wikipedia-multilingual-synthetic-ir-query). Metadata imported from the dataset’s Hub tags.