medicine-tasks
Adapting LLMs to Domains via Continual Pre-Training (ICLR 2024) This repo contains the evaluation datasets for our paper…
2,922 results
Adapting LLMs to Domains via Continual Pre-Training (ICLR 2024) This repo contains the evaluation datasets for our paper…
Core-S2L1C Contains a global coverage of Sentinel-2 (Level 1C) patches, each of size 1,068 x 1,068 pixels. Source…
This repo contains (up to) 30k samples of 21 languages (top 20 languages by StackOverflow survey, html/css was…
Romanian Real Estate Listings Dataset
Hate Speech and Offensive Language
Code Leaderboard Results Paper RewardBench 2 Evaluation Dataset Card The RewardBench 2 evaluation dataset is the new version…
MVTamperBench Dataset Overview MVTamperBench is a robust benchmark designed to evaluate Vision-Language Models (VLMs) against adversarial video…
Languages: 简体中文 · English dojo forex kline — FX Daily Bars Overview Daily OHLC and amplitude for major…
This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase version": "v2.1", "robot type": "dual panda robotiq…
AIDev: Studying AI Coding Agents on GitHub (The Rise of AI Teammates in Software Engineering 3.0) Papers: The…
This dataset was created using LeRobot. Dataset Structure meta/info.json: { "codebase version": "v2.0", "robot type": "franka", "total episodes":…
Pretraining (MimicGen) — atomic MimicGen-generated rollouts across 60 atomic tasks (~10,000 demos/task). 1,615 hours total, generated by scripted…
DEAS-RoboCasa Robocasa dataset used for fine-tuning GR00T-N1.5 in DEAS Dataset Owner(s): Changyeon Kim Dataset Creation Date: October 14,…
MVBench Important Update 18/10/2024 Due to NTU RGB+D License, 320 videos from NTU RGB+D need to be downloaded…
Core-S1RTC Contains a global coverage of Sentinel-1 (RTC) patches, each of size 1,068 x 1,068 pixels. Source Sensing…
starcoderdata-python-edu StarCoder Training Dataset Cleaned and Scored Dataset Details Dataset Description This dataset is a filtered version of…
Dataset Card for DeMix Corpora DeMix 📄 Paper: Decouple Searching from Training: Scaling Data Mixing via Model Merging…
Embeddings pre-training curated data This dataset is the English subset of lightonai/embeddings-pre-training, assembled to reproduce the English data…
SoC Builder RTL Dataset v1 (Experiment)