Text Generation
217 results
PKU-SafeRLHF
Dataset Card for PKU-SafeRLHF Warning: this dataset contains data that may be offensive or harmful. The data are…
the-stack-smol
Dataset Description A small subset (~0.1%) of the-stack dataset, each programming language has 10,000 random samples from the…
car-bench-dataset
CAR-Bench Dataset CAR-Bench is a benchmark for evaluating AI voice assistants in a realistic automotive (car) environment. It…
Magicoder-OSS-Instruct-75K
This is the OSS-Instruct dataset generated by gpt-3.5-turbo-1106 developed by OpenAI. Please pay attention to OpenAI's usage policy…
Audio2Tool — Spoken Tool-Calling Benchmark
Audio2Tool — Spoken Tool-Calling Benchmark
legco-speech
香港立法會會議語音數據集 本數據集係由香港立法會會議製成嘅大規模語音數據集。原始錄音總時長 22,196 個鐘,切分語音後總時長 20,471 個鐘。數據集分兩個子集,raw同segmented,分別為原始錄音同VAD識別切分後嘅語音。 數據集製作流程 先去香港特別行政區立法會…
Knesset Plenum Source Dataset
Knesset Plenum Source Dataset
Marco_Longspeech
Marco-LongSpeech Dataset Marco-LongSpeech is a multi-task long speech understanding dataset containing 8 different speech understanding tasks…
Fineweb-Edu-Chinese-V2.1
Chinese Fineweb Edu Dataset V2.1 中文 English OpenCSG Community 👾github wechat Twitter 📖Technical Report The Chinese Fineweb Edu…
Argimi-Ardian-Finance-10k-text
The ArGiMI Ardian datasets : Text-only version The ArGiMi project is committed to open-source principles and data sharing.…
prompts.chat
a.k.a. Awesome ChatGPT Prompts This is a Dataset Repository mirror of prompts.chat — a social platform for AI…