Token Classification
27 results
Text
NIKL-korean-english-dictionary
Column Name Type Description 설명 Form str Registered word entry 단어 Part of Speech str or None Part…
10K–100K·MIT·CSV
Text
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
Shaistagi (شائستگی) Clean Urdu Mega-Dataset
100M–1B·Apache-2.0·Parquet
MultimodalTabularText
CLERC Épée v0.2 — Sign Language Data Layer
CLERC Épée v0.2 — Sign Language Data Layer
<1K·CC-BY-NC-SA
Text
Open PII Masking 500k Ai4Privacy Dataset
Open PII Masking 500k Ai4Privacy Dataset
100K–1M·Custom / Research-only·JSON
3D / Point Cloud
3DSES: Indoor TLS Point Cloud Segmentation
3DSES: Indoor TLS Point Cloud Segmentation
100M–1B·CC-BY-SA
AudioMultimodalText
AudioMarathon
AudioMarathon AudioMarathon is a long-context audio benchmark for evaluating multimodal LLMs on speech, music, environmental audio, and meetings.…
<1K·Custom / Research-only·CSV