Skip to content
Advertisement

CC-BY-SA

124 results

Text

FloresBitextMining

FloresBitextMining An MTEB dataset Massive Text Embedding Benchmark FLORES is a benchmark dataset for machine translation between English…

1K–10K·CC-BY-SA·Parquet
Text

IndicGenBenchFloresBitextMining

IndicGenBenchFloresBitextMining An MTEB dataset Massive Text Embedding Benchmark Flores-IN dataset is an extension of Flores dataset released as…

100K–1M·CC-BY-SA·Parquet
Text

pixelrag-tiles

PixelRAG tile corpus Rendered screenshot tiles for PixelRAG, a visual retrieval-augmented-generation system that retrieves over page images instead…

>1B·CC-BY-SA
ImageMultimodalText

CharXiv

CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs NeurIPS 2024 🏠Home (🚧Still in construction) 🤗Data 🥇Leaderboard…

1K–10K·CC-BY-SA·Parquet
AudioMultimodalText

MiscSpeech-ja

MiscSpeech-ja This dataset comprises audio and corresponding transcripts collected from a diverse range of YouTube videos and Podcasts.

10K–100K·CC-BY-SA·Parquet
Audio

turkish-tts-combined-raw

Türkçe TTS Birleşik Veri Seti 7 farklı açık kaynak Türkçe TTS veri setinin birleşimi. ~81,500 örnek 24kHz SNAC…

10K–100K·CC-BY-SA
Advertisement