Sentence Similarity
9 results
Text
English-Polish MetricX-filtered Parallel Sentences with Qwen3 Embeddings
English-Polish MetricX-filtered Parallel Sentences with Qwen3 Embeddings
10M–100M·Custom / Research-only·Parquet
MultimodalTabularText
JMedBench
Maintainers Junfeng Jiang@Aizawa Lab: jiangjf (at) is.s.u-tokyo.ac.jp Jiahao Huang@Aizawa Lab: jiahao-huang (at) g.ecc.u-tokyo.ac.jp If you find any…
100K–1M·JSON
Text
Gov-ZA Cabinet Statements (Sentence-Aligned)
Gov-ZA Cabinet Statements (Sentence-Aligned)
100K–1M·CC-BY·Parquet
MultimodalTabularText
The Vuk’uzenzele South African Multilingual Corpus
The Vuk'uzenzele South African Multilingual Corpus
100K–1M·CC-BY
Text
stsbenchmark-sts
STSBenchmark An MTEB dataset Massive Text Embedding Benchmark Semantic Textual Similarity Benchmark (STSbenchmark) dataset. Task category t2t Domains…
1K–10K·Custom / Research-only·JSON