Skip to content
Advertisement

10M–100M

169 results

MultimodalTabularText

Core-S2RGB-DINOv2

Core-S2RGB-DINOv2 🔴🟢🔵 Dataset Modality Number of Embeddings Sensing Type Total Comments Source Dataset Source Model Size Core-S2RGB-SigLIP Sentinel-2…

10M–100M·CC-BY-SA·Parquet
MultimodalTabularText

Core-S1RTC-SSL4EO

Core-S1RTC-SSL4EO 📡⚡🛰️ Dataset Modality Number of Embeddings Sensing Type Total Comments Source Dataset Source Model Size Core-S1RTC-SSL4EO…

10M–100M·CC-BY-SA·Parquet
MultimodalTabularText

Core-S2L1C-SSL4EO

Core-S2L1C-SSL4EO 🟥🟩🟦🟧🟨🟪 🛰️ Dataset Modality Number of Embeddings Sensing Type Total Comments Source Dataset Source Model Size Core-S2L1C-SSL4EO…

10M–100M·CC-BY-SA·Parquet
MultimodalTabularText

Core-S2L1C-DeCUR

Core-S2L1C-DeCUR 🟥🟩🟦🟧🟨🟪 🛰️ Dataset Modality Number of Embeddings Sensing Type Total Comments Source Dataset Source Model Size Core-S2L1C-DeCUR…

10M–100M·CC-BY-SA·Parquet
Multimodal

Core-S1RTC-DeCUR

Core-S1RTC-DeCUR 📡⚡🛰️ Dataset Modality Number of Embeddings Sensing Type Total Comments Source Dataset Source Model Size Core-S1RTC-SSL4EO Sentinel-1…

10M–100M·CC-BY-SA
MultimodalTabularText

Geonames

Geonames A simple parquet conversion of Geonames place database and ZIP codes. Source The tab-separated, zipped textfiles allCountries.zip…

10M–100M·CC-BY·Parquet
MultimodalTabularText

Core-S2RGB-SigLIP

Core-S2RGB-SigLIP 🔴🟢🔵 Modality Number of Embeddings Sensing Type Comments Source Dataset Source Model Size Sentinel-2 Level 2A (RGB)…

10M–100M·CC-BY-SA·Parquet
Multimodal

Core-S2L2A-MMEarth

Core-S2L2A-MMEarth (Pooled) 🟥🟩🟦🟧🟨🟪 🛰️ This is a pooled down (about 10x) version of the computed dataset due to…

10M–100M·CC-BY-SA
Text

quickmt-train.fa-en

quickmt fa-en Training Corpus Contains the following datasets downloaded with mtdata after deduplication and basic filtering with quickmt:…

10M–100M·Parquet
Text

croissant_dataset_no_web_data

CroissantLLM: A Truly Bilingual French-English Language Model Dataset Ressources are currently being uploaded ! Licenses Data redistributed here…

10M–100M·Arrow
MultimodalTabularText

undl_zh2en_aligned

联合国数字图书馆的段落级中-英对齐平行语料 用我口胡的方法弄出来的平行语料,统计数据和拿argostranslate直接又跑了一份bleu score的结果已经丢论文里了,论文在写了在写了。应该拿这份去练机翻模型没问题,数据源是人写的。 bleu score…

10M–100M·MIT·Parquet
Text

Translate_datasets

Datasets From convert to RWKV datasets format It is recommended to shuffle before use Chinese - English &…

10M–100M·MIT·Arrow
Text

GH_text2code

Docstring to code data Dataset Summary This dataset contains pairs of English text and code from multiple programming…

10M–100M·Parquet
MultimodalTabularText

panlex-meanings

Dataset Card for panlex-meanings This is a dataset of words in several thousand languages, extracted from Dataset Details…

10M–100M·CC0·CSV
Advertisement