Skip to content
Advertisement
MultimodalTabularText

FineWeb2-embedded

FineWeb2-embedded

FineWeb2-embedded Dataset summary FineWeb2-embedded is an extension of the FineWeb2 dataset, annotated with document-level XLM-RoBERTa embeddings for 20 languages, making the dataset useful for a variety of tasks, including document clustering, filtering, and other multilingual research. Since XLM-RoBERTa has a sequence length limit of 512 tokens, each document’s embeddings are obtained by mean-pooling 512 token chunks of the XLM-RoBERTa output. Therefore, longer texts… See the full description on the dataset page:

Source: Hugging Face Hub (epfml/FineWeb2-embedded). Metadata imported from the dataset’s Hub tags.

Advertisement