相关数据集
FaMTEB
FaMTEB是一个大规模的波斯语文本嵌入基准,由Sharif University of Technology创建。该数据集包含63个数据集,涵盖7个任务,包括分类、聚类、成对分类、重排、检索、摘要检索和语义文本相似度。数据集由现有数据、翻译数据和通过大型语言模型生成的新合成数据组合而成,为波斯语语言模型提供了多样化的评估框架。
arXiv2025-02-17 更新340
illuin-conteb/narrative-qa
ConTEB NarrativeQA数据集是ConTEB(上下文感知文本嵌入基准)的一部分,设计用于评估上下文嵌入模型的能力。它基于广泛使用的NarrativeQA数据集,包含长文档以及与之相关的现有问答对集。数据集由原始文档集合构建而成,文本被提取并分块处理,这些块并不总是自包含的,需要文档级的上下文来构建有意义的表示。数据集提供了8575个查询、355个文档和1750个块,每个块平均包含约15
Hugging Face2025-06-02 更新60
argilla-warehouse/personahub-fineweb-edu-4-embeddings
该数据集通过使用Alibaba-NLP/gte-large-en-v1.5模型从句子转换器中获取了argilla-warehouse/personahub-fineweb-edu-4-dedup数据集的嵌入。数据集包含一个pipeline.yaml文件,可用于在distilabel中使用distilabel CLI重现生成数据集的管道。数据集的特征包括id、persona、model_name_e
Hugging Face2024-09-10 更新160



