遇见数据集

pyterrier/nfcorpus.retromae.flex

收藏
Hugging Face2024-10-13 更新2025-04-26 收录
官方服务:

资源简介:

--- # pretty_name: "" # Example: "MS MARCO Terrier Index" tags: - pyterrier - pyterrier-artifact - pyterrier-artifact.dense_index - pyterrier-artifact.dense_index.flex task_categories: - text-retrieval viewer: false --- # nfcorpus.retromae.flex ## Description RetroMAE index for NFCorpus ## Usage ```python # Load the artifact import pyterrier_alpha as pta artifact = pta.Artifact.from_hf('pyterrier/nfcorpus.retromae.flex') artifact.np_retriever() ``` ## Benchmarks `nfcorpus/dev` | name | nDCG@10 | R@1000 | |:----------|----------:|---------:| | np (flat) | 0.3116 | 0.6077 | `nfcorpus/test` | name | nDCG@10 | R@1000 | |:----------|----------:|---------:| | np (flat) | 0.335 | 0.6096 | ## Reproduction ```python import pyterrier as pt from tqdm import tqdm import ir_datasets from pyterrier_dr import FlexIndex, RetroMAE pipeline = RetroMAE.msmarco_distill() >> FlexIndex("nfcorpus.retromae.flex") dataset = ir_datasets.load('beir/nfcorpus') docs = ({'docno': d.doc_id, 'text': d.default_text()} for d in tqdm(dataset.docs)) pipeline.index(docs) ``` ## Metadata ``` { "type": "dense_index", "format": "flex", "vec_size": 768, "doc_count": 3633 } ```

# 可视化名称: "" # 示例: "MS MARCO Terrier 索引" 标签: - PyTerrier(pyterrier) - PyTerrier工件(pyterrier-artifact) - PyTerrier工件·稠密索引(pyterrier-artifact.dense_index) - PyTerrier工件·稠密索引·Flex(pyterrier-artifact.dense_index.flex) 任务类别: - 文本检索(text-retrieval) 查看器: 关闭 --- # nfcorpus.retromae.flex ## 描述 适用于NFCorpus的RetroMAE(RetroMAE)索引 ## 使用方法 python # 加载该工件 import pyterrier_alpha as pta artifact = pta.Artifact.from_hf('pyterrier/nfcorpus.retromae.flex') artifact.np_retriever() ## 基准测试 `nfcorpus/开发集` | 指标名称 | nDCG@10(归一化折损累积增益@10) | R@1000(召回率@1000) | |:----------|----------:|---------:| | NP(扁平式) | 0.3116 | 0.6077 | `nfcorpus/测试集` | 指标名称 | nDCG@10(归一化折损累积增益@10) | R@1000(召回率@1000) | |:----------|----------:|---------:| | NP(扁平式) | 0.335 | 0.6096 | ## 复现方法 python import pyterrier as pt from tqdm import tqdm import ir_datasets from pyterrier_dr import FlexIndex, RetroMAE pipeline = RetroMAE.msmarco_distill() >> FlexIndex("nfcorpus.retromae.flex") dataset = ir_datasets.load('beir/nfcorpus') docs = ({'docno': d.doc_id, 'text': d.default_text()} for d in tqdm(dataset.docs)) pipeline.index(docs) ## 元数据 { "类型": "稠密索引(dense_index)", "格式": "flex", "向量维度": 768, "文档总数": 3633 }

提供机构:
pyterrier
二维码
社区交流群
二维码
科研交流群
商业服务