遇见数据集

pyterrier/quora.retromae.flex

收藏
Hugging Face2024-10-13 更新2025-04-26 收录
官方服务:

资源简介:

--- # pretty_name: "" # Example: "MS MARCO Terrier Index" tags: - pyterrier - pyterrier-artifact - pyterrier-artifact.dense_index - pyterrier-artifact.dense_index.flex task_categories: - text-retrieval viewer: false --- # quora.retromae.flex ## Description RetroMAE index for Quora ## Usage ```python # Load the artifact import pyterrier_alpha as pta artifact = pta.Artifact.from_hf('pyterrier/quora.retromae.flex') artifact.np_retriever() ``` ## Benchmarks `quora/dev` | name | nDCG@10 | R@1000 | |:----------|----------:|---------:| | np (flat) | 0.8637 | 0.9995 | `quora/test` | name | nDCG@10 | R@1000 | |:----------|----------:|---------:| | np (flat) | 0.8646 | 0.9994 | ## Reproduction ```python import pyterrier as pt from tqdm import tqdm import ir_datasets from pyterrier_dr import FlexIndex, RetroMAE pipeline = RetroMAE.msmarco_distill() >> FlexIndex("quora.retromae.flex") dataset = ir_datasets.load('beir/quora') docs = ({'docno': d.doc_id, 'text': d.default_text()} for d in tqdm(dataset.docs)) pipeline.index(docs) ``` ## Metadata ``` { "type": "dense_index", "format": "flex", "vec_size": 768, "doc_count": 522931 } ```

# 显示名称:"" # 示例:"MS MARCO Terrier 索引" 标签: - PyTerrier(pyterrier) - pyterrier-artifact - pyterrier-artifact.dense_index - pyterrier-artifact.dense_index.flex 任务类别: - 文本检索(text-retrieval) 查看器:禁用 --- # quora.retromae.flex ## 数据集描述 面向Quora数据集的RetroMAE索引 ## 使用方法 python # 加载制品 import pyterrier_alpha as pta artifact = pta.Artifact.from_hf('pyterrier/quora.retromae.flex') artifact.np_retriever() ## 基准测试结果 `quora/dev` | 方法名称 | nDCG@10 | R@1000 | |:-----------|---------:|--------:| | np (flat) | 0.8637 | 0.9995 | `quora/test` | 方法名称 | nDCG@10 | R@1000 | |:-----------|---------:|--------:| | np (flat) | 0.8646 | 0.9994 | ## 复现步骤 python import pyterrier as pt from tqdm import tqdm import ir_datasets from pyterrier_dr import FlexIndex, RetroMAE pipeline = RetroMAE.msmarco_distill() >> FlexIndex("quora.retromae.flex") dataset = ir_datasets.load('beir/quora') docs = ({'docno': d.doc_id, 'text': d.default_text()} for d in tqdm(dataset.docs)) pipeline.index(docs) ## 元数据 json { "类型": "dense_index", "格式": "flex", "向量维度": 768, "文档数量": 522931 }

提供机构:
pyterrier
二维码
社区交流群
二维码
科研交流群
商业服务