遇见数据集

keenbench-results

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

该数据集名为keenbench results,包含来自keenbench计划的搜索引擎基准测试(Keenable与Exa对比)的完整每轮运行产物,由持续集成(CI)发布。数据以时间戳目录结构组织(例如runs/2026-07-02T1505Z/),涵盖多个评估文件:rbp.json提供新鲜流排名评估,包括每查询、每结果的判断评分、LLM判断标签和推理(每小时更新);fresh.jsonl存储从RSS生成的新鲜查询;recall.json包含公司填充答案召回评估,记录每查询结果和命中排名(每日更新);gold.jsonl则包含当天使用的基于注册的黄金查询。所有运行的汇总数据保存在仓库gh-pages分支的data/history.jsonl文件中。该数据集适用于搜索引擎性能评估、查询新鲜度分析、答案召回率测试以及基于LLM的排名判断研究,支持对搜索算法进行持续监控和比较分析。

The dataset, named KeenBench Results, encompasses complete per-run artifacts from the KeenBench program's search engine benchmarking (a comparison between Keenable and Exa), released via Continuous Integration (CI). The data is structured in timestamped directory hierarchies (e.g., runs/2026-07-02T1505Z/), covering multiple evaluation files: rbp.json provides fresh stream ranking evaluation, including judgment scores, LLM judgment labels and reasoning for each query and each result, updated hourly; fresh.jsonl stores fresh queries generated from RSS feeds; recall.json contains company-filled answer recall evaluations, recording per-query results and hit rankings, updated daily; gold.jsonl contains the registration-based gold standard queries used on the current day. Aggregated data from all runs is stored in the data/history.jsonl file under the repository's gh-pages branch. This dataset is applicable to search engine performance evaluation, query freshness analysis, answer recall rate testing, and LLM-based ranking judgment research, supporting continuous monitoring and comparative analysis of search algorithms.

创建时间:
2026-07-02
原始信息汇总
  • 数据集名称: keenbench results
  • 许可证: MIT
  • 配置:
    • freshstream(默认): 数据文件路径为 runs/*/fresh.jsonl
    • companyfill: 数据文件路径为 runs/*/gold.jsonl
    • scholar: 数据文件路径为 runs/*/scholar.jsonl
  • 数据集页面地址: https://huggingface.co/datasets/keenable-ai/keenbench-results
搜集汇总
数据集介绍
keenbench-results 数据集图片
构建方式
该数据集以KeenBench评估框架为基础构建,通过系统收录多轮模型推理结果以支持对比分析。数据按运行批次组织,每条记录均以JSONL格式存储,确保序列化过程的完整性。配置项精细划分为freshstream、companyfill与scholar三类,分别对应原始流数据、金标准填充数据及学术场景数据,层级结构清晰便于溯源。
特点
数据集呈现出高度结构化的分治特性,通过config配置将异构数据分离为独立子集,兼顾通用性与场景特异性。采用免版税MIT协议开放授权,降低知识共享壁垒。数据文件采用运行标识符命名空间进行隔离,有效规避批次冲突,同时保持单文件内的逻辑连贯性,为下游任务提供灵活的数据切片能力。
使用方法
使用者可通过HuggingFace Datasets库按config名称直接加载特定子集,例如选择freshstream作为默认配置进行通用场景分析。JSONL格式支持逐行流式读取,适合大规模数据的高效处理。建议结合批次目录层级进行性能基准测试,利用companyfill配置聚焦于填充任务评估,或基于scholar配置复现学术级实验管线。
背景与挑战
背景概述
在信息检索与自动化评估领域,标准化基准测试集对于衡量系统性能至关重要。keenbench-results数据集应运而生,其创建时间不详,但由相关研究机构或社区构建,旨在为多场景下的检索任务提供可复现的评估框架。该数据集涵盖freshstream、companyfill、scholar三个配置,分别对应时效性、企业填充及学术检索等细分方向,为领域内算法对比与模型优化提供了统一标尺。其影响力体现在推动检索系统从单一指标向多维评估的演进,促进了技术迭代与学术交流。
当前挑战
keenbench-results数据集面临的核心挑战在于检索任务的多样性与动态性。具体而言,freshstream配置需应对信息时效性带来的动态数据变化,companyfill配置则需处理企业场景下结构化与非结构化数据的融合难题,而scholar配置面临学术文献的语义匹配与引用网络挖掘复杂性。构建过程中,如何确保多场景数据的代表性与标注一致性,以及如何平衡不同配置间的评估权重,均是亟待解决的难题,这要求数据集持续迭代以适配快速演进的检索技术生态。
常用场景
经典使用场景
KEENBench Results数据集汇集了在大规模知识图谱嵌入(KGE)评测基准KEENBench上的多项实验结果,其经典使用场景在于作为知识图谱嵌入模型性能的标准化比较平台。研究人员可将自身模型的预测结果以JSONL格式提交至对应配置(如freshstream、companyfill、scholar子集),通过与现有基准结果的横向对比,客观评估模型在不同知识图谱补全任务上的准确性、鲁棒性与泛化能力。这一数据集犹如一面明镜,忠实地映照出各模型在标准化评测协议下的真实表现。
解决学术问题
该数据集的核心价值在于系统性地解决了知识图谱嵌入领域长期存在的可重复性危机与评估标准碎片化问题。通过提供统一的结果存储与对比框架,KEENBench Results使得不同团队开发的模型能够在完全一致的训练集、验证集与测试集划分下进行公平比较,消除了因数据预处理、超参数设置或评估指标差异导致的结论偏差。其深远意义在于催生了一个透明、可复现的学术社区生态,使得研究者能够更专注于模型创新本身,而非陷入无穷无尽的对比实验构建之中。
衍生相关工作
基于KEENBench Results这一数据基础设施,衍生出多项具有深远影响力的学术贡献。研究者通过分析各配置下的结果差异,提出了面向流式知识的时序感知嵌入模型、面向稀疏关系的企业级补全策略以及融合多源语义的学术知识推理框架。更值得注意的是,该数据集催生了对评测指标本身的反思——部分工作通过分析结果中的长尾关系表现,揭示了现有评分准则在稀有实体评估上的局限性,进而推动了更具区分度的分层评估体系问世。这些衍生工作共同编织了一张从数据到理论再到应用的完整创新网络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务