遇见数据集

sie-task-evidence

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

SIE task evidence 是一个用于重现 superlinked.com 上任务页面结果的数据集。它记录了每个任务的实际输入和模型响应,按任务组织为独立文件夹。每个文件夹包含三个部分:inputs/(精确的文档、查询、图像或音频输入)、calls.json(每次调用的请求、响应、状态和计时详情)以及 manifest.json(端点、模型 ID、服务修订版和运行日期)。特别地,redact 子文件夹用于个人数据检测基准测试,包含 660 篇英文文档(来自 gretelai/synthetic_pii_finance_multilingual 数据集的测试集),每篇文档标注了黄金标准 PII 跨度(共 1792 个跨度),并记录了五个模型臂(SIE、Microsoft Presidio、OpenAI Privacy Filter、GPT-6 Luna、Claude Haiku 4.5)的响应、结果、令牌计数和成本。数据集的目的是让任何人都能使用 Python 标准库从头重现已发布的评估数字,而无需 API 密钥或推理支出。数据集仅保证这些数字来自真实运行,并不代表输入对用户数据的适用性。输入来源公开,许可证因来源而异(redact 部分采用 Apache 2.0)。

SIE task evidence is a dataset for reproducing results from task pages on superlinked.com. It records actual inputs and model responses for each task, organized into independent folders per task. Each folder contains three parts: inputs/ (exact documents, queries, images, or audio inputs), calls.json (request, response, status, and timing details for each call), and manifest.json (endpoint, model ID, service revision, and run date). Notably, the redact subfolder is used for personal data detection benchmarking, containing 660 English documents (from the test set of the gretelai/synthetic_pii_finance_multilingual dataset), each annotated with gold-standard PII spans (1792 spans in total), and records responses, results, token counts, and costs for five model arms (SIE, Microsoft Presidio, OpenAI Privacy Filter, GPT-6 Luna, Claude Haiku 4.5). The dataset aims to allow anyone to reproduce published evaluation numbers from scratch using Python standard library, without requiring API keys or inference expenses. The dataset only guarantees these numbers come from real runs and does not represent the applicability of inputs to user data. Input sources are public, and licenses vary by source (the redact part is under Apache 2.0).

创建时间:
2026-09-21
原始信息汇总

SIE task evidence 数据集概述

基本信息

  • 数据集名称:SIE task evidence
  • 许可证:other
  • 标签:evaluation、reproducibility
  • 数据集地址:https://huggingface.co/datasets/superlinked/sie-task-evidence

数据集用途

该数据集记录了 superlinked.com 任务页面背后的输入和模型响应,每个任务对应一个文件夹。任务页面上发布的每个数字均由针对 https://api.superlinked.com 的真实记录运行产生;对于某些任务(如 typed-decisions),则是针对自托管 SIE 服务器在 GPU 上固定提交(pinned commit)运行产生,该提交记录在任务的 manifest.json 中。

该数据集的核心目的是让任何人都能无需 API 密钥、无需消耗任何推理即可重新推导出已发布的数字。

使用方法

每个任务的可运行示例位于公开仓库 superlinked/sie 的 examples/ 目录下。每个示例包含运行器(runner)、评分器(scorer)和 README。操作流程如下:

git clone https://github.com/superlinked/sie cd sie/examples/<task> python3 fetch.py # 下载此数据集,版本为该示例所固定的修订版 python3 score.py # 复现已发布页面上的数字

特点:

  • 仅使用标准库,无依赖安装、无 Hugging Face token、无 API 密钥、无推理开销
  • 每个示例固定一个提交 SHA 而非 main,确保所评分的字节与编写时一致
  • fetch.py 携带 manifest.json 的摘要,进而固定 calls.json 和每个输入,因此缺失或被篡改的文件会导致获取失败,而非静默产生不同数字

目录结构

<task>/ inputs/ 使用的确切文档、查询、图像或音频 calls.json 每次调用一条记录:请求、响应、状态、计时 manifest.json 端点、模型 id、服务修订版、运行日期

数据集的证明范围

  • 可以证明:任务页面上的数字来自实际发生过的运行,且任何人都能从相同的字节重新计算
  • 不能证明:这些输入能代表你的数据;相同模型在你的文档上会得到相同分数;未来模型修订版行为一致
  • 若页面展示的是更大记录集的选取部分,页面会注明,完整集在此处提供

/redact 子集

redact/ 保存了 superlinked.com/redact 背后的运行记录(来源:SOURCES.md),记录日期为 2026-09-30。

  • 测量指标:覆盖率召回率(coverage recall)——被某方案掩码的范围内个人数据跨度(HIPAA Safe Harbor 标识符加凭据)中每个非空格字符被掩码的比例
  • 规模:660 篇文档,1,792 个范围内跨度,五个方案
  • 五个方案:SIE(urchade/gliner_multi_pii-v1 和 numind/NuNER_Zero 在 https://api.superlinked.com 上组合)、Microsoft Presidio、OpenAI Privacy Filter、GPT-6 Luna、Claude Haiku 4.5

redact 目录结构

redact/ manifest.json 运行日期、端点、模型、标签、提示词、方案设置、每个文件的 sha256 inputs/ gretel-main.jsonl:660 篇文档及其黄金跨度 rows/ 每篇文档每方案一行 JSONL,该方案的记录响应 results/ 研究图表、token 计数、吞吐量及每方案价格

examples/redact 在固定修订版获取此文件夹,并使用 Python 标准库重新推导每个已发布图表。

redact 数据来源

  • 文档为 gretelai/synthetic_pii_finance_multilingual 英文测试集的 660 行,修订版 7b844d16738527a04264f50214cb426a4cea0897,由 Gretel.ai 提供,采用 Apache License 2.0 许可
  • 文本和黄金跨度未经修改地重新分发;字段已重命名(generated_text → text,document_type → domain,pii_spans → gold,每个跨度保留 start、end 和 label)
  • 其中的个人数据为合成数据

来源与许可

输入来自公共来源,每个任务的 manifest.json 记录每个输入的来源。许可证因来源而异,目前正在审查中。若你是此处某内容的权利持有人并希望移除,请在本数据集上发起讨论。

搜集汇总
数据集介绍
sie-task-evidence 数据集图片
构建方式
该数据集系为支撑可复现性评估而构建,其核心在于将 superlinked.com 任务页面背后真实发生的模型调用与响应逐条留存。构建过程以任务为单位划分目录,每个任务均包含 inputs 目录下原初文档、查询、图像或音频,calls.json 记录每次调用的请求、响应、状态与耗时,manifest.json 则标明端点、模型标识、服务修订版本与运行日期。部分任务在 GPU 上以固定提交自托管 SIE 服务器完成推理,所有录制均不依赖外部 API 密钥,仅凭标准库即可重新推导已发布的数值。
特点
数据集以字节级可验证性与版本锁定为显著特性。每个任务示例通过固定提交 SHA 而非主分支拉取数据,fetch.py 携带 manifest.json 的摘要,进而锁定 calls.json 与全部输入,任何文件缺失或篡改都会导致抓取失败,而非悄然产生不同结果。此外,数据集明确界定其能确立与不能确立的边界:它证实页面数值源自真实运行且可由相同字节重算,但不宣称输入具有普遍代表性,亦不保证未来模型修订版本行为一致。
使用方法
使用流程围绕公开仓库中的可运行示例展开。用户克隆 superlinked/sie 仓库后,进入 examples/<task> 目录,依次执行 fetch.py 与 score.py,即可在无令牌、无密钥、无推理开销的条件下复现任务页面公布的指标。每个示例均配备运行器、评分器与 README,评分所依据的证据即由本数据集按固定修订版本提供,全程仅依赖 Python 标准库,确保结果可追溯且不引入额外依赖。
背景与挑战
背景概述
随着大语言模型与信息抽取系统的评测需求日益增长,结果可复现性成为衡量研究可信度的关键标尺。SIE task evidence数据集由Superlinked团队构建并维护,旨在公开其任务页面背后真实运行的输入与模型响应,使外部研究者无需API密钥或推理开销即可重新推导已发布的评测数值。该数据集通过固定提交哈希与文件摘要,确保了评分字节与撰写时完全一致,为信息抽取领域的透明评测与可复现研究提供了基础设施,对推动评测标准化具有积极意义。
当前挑战
该数据集所面对的领域挑战在于信息抽取评测长期缺乏可验证的证据链,已发布数值常因环境漂移、模型版本更迭而难以复现。构建过程中的挑战则体现在多源异构数据的整合与治理:需从公开渠道采集文档、查询、图像或音频,协调不同来源的许可证差异,并对敏感内容进行脱敏处理。此外,固定端点和模型版本的记录须在推理环境变化时保持稳定,任何文件缺失或篡改都会导致抓取失败,这对数据管线的严谨性与长期可维护性提出了较高要求。
常用场景
经典使用场景
在信息抽取与文档理解的研究中,可复现评测已成为衡量模型真实效能的核心环节。sie-task-evidence数据集以任务为单位,系统性地保存了调用Superlinked推理端点所产生的请求、响应、状态与时序信息,并配以输入文档、查询、图像或音频以及记录端点、模型标识与运行日期的清单文件。其最经典的使用场景在于支撑公开示例仓库中的评分脚本,使研究者无需API密钥、无需消耗任何推理算力,即可依据固定提交哈希重新推导已发布任务的评测数值,从而在标准化条件下对抽取、脱敏等任务的表现进行独立复核。
衍生相关工作
围绕该数据集,公开的sie仓库衍生出与各任务对应的可运行示例,每个示例均包含运行器、评分器与说明文档,并以固定修订版本拉取证据以复现页面数值。其中脱敏任务示例依据固定提交重算全部已发布图表,成为可复现评测的典型实践。这些衍生工作将证据记录与标准化脚本相衔接,形成从数据获取到指标推导的完整链路,亦为后续在命名实体识别、类型化决策等任务上开展可验证研究提供了模板与参照。
数据集最近研究
最新研究方向
在隐私保护与合规性评估领域,可复现性正成为衡量评测基准可信度的核心议题。sie-task-evidence数据集通过记录真实API调用与模型响应,为PII检测任务的覆盖召回率、吞吐量及成本效益分析提供了无需重复推理即可复算的实证基础。当前研究聚焦于将此类证据集与标准化评估框架结合,以验证多模态隐私过滤系统在真实文档分布下的泛化能力,并推动跨模型、跨端点的公平比较。其价值在于揭示了评测结果对输入样本、模型版本及服务端点的敏感性,为构建可审计、可追溯的隐私保护基准提供了方法论参考,亦回应了监管对算法透明度的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务