DefExtra, DefSim
收藏资源简介:
DefExtra是一个用于定义提取评估的人类标注数据集,包含来自75篇论文的268个定义,其中60篇与媒体偏见相关,15篇非媒体偏见相关。DefSim是一个用于定义相似性评估的人类标注数据集,包含60个定义对,每个对都有1-5的相似性评分。
DefExtra is a human-annotated dataset for definition extraction evaluation, containing 268 definitions from 75 academic papers. Among these papers, 60 are related to media bias while the remaining 15 are unrelated to media bias. DefSim is a human-annotated dataset for definition similarity evaluation, including 60 definition pairs, each assigned a similarity score ranging from 1 to 5.
SciDef 数据集概述
数据集简介
SciDef 是一个为支持从科学文献中进行定义抽取和定义相似性研究而提供的资源集合。其核心包含两个人工标注的数据集。
数据集构成
1. DefExtra:定义抽取数据集
- 目的:用于评估定义抽取任务。
- 内容:
- 包含来自 75 篇论文的 268 个定义。
- 涵盖 60 篇与媒体偏见相关的论文和 15 篇非媒体偏见相关的论文。
- 重要说明:
- 公开版本仅提供标记信息(无文本摘录)。
- 使用者需从自有 PDF 文件中补充文本内容,并将补充后的 CSV 文件转换为 SciDef 所需的 JSON 格式。
- 详细操作指南见
docs/defextra_integration.md。
- 访问地址:https://huggingface.co/datasets/mediabiasgroup/DefExtra
2. DefSim:定义相似性数据集
- 目的:用于评估定义相似性任务。
- 内容:
- 包含 60 个定义对。
- 每个定义对带有 1-5 分的相似性人工评分。
- 访问地址:https://huggingface.co/datasets/mediabiasgroup/DefSim
相关资源
- 代码与工具:提供基于 LLM 的定义抽取流水线、运行与评估脚本、以及覆盖多种模型、提示策略和相似性度量的评估脚本。
- 优化提示:在
artifacts/目录下提供了针对多种开源与专有模型的 DSPy 优化提示。 - 项目页面:https://media-bias-group.github.io/SciDef-ProjectPage/
- 数据归档:https://doi.org/10.5281/zenodo.18501198
引用信息
若使用本资源,请引用以下文献: bibtex @misc{kucera2026scidefautomatingdefinitionextraction, title={SciDef: Automating Definition Extraction from Academic Literature with Large Language Models}, author={Filip Kuv{c}era and Christoph Mandl and Isao Echizen and Radu Timofte and Timo Spinde}, year={2026}, eprint={2602.05413}, archivePrefix={arXiv}, primaryClass={cs.IR}, url={https://arxiv.org/abs/2602.05413}, }



