遇见数据集

law-links-votes

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

Law Links Survey Votes 是一个用于评估法律引用识别系统的数据集,基于俄罗斯司法判决文本中的法律引用标注(如 ч. 3 ст. 158 УК РФ)。数据集包含两类文件:items(问题)和 votes(投票结果)。问题分为三类:verify(验证程序已找到的引用是否正确)、missed(候选遗漏的引用,判断是否确实存在引用)、control(已知答案的控制问题)。每个问题包含上下文片段(before、fragment、after)、程序对引用的解析(claim)以及结构化字段(law、article、lower)。投票记录包含每个参与者对问题的回答(对于 verify/control:yes、no_law、no_article、no_part、no_ref、unsure;对于 missed:yes、other_doc、no、unsure),以及响应时间、参与者随机标识符和自定义姓名。数据来源为 sudact.ru 上的司法判决片段(已匿名,不受版权保护),问题由 law-links v1.0.1 模型生成。投票者是非法律专业的学生,通过控制问题筛选注意力不集中者。数据集规模小于1K样本,使用 CC-BY-4.0 许可证,仅用于研究和评估目的。

Law Links Survey Votes is a dataset for evaluating legal citation recognition systems, based on legal citation annotations (e.g., ч. 3 ст. 158 УК РФ) from Russian judicial decisions. The dataset contains two types of files: items (questions) and votes (voting results). Questions are divided into three categories: verify (verify whether program-found citations are correct), missed (candidate missed citations, decide if a citation actually exists), and control (control questions with known answers). Each question includes context snippets (before, fragment, after), the programs parsed citation (claim), and structured fields (law, article, lower). Each vote record contains the participants answer to the question (for verify/control: yes, no_law, no_article, no_part, no_ref, unsure; for missed: yes, other_doc, no, unsure), along with response time, participant random identifier, and custom name. The data source is anonymously processed judicial decision excerpts from sudact.ru (not copyrighted), and questions are generated by the law-links v1.0.1 model. Voters are non-law students, with attention filters via control questions. Dataset size is under 1K samples, licensed under CC-BY-4.0, for research and evaluation purposes only.

创建时间:
2026-09-30
原始信息汇总

数据集概述

基本信息

  • 数据集名称:Law Links Survey Votes(俄语:Law Links: ответы опроса о юридических ссылках)
  • 数据集地址:https://huggingface.co/datasets/fpakhurov/law-links-votes
  • 许可证:CC-BY-4.0
  • 语言:俄语(ru)
  • 任务类别:Token Classification(标记分类)
  • 标签:legal、russian、human-feedback
  • 数据规模:n<1K

数据集简介

该数据集包含关于俄罗斯法院判决文本中法律条文引用问题的“是/否”回答,用于验证程序是否正确找到并理解了法律引用(例如“ч. 3 ст. 158 УК РФ”对应 статья 158、часть 3、Уголовный кодекс),以及程序是否遗漏了片段中的引用。

相关资源

  • 调查问卷:https://huggingface.co/spaces/fpakhurov/law-links-survey
  • 服务、调查与分析代码:https://github.com/fpakhurov/law-links
  • 方法论:https://github.com/fpakhurov/law-links/blob/master/docs/SURVEY.md
  • 技术报告:https://github.com/fpakhurov/law-links/blob/master/REPORT.md
  • 回答分析命令:python -m annotation.survey analyze survey1 --votes <папка с votes>

文件结构

items/survey1.jsonl(问题)

字段包括:

  • item_id:问题标识
  • kind:问题类型
    • verify:验证已找到的引用
    • missed:候选遗漏项
    • control:已知答案的控制问题
  • doc_id:文档标识
  • source:sudact.ru 上的判决链接及行号
  • before / fragment / after:上下文与突出显示的片段
  • claim:程序对片段的理解(以引用格式记录,如 п. 6 ч. 1 ст. 24.5 — КоАП РФ)
  • fields:按元素拆分(law、article、lower)
  • links:引用格式 {law_id, article, point_article, subpoint_article},law_id 依据任务词典
  • expected:control 类型问题的答案

votes/votes-*.jsonl(回答,调查期间追加)

字段包括:

  • vote_id:回答标识
  • item_id:问题标识
  • kind:问题类型
  • answer:答案
    • 对于 verify/control:yes、no_law(错误法律)、no_article(错误条款)、no_part(错误部分、点或子点)、no_ref(非引用)、unsure(跳过);早期回答中以 no_numbers 代替 no_article/no_part
    • 对于 missed:yes(指向法律或法典的引用)、other_doc(指向其他文档)、no、unsure
  • voter:浏览器随机标识
  • name:参与者自拟名称
  • ms:回答耗时
  • time:UTC 时间

来源与限制

  • 文本为 sudact.ru 的法院判决片段,已由来源去标识化;法院判决不受版权保护(俄罗斯联邦民法典第 1259 条第 6 款)。
  • 问题由 law-links v1.0.1 模型生成。
  • 回答者为学生,非律师;不认真的参与者通过控制问题筛除(python -m annotation.survey analyze)。
  • 基于 missed 问题评估的完整度仅针对候选池,而非文本中的所有引用。
搜集汇总
数据集介绍
law-links-votes 数据集图片
构建方式
该数据集源于对俄罗斯司法判决文本中法律条文引用自动识别效果的众包评估。构建过程以law-links v1.0.1模型生成的候选引用为对象,通过公开问卷收集非法律专业学生群体的判断,围绕引用是否被正确解析及是否存在遗漏展开标注,并设置控制问题以筛选注意力不集中的参与者,最终形成带有人工反馈的俄语法律引用验证数据。
使用方法
使用者可加载items目录下的JSONL文件获取问题条目,结合votes目录中的投票记录进行分析。借助配套代码库中的annotation.survey analyze命令,可对投票结果进行统计与质量控制。数据适用于训练或评估引用识别模型,亦可用于研究众包标注中的一致性与可靠性,使用时需注意其结论仅适用于候选引用集合,而非全部法律引用。
背景与挑战
背景概述
法律文本的自动解析与引用识别是法律信息学与自然语言处理交叉领域的核心议题。俄罗斯司法判决中频繁出现对法典条款的规范性引用,其准确提取直接关系到法律检索、论证分析与智能辅助系统的可靠性。law-links-votes数据集由研究者fpakhurov创建,旨在通过众包方式评估自动化系统对俄罗斯法院判决中法律引用的识别与理解质量。该数据集以俄语司法文书为语料基础,采用“是/否”问答形式收集非法律专业学生对程序识别结果的判断,涵盖引用验证与遗漏检测两类任务,为法律引用抽取模型的性能评估提供了独特的人类反馈视角,对推动俄语法律自然语言处理研究具有基础性意义。
当前挑战
在领域问题层面,法律引用的嵌套结构(如“ч. 3 ст. 158 УК РФ”)要求模型精确解析法律、条款、部分与子项的多层语义,而司法文本书写风格的多样性与引用格式的非规范性进一步加剧了抽取难度。构建过程中,数据集面临多重挑战:标注者均为非法律专业学生,其法律知识局限可能导致对引用正确性的误判,尽管设置控制问题用于筛选不专注的参与者,但标注质量仍受主观因素影响;同时,遗漏检测的完整性仅针对候选池而非全部文本引用,限制了召回率评估的全面性。此类挑战凸显了法律领域众包标注在专业性与覆盖度之间的固有张力。
常用场景
经典使用场景
在法律信息抽取领域,针对俄罗斯司法判决中法律条文引用的自动识别与解析,law-links-votes数据集提供了经人工校验的否/是反馈,成为评估和优化引用抽取模型的关键资源。经典使用场景聚焦于验证模型是否准确捕捉了诸如“ч. 3 ст. 158 УК РФ”的完整引用结构,包括法律名称、条款、部分及子项,并甄别遗漏的引用片段。通过参与式调查收集的投票数据,研究人员能够量化模型在引用验证与遗漏检测任务上的表现,进而驱动模型迭代。
解决学术问题
该数据集直面法律文本挖掘中引用解析的精准度与召回率难题,解决了自动系统在复杂司法文书中误判、漏判法律引用的问题。其提供的细粒度标注(如no_law、no_article、no_part)为错误分析提供了 granular 视角,使研究者能剖析模型在语义理解与结构匹配上的短板。意义在于,它推动了法律领域自然语言处理向可解释、可验证的方向发展,为构建高可靠性的法律信息检索与推理系统奠定了数据基础。
实际应用
在实际应用层面,law-links-votes数据集赋能法律科技工具的开发,如判决书自动摘要、法律条文关联推荐及司法大数据分析平台。通过训练模型精准识别引用,可辅助律师快速定位相关法条,提升案例检索效率;同时,法院系统可利用该技术校验文书引用的规范性,减少人工复核成本。其俄语法律场景的针对性,也为多语言法律信息处理提供了可迁移的范式。
数据集最近研究
最新研究方向
在法律人工智能领域,针对俄罗斯司法判决中法律条文引用自动识别的研究正借助众包标注数据取得进展。law-links-votes数据集通过收集非法律专业学生对程序识别结果的验证与遗漏反馈,为链接预测模型提供了人类判断基准,推动了司法文本中法律引用的细粒度抽取与验证任务。该资源呼应了法律信息学中提升裁判文书可解释性与检索准确性的热点议题,其标注方法为低资源语言的法律实体链接研究提供了可复用的范式,对构建可信赖的司法辅助系统具有基础性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务