遇见数据集

Offshore Energy Law Dataset · 海洋能源法结构化数据库

收藏
github2026-08-29 更新2026-09-07 收录
官方服务:

资源简介:

将中国海洋能源法律规范拆解为机器可读的结构化数据,并驱动一个回答可溯源的法律咨询智能体。

This dataset decomposes China's offshore energy legal norms into machine-readable structured data, and powers a legal consultation AI Agent that provides traceable answers.

创建时间:
2026-08-26
原始信息汇总

海洋能源法结构化数据库(Offshore Energy Law Dataset)概述

项目简介

本项目由广西大学法学院52名大二法学学生与1名教师共同建设,将中国海洋能源法律规范拆解为机器可读的结构化数据,用于驱动一个回答可溯源的法律咨询智能体。项目作为2026-2027学年第1学期《数据处理与分析》课程的考核成果,同时是一次前沿部署工程实践(FDE)。

四层组织架构

项目按照四层组织,与仓库目录一一对应:

  1. 方法层(methods/):包含领域地图、标注规范(Schema v0.5)、修订日志。领域地图由85份经绝对信源核对的国家层面规范组成,主题标签按规范对象分为9类;标注规范共27个字段,包含校验规则;修订日志记录五个版本的修订过程。
  2. 工具层(templates/、skills/):包含学生录入模板与批量校验脚本。模板含下拉受控词表、实时自检公式和自动生成的条目ID;校验脚本可独立重算全部规则并输出逐条问题报告。
  3. 数据层(data/):当前有教师制作的30条种子数据(已通过校验脚本全量校验),后期将并入脱敏学生条目数据(约1300条)。
  4. 过程层(cases/ + 修订日志):记录设计思路、失败经验与修改过程。

方法论亮点

五要素规范拆解

每条数据强制拆为规范主体、适用条件、行为模式类型、行为模式内容、法律后果五个要素,复刻法律要件化方法,使数据具有机器可读性。

「指导性」规范类型

在义务性、授权性、禁止性、定义性、程序性等传统行为模式之外,增设「指导性」类型,用于指代对象抽象、不具备直接执行可能但具有可解释空间的框架性经济公法规则。

央地镜像字段

国家层面条目记录中央「授予了什么」(央地权限配置),地方层面条目记录地方「行使了什么」(地方自主权类型),便于在数据交叉比对中分析央地权限配置的应然与实然。

复用与移植层次

  1. 同一门课复用:讲授《数据处理与分析》的教师可直接取用录入模板、校验脚本和治理文件,也可替换领域地图与主题标签词表后使用。
  2. 其他经济公法领域移植:能源、价格、财税、金融监管等领域可沿用字段结构与校验规则,需重做领域地图及替换词表,预计1-5天工作量。注意「指导性」类型与央地镜像字段专为经济公法设置,移植到民商法、刑法需结构性重构,行政法领域可复用。
  3. 数据质量保障框架复用:校验体系(确定性规则+权威母表交叉核对+相似度检测+AI初筛人工定级)可作为法律规范类数据集的通用质量保障方案。

当前状态与路线图

项目当前处于v1.0版本(✅),已完成领域地图、Schema v0.5、模板与校验脚本以及30条教师种子数据。后续规划包括:

  • v1.5(期中前):52份学生v1数据的校验统计(错误类型分布)
  • v2.0(v2修订后):脱敏学生语料(约1300条)及贡献者名单
  • v2.5(期末前):双平台智能体实测记录
  • v3.0(待第二班级/社区认领):地方层(11沿海省市)及央地权限配置矩阵

许可证与引用信息

  • 许可证:代码采用MIT协议;数据与文档采用CC BY 4.0协议
  • 引用格式:窦超(主持),广西大学法学院法学252班(贡献),Offshore Energy Law Dataset,GitHub: chao-niverse,2026
  • 数据获取地址:https://github.com/chao-niverse/offshore-energy-law-dataset
搜集汇总
数据集介绍
Offshore Energy Law Dataset · 海洋能源法结构化数据库 数据集图片
构建方式
本数据集依托法学教育实践,由52名法学专业本科生与指导教师共同构建,将中国海洋能源法律规范系统性地转化为机器可读的结构化数据。构建过程遵循四层组织架构,以方法层为核心,包含由85份经过信源核实的国家层面规范构成的领域地图、涵盖27个字段与校验规则的标注规范,以及详尽的修订日志。数据录入借助定制化模板与批量校验脚本,对学生条目进行实时自检与独立验算,确保数据质量与可追溯性。
使用方法
该数据集使用方式灵活多样,支持多层级复用。数据驱动了一个回答可溯源的法律咨询智能体,使用者可通过自然语言提问,答案将精准回溯至数据具体条目。数据集的设计使其成为独特教学资源,可直接应用于数据处理与分析课程,也可供经济公法领域研究者移用。技术团队提供了完整Schema、录入模板及校验脚本,支持跨领域移植,仅需调整领域地图与标签词表即可。API或文件访问提供了便捷的数据检索接口,适用于法律实证研究与教学评估等多重场景。
背景与挑战
背景概述
随着数字人文与法律计量研究的兴起,将法律文本转化为机器可读的结构化数据成为跨学科研究的前沿。海洋能源法作为经济公法的重要分支,其规范体系复杂且动态更新,传统研究多依赖人工阅读与定性分析,难以支撑大规模、可验证的实证研究。2026年,广西大学法学院窦超教师带领52名大二学生,依托《数据处理与分析》课程,创建了首个海洋能源法结构化数据库。该数据库基于85份国家层面经信源核对的规范,设计了27字段的标注规范,并集成校验脚本与央地镜像字段,旨在实现法律规范的精细化拆解与可溯源问答。该项目不仅是教学创新的典范,更为经济公法领域的计算法学研究提供了基础设施,推动了法律数据的开源共享与跨学科协作。
当前挑战
该数据集面临多重挑战。领域层面,海洋能源法涉及国家与地方多层级的规范性文件,规范类型多样,其中“指导性”规范缺乏具体行为指向,定义模糊,如何准确拆解并形式化表达是一大难点;同时,央地权限配置的镜像字段设计需精准捕捉法律授权与自主权行使的对应关系,对标注者的法学素养提出高要求。构建过程中,52名学生协同工作,需统一标注标准,确保一致性;数据质量保障依赖多版本人工校验与自动化脚本,但平衡人工成本与准确率仍具挑战;此外,地方层数据(11个沿海省市)尚未完全覆盖,跨区域法律差异的标准化处理是后续扩展的瓶颈。该数据集的成功依赖于持续迭代与社区协作,如何维持更新与质量控制是长期挑战。
常用场景
经典使用场景
海洋能源法结构化数据库作为法学与数据科学交叉领域的开创性资源,其经典使用场景在于支撑法律文本的机器可读化解析与智能化检索。该数据集将中国海洋能源领域的国家层面规范拆解为遵循五要素法(规范主体、适用条件、行为模式类型、行为模式内容、法律后果)的结构化条目,并辅以27字段的精细标注体系,使得研究者能够基于该数据库进行法规间关联分析、规范效力层级比对以及中央与地方权限配置的实证研究。同时,该数据库可作为法律人工智能(Legal AI)中法律知识图谱构建、法律推理链生成的关键底层数据源,驱动能够实现答案溯源的法律咨询智能体,为法律科技领域的算法训练与模型微调提供高质量的中国法律领域专项语料。其制作过程中形成的标注规范与质量校验框架亦可作为其他法律领域数据集构建的方法论蓝本,促进法律数据治理的标准化进程。
解决学术问题
该数据集直面法律文本非结构化与语义复杂性所导致的计算法学研究瓶颈,有效解决了法律规范无法被计算机直接解析与推理的学术难题。通过建立涵盖义务性、授权性、禁止性、定义性、程序性及独创的“指导性”规范类型在内的多维分类体系,该数据集为经济公法领域规范的量化分析提供了可重复、可验证的数据基础,填补了海洋能源法方向结构化公共数据集的空白。其构建过程中引入的央地镜像字段,巧妙回应了央地关系这一经济公法核心命题,使得学者能够利用数据交叉比对方法,实证考察中央授权与地方自主权行使的应然与实然状态,从而深化对制度运行逻辑的理解,促进了法学研究从规范解释向数据驱动的实证范式转型,为计算法学、立法评估及政策模拟等前沿领域的发展奠定了基石。
实际应用
在实际应用层面,该数据集最直接地赋能了“回答可溯源”的法律咨询智能体。依托数据库各条目与法律规范原文的精确映射,智能体生成的每一条答复均可回溯至特定规范条目,从而大幅提升法律咨询的准确性与可信度,并使得回答的审查、复核与申诉流程具有客观依据。这一应用模式适用于面向公众的海洋能源法规普及、企业合规风险筛查、政府监管辅助决策等多样化场景。此外,该数据集的框架设计具备跨领域复用性,能够便捷地移植至能源、价格、财税、金融监管等其他经济公法领域,助力构建更广泛的领域法规知识库;其数据质量保障框架亦可被采纳为法律数据生产项目的通用质检方案,切实推动法律行业数据的结构化与资产化进程,展现出从课堂成果到产业应用的实质转化潜力。
数据集最近研究
最新研究方向
当前,海洋能源法领域的研究正经历从文本解读向数据驱动范式跃迁的关键转型,其核心在于构建以要件化拆解为圭臬的机器可读法律知识库。该数据集独辟蹊径,将中国海洋能源法律规范解构为结构化条目,进而驱动具备溯源能力的法律咨询智能体,此举不仅突破了传统法学教育中案例与法条堆砌的范式桎梏,更创生了“五要素拆解+央地镜像字段”的规范表征体系,为经济公法规范的数字化治理提供了可移植的通用模板。前沿研究方向聚焦于法律知识图谱与智能法律服务的深度融合,旨在通过自动化质量评级与跨区域数据矩阵,实现法律推理过程的可解释性与可验证性,为涉海能源争议解决及政策制定注入透明化、智能化的数据底座,昭示着法律人工智能从辅助检索迈向协同决策的演进路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务