legal-world
收藏官方服务:
资源简介:
LEGALWORLD数据集是一个专为法律智能体设计的生命周期交互环境数据集,基于中国民事诉讼程序建模。该数据集将民事诉讼建模为一个相互关联的生命周期过程,而非一系列孤立任务,涵盖法律咨询、文书起草、一审审判、上诉裁决、上诉书起草和二审审判等连续程序阶段。数据集包含案例数据和法律条文检索数据,以支持对LEGALWORLD环境及相关法律智能体的研究。数据文件包括三个原始版本(Full_version_raw.json、medium_version_raw.json、light_version_raw.json),这些版本仅按数据规模区分,适用于自定义信息提取、数据清洗、建模和实验构建;light_case_dataset.json是经过处理的轻量级案例数据集,已完成基本信息提取和结构化,可直接用于LEGALWORLD相关任务和下游实验;law_metadata.jsonl是法律条文检索的原始数据,用户可独立生成法律条文文本的嵌入向量,并结合向量数据库或检索模块构建法律条文检索工具。该数据集旨在支持研究法律智能体在多阶段诉讼工作流程中的能力,包括法律咨询、法律推理、法律文书生成、法庭互动和法律条文检索等任务。
创建时间:
2026-06-19
原始信息汇总
数据集概述:LEGALWORLD
LEGALWORLD 是一个面向法律智能体的生命周期交互环境,基于中国民事诉讼程序建模。其数据覆盖从法律咨询、文书起草、一审审判、上诉裁定、上诉状起草到二审审判的连续诉讼阶段。
数据文件说明
| 文件名称 | 描述 |
|---|---|
Full_version_raw.json、medium_version_raw.json、light_version_raw.json |
三个原始版本,仅按数据规模区分,适用于自定义信息抽取、数据清洗、建模及实验构建。 |
light_case_dataset.json |
轻量级处理后的案例数据集,已完成必要信息提取和结构化,可直接用于LEGALWORLD相关任务及下游实验。 |
law_metadata.jsonl |
法律条文检索的原始数据,用户可自行生成法律条文文本的嵌入向量,结合向量数据库或检索模块构建法律条文检索工具。 |
相关链接
- 项目主页:https://chidaic.github.io/Legal-world/
- 论文:https://arxiv.org/abs/2606.18728
- 演示:http://www.fudan-disc.com/legalworld/
数据特色
该数据集将民事诉讼定义为一个互联的生命周期过程,而非一系列孤立任务。其中的案例与法律条文资源支持法律智能体在多阶段诉讼工作流中的能力研究,涵盖法律咨询、法律推理、法律文书生成、法庭交互及法律条文检索。
搜集汇总
数据集介绍

构建方式
LEGALWORLD数据集以中国民事诉讼程序为蓝本,构建了一个覆盖法律咨询、文书起草、一审庭审、上诉裁定、上诉材料撰写及二审庭审等连续诉讼阶段的交互式智能体环境。该数据集提供了三种不同规模(完整版、中等版、精简版)的原始案件数据,支持用户根据需求进行自定义信息抽取、数据清洗与建模实验。同时,轻量版案件数据集已完成关键信息提取与结构化处理,可直接用于LEGALWORLD相关任务与下游实验。此外,法律条文元数据以jsonl格式存储,便于用户独立生成条文文本的嵌入向量,并结合向量数据库或检索模块构建法律条文检索工具。
特点
该数据集的显著特色在于将民事诉讼定义为一个相互关联的生命周期过程,而非一组孤立的任务。它突破了传统法律数据集仅聚焦单一任务的局限,全面覆盖多阶段诉讼工作流,为研究法律智能体在法律咨询、法律推理、法律文书生成、庭审交互及法律条文检索等环节的综合能力提供了丰富资源。案件数据与法律条文检索数据的双重支持,使得研究者能够系统性评估和提升智能体在复杂诉讼场景下的协作与决策能力。
使用方法
研究者可根据研究目标灵活选用不同规模的数据版本:原始数据适用于定制化的数据预处理与特征工程,而轻量处理版则开箱即用,便于快速验证模型效果。对于法律条文检索任务,需自行对law_metadata.jsonl中的条文文本生成嵌入向量,通过集成向量数据库或检索模块来构建检索工具。相关项目页面、论文及在线演示平台提供了详细的技术文档与应用示范,用户可参考这些资源快速上手,开展多阶段法律智能体的实验与评估工作。
背景与挑战
背景概述
LEGALWORLD数据集由复旦大学的科研团队于2026年创建,其核心研究问题在于构建一个覆盖中国民事诉讼全生命周期的交互式环境,以支持法律智能体的研究。该数据集将民事诉讼视为一个相互关联的生命周期过程,而非孤立任务的集合,涵盖了法律咨询、文件起草、一审、上诉、上诉文件起草及二审等连续程序阶段。通过提供案例数据和法律条文检索数据,LEGALWORLD推动了法律智能体在多阶段诉讼工作流中的能力研究,包括法律推理、法律文件生成、法庭交互与法律检索,在人工智能与法律交叉领域产生了显著影响力。
当前挑战
该数据集所解决的领域问题挑战在于,传统法律AI研究通常聚焦于单一任务(如法律判决预测),而忽视了诉讼过程中多阶段任务的动态关联性与信息传递,使得智能体难以实现全局性协作。在构建过程中,面临的挑战包括:第一,如何将现实生活中复杂且非结构化的民事诉讼流程抽象为可编程的阶段性任务;第二,如何从海量法律文书中提取结构化的关键信息,并确保数据覆盖不同案件类型与法律条文;第三,如何设计轻量级与全量版本的数据集,以适配不同计算资源下的实验需求,同时保持数据的一致性与可复用性。
常用场景
经典使用场景
LEGALWORLD数据集以中国民事诉讼程序为蓝本,构建了一个覆盖法律咨询、文书起草、一审庭审、上诉裁决等完整诉讼生命周期的交互式环境。其经典使用场景在于为法律智能体提供多阶段、连贯性的任务训练与评估平台。研究者可借助该数据集中的案例数据与法条检索资源,模拟真实诉讼流程中不同环节的协同推理与决策。例如,法律智能体需在咨询阶段理解用户诉求,在文书阶段生成规范文本,并在庭审阶段进行逻辑辩论与法条引用。这种全流程覆盖的设计,使得数据集成为检验法律智能体在复杂司法情境下综合能力的重要基准。
实际应用
在实际应用中,LEGALWORLD数据集可支撑法律科技产品的原型开发与效果验证。例如,基于其案例数据训练的智能体可部署于在线法律服务平台,为用户提供全流程的诉讼辅助,包括初步咨询、证据整理建议及文书模板生成。法条检索模块则能嵌入法院内部的智慧审判系统,帮助法官快速定位相关法律条文。此外,该数据集还适用于法律教育培训场景,通过模拟庭审交互环境,培养法律实务人员的辩论与文书写作能力。这些应用显著降低了法律服务的门槛,提升了司法流程的效能与透明度。
衍生相关工作
围绕LEGALWORLD数据集,已衍生出多项具有影响力的研究工作。其中,研究者基于其生命周期框架提出了面向法律智能体的多阶段强化学习策略,探讨了如何在咨询与庭审等环节之间传递优化信号。另有工作聚焦于法律文书的跨阶段生成一致性,利用该数据集中的结构化信息设计了条件式生成模型。此外,法条检索组件催生了结合知识图谱与向量数据库的混合检索方法,显著提升了法律信息获取的准确率。这些衍生工作不仅验证了数据集在推动司法大模型发展中的核心价值,也为后续研究提供了丰富的基线方法与实验参考。
以上内容由遇见数据集搜集并总结生成




