遇见数据集

ethanz001/CANLegalRagBench

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

CanLegalRAGBench 是一个用于加拿大法律检索增强生成(RAG)任务的数据集。该数据集主要包含来自不同加拿大来源的案例法(判例法)以及少量法规。查询设计旨在模拟AI聊天机器人用户的真实问题,这些查询通过Gemini-2.5-Pro生成,并由行业专家验证样本。案例法通过人工注释员收集作为真实检索的基础,并补充了来自A2AJ加拿大法律数据集和CasewayAI提供的私人文档。数据集支持研究和开发AI系统以改善司法访问,提供法律查询、真实检索文档以及由LLM生成并经专家注释员验证的答案,用于评估检索和文本生成性能。数据集结构包括检索文档字段(如引用、名称、原始来源、年份、文本、URL等)和查询字段(如查询ID、查询文本、答案、批次ID等)。数据集由UBC NLP Lab策划,资金来自Mitacs和Caseway,语言主要为英语(部分法语文档),许可证为MIT(但检索文档来源文本受其自身许可证约束)。

CanLegalRAGBench is a dataset for Canadian legal Retrieval-Augmented Generation (RAG) tasks. It primarily contains case law from various Canadian sources and a small amount of legislation. The queries are designed to mimic real questions from users of an AI chatbot, generated via Gemini-2.5-Pro with samples verified by an industry expert. Case laws were gathered by human annotators for ground truth retrieval, supplemented by the A2AJ Canadian Legal Dataset and private documents from CasewayAI. The dataset is intended for research into developing AI systems to improve justice, providing legal queries, ground truth retrieval documents, and answers generated by an LLM and edited/verified by expert annotators for evaluating retrieval and text generation. The dataset structure includes fields for retrieval documents (e.g., citation, name, original_source, year, text, url) and queries (e.g., query_id, query_text, answer, batch_id). It is curated by the UBC NLP Lab, funded by Mitacs and Caseway, with languages mainly English (some French in English documents), and licensed under MIT (though retrieval document source texts are subject to their own licenses).

提供机构:
ethanz001
搜集汇总
数据集介绍
ethanz001/CANLegalRagBench 数据集图片
构建方式
CANLegalRagBench数据集的构建旨在服务于加拿大判例法的检索增强生成任务。数据集核心包含来自加拿大各级法院的判例及少量立法文本,其查询语句由Gemini-2.5-Pro模拟AI聊天机器人用户的真实提问生成,并经行业专家抽样验证以确保真实性。用于检索的真实性文档由资深法律专业学生与助理律师手动标注,并辅以A2AJ加拿大判例数据集和CasewayAI提供的私有文档进行扩充,最终形成了涵盖多种来源的高质量法律文本集合。
特点
该数据集展现出鲜明的领域特色与实用导向:首先,查询与文档的配对经由法律专家人工筛选,保证了检索任务的真实性与专业性;其次,每个查询均附有基于真实文档、由大语言模型生成并经过核验的参考答案,实现了对检索与生成双重能力的评估;此外,文档来源多样,包含人工标注、公开数据集与企业私有资料,并明确标注了各自的开源许可,为研究者在不同应用场景下的合规使用提供了清晰指引。
使用方法
使用者可通过Hugging Face平台直接加载数据集,利用标准字段如'query_text'和'text'进行检索实验,并通过'ground_truth_citations'字段对照文档列表进行检索性能的评测。对于生成任务,可参考'answer'字段中的专家核验答案作为基准。需注意,该数据集适用于对比研究,任何高得分方法均需经法律专业人士核实方可应用于正式法律流程,且商业用途需额外联系相关法院获取授权。
背景与挑战
背景概述
在法律人工智能领域,信息检索(Legal RAG)是提升司法可及性与法律服务质量的关键技术,然而高质量、专业标注的法律检索数据集长期稀缺,尤其对于加拿大这样的多法域国家。CANLegalRagBench数据集由不列颠哥伦比亚大学(UBC)自然语言处理实验室主导,联合CasewayAI及其他合作伙伴,在Mitacs资助下于2024年创建。该数据集聚焦加拿大判例法检索任务,包含来自法院、仲裁庭等多元来源的判例文本及少量立法文档,并辅以由法律专业学生与助理人工标注的基准答案。其核心研究问题在于模拟真实用户(包括公众与法律从业者)对AI法律助手的查询需求,为检索增强生成系统提供评估基准。该数据集通过将查询与真实判例对应,填补了加拿大法律RAG领域结构化评测数据的空白,对推动北美法律AI研究具有里程碑意义。
当前挑战
该数据集所解决的核心领域挑战是法律文档检索的精度与可靠性问题,尤其在多司法管辖区并存且判例法体系复杂的加拿大,如何从海量法律文本中精准定位与用户查询语义匹配的权威判例,是制约法律AI落地的关键瓶颈。在构建过程中,数据集面临多重挑战:首先,法律查询需兼顾真实性与多样性,数据集采用Gemini-2.5-Pro自动生成查询并辅以行业专家验证,但自动生成内容仍存在偏离法律实务术语的风险;其次,基准文档标注依赖人类专家从繁杂的判例中筛选出契合的法律依据,耗时且易受个人判读差异影响;此外,文档来源异构(包括公开判例、私有文档与第三方数据集),导致元数据格式不统一,特别是引用格式与许可证条款的兼容性问题增加了数据整合难度。
常用场景
经典使用场景
在法律人工智能与自然语言处理领域,CANLegalRagBench数据集被设计为专门服务于加拿大判例法的检索增强生成任务。其核心用途在于提供一个标准化的评测平台,研究人员可利用该数据集对法律文本检索系统与法律问答生成模型进行协同评估。该数据集精心构造了模仿真实AI法律助手用户提问的查询语句,并配备了由领域专家标注的答案与检索所需的相关判例,从而为法律检索与生成的一体化研究提供了可靠的实验基准。
实际应用
在实际应用层面,CANLegalRAGBench可被用于构建和优化面向加拿大法律从业者与公众的智能法律咨询系统。例如,AI法律助手能够快速从海量判例库中精准检索与用户问题相关的法律条文和判例摘要,并基于检索到的内容生成具有法律依据的初步分析报告。该系统有望在节约司法资源、加速法律文书查阅、辅助非专业人士获取法律信息等场景中发挥关键作用,从而提升加拿大司法体系的可及性与效率。
衍生相关工作
基于CANLegalRAGBench评测框架,可衍生出一系列聚焦法律AI的经典研究工作。例如,针对加拿大跨省管辖权差异的检索策略优化研究、融合判例法与条文法的新型混合推理模型,以及面向法律摘要生成的多任务学习范式。此外,该数据集还为验证大语言模型在法律领域的鲁棒性、公平性与可解释性提供了重要的实验素材,预计将催生出一批关于法律知识增强、领域微调与检索对齐的学术成果,进一步丰富法律与人工智能交叉学科的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务