maritaca-ai/oab-bench
收藏官方服务:
资源简介:
OAB-Bench是一个用于评估大型语言模型在法律写作任务上的基准,包含巴西律师资格考试的七个法律领域的105个问题。该基准旨在检验模型撰写法律文件和回答论述性问题的能力,并提供人类考官的全面评估指南。
OAB-Bench is a benchmark for evaluating Large Language Models (LLMs) on legal writing tasks, containing 105 questions across seven areas of law from the Brazilian Bar Examination. It is designed to test the ability of models to write legal documents and answer discursive questions, and it provides comprehensive evaluation guidelines used by human examiners.
提供机构:
maritaca-ai搜集汇总
数据集介绍

构建方式
OAB-Bench基准测试的构建以巴西律师资格考试第二阶段的210道论述题为基础,覆盖七类法律领域,横跨第39至44届考试。数据集包含两个配置:其一为“questions”格式,存储题目信息,包括唯一标识符、法律领域分类、问题陈述、对话轮次、最高分值及系统提示词;其二为“guidelines”格式,收录官方评分指南,与题目一一对应。所有数据均以结构化形式组织,旨在为大型语言模型在法律文书撰写任务上的评估提供标准化素材。
特点
该数据集以自动评估为核心特色,采用大语言模型作为评委,支持结构化与非结构化两种输出格式,其中结构化模式因高相关性被优先推荐。涵盖210道题目,规模虽小但聚焦于法律写作这一专业领域,具备极强的领域针对性。评估流程包含模型答案生成与自动评分,且与人类评分者之间展现出高度一致性,确保了评价结果的可靠性。
使用方法
数据集通过HuggingFace Datasets库加载,用户可分别调用“questions”与“guidelines”两个配置的train分片,以获取题目及配套评分标准。完整的评估管线,涵盖答案生成与LLM评判流程,托管于数据集配套的GitHub仓库中,便于研究者复现实验或自定义评估。当前v2版本包含全部210题,适合用于检验模型在巴西律师资格考试背景下的法律文书撰写能力。
背景与挑战
背景概述
在法律人工智能领域,评估大语言模型在法律文书撰写等生成式任务中的表现始终是一个核心难题。现有基准多聚焦于多项选择或封闭式问答,难以捕捉真实法律场景中所需的推理与表达能力。由Ramon Pires、Roseval Malaquias Junior及Rodrigo Nogueira等研究者于近期提出的OAB-Bench基准,旨在填补这一空白。该基准源自巴西律师资格考试(OAB)第二阶段,涵盖第39至44届共七个法律领域的210道论述性问题,为评测模型在法律文书撰写上的能力提供了标准化框架。其发布依托于ACM国际人工智能与法律会议(ICAIL '25),并配套了基于大语言模型作为自动裁判的评估流程,对推动法律自然语言处理研究具有显著影响力。
当前挑战
OAB-Bench所面临的领域挑战在于,法律文书生成不仅需要准确理解法律条文与事实间的逻辑关系,还需产出符合专业格式与论证结构的连贯文本,这对模型的语义理解与长程生成能力提出了极高要求。此外,巴西律师资格考试的论述题评分依赖人工考官依据详尽评分指南,标准主观且复杂。在基准构建过程中,研究者需将这一人工评分体系转化为可被大语言模型自动化执行的评判准则,确保自动裁判与人类评分间的高度一致性。同时,涵盖210道跨领域、多届次试题的构建,也考验了数据收集的全面性与评分标准的统一性,是一项兼具学术深度与工程挑战的任务。
常用场景
经典使用场景
OAB-Bench 数据集专为评估大型语言模型在巴西律师资格考试(OAB)第二阶段的法律文书写作能力而设计。该基准包含来自六届考试(第39至44届)的210道论述题,覆盖行政法、民法等七大法律领域。经典使用场景是让模型根据给定的案件陈述生成法律文书或论述性回答,并利用官方评分指南与GPT-5.2等自动裁判模型进行打分,从而系统衡量模型在法律文本生成方面的专业水平。
解决学术问题
该数据集有效填补了法律领域开放型写作任务自动化评估的空缺,解决了传统上依赖人工阅卷耗时耗力且主观性强的问题。通过引入LLM作为裁判并与人类评分高度相关,OAB-Bench为研究法律文本的生成质量、推理逻辑和格式规范提供了标准化评估框架。其意义在于推动了自然语言处理在法律专业领域的能力边界探索,并为跨学科的法律人工智能研究提供了可靠基准。
衍生相关工作
OAB-Bench已催生出多项经典相关工作,包括基于该基准的LLM裁判方法研究,如采用结构化和非结构化输出格式对比评估效果。其论文在ICAIL '25发表后,推动了法律领域自动评估工具链的完善,例如结合Sabia系列模型进行葡萄牙语法律文本生成的专项优化。此外,研究者还借鉴其评估思路,拓展至其他语种的法律文书基准构建,以及多轮对话式法律咨询系统的效果评测。
以上内容由遇见数据集搜集并总结生成



