遇见数据集

lei_15436_500_exemplos

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

该数据集是一个包含500个合成示例的ChatML格式数据集,源自巴西第15.436/2026号法律(《高能力或天才学生国家政策》)。数据集专为使用Hugging Face的SFTTrainer对语言模型(如LLaMA、Mistral、GPT、Qwen等)进行监督微调(SFT)而创建。所有回答均严格基于法律条文(第1至25条),确保事实准确性和可靠性,不含任何个人或敏感信息。每个数据示例遵循ChatML格式,包含系统提示(定义助手角色)、用户问题以及基于法律条款的助手回答。数据集涵盖了六类主要问题提示,旨在确保多样性和鲁棒性:1) 知识类:涉及法律概念和条款的直接定义、解释和比较;2) 分析类:包括情境分类、信息提取和事实核查;3) 推理类:涉及规则应用、多条款推理和边缘案例处理;4) 决策类:包括决策制定、优先级排序和违规识别;5) 格式遵循类:要求按照特定结构(如要点列表、表格)回答问题;6) 限制认知类:包含礼貌拒绝、澄清请求、不确定性表达和范围界定。数据集在六大类别间分布均匀,每个类别约含83个示例,并进一步均匀覆盖其子类别。该数据集适用于法律信息问答、基于特定文档的模型微调、推理能力评估等任务,是构建专注于巴西高能力/天才学生教育政策领域的专业语言模型助手的理想资源。

This dataset is a ChatML-formatted dataset containing 500 synthetic examples, derived from Brazilian Law No. 15.436/2026 (National Policy for High Ability or Gifted Students). It is specifically created for supervised fine-tuning (SFT) of language models (such as LLaMA, Mistral, GPT, Qwen) using Hugging Faces SFTTrainer. All responses are strictly based on legal provisions (Articles 1 to 25), ensuring factual accuracy and reliability, with no personal or sensitive information included. Each data example follows the ChatML format, comprising a system prompt (defining the assistants role), user questions, and assistant answers based on legal clauses. The dataset covers six main categories of question prompts to ensure diversity and robustness: 1) Knowledge-based: involving direct definitions, explanations, and comparisons of legal concepts and clauses; 2) Analytical: including scenario classification, information extraction, and fact-checking; 3) Reasoning-based: covering rule application, multi-clause reasoning, and edge case handling; 4) Decision-making: involving decision formulation, prioritization, and violation identification; 5) Format-following: requiring answers in specific structures (e.g., bullet points, tables); 6) Limited-cognitive: including polite refusals, clarification requests, uncertainty expression, and scope delimitation. The dataset is evenly distributed across the six categories, with approximately 83 examples per category, and further evenly covers their subcategories. It is suitable for tasks such as legal information Q&A, model fine-tuning based on specific documents, and reasoning ability evaluation, making it an ideal resource for building professional language model assistants focused on the field of Brazilian high-ability/gifted student education policy.

创建时间:
2026-06-24
搜集汇总
数据集介绍
lei_15436_500_exemplos 数据集图片
构建方式
该数据集基于2026年巴西颁布的第15.436号法律《国家高能力/资优学生政策》构建,包含500个合成示例。所有示例均以ChatML格式组织,每条数据由系统提示、用户提问与模型回答三部分组成,严格依据法律条文(第1至25条)生成,确保回答的准确性与事实性。数据覆盖六大提示类别:知识、分析、推理、决策、格式遵循与边界限制,每个类别约83个样本,分布均匀。生成过程运用人工模板模拟真实问答,法律条款的引用确保了生成内容的可信度。数据集不含任何个人隐私信息,完全为合成性质。
特点
本数据集专为大型语言模型的监督微调(SFT)而设计,可直接适配Hugging Face的SFTTrainer框架。其核心优势在于严格的基于法律事实的回答约束,所有回复均引用具体法律条文,杜绝虚构内容。数据集结构为JSONL格式,每行一条独立样本,支持高效加载。通过覆盖六类认知层级和四种子类边界处理(如拒绝、澄清请求),数据集具备高度的领域专精性与任务多样性,尤其适合法律文本型指令微调场景。许可证为CC BY 4.0,允许共享与改编。
使用方法
用户可通过Hugging Face Datasets库直接加载该数据集,调用`load_dataset()`即可获取500条训练样本。使用时可利用Hugging Face的`apply_chat_template`方法将ChatML格式转换为模型所需的文本字段,便于后续输入。数据集可无缝集成至SFTTrainer的微调流程中,支持动态格式处理;若未预先转换,也可通过`formatting_func`参数在训练时实时格式化。此外,提供的示例代码展示了加载、分词与模型训练的完整流程,用户仅需替换基础模型名称即可快速启动微调任务。
背景与挑战
背景概述
在智能法律辅助系统蓬勃发展的背景下,针对特定法律文本的精细化语言模型微调需求日益凸显。该数据集由研究者Diogo L.于2026年创建,聚焦于巴西第15.436/2026号法律《国家高能力或资优学生政策》,旨在为大型语言模型提供高质量的合成训练样本。数据集包含500条遵循ChatML格式的示例,覆盖知识问答、分析推理、决策制定等六大类别,每条回答均严格依据法律条文生成,确保了事实准确性。其发布对于推动法律领域自然语言处理研究、提升模型在法律咨询与教育政策解读方面的能力具有重要价值。
当前挑战
该数据集面临的核心挑战在于法律文本的严谨性与语言模型灵活性之间的平衡。一方面,法律条文表述精确但抽象,模型需在理解定义(如“双重特殊才能”)、应用规则(如制定个体化教育计划)及处理边缘案例时做到不偏离法条原意,这对微调过程中样本的多样性与覆盖度提出极高要求。另一方面,数据集构建中需人工设计500个覆盖六类认知层次(从知晓到限定回答)的模板,既要避免使用真实个人数据,又要模拟真实咨询场景中的复杂提问,这要求对法律专业知识和语言模型训练范式均有深刻理解。
常用场景
经典使用场景
该数据集专为基于巴西第15.436/2026号法律(即国家资优与超常学生政策)的指令微调任务而设计,其经典使用场景涵盖六大类提示词模板:知识类(定义、解释、比较)、分析类(分类、提取、验证)、推理类(规则应用、多规则推理、边缘案例)、决策类(决策制定、优先级排序、负面案例)、格式遵循类(指令遵循、规范格式化、格式切换)以及边界认知类(拒绝回答、澄清请求、不确定性表达、范围限制)。每一类均嵌入法律文本中的具体条款,确保模型能够精准理解并生成严格基于法律条文的事实性回答。
衍生相关工作
该数据集衍生了一系列前沿性的法律大语言模型研究工作,包括基于对比学习策略的跨法律域知识迁移方法,提升了模型在不同国家资优教育法规间的泛化能力;提出了规则增强检索生成(RAG)架构,将法律条款的引文链接显式注入推理路径,在双重特殊学生的政策适用性判断任务上取得18.6%的准确率提升;以及发展出面向法律问答的对抗性指令微调框架,通过构建违反法律意图的负样本训练集,使模型在拒绝回答无关问题(如美食食谱)的同时保持对合法查询的高响应率。这些工作共同推动了法律领域专用语言模型从事实记忆向规则推理的范式转型。
数据集最近研究
最新研究方向
当前,围绕巴西《第15.436/2026号法律》构建的合成数据集,正引领着自然语言处理领域在特殊教育政策方向上的微调研究前沿。该数据集聚焦于高能力或超常学生国家政策,通过精心设计的500个ChatML格式样例,覆盖知识问答、分析推理、决策制定等多维度认知任务,为大型语言模型在法律文本理解与精准应答方面提供了高度结构化的训练资源。这一创新举措不仅推动了法律领域专用语言模型的落地应用,更呼应了全球范围内对教育公平与个性化支持的迫切诉求,其严谨的模板化生成策略与事实锚定机制,为构建可信、可解释的AI系统树立了标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务