遇见数据集

2026-08-14-courtroom

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是名为“synth courtroom run”的合成数据生成实验的产物,包含从生成流水线中各个阶段保存的快照,用于支持可恢复的生成缓存。数据集共包含19个配置,每个配置对应一个JSONL格式的文件:主数据集文件(dataset.jsonl)以及从阶段1(chunk_constitution)到阶段12(export_sft)的中间结果快照,部分阶段还提供了.partial部分快照。元数据记录了实验名、生成日期(20260815_201700)、所使用的宪法(constitution)文件(claude_distilled_09_principles_mid_20260804)、源仓库、各阶段模型及完整生成配置。数据集标签标明其为训练数据(training-data)、合成生成(kind:synth)、与法庭流程相关(pipeline:courtroom),并关联了特定的宪法版本。该数据集适用于监督微调(SFT)等任务,尤其适合探索基于宪法原则的AI对话生成。

This dataset is the product of a synthetic data generation experiment called synth courtroom run, containing snapshots saved at various stages of the generation pipeline to support resumable generation caching. The dataset contains 19 configurations, each corresponding to a JSONL file: the main dataset file (dataset.jsonl) and intermediate result snapshots from stage 1 (chunk_constitution) to stage 12 (export_sft), with some stages providing .partial partial snapshots. Metadata records the experiment name, generation date (20260815_201700), the constitution file used (claude_distilled_09_principles_mid_20260804), source repository, models at each stage, and complete generation configuration. The dataset is labeled as training-data, synthetic generation (kind:synth), related to courtroom processes (pipeline:courtroom), and associated with a specific constitution version. This dataset is suitable for supervised fine-tuning (SFT) and other tasks, especially for exploring AI dialogue generation based on constitutional principles.

创建时间:
2026-08-15
原始信息汇总

数据集概述

数据集名称:synth courtroom run — per-stage snapshots (resumable generation cache)

数据集地址:https://huggingface.co/datasets/LASR-Callum/2026-08-14-courtroom

数据集用途:该数据集是一个合成数据生成流水线(courtroom 流水线)的阶段性快照集合,用于存储和管理可恢复的生成缓存。它记录了从宪法文本分块到最终监督微调(SFT)数据导出的完整生成过程。

生成时间:20260815_201700

宪法来源:constitutions/claude_distilled_09_principles_mid_20260804/constitution.md

源仓库:https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git @ b992089ffec3dbc23ba676ef5c1ebad319937daa

生成工具:使用 uv run synth run --config configs/data/synth/courtroom.yaml 命令生成

数据集结构:由多个阶段的 JSONL 文件快照组成,每个阶段对应流水线中的一个步骤,并附有 manifest.json 文件记录完整的运行配置、采样设置和各阶段使用情况。共有以下配置(config)可供加载:

  • dataset(默认配置,主数据文件 dataset.jsonl
  • stage_1_chunk_constitution:宪法文本分块
  • stage_2_write_scenarios:编写场景
  • stage_3_dedupe_scenarios:场景去重
  • stage_4_draft_positions.partial / stage_4_draft_positions:草拟立场(含部分快照与完整快照)
  • stage_5_argue_a.partial / stage_5_argue_a:A 方论证(含部分快照与完整快照)
  • stage_6_argue_b.partial / stage_6_argue_b:B 方论证(含部分快照与完整快照)
  • stage_7_compose_prompts.partial / stage_7_compose_prompts:编写提示词(含部分快照与完整快照)
  • stage_8_revise_prompts.partial / stage_8_revise_prompts:修订提示词(含部分快照与完整快照)
  • stage_9_draft_verdict.partial / stage_9_draft_verdict:草拟裁决(含部分快照与完整快照)
  • stage_10_judge_draft.partial / stage_10_judge_draft:评判草稿(含部分快照与完整快照)
  • stage_11_revise_verdict.partial / stage_11_revise_verdict:修订裁决(含部分快照与完整快照)
  • stage_12_export_sft:导出监督微调(SFT)数据

标注说明:该数据集的标签包括:

  • training-data:训练数据
  • kind:synth:合成数据
  • pipeline:courtroom:法庭场景流水线
  • constitution:claude_distilled_09_principles_mid_20260804:使用的宪法版本
  • backfilled-2026-08-25:回填日期标记

数据模式:各阶段快照遵循 stage_<n>_<name>.jsonl 命名规则,并附带 manifest.json 作为完整的运行元数据文件。

搜集汇总
数据集介绍
2026-08-14-courtroom 数据集图片
构建方式
该数据集系由自动化流程生成的高质量法庭辩论仿真语料,其构建遵循了阶段性的演绎逻辑。从基础宪法原则的切分出发,逐步生成案件场景,经过场景去重、立场草拟,再到双方辩论对抗、提示词编制与优化,最终完成判决草稿的撰写、评审与修订,直至导出可用的监督微调格式。每一阶段均产出独立的JSONL快照文件,完整记录了从原始理念到最终数据形态的演变足迹,这种透明且可恢复的生成架构为数据集的可追溯性与迭代优化提供了坚实基础。
特点
该数据集的核心特点在于其鲜明的对抗性与法律专业性。它内置了多层次的辩论结构,涵盖了原告与被告立场的动态博弈、法官评审的介入以及判决的反复修订,真实模拟了法庭审判的完整流程。数据集基于一套精细提炼的宪法原则,确保了生成内容在法律逻辑与伦理框架内的自洽性。此外,其分阶段快照的设计不仅极大增强了生成过程的透明度,还允许研究者深入探究每一步推理脉络,为训练具备严谨法律推理能力的模型提供了独特资源。
使用方法
该数据集可被灵活运用于多种语言模型的研究与开发场景。其主数据集名为'dataset',包含了最终的监督微调样本,适合直接用于训练模型的指令遵循与情境对话能力。各阶段快照作为独立配置(config)存储,为研究模型多步推理、对抗生成以及长文本结构化写作提供了宝贵的中间态数据。使用者可通过HuggingFace的datasets库按需加载各阶段数据,进行偏好对齐、分步微调或作为评估模型审判能力的基准,其结构化的字段设计亦便于定制化解析与整合。
背景与挑战
背景概述
该数据集名为“2026-08-14-courtroom”,由Matthew-Bozoukov等人于2026年8月创建,源自GitHub仓库“Lessons_from_constitutional_AFT”。它旨在通过模拟法庭辩论场景,生成高质量的合成训练数据,用于提升语言模型在复杂推理与立场对抗中的能力。数据集采用多阶段流水线(如宪法分块、场景编写、立场草拟、辩论、判决等),构建了结构化的法庭对抗流程,并配有可恢复的生成缓存。作为合成数据领域的创新实践,它推动了基于宪法原理的AI对齐研究,为后续研究者提供了可复现的范式,对提升模型在争议性议题上的论证与裁决能力具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于,传统训练数据难以模拟多轮对抗性辩论与结构化推理,尤其是涉及立场对立、证据权衡和最终裁决的复杂场景。构建过程中面临的挑战包括:设计合理的宪法原则以引导生成内容的合规性与逻辑性;在多阶段流水线中确保每一步的数据质量与一致性,避免偏差累积;去重与修正环节需权衡多样性与冗余度;以及部分阶段(如partial文件)因生成中断或失败而需部分重跑,增加了管理复杂性。此外,不同阶段采用不同模型,需协调模型间的接口与采样设置,确保整体流程的稳定性与可复现性。
常用场景
经典使用场景
该数据集源于宪法性AI对齐技术的前沿探索,其核心形态为多阶段生成的法庭辩论与判决场景文本。经典使用场景在于为大型语言模型提供结构化、高对抗性的法律推理训练语料,涵盖从场景构建、立场草拟到辩论交锋与最终裁决的完整流程。研究者可借助其分阶段快照,精细调控模型在复杂法律语境下的论证能力、证据权衡与逻辑一致性,从而提升模型在模拟法庭、法律咨询等任务中的表现。
实际应用
在实际应用中,该数据集直接服务于司法辅助系统的智能化升级,可用于训练法律文书的自动起草、判决结果预测及争议焦点归纳模型。其生成的模拟法庭数据能帮助法律科技企业构建更贴近实战的培训环境,供律师或法学生进行虚拟演练。此外,该数据集也为在线纠纷解决平台提供底层数据支持,使AI能够中立地分析双方陈述,生成平衡的和解建议,提升法律服务的效率与公平性。
衍生相关工作
该数据集衍生了若干值得瞩目的研究方向,例如基于其分阶段生成范式,研究人员发展了“过程监督”的奖励模型,用以在辩论中间阶段提供细粒度反馈;同时,其宪法约束机制启发了新的模型微调策略,如“规范蒸馏”和“对抗性价值对齐”。此外,该数据集的多角色架构亦被借鉴于多智能体协作模拟的通用框架,促进了叙事生成、复杂任务规划等领域的交叉创新,形成了一系列后续成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务