遇见数据集

LegalCon

收藏
arXiv2025-06-05 更新2025-11-28 收录
数据链接:
官方服务:

资源简介:

LegalCon是一个包含1,063个标记法庭对话的数据集,用于检测操纵、识别主要操纵者以及分类操纵技术。数据集由Manipal University Jaipur创建,旨在解决法庭对话中操纵的检测和分析问题。数据集来源于美国各级法院的庭审记录,包括最高法院、家庭支持法院、审判法院和小额申诉法院。该数据集通过人工标注,确保了数据的准确性和可靠性,并为法庭语言分析提供了宝贵资源。

LegalCon is a dataset consisting of 1,063 annotated court dialogues, developed for three core tasks: detecting manipulation, identifying primary manipulators, and classifying manipulation techniques. It was created by Manipal University Jaipur to address the detection and analysis of manipulation in court dialogues. The dataset is sourced from trial transcripts of U.S. courts at all levels, including the Supreme Court, Family Support Court, Trial Court, and Small Claims Court. Manual annotation is employed to ensure the accuracy and reliability of the data, making it a valuable resource for forensic linguistic analysis.

创建时间:
2025-06-05
搜集汇总
数据集介绍
LegalCon 数据集图片
构建方式
LegalCon数据集的构建源自对美国多个司法管辖区法庭 transcripts 的系统性采集,涵盖最高法院、家庭扶助法院、审判法院及小额索赔法院等多元审判场景。数据主要来源于 Oyez 司法档案及《亲子法庭》《扶助法庭》等法律电视节目,共计收录 1063 段长篇幅对话,平均字数约 1000 词。为确保法律准确性,所有材料均经过标准法律框架与法庭程序的核实。标注过程采用多层架构,围绕三个核心任务展开:操纵性检测、主要操纵者识别及操纵技巧分类,由四位标注者依据从心理学文献与法庭实证中提炼的 11 种操纵技巧进行人工标注,并辅以 LLM 推断作为参照。标注的一致性通过后验信度检验,Cohen's Kappa 与 Krippendorff's Alpha 值分别为 0.68、0.59 与 0.41,反映了法律与心理领域主观标注任务的合理预期。
特点
LegalCon 数据集的独特之处在于其对法庭语境中语言操纵现象的细腻刻画。不同于既往研究主要聚焦社交媒体的显性操纵,本数据集深入法律话语的复杂场域,捕捉隐藏在专业术语与辩论策略背后的微妙操控。其三层标注体系不仅区分操纵性与非操纵性对话,更精准定位主要操纵者及其运用技巧,涵盖煤气灯效应、罪疚诱导、情感诉诸等 11 种具体手法。数据集中约 62.4% 的对话被标注为操纵性样本,且特别强调长篇幅对话的收录,使得对语境依赖型操纵行为的分析成为可能。原始说话者名称被替换为功能性角色标签(如原告、被告、律师、法官),有效消除了身份偏差,提升了模型的泛化基础。
使用方法
LegalCon 数据集适用于法庭对话操纵分析的多种实验范式。研究者可将其用于三个递进任务:操纵性二分类检测、主要操纵者身份识别以及操纵技巧的多标签分类。数据集按 70%、15%、15% 比例划分为训练、验证和测试子集,支持零样本与少样本提示学习场景。结合论文提出的 CLAIM 双阶段框架,用户可先通过意图驱动的思维链提示提取说话者意图,再经由由 Mistral-7B 模型经 QLoRA 微调构建的多智能体系统(检测、分析、证据、元智能体)进行协作推理。该框架特别适用于长篇幅、语境复杂的法庭对话,能显著提升操纵检测与主操纵者识别的准确性,F1 分数分别达到 0.727 与 0.602。
背景与挑战
背景概述
在司法话语分析领域,法庭对话中的语言操纵问题长期未获充分关注。尽管自然语言处理技术在虚假新闻检测、有害语言识别等社会操纵任务上取得显著进展,但法庭场景因其独特的对抗性结构与法律术语的复杂性,使得现有模型难以精准捕捉潜藏于辩论间的操纵策略。2025年,Manipal University Jaipur的研究团队针对这一空白,构建了LegalCon数据集,包含1063段来自美国最高法院、家庭法庭等多类司法场景的标注对话,聚焦于操纵检测、主要操纵者识别及操纵技术分类三大核心任务。该数据集不仅为法律话语的量化分析提供了基准资源,更首次系统地将多智能体框架与意图驱动推理引入法庭语言研究,推动了自然语言处理在法律公平性保障中的实践探索。
当前挑战
LegalCon的构建与应用面临多重挑战。在领域问题层面,法庭操纵具有高度主观性与情境依赖性,例如同一辩论中“情感诉求”与“框架叙事”可能交织出现,且操纵意图常深嵌于法律术语与权力动态中,导致现有大语言模型在识别主要操纵者与细粒度技术时准确率偏低,尤其是长对话中的意图归属极易出错。在数据构建过程中,团队面临标注一致性难题:人力标注的Cohen's Kappa仅为0.68(操纵检测)与0.59(操纵者识别),多标签技术的Krippendorff's Alpha仅0.41,反映司法心理学术语的主观分歧。此外,数据来源包含电视法庭节目,虽经法律规范性校验,但舞台化对话与真实庭审的生态效度差异仍构成泛化性瓶颈,且单一GPU算力限制了大模型微调的探索空间。
常用场景
经典使用场景
LegalCon数据集的核心经典使用场景在于对法庭对话中的操纵性语言进行系统化检测与分析。该数据集涵盖了来自美国最高法院、家庭支持法院、审判法院及小额索赔法院等多种司法场景的1063段对话,并针对每一段对话标注了是否含有操纵、主要操纵者身份以及具体采用的操纵技巧。研究者利用该数据集,可以训练和评估自然语言处理模型在复杂、冗长的法律对话中识别隐蔽操纵行为的能力,尤其适用于那些需要深入理解上下文、识别说话者意图与修辞策略的任务。通过LegalCon,学术界首次拥有了一个聚焦法律领域的操纵检测基准,填补了此前该领域数据集匮乏的空白。
解决学术问题
LegalCon数据集有效解决了当前自然语言处理研究中一个长期被忽视的学术问题——如何在充满専門术语与复杂权力动态的法庭场景中自动检测并分析语言操纵。此前,多数操纵检测研究集中于社交媒体、心理健康等非法律领域,而法律文本中操纵行为常被掩盖在严谨的司法辞令下,现有模型难以捕捉。LegalCon提供了精细的多层次标注,包括11种操纵技巧(如煤气灯效应、情感操控、叙事框架化等),使研究者能够系统探究操纵的语言学特征与分布规律。该数据集的推出推动了法律话语分析与计算法学交叉领域的发展,为构建更透明、公正的司法辅助工具奠定了数据基础。
衍生相关工作
LegalCon数据集的发布催生了多项具有影响力的衍生研究工作。首先,围绕该数据集,研究者提出了CLAIM(Courtroom Language Analysis with Intent-driven Multi-agent Framework)框架,该框架通过两阶段设计——先利用意图驱动的链式思维提示提取说话者意图,再通过多智能体协作完成操纵检测、主操纵者识别与技巧分类,显著提升了复杂长对话中的分析准确率。此外,LegalCon的出现也激发了学界对法律领域操纵检测更广泛的兴趣,例如后续工作探索了跨文化法庭对话中的操纵模式对比、多模态(如语音语调和面部表情)融合的操纵识别方法,以及基于LegalCon微调的专用语言模型。这些衍工作共同推动了对司法语言细节的深度挖掘,为构建负责任的人工智能法律助手开辟了新方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务