遇见数据集

life-event-benchmark-v2-dialogues

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

Life-Event Benchmark v4 — Korean Financial Dialogues 是一个用于状态优先金融生活事件记忆基准测试的合成韩语银行对话数据集。该数据集模拟了客户与助理之间的简短对话,每个对话都与一个模拟人物生活轨迹中的特定时间点相关联。数据集包含20个独立的人物/轨迹(persona_id从traj_001到traj_020),每个轨迹有300个规范会话,总计6000个规范会话。此外,还包含400个反事实填充会话(每个轨迹20个),这些会话作为评估控制项,用于信号消融实验,不包含任何生命周期事件或记忆更新。数据由Claude Sonnet 5(Anthropic提供)生成,版本为v4。数据集分为多个配置:dialogues配置包含无答案键的对话数据,字段包括persona_id、session_id、trajectory_id、时间顺序位置、对话轮次(turns)、模型和提供者等;gold配置是基准答案键,包含标签和生成元数据,如会话类型、映射动作、金融任务、事件链接/状态、提示注释、动作解析、计划和生成元数据等;counterfactual_fillers配置包含反事实填充会话,这些会话具有特定属性(如源类型为“synthetic_reserve”、月份索引为空、包含8轮交替对话、使用相同人物风格但无生活状态事实等)。数据集完全合成,不代表真实客户对话,适用于金融对话基准测试、记忆更新任务评估和信号消融实验等场景。

Life-Event Benchmark v4 — Korean Financial Dialogues is a synthetic Korean bank dialogue dataset for state-prioritized financial life event memory benchmarking. It simulates brief dialogues between customers and assistants, with each dialogue associated with specific time points in simulated persona life trajectories. The dataset includes 20 independent personas/trajectories (persona_id from traj_001 to traj_020), each with 300 canonical sessions, totaling 6000 canonical sessions. Additionally, it contains 400 counterfactual filler sessions (20 per trajectory), which serve as evaluation controls for signal ablation experiments and do not include any life cycle events or memory updates. The data is generated by Claude Sonnet 5 (provided by Anthropic), version v4. The dataset is divided into multiple configurations: the dialogues configuration contains dialogue data without answer keys, with fields including persona_id, session_id, trajectory_id, temporal order position, dialogue turns, model, and provider; the gold configuration is the benchmark answer key, containing labels and generation metadata, such as session type, mapped actions, financial tasks, event links/states, prompt annotations, action parsing, plans, and generation metadata; the counterfactual_fillers configuration includes counterfactual filler sessions with specific attributes (e.g., source type as synthetic_reserve, month index empty, containing 8 alternating turns, using the same persona style but without life state facts). The dataset is entirely synthetic and does not represent real customer dialogues, suitable for scenarios like financial dialogue benchmarking, memory update task evaluation, and signal ablation experiments.

创建时间:
2026-07-23
原始信息汇总

数据集概述

Life-Event Benchmark v4 — Korean Financial Dialogues 是一个韩语金融对话数据集,专为“状态优先的金融生活事件记忆基准”设计。每个典型会话是客户与助手的简短对话,关联于模拟人物生活轨迹中的某一点。

基本信息

  • 语言:韩语(ko)
  • 许可证:其他(other)
  • 生成器claude-sonnet-5(提供商:Anthropic)
  • 版本:v4;反事实填充契约:counterfactual-filler-v1

数据规模与结构

  • 人物/轨迹:20个(traj_001traj_020,每人一个唯一persona_id
  • 典型会话:6,000个(每人300个)
  • 反事实填充会话:400个无时间限制的储备对话(每人20个)
  • 所有数据按人物拆分为每人物一个文件,分别存放于dialogues/gold/目录

配置(Configs)

配置名 数据路径 说明
dialogues dialogues/*.jsonl 无答案的对话数据,包含persona_idsession_idtrajectory_id、时间位置、turnsmodelprovider等字段
gold gold/*.jsonl 基准答案键,包含session_typemapped_actionfinancial_task、事件链接/状态、cue_annotationsaction_resolutionplangeneration_metadata等标签和生成元数据
counterfactual_fillers counterfactual_fillers/v1/sessions/*.jsonl 反事实填充会话,每个填充会话有source_kind="synthetic_reserve"month_index=null、恰好8个交替的用户/助手回合、仅包含无链接的常规银行任务、无生活事件或记忆更新
counterfactual_filler_plans counterfactual_fillers/v1/plans/*.jsonl 反事实填充计划,用于精确实验重建

连接方式:通过(trajectory_id, session_id)dialoguesgold连接。

反事实填充库 v1

该库用于信号消融实验:固定典型前缀检查点,用中性储备对话替换选定的生活证据回合。结构如下: text counterfactual_fillers/v1/ ├── sessions/fillers_traj_001.jsonl … fillers_traj_020.jsonl ├── plans/plans_traj_001.jsonl … plans_traj_020.jsonl ├── audit/ ├── filler_generation_manifest.json └── artifact_manifest.json

每个填充会话:

  • 使用source_kind="synthetic_reserve"month_index=null
  • 恰好包含8个交替的用户/助手回合
  • 使用同一人物的对话风格但不含生活状态事实
  • 仅包含无链接的、信息性的常规银行任务
  • 无生命周期事件或记忆更新
  • claude-sonnet-5生成并保留每批次的生成元数据

质量控制

  • 典型生成人物通过了仓库的对话QA流程
  • 反事实库通过了确定性冻结计划审计:
    • 20个人物文件和400/400预期填充会话
    • 每人恰好20个填充会话,每个中性任务有两个实现
    • 无生命周期/记忆线索、个人查找结果、跨人物捐赠者或契约违规
    • 所有451个终端事件可被掩码,且无填充排除
  • 审计决策、计数和SHA256哈希见counterfactual_fillers/v1/audit/artifact_manifest.json

注意事项

  • 完全合成:没有对话代表真实客户
  • 反事实填充是评估控制项,而非额外的时间序列会话
  • 评估期间不重新运行填充生成;消费者应获取并固定冻结的v1工件
  • 填充库控制缺失的证据;需要单独的安慰剂组来隔离任何残留的填充风格效应
搜集汇总
数据集介绍
life-event-benchmark-v2-dialogues 数据集图片
构建方式
该数据集基于Anthropic的Claude-Sonnet-5模型,通过合成方式生成了20个虚拟人物角色(traj_001至traj_020)的模拟金融对话轨迹。每个角色拥有300个规范对话会话,总计6000条银行客服对话。此外,数据构建过程中还精心设计了400条反事实填充会话,每个角色20条,这些会话不包含任何生命周期事件或记忆线索,仅呈现无链接的常规银行业务。数据集遵循统一的对话布局模板,将答案无关的对话与标签分离存储,分别置于dialogues和gold两个配置中。反事实填充会话则独立于时间线存放于counterfactual_fillers配置,确保实验控制的可隔离性。
特点
数据集的核心特色在于其针对金融生命周期事件记忆的基准测试定位。每个对话均与模拟人生轨迹中的一个时间点紧密关联,包含丰富的标注信息如会话类型、映射动作、金融任务、事件链接状态、线索注释及行动解析。反事实填充会话的设计尤为独特,它们严格遵循源角色的对话风格但剔除所有事实性生命周期线索,为信号消融实验提供了理想的控制对照。数据集还包含详细的质量审计报告,确保所有451个终端事件均可通过零填充排除实现完全掩蔽,体现了对实验可重复性的严谨考量。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据集,指定config名称为dialogues、gold或counterfactual_fillers分别获取对应数据。dialogues配置提供无答案的会话字段,gold配置则提供对应的标签数据,两者可通过trajectory_id和session_id进行联合。反事实填充会话支持按人物角色文件加载,便于精确重建实验。对于需要固定版本控制的场景,建议通过仓库提交哈希锁定数据集版本。数据集的JSONL文件格式天然适配于对话系统的流水线处理,可直接输入至评估框架进行性能测试。
背景与挑战
背景概述
在金融科技与自然语言处理交叉领域中,如何使对话系统具备长期记忆能力以跟踪用户生命事件(如就业、购房、结婚等)成为重要研究方向。由研究机构发布于2024年的Life-Event Benchmark v2 Dialogues数据集,由20个模拟人物轨迹生成6000段合成韩语银行客服对话,并配套反事实填充对话用于信号消融实验。该数据集聚焦于评估模型从多轮对话中提取、关联并更新用户生命周期事件的能力,为金融对话系统的长期记忆机制研究提供了标准化评估基准,推动了对记忆增强对话模型性能的量化分析。
当前挑战
该数据集面临的核心挑战包括:领域问题层面,金融对话中生命周期事件具有时序交织、隐含表达及跨会话关联的特点,现有模型难以精准捕捉事件间的因果链与状态变更。构建层面,合成数据需平衡自然对话的流畅性与事件标注的完整性,反事实填充对话既要维持对话风格一致性又要完全剥离生命状态信息,同时确保20个独立人物轨迹的300段标准对话中451个终端事件均可通过反事实填充实现掩码,对数据生成与质量审计提出了严苛要求。
常用场景
经典使用场景
Life-Event Benchmark v4 — Korean Financial Dialogues 是一个专为金融领域生命周期事件记忆基准测试而设计的合成韩语银行对话数据集。其最经典的使用场景在于评估和提升对话系统对用户长期金融生活轨迹的记忆与推理能力。通过模拟20个虚拟人物的完整生命历程,每个角色包含300段标准对话,数据集构建了丰富的上下文线索,要求模型从分散的对话片段中准确提取、关联并更新与生命周期事件(如贷款、退休、遗产规划)相关的个人信息。研究者利用该基准测试可系统性地检验对话模型在长时记忆保持、跨会话信息关联以及事件驱动决策等方面的表现,从而推动金融领域个性化智能助手的技术发展。
衍生相关工作
该基准的发布催生了一系列围绕长期对话记忆评估与增强的经典研究工作。受其反事实填充设计启发,研究者开发了因果干预分析方法,通过屏蔽或替换关键生命周期线索来诊断模型的事实推理漏洞,并提出了基于事件图神经网络的记忆增强架构,显式建模对话中事件的时间戳与依赖关系。此外,部分工作利用该数据集的标准化会话格式,设计了对比学习预训练任务,使模型在无标签对话语料上也能学习到稳健的长期依赖表征。另有学者借鉴其多角色、多轨迹的构造范式,拓展至医疗健康、法律咨询等同样依赖长期状态追踪的垂直领域,提出了跨领域生命周期对话基准,推动了通用对话记忆技术的理论进展与工程实践。
数据集最近研究
最新研究方向
该数据集聚焦于韩语金融对话中基于生命周期事件的记忆基准测试,前沿研究方向包括利用反事实填充技术进行信号消融实验,以评估模型在缺失关键生活事件证据时的记忆检索与推理能力。关联热点事件为大语言模型在垂直金融场景下的个性化服务与长期记忆建模需求激增,该基准通过合成客服-客户对话轨迹,系统性地检验模型对用户时序性金融行为(如贷款、投资)的关联与回溯能力,对推动金融领域对话AI的可信决策与记忆持续性研究具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务