遇见数据集

ibm-research/synthetic-conversations-traces

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含720个合成的OpenTelemetry(OTel)跟踪记录,模拟用户与大型语言模型(LLM)助手之间的多轮聊天对话,覆盖12个日常建议主题,每个跟踪记录包含30到50轮对话。对话是使用llama-3-3-70b-instruct模型生成的:脚本化的用户消息驱动每一轮,同时模型实时产生助手响应,每轮对话被记录为一个OTel跨度,包括完整的累积消息历史。该数据集专为测试和开发可观察性工具而设计,这些工具遵循gen_ai.*语义约定,用于处理生成式人工智能的遥测数据。

This dataset contains 720 synthetic OpenTelemetry (OTel) trace records that simulate multi-turn chat conversations between users and Large Language Model (LLM) assistants, spanning 12 daily advice-related topics. Each trace record includes 30 to 50 conversation turns. The conversations were generated using the llama-3-3-70b-instruct model: scripted user messages drive each conversation turn, while the model generates assistant responses in real time. Each conversation turn is recorded as an OTel span, which contains the full accumulated message history. This dataset is specifically designed for testing and developing observability tools that follow the gen_ai.* semantic conventions for processing generative AI telemetry data.

提供机构:
ibm-research
搜集汇总
数据集介绍
ibm-research/synthetic-conversations-traces 数据集图片
构建方式
本数据集通过调用llama-3-3-70b-instruct大语言模型,模拟了用户与AI助手之间的多轮对话流程。每一轮交互由预编写的用户消息驱动,模型实时生成助手的回复,并按照OpenTelemetry规范将每轮对话记录为一个独立的Span。所有Span按对话顺序组织为完整的Trace,共涵盖12个日常咨询主题,每个主题包含60条Trace,确保数据集在主题分布上达到完美平衡。最终生成了720条结构化的Trace数据,每条Trace包含30至50轮对话。
特点
该数据集的核心特点在于其高度模拟真实对话场景的多轮交互结构,每条Trace均附带完整的累积对话历史,使得Span之间具备明确的时序与语义关联。数据严格遵循gen_ai.*语义约定,记录了输入消息、模型输出、Token用量等关键观测指标,为生成式AI的可观测性工具提供了真实且标准化的测试数据。此外,12个主题的均衡分布以及每次对话的Span数量差异,增强了数据集在多场景下的代表性与鲁棒性。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,仅需一行代码即可将JSON Lines格式的synthetic.jsonl文件读取为Dataset对象。每条数据以Trace为单位,包含trace_id、span_count、collected_at时间戳及spans列表。开发者可遍历spans列表,访问每个Span中的attributes字段,以提取gen_ai.input.messages和gen_ai.output.text等关键信息,用于测试监控仪表盘、追踪分析工具或LLM调用日志管道等下游任务。
背景与挑战
背景概述
随着大型语言模型(LLM)在对话系统中的应用日益广泛,如何对多轮交互进行有效观测与诊断成为可观测性领域的关键课题。为此,该数据集于2026年由相关研究团队创建,基于OpenTelemetry(OTel)标准,利用llama-3-3-70b-instruct模型生成了720条覆盖12个日常咨询主题的多轮合成对话轨迹。每条轨迹包含30至50轮交互,并按照gen_ai.*语义约定记录为OTel span。该数据集旨在为生成式AI遥测数据的可观测性工具研发提供标准化测试基准,推动了LLM链路追踪与性能监控领域的发展。
当前挑战
该数据集面临的核心挑战在于:领域层面,多轮对话的复杂上下文依赖与长序列语义一致性使得传统观测工具难以精准捕捉模型行为,亟需高保真模拟数据来验证链路追踪与归因分析能力;构建层面,确保合成数据在涵盖广泛主题的同时保持对话逻辑连贯、避免生成幻觉,且严格遵循OTel规范生成结构化span,对模型调控与数据质量控制提出了极高要求。此外,720条样本规模虽能满足初步测试需求,但面对真实场景的多样性仍显不足,限制了评估的全面性。
常用场景
经典使用场景
该数据集作为生成式人工智能可观测性领域的基准测试资源,其经典使用场景聚焦于模拟多轮对话场景中大型语言模型的行为轨迹。通过精心构造的720条OpenTelemetry追踪数据,每条包含30至50个交互回合,覆盖12个日常咨询主题,研究者能够利用这些数据重现并分析LLM在多轮对话中的实时推理过程。数据集以标准化span格式记录每一次用户与助手的交互,从系统提示到累计对话历史均被完整保留,为评估追踪工具在捕捉gen_ai语义约定下的性能和完整性提供了最直接的实验环境。
衍生相关工作
围绕该数据集衍生了多项经典研究工作。在数据生成层面,基于llama-3-3-70b-instruct的脚本驱动对话生成方法启发了后续更复杂、更自然的对话轨迹合成技术,促进了多轮对话模拟方法论的发展。在工具开发领域,该数据集催生了针对gen_ai语义约定的追踪分析器和可视化看板,以及用于检测对话异常回落的统计模型。此外,多个开源可观测性项目如OpenObserve和SigNoz社区已将其作为测试套件的组成部分,推动了LLM应用监控领域从手工测试向自动化基准测评的范式转变。
数据集最近研究
最新研究方向
随着大型语言模型(LLM)在对话式人工智能中的广泛应用,如何对其多轮交互过程进行高效、标准化的可观测性追踪成为前沿研究热点。该数据集聚焦于生成式AI遥测领域,基于OpenTelemetry(OTel)标准构建了720条模拟多轮对话追踪轨迹,覆盖技术支持、财务规划、心理健康等12个日常咨询主题,每条轨迹包含30至50轮完整交互。其核心贡献在于将gen_ai.*语义惯例引入实际追踪数据,为开发与验证生成式AI可观测性工具提供了基准测试资源。近期,该数据集被用于研究LLM对话系统的性能瓶颈诊断、异常行为检测及合规审计,特别是在长上下文会话中追踪令牌消耗与响应延迟的关联模式。这一工作顺应了AI运维(AIOps)领域对标准化、细粒度遥测数据的需求,推动了从静态评估向动态可观测性分析的范式转变,对保障企业级对话AI系统的可靠性、安全性与可解释性具有重要的实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务