遇见数据集

TS-Dataset

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

SafetyRAISE TS Dataset 是一个面向交通安全事故分析与推理任务的中文训练数据集,专为 SafetyRAISE 项目设计,旨在支持专家小模型的监督微调(SFT)、偏好优化(DPO)与能力评估。数据集包含两个独立配置:sft 配置包含 9,610 个样本,主要用于监督微调,样本内容涵盖交通事故材料、事故知识问答、因果分析和通用知识问答,其字段包括指令(instruction)、可选上下文输入(input)、期望输出(output)和样本类型标签(label),标签分布为因果分析(3,584 条)、事故描述(3,262 条)、交通知识(1,554 条)和通用知识(1,210 条);dpo 配置包含 516 个样本,用于直接偏好优化,每条样本包含同一指令下的优选回答(chosen)和较弱回答(rejected)。该数据集适用于交通事故分析专家模型的训练,具体任务包括事故责任判定、因果链推理、风险因素分析和场景复盘问答,以及基于对比样本的偏好对齐与优化。数据以 Parquet 和 JSONL 格式提供,部分内容包含 Markdown 格式的富文本。使用时需注意,数据集聚焦于交通安全领域分析,不应作为唯一的法律责任判定依据,建议在生产应用中结合事实核验与人工复核。

The SafetyRAISE TS Dataset is a Chinese training dataset for traffic safety accident analysis and reasoning tasks, specifically designed for the SafetyRAISE project to support supervised fine-tuning (SFT), preference optimization (DPO), and capability evaluation of expert small models. The dataset includes two independent configurations: the sft configuration contains 9,610 samples primarily for supervised fine-tuning, covering traffic accident materials, accident knowledge Q&A, causal analysis, and general knowledge Q&A, with fields including instruction, optional context input, expected output, and sample type labels, distributed as causal analysis (3,584 entries), accident description (3,262 entries), traffic knowledge (1,554 entries), and general knowledge (1,210 entries); the dpo configuration contains 516 samples for direct preference optimization, each including a preferred response (chosen) and a weaker response (rejected) under the same instruction. This dataset is suitable for training expert models in traffic accident analysis, with specific tasks including accident liability determination, causal chain reasoning, risk factor analysis, scenario review Q&A, and preference alignment and optimization based on comparative samples. Data is provided in Parquet and JSONL formats, with some content containing rich text in Markdown format. Note that the dataset focuses on traffic safety analysis and should not be used as the sole basis for legal liability determinations; it is recommended to combine fact verification and manual review in production applications.

创建时间:
2026-07-03
原始信息汇总

SafetyRAISE TS Dataset 概述

SafetyRAISE TS Dataset 是一个面向交通安全事故分析与推理任务的中文训练数据集,旨在支持专家小模型的监督微调(SFT)、偏好优化(DPO)及能力评估。该数据集与 SafetyRAISE 开源项目及其配套工具链紧密结合。

数据集配置

数据集包含两个独立的配置,分别用于不同的训练阶段:

配置 文件名 样本量 字段
sft ts-sft.parquet 9,610 instruction, input, output, label
dpo ts-dpo.parquet 516 instruction, chosen, rejected

数据详情

sft 配置(监督微调)

  • 内容:包含交通事故材料、事故知识问答、因果分析和通用知识问答。
  • 字段说明
    • instruction:用户问题或任务指令。
    • input:可选的上下文材料,部分样本为空。
    • output:期望模型生成的参考答案。
    • label:样本类型标签。
  • label 标签分布
标签 样本量
causal-analysis 3,584
accident-description 3,262
traffic-knowledge 1,554
general-knowledge 1,210

dpo 配置(偏好优化)

  • 内容:每条样本包含同一指令下的优选回答与较弱回答。
  • 字段说明
    • instruction:事故信息、结构化输入或分析任务。
    • chosen:更符合任务要求的优选回答。
    • rejected:质量较弱或不符合要求的对照回答。

加载方式

推荐使用 Hugging Face datasets 库加载:

python from datasets import load_dataset

sft_dataset = load_dataset("suyuan37/TS-Dataset", "sft", split="train") dpo_dataset = load_dataset("suyuan37/TS-Dataset", "dpo", split="train")

文件说明

数据以 Parquet 格式为主(首选),同时提供 JSONL 和 JSON 格式用于兼容。文件位于数据集页面中。

  • 首选下载ts-sft.parquet(SFT 训练)、ts-dpo.parquet(DPO 训练)。
  • 兼容格式ts-sft.jsonlts-dpo.jsonl(JSONL 管线)、ts-sft.jsonts-dpo.json(归档用途)。

注意:Hugging Face Data Studio 将长文本按普通表格显示。如需查看 inputoutputchosenrejected 中 Markdown 渲染效果,可使用配套的 Markdown 富文本预览 Space:https://huggingface.co/spaces/suyuan37/TS-Dataset-Markdown-Viewer

适用场景

  • 交通事故分析专家模型的监督微调。
  • 事故责任、因果链、风险因素、场景复盘等任务的问答训练。
  • 基于 chosen / rejected 样本的 DPO、偏好优化或回答质量对齐。
  • 配合 SafetyRAISE-OS 与 SafetyRAISE-LMEngine 进行本地专家模型实验。

注意事项

  • 数据集聚焦于交通安全与事故分析,不应作为唯一法律责任判定依据。
  • 部分样本包含事故细节和推理过程,使用时需结合应用场景进行安全审查。
  • 用于生产系统时,建议增加事实核验、人工复核和输出约束。

相关资源

搜集汇总
数据集介绍
TS-Dataset 数据集图片
构建方式
TS-Dataset是为交通安全事故分析与推理任务构建的中文训练数据集。其构建过程依托于SafetyRAISE项目,旨在支持专家小模型的监督微调与偏好优化。数据集包含两个主要配置:sft配置用于监督微调,涵盖交通事故材料、事故知识问答、因果分析和通用知识问答四类样本,共计9,610条;dpo配置用于偏好优化,包含516条样本,每条样本均提供同一指令下的优选回答与较弱回答,用于DPO训练或回答质量对齐。数据以Parquet格式存储,同时提供JSONL和JSON兼容格式以满足不同管线需求。
特点
TS-Dataset的核心特点在于其针对交通安全领域的专业化设计。sft配置中的样本按类型标注为causal-analysis、accident-description、traffic-knowledge和general-knowledge四类标签,便于按需筛选与训练。dpo配置通过chosen与rejected字段对比呈现优质与劣质回答,为偏好优化提供直接监督信号。数据集聚焦事故责任、因果链、风险因素及场景复盘等任务,涵盖丰富的事故细节与推理过程,适用于提升模型在交通安全领域的分析与生成能力。
使用方法
TS-Dataset的使用简便高效,推荐通过Hugging Face的load_dataset函数加载。用户可按训练阶段分别加载sft配置或dpo配置,例如使用load_dataset('suyuan37/TS-Dataset', 'sft', split='train')获取监督微调数据,或使用load_dataset('suyuan37/TS-Dataset', 'dpo', split='train')获取偏好优化数据。数据集的字段设计清晰,sft配置包含instruction、input、output和label字段,dpo配置包含instruction、chosen和rejected字段,可直接用于模型训练与评估。此外,数据集还提供Markdown富文本预览空间,便于查看长文本内容的渲染效果。
背景与挑战
背景概述
交通安全事故分析与推理是智能交通系统中的关键研究领域,旨在通过自然语言处理技术提升事故场景的理解与决策支持能力。SafetyRAISE TS Dataset(简称TS-Dataset)由suyuan37等研究团队于近期创建,依托SafetyRAISE开源项目,专注于构建面向交通安全事故分析的中文训练数据集。该数据集的核心研究问题在于如何利用大语言模型对交通事故进行因果推理、责任判定及风险因素分析,从而推动专家小模型在垂直场景中的应用。TS-Dataset包含监督微调(SFT)与偏好优化(DPO)两种配置,样本覆盖事故描述、因果分析、交通知识及通用知识等多维度,为模型在复杂事故场景中的推理能力提供基础支撑,对提升交通安全智能化水平具有重要影响。
当前挑战
TS-Dataset所应对的领域挑战在于,通用大语言模型在交通安全事故分析中常缺乏专业知识与结构化推理能力,难以准确识别因果链、判断责任归属或进行场景复盘,亟需专门数据集以提升领域适配性。数据集构建过程中面临的挑战包括:事故样本的多样性不足,需覆盖不同场景与责任类型以确保模型泛化能力;因果分析数据的标注复杂度高,要求标注人员具备深厚的交通安全知识;DPO配置中优选与较弱回答的界定标准需精细设计,以避免偏好偏差影响优化效果。此外,数据集规模有限(SFT仅9,610条,DPO仅516条),在确保数据质量的同时,进一步扩展样本量和丰富场景维度仍是重要难点。
常用场景
经典使用场景
在交通安全研究与人工智能交叉领域,TS-Dataset作为首个面向中文交通事故分析与推理的专用数据集,其经典应用场景集中于对大型语言模型进行监督微调与偏好优化。研究者可借助其精心设计的SFT配置,利用包含事故描述、因果分析、交通知识及通用知识四类标签的九千余条样本,系统性地培养模型对复杂事故场景的语义理解与逻辑推理能力。特别是其中的因果分析类样本,能够有效提升模型在事故责任归因、风险因素识别等核心任务上的表现。而DPO配置则通过成对的优选与弱化回答,为模型提供了对齐人类专家判断偏好的训练基础,使其在生成事故分析结论时更趋严谨与准确。
解决学术问题
该数据集的核心学术价值在于系统性地回应了交通安全领域长期存在的知识工程瓶颈:传统事故分析多依赖规则或统计模型,难以捕捉事故场景中非线性、多因素交织的因果关系。TS-Dataset通过结构化的事故材料与推理问答对,为学术界探索如何利用预训练语言模型进行端到端的交通事故理解与推理提供了标准化的实验平台。它使得研究者能够量化评估模型在因果链推导、责任划分、风险因子提取等细分任务上的能力边界,从而推动从基于规则的专家系统向数据驱动的可解释智能分析范式的范式迁移。此外,其DPO配置也为偏好对齐、奖励建模等前沿研究方向提供了贴近实际应用需求的评估基准,促进了安全关键领域大模型对齐技术的发展。
衍生相关工作
围绕TS-Dataset,已涌现出一系列具有代表性的延伸研究工作,形成了较为完整的交通安全智能分析技术生态。首先是基于该数据集训练的SafetyRAISE-TS-Qwen3专家模型,其通过融合SFT与DPO两阶段训练策略,在事故因果分析任务上显著超越了同等规模的通用基座模型。其次,SafetyRAISE开源项目进一步将专家模型封装为轻量级推理引擎,支持本地化部署与低延迟响应,为实际系统集成提供了工程化基础。此外,研究者还开发了配套的Markdown富文本预览工具,解决了长文本结构化数据在标准数据集查看器中的渲染失真问题,提升了数据质量控制与样本审查的效率。这些工作共同验证了领域专用数据集在提升大模型垂直任务能力中的关键作用,并为后续在更多安全关键领域构建类似数据集提供了可复现的方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务