TS-Dataset
收藏资源简介:
SafetyRAISE TS Dataset 是一个面向交通安全事故分析与推理任务的中文训练数据集,专为 SafetyRAISE 项目设计,旨在支持专家小模型的监督微调(SFT)、偏好优化(DPO)与能力评估。数据集包含两个独立配置:sft 配置包含 9,610 个样本,主要用于监督微调,样本内容涵盖交通事故材料、事故知识问答、因果分析和通用知识问答,其字段包括指令(instruction)、可选上下文输入(input)、期望输出(output)和样本类型标签(label),标签分布为因果分析(3,584 条)、事故描述(3,262 条)、交通知识(1,554 条)和通用知识(1,210 条);dpo 配置包含 516 个样本,用于直接偏好优化,每条样本包含同一指令下的优选回答(chosen)和较弱回答(rejected)。该数据集适用于交通事故分析专家模型的训练,具体任务包括事故责任判定、因果链推理、风险因素分析和场景复盘问答,以及基于对比样本的偏好对齐与优化。数据以 Parquet 和 JSONL 格式提供,部分内容包含 Markdown 格式的富文本。使用时需注意,数据集聚焦于交通安全领域分析,不应作为唯一的法律责任判定依据,建议在生产应用中结合事实核验与人工复核。
The SafetyRAISE TS Dataset is a Chinese training dataset for traffic safety accident analysis and reasoning tasks, specifically designed for the SafetyRAISE project to support supervised fine-tuning (SFT), preference optimization (DPO), and capability evaluation of expert small models. The dataset includes two independent configurations: the sft configuration contains 9,610 samples primarily for supervised fine-tuning, covering traffic accident materials, accident knowledge Q&A, causal analysis, and general knowledge Q&A, with fields including instruction, optional context input, expected output, and sample type labels, distributed as causal analysis (3,584 entries), accident description (3,262 entries), traffic knowledge (1,554 entries), and general knowledge (1,210 entries); the dpo configuration contains 516 samples for direct preference optimization, each including a preferred response (chosen) and a weaker response (rejected) under the same instruction. This dataset is suitable for training expert models in traffic accident analysis, with specific tasks including accident liability determination, causal chain reasoning, risk factor analysis, scenario review Q&A, and preference alignment and optimization based on comparative samples. Data is provided in Parquet and JSONL formats, with some content containing rich text in Markdown format. Note that the dataset focuses on traffic safety analysis and should not be used as the sole basis for legal liability determinations; it is recommended to combine fact verification and manual review in production applications.
SafetyRAISE TS Dataset 概述
SafetyRAISE TS Dataset 是一个面向交通安全事故分析与推理任务的中文训练数据集,旨在支持专家小模型的监督微调(SFT)、偏好优化(DPO)及能力评估。该数据集与 SafetyRAISE 开源项目及其配套工具链紧密结合。
数据集配置
数据集包含两个独立的配置,分别用于不同的训练阶段:
| 配置 | 文件名 | 样本量 | 字段 |
|---|---|---|---|
sft |
ts-sft.parquet |
9,610 | instruction, input, output, label |
dpo |
ts-dpo.parquet |
516 | instruction, chosen, rejected |
数据详情
sft 配置(监督微调)
- 内容:包含交通事故材料、事故知识问答、因果分析和通用知识问答。
- 字段说明:
instruction:用户问题或任务指令。input:可选的上下文材料,部分样本为空。output:期望模型生成的参考答案。label:样本类型标签。
label标签分布:
| 标签 | 样本量 |
|---|---|
causal-analysis |
3,584 |
accident-description |
3,262 |
traffic-knowledge |
1,554 |
general-knowledge |
1,210 |
dpo 配置(偏好优化)
- 内容:每条样本包含同一指令下的优选回答与较弱回答。
- 字段说明:
instruction:事故信息、结构化输入或分析任务。chosen:更符合任务要求的优选回答。rejected:质量较弱或不符合要求的对照回答。
加载方式
推荐使用 Hugging Face datasets 库加载:
python from datasets import load_dataset
sft_dataset = load_dataset("suyuan37/TS-Dataset", "sft", split="train") dpo_dataset = load_dataset("suyuan37/TS-Dataset", "dpo", split="train")
文件说明
数据以 Parquet 格式为主(首选),同时提供 JSONL 和 JSON 格式用于兼容。文件位于数据集页面中。
- 首选下载:
ts-sft.parquet(SFT 训练)、ts-dpo.parquet(DPO 训练)。 - 兼容格式:
ts-sft.jsonl、ts-dpo.jsonl(JSONL 管线)、ts-sft.json、ts-dpo.json(归档用途)。
注意:Hugging Face Data Studio 将长文本按普通表格显示。如需查看 input、output、chosen、rejected 中 Markdown 渲染效果,可使用配套的 Markdown 富文本预览 Space:https://huggingface.co/spaces/suyuan37/TS-Dataset-Markdown-Viewer。
适用场景
- 交通事故分析专家模型的监督微调。
- 事故责任、因果链、风险因素、场景复盘等任务的问答训练。
- 基于
chosen/rejected样本的 DPO、偏好优化或回答质量对齐。 - 配合 SafetyRAISE-OS 与 SafetyRAISE-LMEngine 进行本地专家模型实验。
注意事项
- 数据集聚焦于交通安全与事故分析,不应作为唯一法律责任判定依据。
- 部分样本包含事故细节和推理过程,使用时需结合应用场景进行安全审查。
- 用于生产系统时,建议增加事实核验、人工复核和输出约束。
相关资源
- SafetyRAISE 开源项目:https://github.com/QianYan-Art/SafetyRAISE-OS
- SafetyRAISE 专家小模型推理引擎:https://github.com/QianYan-Art/SafetyRAISE-LMEngine
- 配套模型:https://huggingface.co/suyuan37/SafetyRAISE-TS-Qwen3
- Markdown 富文本预览:https://huggingface.co/spaces/suyuan37/TS-Dataset-Markdown-Viewer




