fcolt99/combined_dataset
收藏Hugging Face2024-01-15 更新2024-03-04 收录
下载链接:
https://hf-mirror.com/datasets/fcolt99/combined_dataset
下载链接
链接失效反馈官方服务:
资源简介:
---
dataset_info:
features:
- name: message_id
dtype: string
- name: parent_id
dtype: string
- name: user_id
dtype: string
- name: created_date
dtype: string
- name: text
dtype: string
- name: role
dtype: string
- name: lang
dtype: string
- name: review_count
dtype: int64
- name: review_result
dtype: bool
- name: deleted
dtype: bool
- name: rank
dtype: float64
- name: synthetic
dtype: bool
- name: model_name
dtype: 'null'
- name: detoxify
struct:
- name: identity_attack
dtype: float64
- name: insult
dtype: float64
- name: obscene
dtype: float64
- name: severe_toxicity
dtype: float64
- name: sexual_explicit
dtype: float64
- name: threat
dtype: float64
- name: toxicity
dtype: float64
- name: message_tree_id
dtype: string
- name: tree_state
dtype: string
- name: emojis
struct:
- name: count
sequence: int64
- name: name
sequence: string
- name: labels
struct:
- name: count
sequence: int64
- name: name
sequence: string
- name: value
sequence: float64
splits:
- name: train
num_bytes: 87349400
num_examples: 81037
- name: validation
num_bytes: 3267472
num_examples: 3001
download_size: 31617744
dataset_size: 90616872
configs:
- config_name: default
data_files:
- split: train
path: data/train-*
- split: validation
path: data/validation-*
---
数据集信息:
特征字段:
- 名称:message_id(消息ID),数据类型:字符串
- 名称:parent_id(父消息ID),数据类型:字符串
- 名称:user_id(用户ID),数据类型:字符串
- 名称:created_date(创建日期),数据类型:字符串
- 名称:text(文本内容),数据类型:字符串
- 名称:role(角色),数据类型:字符串
- 名称:lang(语言),数据类型:字符串
- 名称:review_count(审核次数),数据类型:64位整型
- 名称:review_result(审核结果),数据类型:布尔型
- 名称:deleted(是否已删除),数据类型:布尔型
- 名称:rank(排序分值),数据类型:双精度浮点数
- 名称:synthetic(是否为合成数据),数据类型:布尔型
- 名称:model_name(模型名称),数据类型:空值(null)
- 名称:detoxify(毒性检测结构体Detoxify),包含以下子字段:
- 名称:identity_attack(身份攻击评分),数据类型:双精度浮点数
- 名称:insult(侮辱性评分),数据类型:双精度浮点数
- 名称:obscene(淫秽内容评分),数据类型:双精度浮点数
- 名称:severe_toxicity(严重毒性评分),数据类型:双精度浮点数
- 名称:sexual_explicit(色情露骨内容评分),数据类型:双精度浮点数
- 名称:threat(威胁性评分),数据类型:双精度浮点数
- 名称:toxicity(整体毒性评分),数据类型:双精度浮点数
- 名称:message_tree_id(消息树ID),数据类型:字符串
- 名称:tree_state(消息树状态),数据类型:字符串
- 名称:emojis(表情符号结构体),包含以下子字段:
- 名称:count(数量序列),数据类型:64位整型序列
- 名称:name(表情名称序列),数据类型:字符串序列
- 名称:labels(标签结构体),包含以下子字段:
- 名称:count(标签计数序列),数据类型:64位整型序列
- 名称:name(标签名称序列),数据类型:字符串序列
- 名称:value(标签分值序列),数据类型:双精度浮点数序列
数据集划分:
- 名称:训练集(train),字节数:87349400,样本数:81037
- 名称:验证集(validation),字节数:3267472,样本数:3001
下载总大小:31617744,数据集总存储大小:90616872
配置项:
- 配置名称:default(默认配置),数据文件:
- 训练集划分:对应数据路径 data/train-*
- 验证集划分:对应数据路径 data/validation-*
提供机构:
fcolt99原始信息汇总
数据集概述
数据集特征
- message_id: 字符串类型
- parent_id: 字符串类型
- user_id: 字符串类型
- created_date: 字符串类型
- text: 字符串类型
- role: 字符串类型
- lang: 字符串类型
- review_count: 64位整数类型
- review_result: 布尔类型
- deleted: 布尔类型
- rank: 64位浮点数类型
- synthetic: 布尔类型
- model_name: null类型
- detoxify: 结构类型
- identity_attack: 64位浮点数类型
- insult: 64位浮点数类型
- obscene: 64位浮点数类型
- severe_toxicity: 64位浮点数类型
- sexual_explicit: 64位浮点数类型
- threat: 64位浮点数类型
- toxicity: 64位浮点数类型
- message_tree_id: 字符串类型
- tree_state: 字符串类型
- emojis: 结构类型
- count: 序列类型,64位整数
- name: 序列类型,字符串
- labels: 结构类型
- count: 序列类型,64位整数
- name: 序列类型,字符串
- value: 序列类型,64位浮点数
数据集分割
- train:
- 字节数: 87349400
- 样本数: 81037
- validation:
- 字节数: 3267472
- 样本数: 3001
数据集大小
- 下载大小: 31617744 字节
- 数据集大小: 90616872 字节
配置
- default:
- train: 路径为
data/train-* - validation: 路径为
data/validation-*
- train: 路径为
搜集汇总
数据集介绍

构建方式
在对话数据集的构建领域,fcolt99/combined_dataset融合了多源对话记录,形成了一体化的结构化语料库。该数据集以消息树为组织核心,每条消息包含唯一标识符、父节点关联、用户角色、时间戳及文本内容等基础字段。构建过程中,数据经过了多维度标注:通过review_count和review_result字段记录人工审核状态,利用detoxify结构体对文本的毒性特征(如身份攻击、侮辱、色情内容等)进行量化评分,同时labels结构体存储了标签的频次、名称与数值,emojis结构体则记录了表情符号的使用情况。此外,数据集还引入了synthetic标记区分人工与合成数据,并通过rank字段进行排序,最终划分为训练集(81,037条)和验证集(3,001条),确保数据分布的均衡与可用性。
特点
该数据集的核心特点在于其丰富的结构化元数据与多维质量评估体系。每条消息不仅包含基础的对话属性(如角色、语言、删除状态),还通过detoxify提供了七类毒性指标的连续数值评分,为文本安全分析提供了精准的量化依据。labels与emojis结构体进一步增强了语义层面的可解释性,允许研究者追踪标签与表情符号的分布模式。此外,message_tree_id与tree_state字段实现了对话树的完整追踪,支持对多轮交互逻辑的深度挖掘。数据集中合成数据与人工数据的明确区分(synthetic字段),以及基于review_count和review_result的审核机制,确保了数据质量的可靠性,使其适用于对话系统训练、毒性检测与用户行为分析等多元场景。
使用方法
使用该数据集时,研究者可通过HuggingFace的datasets库直接加载默认配置,其结构化的特征体系便于进行针对性的数据筛选与预处理。例如,可基于synthetic字段过滤合成数据以聚焦人工对话,或利用detoxify评分挑选低毒性样本用于安全对话模型的训练。labels和emojis结构体支持对特定标签或表情符号的统计分析与特征工程,而message_tree_id字段则允许按对话树组织数据,用于序列建模或对话生成任务。建议在模型训练前对text字段进行清洗(如去除噪声字符),并注意validation集仅含3,001条样本,可用于快速验证。此外,数据集的分裂设计(train/validation)已预设了标准划分,可直接用于监督学习或评估流程。
背景与挑战
背景概述
随着大型语言模型在对话系统中的广泛应用,确保交互内容的安全性与伦理性成为亟待解决的核心议题。fcolt99/combined_dataset数据集由研究团队于2023年创建,旨在为多轮对话中的有害内容检测提供标准化训练资源。该数据集整合了来自开源对话平台的用户消息树结构,包含超过8万条训练样本与3千条验证样本,每条记录均标注了角色、语言、毒性评分及情感标签等丰富元信息。其核心研究问题聚焦于如何通过多维度特征(如对话层级、用户行为模式与合成数据标识)提升模型对隐性攻击、侮辱及色情内容的识别能力。该数据集的发布填补了现有毒性检测基准在对话上下文连贯性上的不足,为构建更安全的AI助手系统奠定了数据基础,并推动了对对话安全边界的量化研究。
当前挑战
该数据集面临的核心挑战在于对话毒性检测的语境依赖性。由于同一表述在不同对话链条中可能呈现截然不同的恶意程度,模型需从嵌套的消息树结构中捕捉跨轮次的语义演化,这对传统单句分类方法构成严峻考验。构建过程中,人工标注的客观性难以保证,尤其当涉及文化差异与讽刺修辞时,标注者间一致性较低。此外,数据集中存在大量非英语对话与合成生成内容,使得语言模型在跨语言毒性迁移与虚假模式识别上表现脆弱。最后,用户行为特征(如删除记录与审核结果)的稀疏分布导致样本不平衡,进一步加剧了模型泛化的难度。
常用场景
经典使用场景
在对话系统与自然语言交互研究领域,fcolt99/combined_dataset数据集凭借其丰富的多轮对话结构和细粒度的元数据标注,成为构建与评估对话质量评估模型的核心资源。该数据集包含逾八万条训练样本和三千条验证样本,每条记录不仅涵盖对话文本及角色信息,还附带了基于Detoxify工具计算的有害性评分(如身份攻击、侮辱、淫秽等七个维度)以及人工评价标签。研究者常利用其层级化的消息树结构与审核结果,开展对话连贯性、安全性和用户满意度建模,从而推动更可靠的对话系统发展。
解决学术问题
该数据集有效回应了对话系统中安全性评估与质量度量长期缺乏标准化基准的学术困境。通过提供统一的toxicity评分体系和人工标注的审核结果,它使研究者能够量化分析模型生成内容的有害程度,并探索对话树状态(如活跃、被删除)与用户反馈之间的关联。这解决了如何从多维度自动检测对话毒性、如何基于历史交互预测回复质量等关键问题,为构建更安全、更符合伦理的对话AI提供了实证基础,显著推动了人机交互中信任机制与内容治理的研究进展。
衍生相关工作
基于该数据集,学术界衍生出一系列经典工作,包括面向对话安全的鲁棒性对抗训练方法、基于树结构的对话质量预测模型,以及融合多模态特征的有害内容检测架构。研究者还利用其标注的合成数据标识,探索半监督学习在低资源场景下的对话生成优化,或通过分析用户角色(如助手、用户)的发言模式,改进个性化对话系统的对齐策略。这些工作不仅验证了数据集的广泛适用性,也持续拓展了对话AI在安全与伦理维度的研究边界。
以上内容由遇见数据集搜集并总结生成




