遇见数据集

notrichardren/truthfulness_high_quality

收藏
Hugging Face2023-08-09 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: combined path: data/combined-* - split: train path: data/train-* - split: test path: data/test-* dataset_info: features: - name: claim dtype: string - name: label dtype: int64 - name: dataset dtype: string - name: qa_type dtype: int64 - name: ind dtype: int64 splits: - name: combined num_bytes: 12293840 num_examples: 106153 - name: train num_bytes: 9841127 num_examples: 84922 - name: test num_bytes: 2452713 num_examples: 21231 download_size: 6560566 dataset_size: 24587680 --- # Dataset Card for "truthfulness_high_quality" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

配置项: - 配置名称:default(默认配置) 数据文件: - 数据划分(split):combined(合并集) 路径:data/combined-* - 数据划分(split):train(训练集) 路径:data/train-* - 数据划分(split):test(测试集) 路径:data/test-* dataset_info: 特征字段(features): - 字段名(name):claim(声明) 数据类型(dtype):string(字符串) - 字段名(name):label(标签) 数据类型(dtype):int64(64位整数) - 字段名(name):dataset(来源数据集) 数据类型(dtype):string(字符串) - 字段名(name):qa_type(问答类型) 数据类型(dtype):int64(64位整数) - 字段名(name):ind(索引) 数据类型(dtype):int64(64位整数) 数据划分详情(splits): - 划分名称(name):combined(合并集) 总字节数(num_bytes):12293840 样本数量(num_examples):106153 - 划分名称(name):train(训练集) 总字节数(num_bytes):9841127 样本数量(num_examples):84922 - 划分名称(name):test(测试集) 总字节数(num_bytes):2452713 样本数量(num_examples):21231 下载总大小(download_size):6560566 数据集总存储大小(dataset_size):24587680 --- # “高质量真实性”数据集卡片(Dataset Card) [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
notrichardren
原始信息汇总

数据集概述

数据集配置

  • 默认配置 (config_name: default)
    • 数据文件路径
      • 合并数据 (split: combined):data/combined-*
      • 训练数据 (split: train):data/train-*
      • 测试数据 (split: test):data/test-*

数据集信息

  • 特征描述

    • 名称:claim
      • 数据类型:string
    • 名称:label
      • 数据类型:int64
    • 名称:dataset
      • 数据类型:string
    • 名称:qa_type
      • 数据类型:int64
    • 名称:ind
      • 数据类型:int64
  • 数据分割详情

    • 合并数据 (name: combined)
      • 字节数:12293840
      • 示例数:106153
    • 训练数据 (name: train)
      • 字节数:9841127
      • 示例数:84922
    • 测试数据 (name: test)
      • 字节数:2452713
      • 示例数:21231
  • 数据集大小

    • 下载大小:6560566
    • 数据集总大小:24587680
搜集汇总
数据集介绍
notrichardren/truthfulness_high_quality 数据集图片
构建方式
在自然语言处理与事实性验证领域,高质量真值数据集的构建是评估模型可靠性的基石。该数据集名为truthfulness_high_quality,由notrichardren贡献,旨在为陈述真实性判别任务提供精细化标注资源。其构建过程遵循分层抽样与多源融合策略,从海量文本中筛选出包含明确事实性声明的样本,并依据严格标准进行二分类标注(label字段为int64类型,0或1代表虚假或真实)。数据来源通过dataset字段记录,涵盖多种语境下的陈述类型,并由qa_type字段进一步区分问答场景。最终数据集划分为combined、train和test三个子集,其中训练集包含84922条样本,测试集包含21231条样本,确保了模型训练与评估的平衡性。
特点
该数据集最显著的特点在于其高质量与结构化设计。所有样本均以字符串形式存储claim字段,保留了原始陈述的完整语义,避免了预处理过程中的信息损失。label字段采用整型标注,便于直接用于分类模型训练。特别地,qa_type字段的引入使得数据集能够支持不同问答范式下的真实性检测任务,增强了跨场景适配能力。ind字段则为每条样本提供唯一索引,便于追踪与复现实验。数据规模上,总样本量超过10万条,且训练集与测试集比例约为4:1,符合主流深度学习任务的数据分配惯例,为模型泛化性能的评估提供了可靠基础。
使用方法
使用该数据集时,推荐通过HuggingFace的datasets库进行加载。用户可直接指定配置名为default,并利用data_files参数读取存储在data/目录下的分片文件。数据加载后,可依据split参数选择combined、train或test子集,其中combined子集包含全部样本,适合全量分析;train与test子集则分别用于模型训练与性能评估。在建模任务中,建议将claim字段作为输入特征,label字段作为监督信号,并利用dataset和qa_type字段进行消融实验或领域适配研究。由于数据以Parquet格式存储,具备高效的列式读取能力,适合大规模实验场景下的迭代训练。
背景与挑战
背景概述
在自然语言处理领域,随着预训练语言模型的广泛应用,模型生成内容的真实性与可靠性成为亟待解决的核心问题。为应对这一挑战,notrichardren/truthfulness_high_quality数据集应运而生,其创建时间虽未在公开资料中明确标注,但该数据集聚焦于评估和提升文本真实性判断能力,由研究者notrichardren主导构建。该数据集的核心研究问题在于如何系统性地度量并标注自然语言陈述的真伪,从而为模型提供高质量的训练与测试样本。通过包含超过10万条标注样本,数据集覆盖了多种来源与问答类型,为事实性验证和虚假信息检测任务提供了重要基准,对推动可信赖AI系统的发展具有显著影响力。
当前挑战
该数据集面临的首要挑战在于领域问题的复杂性:真实世界中的陈述往往涉及模糊性、上下文依赖或隐含假设,使得简单的二元真伪标注难以覆盖所有语义细微差别,这要求模型具备超越表面信息的深层推理能力。在构建过程中,数据标注的可靠性与一致性构成另一重挑战,由于不同标注者对同一陈述可能存在理解偏差,确保标签的客观性与跨样本的稳定性需要严格的标注规范与多轮校验流程。此外,数据集的规模虽大,但如何平衡不同主题、风格和来源的样本分布,避免因数据偏差导致的模型泛化能力下降,同样是构建过程中必须克服的关键难题。
常用场景
经典使用场景
在自然语言处理与计算语义学的前沿探索中,truthfulness_high_quality数据集以其精细标注的声明(claim)与真实性标签(label)二元结构,成为评估和提升语言模型事实一致性的基石。该数据集汇聚了超过十万条高质量样本,覆盖多样化来源,经典地用于训练和测试模型对陈述真伪的判别能力。研究者常将其作为基准,通过分类任务量化模型在事实性推理上的表现,进而优化生成内容避免信息失真。
解决学术问题
该数据集精准回应了大型语言模型在开放域生成中普遍存在的“幻觉”问题——即模型产生看似合理但实际错误的陈述。通过提供大规模、跨领域的真实性标注语料,它使得学术研究能够系统性地探究模型如何区分事实与虚构,从而推动可解释性研究。其意义在于为事实核查算法提供了标准化测试平台,促进了从模型训练到评估的全链条真实性保障,深刻影响了可信人工智能的发展方向。
衍生相关工作
该数据集衍生了一系列开创性工作,如基于对比学习的事实一致性增强框架和面向声明可信度的多任务学习模型。研究者以其为基础,开发了针对长文本的细粒度真实性检测系统,并催生了跨语言事实校验的迁移学习范式。这些经典工作不仅深化了对模型认知边界的理解,还推动了如TruthfulQA等基准的构建,形成了事实性研究领域的良性生态,持续激发着从数据到理论的创新循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务