遇见数据集

notrichardren/truthfulness_explanation

收藏
Hugging Face2023-08-09 更新2024-03-04 收录
官方服务:

资源简介:

--- configs: - config_name: default data_files: - split: passage_dependent path: data/passage_dependent-* - split: passage_independent path: data/passage_independent-* dataset_info: features: - name: claim dtype: string - name: label dtype: int64 - name: dataset dtype: string - name: qa_type dtype: int64 - name: explanation dtype: string - name: ind dtype: int64 splits: - name: passage_dependent num_bytes: 8245179 num_examples: 12697 - name: passage_independent num_bytes: 31818080 num_examples: 66227 download_size: 0 dataset_size: 40063259 --- # Dataset Card for "truthfulness_explanation" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

配置项: - 配置名称:default 数据文件: - 划分子集:段落依赖型(passage_dependent) 文件路径:data/passage_dependent-* - 划分子集:段落独立型(passage_independent) 文件路径:data/passage_independent-* 数据集信息: 特征字段: - 字段名:断言(claim),数据类型:字符串(string) - 字段名:标签(label),数据类型:64位整型(int64) - 字段名:来源数据集(dataset),数据类型:字符串(string) - 字段名:问答类型(qa_type),数据类型:64位整型(int64) - 字段名:解释(explanation),数据类型:字符串(string) - 字段名:索引(ind),数据类型:64位整型(int64) 划分子集: - 划分名称:段落依赖型(passage_dependent),字节大小:8245179,样本数量:12697 - 划分名称:段落独立型(passage_independent),字节大小:31818080,样本数量:66227 下载大小:0 数据集总大小:40063259 # 「truthfulness_explanation」数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
notrichardren
原始信息汇总

数据集概述

数据集配置

  • 配置名称: default
  • 数据文件:
    • 分割类型: passage_dependent
      • 路径: data/passage_dependent-*
    • 分割类型: passage_independent
      • 路径: data/passage_independent-*

数据集信息

  • 特征:

    • 名称: claim
      • 数据类型: string
    • 名称: label
      • 数据类型: int64
    • 名称: dataset
      • 数据类型: string
    • 名称: qa_type
      • 数据类型: int64
    • 名称: explanation
      • 数据类型: string
    • 名称: ind
      • 数据类型: int64
  • 分割信息:

    • 分割名称: passage_dependent
      • 字节数: 8245179
      • 示例数: 12697
    • 分割名称: passage_independent
      • 字节数: 31818080
      • 示例数: 66227
  • 下载大小: 0

  • 数据集大小: 40063259

搜集汇总
数据集介绍
notrichardren/truthfulness_explanation 数据集图片
构建方式
该数据集名为truthfulness_explanation,由notrichardren贡献,旨在支持对陈述真实性及其解释的研究。数据集构建采用分而治之的策略,划分为两个子集:passage_dependent(12,697条样本)与passage_independent(66,227条样本),以区分依赖上下文段落与独立于段落的真实性判断场景。每条数据包含claim(陈述文本)、label(真实性标签)、dataset(来源数据集)、qa_type(问答类型)、explanation(解释文本)及ind(索引编号)等字段,形成结构化且可追溯的样本库。数据以分片形式存储(如passage_dependent-*),便于分布式加载与处理。
特点
该数据集的核心特点在于其双轨设计,能够兼顾依赖语境与脱离语境的真实性分析,显著提升了模型在多样化场景下的泛化能力。passage_dependent子集聚焦于需要外部段落支撑的判断,而passage_independent则侧重常识或事实性陈述的独立验证。数据规模达78,924条,标签以整型表示,便于分类任务;同时,每个样本均提供解释字段,为可解释性研究奠定基础。此外,qa_type字段的引入,使得数据集可支持多类型问答与推理任务,增强了实用价值。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载,指定config_name为'default',并利用data_files参数选择passage_dependent或passage_independent子集。加载后,数据以字典形式呈现,包含claim、label、explanation等键,可直接用于训练或评估真实性分类模型。研究人员可将explanation字段作为监督信号,训练模型生成解释;或利用label字段进行二分类任务。建议根据任务需求划分训练与测试集,并注意passage_dependent子集需结合上下文使用,以充分发挥数据集的潜力。
背景与挑战
背景概述
在自然语言处理领域,虚假信息与事实核查的研究日益成为焦点,尤其是随着大型语言模型在生成文本中的广泛应用,评估其输出内容的真实性变得至关重要。notrichardren/truthfulness_explanation数据集由研究人员于近期创建,旨在为模型提供判断陈述真伪并生成解释的能力。该数据集包含近八万个样本,分为段落依赖与段落独立两个子集,每个样本由声明、标签、解释等多维度信息构成,核心研究问题聚焦于如何从语言表达中识别事实性错误并给出可理解的推理过程。这一资源为可解释人工智能与可信赖对话系统的发展奠定了数据基础,对推动模型在事实性任务上的鲁棒性评估具有显著影响力。
当前挑战
该数据集面临的核心挑战首先在于领域问题的复杂性:事实性判断不仅需要识别表面语义矛盾,还需理解隐含的常识与背景知识,这对模型的推理能力提出更高要求。其次,构建过程中,标注一致性难以保证,因为不同标注者对声明真伪的判断可能因知识背景差异而产生分歧,尤其在段落独立场景中缺乏上下文支持时更为突出。此外,解释生成需要兼顾准确性与可读性,如何在避免过度简化或引入偏见的同时保持逻辑连贯,是数据质量控制的另一难点。最后,数据覆盖范围的有限性可能导致模型在特定领域或语言风格上的泛化能力不足。
常用场景
经典使用场景
在自然语言处理与可信人工智能的交叉领域中,Truthfulness Explanation数据集作为一项关键资源,被广泛用于训练和评估模型对陈述真实性进行解释的能力。该数据集包含两类样本:依赖于上下文的真实性判断(passage_dependent)与无需外部知识的独立判断(passage_independent),每一条样本均由陈述、标签及对应的解释文本构成。这种结构使得研究者能够深入探究模型在生成可解释、合乎逻辑的真实性判别理由时的表现,从而推动可解释人工智能在事实核查、谣言检测等任务中的发展。
实际应用
在实际应用中,该数据集可赋能多种需要真实性验证与解释的智能系统,例如社交平台上的虚假信息检测引擎、新闻机构的事实核查工具以及在线知识问答系统的答案可信度评估模块。通过训练模型在生成真实性标签的同时附带自然语言解释,用户能够更直观地理解判断依据,提升对系统输出的信任度。在医疗、金融等高风险领域,这种具备解释能力的真实性判别机制尤显重要,可辅助专家决策并降低误判风险。
衍生相关工作
基于Truthfulness Explanation数据集,学术界已衍生出多项经典工作,包括面向解释生成的多任务学习框架、基于对比学习的真实性解释增强方法,以及融合外部知识图谱的解释推理模型。这些工作不仅验证了该数据集在提升模型解释质量方面的有效性,也拓展了其在跨语言事实核查、多模态真实性判断等更复杂场景下的应用潜力。此外,该数据集还常作为基准,被用于比较不同可解释性方法的性能,推动了该领域的标准化评估体系建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务