遇见数据集

gayanin/pubmed-abstracts-noised-with-prob-dist

收藏
Hugging Face2024-02-05 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: - config_name: babylon features: - name: refs dtype: string - name: trans dtype: string splits: - name: train num_bytes: 6285769 num_examples: 24908 - name: test num_bytes: 792114 num_examples: 3113 - name: validation num_bytes: 782322 num_examples: 3114 download_size: 4422353 dataset_size: 7860205 - config_name: gcd features: - name: refs dtype: string - name: trans dtype: string splits: - name: train num_bytes: 5315199 num_examples: 24908 - name: test num_bytes: 732074 num_examples: 3114 - name: validation num_bytes: 730918 num_examples: 3114 download_size: 3902937 dataset_size: 6778191 - config_name: kaggle features: - name: refs dtype: string - name: trans dtype: string splits: - name: train num_bytes: 6277893 num_examples: 24908 - name: test num_bytes: 789835 num_examples: 3113 - name: validation num_bytes: 786894 num_examples: 3114 download_size: 4398378 dataset_size: 7854622 configs: - config_name: babylon data_files: - split: train path: babylon/train-* - split: test path: babylon/test-* - split: validation path: babylon/validation-* - config_name: gcd data_files: - split: train path: gcd/train-* - split: test path: gcd/test-* - split: validation path: gcd/validation-* - config_name: kaggle data_files: - split: train path: kaggle/train-* - split: test path: kaggle/test-* - split: validation path: kaggle/validation-* ---

提供机构:
gayanin
原始信息汇总

数据集概述

数据集配置

配置名称:babylon

  • 特征
    • refs:字符串类型
    • trans:字符串类型
  • 分割
    • train
      • 字节数:6285769
      • 样本数:24908
    • test
      • 字节数:792114
      • 样本数:3113
    • validation
      • 字节数:782322
      • 样本数:3114
  • 下载大小:4422353
  • 数据集大小:7860205

配置名称:gcd

  • 特征
    • refs:字符串类型
    • trans:字符串类型
  • 分割
    • train
      • 字节数:5315199
      • 样本数:24908
    • test
      • 字节数:732074
      • 样本数:3114
    • validation
      • 字节数:730918
      • 样本数:3114
  • 下载大小:3902937
  • 数据集大小:6778191

配置名称:kaggle

  • 特征
    • refs:字符串类型
    • trans:字符串类型
  • 分割
    • train
      • 字节数:6277893
      • 样本数:24908
    • test
      • 字节数:789835
      • 样本数:3113
    • validation
      • 字节数:786894
      • 样本数:3114
  • 下载大小:4398378
  • 数据集大小:7854622

数据文件路径

配置名称:babylon

  • 训练集babylon/train-*
  • 测试集babylon/test-*
  • 验证集babylon/validation-*

配置名称:gcd

  • 训练集gcd/train-*
  • 测试集gcd/test-*
  • 验证集gcd/validation-*

配置名称:kaggle

  • 训练集kaggle/train-*
  • 测试集kaggle/test-*
  • 验证集kaggle/validation-*
搜集汇总
数据集介绍
gayanin/pubmed-abstracts-noised-with-prob-dist 数据集图片
构建方式
在生物医学文本挖掘领域,高质量噪声数据对于训练鲁棒性模型至关重要。gayanin/pubmed-abstracts-noised-with-prob-dist数据集基于PubMed摘要构建,通过引入基于概率分布的噪声机制生成扰动文本。该数据集包含三个子配置:babylon、gcd和kaggle,每个配置均提供refs(原始摘要)与trans(噪声版本)两个字段。数据划分为训练集(约24,908条)、测试集(约3,113条)和验证集(约3,114条),确保模型评估的可靠性。构建过程中,噪声以特定概率分布作用于原始文本,模拟真实场景下的语义变异,从而为去噪或生成任务提供基准。
特点
该数据集的核心特点在于其噪声生成策略的多样性与可控性。三个子配置分别对应不同的概率分布模型,使得噪声模式在词汇、句法或语义层面呈现差异化特征。每个样本均保留原始摘要作为参考,便于监督学习中的对比分析。数据集规模适中,总计约31,135个样本,兼顾了训练效率与统计显著性。此外,噪声的引入并非随机破坏,而是基于概率分布的精细调控,这有助于模型学习到更接近真实分布的噪声模式,从而提升在生物医学文献处理任务中的泛化能力。
使用方法
使用该数据集时,用户可通过HuggingFace的datasets库加载指定配置,例如选择babylon、gcd或kaggle之一。每个配置均提供train、test和validation三个标准分割,可直接用于训练、评估和调优。推荐将trans字段作为模型输入,refs字段作为目标输出,应用于文本去噪、机器翻译或语义恢复等任务。由于数据格式为纯文本字符串,用户可灵活适配各类序列到序列模型,如Transformer或BERT变体。加载代码示例:from datasets import load_dataset; dataset = load_dataset('gayanin/pubmed-abstracts-noised-with-prob-dist', 'babylon')。
背景与挑战
背景概述
在自然语言处理领域,文本噪声的模拟与建模是提升模型鲁棒性的关键课题。gayanin/pubmed-abstracts-noised-with-prob-dist数据集由研究者基于PubMed生物医学文献摘要构建,旨在探索概率分布引导的文本噪声注入方法。该数据集包含babylon、gcd、kaggle三个配置子集,分别对应不同的噪声生成策略或概率分布设定,每个子集均划分训练、验证与测试集,总计约3.1万条样本。其核心研究问题在于:如何通过可控的噪声分布模拟真实场景中的文本退化,从而为去噪模型、机器翻译或文本纠错任务提供基准测试资源。该数据集的出现弥补了生物医学领域缺乏标准化噪声文本资源的空白,推动了面向专业文献的噪声鲁棒性研究。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:生物医学文本包含大量专业术语、缩写与复杂句式,噪声注入需兼顾语义保留与噪声真实性,现有概率分布模型难以精确模拟领域特有的错误模式。其次,构建过程中存在数据平衡难题——不同子集的噪声强度与分布差异可能导致模型在特定配置上过拟合,同时跨配置的泛化能力评估缺乏统一指标。此外,原始PubMed摘要的标注质量参差不齐,噪声生成算法的参数调优依赖人工验证,增加了构建成本与可重复性风险。这些挑战共同制约了数据集在鲁棒性评测中的普适性与可解释性。
常用场景
经典使用场景
在生物医学自然语言处理领域,PubMed摘要作为海量高质量的文本资源,常被用于训练和评估文本生成与噪声鲁棒性模型。该数据集通过引入概率分布噪声,模拟真实世界中文本数据可能出现的污染情况,如拼写错误、OCR识别偏差或机器翻译的不确定性。经典使用场景包括构建去噪自编码器、训练文本纠错模型,以及评估语言模型在噪声环境下的语义保持能力,是研究噪声鲁棒性的理想基准。
解决学术问题
该数据集精准回应了学术研究中两大痛点:一是缺乏针对生物医学领域标注噪声的标准化资源,二是现有去噪方法在专业术语密集文本上的泛化能力不足。通过提供三种不同噪声分布(Babylon、GCD、Kaggle)的并行语料,研究者可系统探究噪声类型对模型性能的影响,推动了噪声建模、可解释性分析和领域自适应等方向的发展,为构建更可靠的生物医学信息抽取系统奠定了基础。
衍生相关工作
基于该数据集,衍生出一系列经典工作:例如利用对比学习框架增强噪声表征的判别能力,提出针对生物医学实体的噪声感知注意力机制,以及设计多任务学习模型同时进行噪声检测与文本修复。这些工作不仅提升了PubMed摘要的清洗效率,还催生了如BioBERT-Noise等预训练模型的变体,推动噪声环境下的迁移学习研究,并拓展到临床笔记、电子健康记录等更广泛的医学文本场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务