HumanF-MarkrAI/WIKI_QA_Near_dedup
收藏官方服务:
资源简介:
WIKI_QA_Near_dedup数据集是通过Near dedup算法创建的,旨在减少相似性。该数据集的原始来源是maywell/wikidata_QA,由开发者maywell(Jeonghwan Park)创建。数据集遵循cc-by-nc-sa-4.0许可证。数据集包含训练集,共有137,505个样本,总大小为145,724,140字节。数据集的特征包括input(float64类型)、output(string类型)和instruction(string类型)。
WIKI_QA_Near_dedup数据集是通过Near dedup算法创建的,旨在减少相似性。该数据集的原始来源是maywell/wikidata_QA,由开发者maywell(Jeonghwan Park)创建。数据集遵循cc-by-nc-sa-4.0许可证。数据集包含训练集,共有137,505个样本,总大小为145,724,140字节。数据集的特征包括input(float64类型)、output(string类型)和instruction(string类型)。
提供机构:
HumanF-MarkrAI原始信息汇总
数据集卡片 for "WIKI_QA_Near_dedup"
数据集详情
配置
- 配置名称: default
- 数据文件:
- 分割: train
- 路径: data/train-*
- 分割: train
- 数据文件:
数据集信息
- 特征:
- 名称: input
- 数据类型: float64
- 名称: output
- 数据类型: string
- 名称: instruction
- 数据类型: string
- 名称: input
- 分割:
- 名称: train
- 字节数: 145724140
- 样本数: 137505
- 名称: train
- 下载大小: 87382170
- 数据集大小: 145724140
许可证
- 许可证: cc-by-nc-sa-4.0
数据集创建
- 数据集由Near dedup算法创建,用于减少相似性。
- 原始来源: maywell/wikidata_QA
- 创建者: maywell(Jeonghwan Park)
搜集汇总
数据集介绍

构建方式
在自然语言处理领域,高质量问答数据集对模型训练至关重要。WIKI_QA_Near_dedup数据集源自maywell团队构建的wikidata_QA原始语料,经由开发者SeungyooLee采用近似去重算法(Near dedup algorithm)精心筛选与重构。该算法旨在降低样本间语义相似性,剔除冗余信息,从而保留更具多样性与代表性的问答对。最终数据集包含137505条样本,涵盖input、output与instruction三个字段,以float64与string类型存储,并以parquet格式分片存储于训练集中。
特点
本数据集的核心特色在于其去重机制带来的高多样性与低冗余度。通过近似去重算法,有效缓解了原始语料中常见的内容重复与模式趋同问题,使得每个问答实例在语义层面保持独特。此外,数据集采用标准的指令跟随结构(instruction-input-output),便于适配现代大语言模型的微调范式。其规模适中(约145MB),在保证样本丰富性的同时,兼顾了计算效率与存储便捷性。许可证采用cc-by-nc-sa-4.0,适用于非商业研究与共享场景。
使用方法
使用该数据集时,可通过HuggingFace Datasets库直接加载,指定配置名为default,并读取data/train-*路径下的分片文件。加载后,每条数据包含instruction(指令描述)、input(数值型输入)与output(文本型输出)三个字段,可直接用于监督微调或指令微调任务。建议在训练前对input字段进行归一化处理,并将output字段作为模型生成目标。对于需要构建大规模问答系统的开发者,此数据集可作为去重后高质量数据源的典型范例,亦可与其他问答语料混合使用以增强模型泛化能力。
背景与挑战
背景概述
在自然语言处理领域,高质量的问答数据集对于训练和评估模型至关重要,尤其是在开放域问答任务中。WIKI_QA_Near_dedup数据集由韩国开发者SeungyooLee(DopeorNopeLee)创建,其原始来源为maywell(Jeonghwan Park)构建的wikidata_QA数据集。该数据集于近期发布,旨在通过近重复(Near dedup)算法对原始问答对进行去重,以降低数据冗余并提升样本多样性。其核心研究问题聚焦于如何在保留关键语义信息的同时,消除训练数据中的高度相似样本,从而避免模型过拟合于重复模式。作为基于维基数据生成的问答资源,该数据集为多语言、多领域的知识推理任务提供了更紧凑且高效的训练基础,对推动轻量化问答模型的发展具有潜在影响力。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上:开放域问答需要模型具备从海量知识中精准抽取答案的能力,而原始wikidata_QA中大量语义相近的问答对可能导致模型偏向于记忆而非推理,降低泛化性能。在构建过程中,近重复去重算法需权衡相似度阈值的选择——阈值过高会遗漏冗余样本,过低则可能误删语义不同但表述相似的问答对,破坏数据完整性。此外,数据集仅包含单一训练拆分,缺乏验证与测试集,使得模型评估和超参数调优受限。同时,cc-by-nc-sa许可协议限制了商业场景的应用,进一步缩小了其实际使用范围。
常用场景
经典使用场景
在自然语言处理与知识问答系统的研究中,WIKI_QA_Near_dedup数据集以其高度去冗余的特性,成为训练高效问答模型的经典资源。该数据集通过对原始维基数据问答对进行近重复检测与剔除,保留了语义多样且信息密度高的样本,尤其适用于序列到序列模型、检索增强生成系统以及开放式问答任务的微调与评估。其简洁的输入输出结构,为研究者提供了纯净的监督信号,助力模型在减少噪声干扰的同时提升泛化能力。
衍生相关工作
基于WIKI_QA_Near_dedup数据集,衍生出多项经典研究工作。例如,研究者利用该数据集训练领域自适应问答模型,探索跨知识图谱的语义对齐方法;另有工作将其作为对比学习的基准语料,验证去冗余策略对表示学习质量的影响。此外,该数据集还催生了针对长尾知识问题的高效检索算法,以及结合主动学习的半监督问答框架,推动了数据高效利用与模型压缩技术的交叉创新。
数据集最近研究
最新研究方向
在知识密集型自然语言处理任务中,高质量问答对是构建可靠模型的基础。WIKI_QA_Near_dedup数据集通过近重复检测算法对原始维基数据问答语料进行去冗余处理,有效降低了样本间的语义相似度,从而提升了训练数据的多样性与泛化能力。这一研究方向正契合当前大语言模型对数据质量与效率的迫切需求,尤其是在指令微调与知识蒸馏领域,去重后的数据集能够减少模型对高频模式的过拟合,增强其在不同知识场景下的鲁棒性。该数据集的发布不仅推动了开源社区对数据清洗方法的关注,也为后续研究如何平衡数据规模与信息密度提供了重要参考,具有显著的实践意义与学术价值。
以上内容由遇见数据集搜集并总结生成



