遇见数据集

sentence-transformers/wikianswers-duplicates

收藏
Hugging Face2024-05-01 更新2024-06-12 收录
官方服务:

资源简介:

--- language: - en multilinguality: - monolingual size_categories: - 100M<n<1B task_categories: - feature-extraction - sentence-similarity pretty_name: WikiAnswers Duplicate Questions tags: - sentence-transformers dataset_info: config_name: pair features: - name: anchor dtype: string - name: positive dtype: string splits: - name: train num_bytes: 78825722188 num_examples: 761379586 download_size: 33891162136 dataset_size: 78825722188 configs: - config_name: pair data_files: - split: train path: pair/train-* --- # Dataset Card for WikiAnswers Duplicate Questions This dataset contains duplicate questions from the [WikiAnswers Corpus](https://github.com/afader/oqa#wikianswers-corpus), formatted to be easily used with Sentence Transformers to train embedding models. ## Dataset Subsets ### `pair` subset * Columns: "anchor", "positive" * Column types: `str`, `str` * Examples: ```python { 'anchor': 'How many calories is in a handful of strawberries?', 'positive': 'How many calories are in a strawberry popsickles?', } ``` * Collection strategy: Reading the WikiAnswers dataset from [embedding-training-data](https://huggingface.co/datasets/sentence-transformers/embedding-training-data), which has lists of duplicate questions. I've considered all adjacent questions as a positive pair, plus the last and first caption. So, e.g. 5 duplicate questions results in 5 duplicate pairs. * Deduplified: No

--- language: - 英语 multilinguality: - 单语言 size_categories: - 1亿 < 样本数 < 10亿 task_categories: - 特征提取 - 句子相似度 pretty_name: WikiAnswers重复问句数据集 tags: - 句子变换器(Sentence Transformers) dataset_info: 配置名称: pair 特征: - 名称: anchor 数据类型: 字符串类型 - 名称: positive 数据类型: 字符串类型 拆分方式: - 名称: 训练集 字节数: 78825722188 样本数: 761379586 下载大小: 33891162136 数据集总大小: 78825722188 configs: - 配置名称: pair 数据文件: - 拆分: 训练集 路径: pair/train-* --- # WikiAnswers重复问句数据集卡片 本数据集源自[WikiAnswers语料库(WikiAnswers Corpus)](https://github.com/afader/oqa#wikianswers-corpus)中的重复问句,经标准化格式化后可直接用于句子变换器(Sentence Transformers)训练文本嵌入模型。 ## 数据集子集 ### `pair` 子集 * 列名:"anchor"、"positive" * 列数据类型:字符串类型、字符串类型 * 示例: python { 'anchor': '一小把草莓含有多少卡路里?', 'positive': '一根草莓味冰棒含有多少卡路里?', } * 数据集构建策略:从[嵌入训练数据集](https://huggingface.co/datasets/sentence-transformers/embedding-training-data)中读取WikiAnswers数据集,该数据集包含多组重复问句列表。本数据集将所有相邻的问句视为正样本对,同时将首尾问句也纳入配对范畴。例如,若存在5组重复问句,则生成5组重复样本对。 * 去重处理:否

提供机构:
sentence-transformers
原始信息汇总

WikiAnswers Duplicate Questions 数据集概述

基本信息

  • 语言: 英语
  • 多语言性: 单语种
  • 数据集大小: 100M<n<1B
  • 任务类别: 特征提取, 句子相似度
  • 标签: sentence-transformers

数据集详情

  • 配置名称: pair
  • 特征:
    • anchor: 字符串类型
    • positive: 字符串类型
  • 分割:
    • 训练集:
      • 字节数: 78825722188
      • 样本数: 761379586
  • 下载大小: 33891162136
  • 数据集大小: 78825722188

数据集子集

pair 子集

  • : "anchor", "positive"

  • 列类型: 字符串, 字符串

  • 示例: python { anchor: How many calories is in a handful of strawberries?, positive: How many calories are in a strawberry popsickles?, }

  • 收集策略: 从 embedding-training-data 读取 WikiAnswers 数据集,该数据集包含重复问题列表。将所有相邻问题视为正样本对,加上最后一个和第一个标题。例如,5个重复问题形成5个重复对。

  • 去重: 否

搜集汇总
数据集介绍
sentence-transformers/wikianswers-duplicates 数据集图片
构建方式
WikiAnswers Duplicates数据集源于WikiAnswers语料库,专门为句子嵌入模型的训练而构建。其构建策略聚焦于从原始语料中提取重复问题对,通过读取sentence-transformers/embedding-training-data数据集中的重复问题列表,将相邻问题视为正面对,并将首尾问题也配对,从而形成训练样本。例如,若一组包含5个重复问题,则生成5个正面对。该数据集以“pair”配置存储,包含“anchor”和“positive”两个字符串列,分别代表原始问题与语义等价的重复问题。
特点
该数据集规模庞大,训练集包含约7.61亿个样本,数据量达78.7GB,属于100M至1B量级的大规模语料。其特点在于专为句子相似度任务设计,聚焦于同义问题对,可直接用于训练Sentence Transformers模型以学习语义嵌入。数据以单语言英语呈现,未进行去重处理,保留了原始语料的多样性,有助于模型捕捉细微的语义等价关系。
使用方法
数据集通过HuggingFace Datasets库加载,使用load_dataset函数指定sentence-transformers/wikianswers-duplicates和pair配置即可获取训练数据。加载后,数据以字典形式提供,包含anchor和positive字段,可直接用于对比学习或三元组损失训练。用户可结合Sentence Transformers框架,将数据对作为输入,训练模型以将语义相似的问题映射到相近的嵌入空间,适用于特征提取或语义搜索等下游任务。
背景与挑战
背景概述
在自然语言处理领域,语义相似度计算与重复问题检测是信息检索和问答系统中的核心挑战。WikiAnswers Duplicate Questions数据集由sentence-transformers团队于近年创建,依托于WikiAnswers语料库,旨在为句子嵌入模型的训练提供高质量的语义等价对数据。该数据集包含超过7.6亿对重复问题,规模庞大,覆盖了日常问答中多样的表述变体,显著推动了语义匹配技术的进步。其主要研究人员来自HuggingFace社区,致力于弥合语义理解与向量表示之间的鸿沟,为特征提取和句子相似度任务提供了标准化基准,对嵌入模型在真实场景下的泛化能力产生了深远影响。
当前挑战
该数据集所解决的领域问题在于,传统问答系统难以识别表述不同但语义相同的问题,导致检索冗余与效率低下。构建过程中面临的挑战包括:首先,从WikiAnswers语料中提取重复问题对时,需处理噪声和歧义,例如拼写错误或语法差异可能掩盖真实语义等价关系;其次,数据规模超过7.6亿对,对存储和计算资源提出了极高要求,且未进行去重处理,可能引入冗余样本,影响模型训练效率与鲁棒性;此外,相邻问题对作为正样本的策略虽简化了标注流程,但可能遗漏非相邻的等价对,限制了数据覆盖的完备性。
常用场景
经典使用场景
在自然语言处理领域,语义等价性判别是众多下游任务的核心挑战之一。sentence-transformers/wikianswers-duplicates数据集专注于捕捉问句之间的语义相似性,其经典使用场景在于为句向量编码模型提供大规模、高质量的语义等价训练样本。通过将来自WikiAnswers语料库的重复问题组织成(anchor, positive)对形式,该数据集可直接用于训练Sentence Transformers架构下的孪生或三重网络,从而学习将语义相近的问句映射到嵌入空间中的邻近区域,最终实现精准的语义匹配与检索。
解决学术问题
该数据集有效回应了学术界在句子级语义表示学习中长期面临的标注数据稀缺与规模不足的困局。传统上,构建大规模语义等价标注数据需耗费大量人力,而WikiAnswers语料库天然蕴含了用户提出的重复问题,使得该数据集能够以低成本获取超过七亿对高质量正样本。这为研究无监督或弱监督的句向量学习、对比学习范式在文本匹配中的泛化能力,以及跨领域语义迁移的鲁棒性等核心学术问题提供了坚实的数据基础,推动了语义相似度建模的理论边界。
衍生相关工作
基于该数据集,研究者衍生出一系列经典工作,其中包括利用对比学习框架优化句向量分布的SimCSE及其变体,以及探索多任务联合训练以增强嵌入模型通用性的相关研究。此外,该数据集的构建范式还启发了诸如embedding-training-data系列数据集的生成,推动了大规模语义对齐数据的高效采集与标准化流程。这些工作不仅验证了WikiAnswers重复问题对在嵌入学习中的有效性,还进一步拓展了其在跨语言迁移、长文本匹配等复杂场景下的应用潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务