遇见数据集

MicPie/unpredictable_cluster28

收藏
Hugging Face2022-08-04 更新2024-03-04 收录
官方服务:

资源简介:

UnpredicTable数据集由互联网表格格式化而成,用于few-shot任务的训练,旨在通过微调语言模型来提高其在few-shot学习中的表现。数据集包含多种任务类型,如多项选择、问答、文本生成等。数据集为单语种(英语),包含大量任务,但每个任务的示例较少。数据集的主要用途是作为研究资源,探讨训练数据与few-shot学习之间的关系。

UnpredicTable is a dataset compiled from web-formatted tables, designed for training few-shot tasks with the goal of enhancing the few-shot learning performance of language models through fine-tuning. The dataset covers a wide range of task types, including multiple choice, question answering, text generation, and more. It is a monolingual (English-only) dataset that contains a large number of tasks, but only a small number of examples per task. Its primary application is as a research resource for investigating the relationship between training data and few-shot learning.

提供机构:
MicPie
原始信息汇总

数据集概述

名称: UnpredicTable-cluster28

语言: 英语

许可证: Apache-2.0

多语言性: 单语种

大小: 100K<n<1M

任务类别:

  • 多项选择
  • 问答
  • 零样本分类
  • 文本到文本生成
  • 表格问答
  • 文本生成
  • 文本分类
  • 表格分类

任务ID:

  • 多项选择QA
  • 抽取式QA
  • 开放域QA
  • 封闭域QA
  • 闭书QA
  • 开书QA
  • 语言建模
  • 多类分类
  • 自然语言推理
  • 主题分类
  • 多标签分类
  • 表格多类分类
  • 表格多标签分类

数据集结构

数据实例:

  • 每个任务表示为jsonline文件,包含几个few-shot示例。
  • 每个示例是一个字典,包含task, input, options, output等字段。
  • input字段包含表中同一行的几个列元素。
  • output字段是同一行的目标列元素。
  • 对于多选分类,options字段提供选择的可能类。

数据字段:

  • task: 任务标识符
  • input: 表中特定行的列元素
  • options: 多选分类的选择项
  • output: 与输入同一行的目标列元素
  • pageTitle: 包含表的页面的标题
  • outputColName: 输出列名
  • url: 包含表的网站的URL
  • wdcFile: WDC Web Table Corpus文件

数据分割:

  • 数据集未提供额外的数据分割。

数据集创建

来源数据:

  • 数据集从WDC Web Table Corpus 2015的英语关系子集中自动提取。
  • 原始数据包含50,820,165个表,来自323,160个网站域。

注释:

  • 仅对特定子集进行了手动注释以评估任务质量。

个人和敏感信息:

  • 数据集可能包含未过滤的个人身份或敏感信息。

使用数据集的考虑

社会影响:

  • 数据集用于研究训练数据与few-shot学习之间的关系,可能包含高质量和低质量数据,以及可能不真实或不适当的内容。

偏见讨论:

  • 数据集可能包含来自网络的毒性、种族主义、性别歧视等有害偏见和文本。

附加信息

数据集创建者:

  • Jun Shern Chan, Michael Pieler, Jonathan Jao, Jérémy Scheurer, Ethan Perez

许可证信息:

  • Apache 2.0
搜集汇总
数据集介绍
MicPie/unpredictable_cluster28 数据集图片
构建方式
在自然语言处理领域,少样本学习任务的构建往往依赖昂贵的人工标注,限制了训练数据的规模与多样性。为突破这一瓶颈,UnpredicTable-cluster28数据集从WDC Web Table Corpus 2015的英文关系子集中自动提取表格,经过系统化的表格到任务转换流程,生成了涵盖广泛主题的少样本任务。具体而言,该数据集基于聚类方法从大规模表格语料中筛选出特定子集,每个任务以JSON行格式存储,包含任务标识符、输入列元素、输出目标列以及可选的分类选项字段,从而将原始网页表格转化为结构化的少样本学习样本。
使用方法
使用UnpredicTable-cluster28数据集时,研究者可将其直接用于语言模型的少样本微调或预训练。每个任务由多个示例组成,可拼接为少样本提示供模型学习。数据集支持多种自然语言处理任务,包括文本生成、分类、问答等,用户可根据需求选择相应的任务子集。由于数据以JSON行格式存储,便于加载与处理,建议结合HuggingFace的datasets库进行高效调用。在实验设计中,可将该数据集与其它UnpredicTable子集结合使用,以系统评估训练数据对少样本学习性能的影响。
背景与挑战
背景概述
UnpredicTable-cluster28是UnpredicTable数据集的一个子集,由纽约大学研究人员Jun Shern Chan、Michael Pieler等人在2022年创建,旨在探索从互联网表格中自动提取少样本学习任务。该数据集源于对大规模多任务训练如何提升语言模型少样本学习能力的关注,传统上少样本数据集依赖昂贵的人工标注,限制了任务的规模与多样性。UnpredicTable从WDC Web Table Corpus 2015的5000万张表格中,通过自动化流程提取了超过41万项任务,覆盖了多选问答、文本分类、表格问答等广泛领域。这一资源为研究训练数据与少样本适应之间的关系提供了独特视角,推动了少样本学习领域向更自动化、更大规模的方向发展。
当前挑战
UnpredicTable-cluster28面临的核心挑战包括:首先,在领域问题层面,少样本学习任务本身存在数据稀疏性,每个任务仅有少量示例,导致模型难以从有限样本中泛化,且任务分布极广(涵盖数千种主题),增加了跨任务迁移的难度。其次,在构建过程中,从互联网表格自动转换任务时面临质量不可控的难题,表格内容可能包含不准确、不完整或有害信息,且缺乏人工验证,导致任务质量参差不齐。此外,数据来源的多样性引入了潜在的社会偏见和毒性文本,未经筛选的原始数据可能放大模型中的歧视性输出,如何平衡数据规模与质量成为关键瓶颈。
常用场景
经典使用场景
在自然语言处理与少样本学习的研究前沿,MicPie/unpredictable_cluster28数据集作为UnpredicTable系列中基于聚类划分的子集,承载了从海量互联网表格中自动提取的少样本任务。其经典使用场景聚焦于语言模型的少样本适应能力提升,通过将结构化表格数据转化为格式统一的问答、文本分类或多项选择任务,为模型提供丰富多样的训练范例。研究者可借助该数据集对预训练语言模型进行微调,使其在仅有少量标注样本的新任务上展现出卓越的泛化性能,从而验证少样本学习范式的有效性与可扩展性。
解决学术问题
该数据集的核心学术贡献在于破解了少样本学习研究中训练数据稀缺且人工标注成本高昂的困境。传统少样本数据集依赖专家精心构建,规模与多样性受限,难以系统探究训练数据特性与下游任务适应效果之间的因果关系。UnpredicTable系列通过自动化流程从互联网表格中提取数十万任务,cluster28子集则聚焦于特定聚类结构,使得研究者能够在大规模、多领域的数据支持下,严谨分析任务分布、数据质量与模型少样本表现之间的内在规律,为少样本学习的理论深化与算法优化提供了坚实的数据基石。
实际应用
在实际应用层面,该数据集为构建能够快速适应新领域的智能系统提供了关键支撑。例如,在电商产品分类、客户服务意图识别、医学文献信息抽取等场景中,模型往往面临标注数据匮乏的挑战。借助在UnpredicTable-cluster28上微调后的语言模型,开发者可仅凭少量领域内示例即可完成高效适配,显著降低数据准备成本与部署周期。此外,该数据集还可用于开发跨领域迁移的问答系统与个性化推荐引擎,推动少样本学习技术从实验室研究走向工业级落地。
数据集最近研究
最新研究方向
在自然语言处理领域,少样本学习(Few-shot Learning)一直是提升语言模型泛化能力的关键挑战。UnpredicTable-cluster28作为UnpredicTable数据集的子集,聚焦于从多样化网络表格中自动提取少样本任务,为少样本适应(Few-shot Adaptation)研究提供了全新视角。该数据集通过将互联网表格转化为分类、问答、文本生成等任务,突破了传统人工标注的规模与成本限制,使研究者能够探索训练数据多样性与下游任务适应效果之间的内在关联。当前前沿方向包括利用聚类子集(如cluster28)分析任务分布对模型少样本性能的差异化影响,以及结合零样本分类与表格问答等复杂任务评估跨域迁移能力。这一资源不仅推动了少样本学习向更真实、更广泛的场景延伸,也为理解数据质量与模型鲁棒性的平衡提供了实证基础,对构建更高效、更通用的预训练范式具有重要理论价值与实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务