遇见数据集

MicPie/unpredictable_cluster22

收藏
Hugging Face2022-08-04 更新2024-03-04 收录
官方服务:

资源简介:

UnpredicTable数据集由互联网表格格式化而成的少样本任务组成,旨在通过微调语言模型来提高其少样本学习性能。数据集包含多个版本,如UnpredicTable-full、UnpredicTable-unique、UnpredicTable-5k等,每个版本包含不同数量的任务和表格。数据集支持多种任务类别,如多项选择、问答、文本生成等。数据集的创建基于WDC Web Table Corpus 2015,并通过自动化流程将表格转换为少样本学习任务。数据集未进行人工标注,但部分子集进行了任务质量的人工评级。数据集可能包含敏感信息,使用时需谨慎。

The UnpredicTable dataset consists of few-shot tasks formatted from internet tables, aiming to improve the few-shot learning performance of language models via fine-tuning. The dataset includes multiple variants such as UnpredicTable-full, UnpredicTable-unique, UnpredicTable-5k, and others, with each variant containing a distinct number of tasks and tables. It supports a wide range of task categories including multiple choice, question answering, text generation, and more. The dataset is developed based on the WDC Web Table Corpus 2015, and converts tables into few-shot learning tasks through an automated pipeline. No manual annotation is performed for the entire dataset, but manual ratings of task quality are conducted for some subsets. Caution is advised when using the dataset, as it may contain sensitive information.

提供机构:
MicPie
原始信息汇总

数据集概述

数据集名称

  • 名称: UnpredicTable-cluster22
  • 别名: UnpredicTable

数据集描述

  • 概述: UnpredicTable 数据集包含从网页表格转换而来的少量样本任务,用于微调语言模型以提高其在少量样本学习(Few-shot Learning)中的表现。
  • 版本: 数据集有多个版本,包括 UnpredicTable-full, UnpredicTable-unique, UnpredicTable-5k 等,以及基于人类质量评级的子集和基于网站来源的子集。

语言

  • 主要语言: 英语

许可

  • 许可证: Apache 2.0

多语言性

  • 类型: 单语种

数据集大小

  • 规模: 100K<n<1M

任务类型

  • 支持的任务:
    • 多项选择
    • 问答
    • 零样本分类
    • 文本到文本生成
    • 表格问答
    • 文本生成
    • 文本分类
    • 表格分类

数据集结构

  • 数据实例: 每个任务以jsonline文件形式表示,包含多个少量样本示例。每个示例包括task, input, options, output等字段。
  • 数据字段: 包括task, input, options, output, pageTitle, title, outputColName, url, wdcFile等。
  • 数据分割: 数据集未提供额外的数据分割。

数据集创建

  • 来源数据: 数据源自WDC Web Table Corpus 2015的英语关系子集,包含50,820,165个表格。
  • 注释过程: 仅对特定子集进行了人工注释以评估任务质量。
  • 个人和敏感信息: 数据集可能包含未过滤的个人或敏感信息。

使用考虑

  • 社会影响: 数据集用于研究训练数据与少量样本学习之间的关系,不应用于决策关键或面向用户的场景。
  • 偏见讨论: 数据集可能包含有害偏见,未进行偏见分析。

附加信息

  • 数据集创建者: Jun Shern Chan, Michael Pieler, Jonathan Jao, Jérémy Scheurer, Ethan Perez
  • 引用信息: 请参考提供的引用信息。
搜集汇总
数据集介绍
MicPie/unpredictable_cluster22 数据集图片
背景与挑战
背景概述
该数据集是UnpredicTable的一个聚类子集(cluster22),包含从网页表格自动提取的1,903个少样本任务,用于语言模型的少样本学习微调。任务类型多样,涵盖多项选择、问答和零样本分类等,数据以英语为主,具有广泛的主题覆盖,但可能包含未过滤的偏见或有害内容,需在研究环境中谨慎使用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务