UnpredicTable数据集由网络表格格式化而成的少样本任务组成,旨在通过微调语言模型来提高其少样本学习性能。数据集包含从23,744个唯一网站中提取的413,299个任务。每个任务以JSON行文件表示,包含输入、选项、输出等字段。数据集支持多种任务,如多项选择、问答、表格问答、文本分类等。数据集的语言为英语,数据来源于WDC Web Table Corpus。由于数据是从网络抓取的,可能包含
**Overview** This hybrid synthetic dataset is designed to be used to fine-tune Large Language Models such as GPT, Mistral and OpenELM, and has been generated using our NLP/NLG technology and our auto