TIGER-Lab/WebInstructSub
收藏官方服务:
资源简介:
WebInstruct数据集是MAmmoTH2项目的一部分,主要用于通过指令调优提升大语言模型(LLM)的性能。该数据集主要来源于StackExchange和Socratic等论坛,包含高质量的问答对。数据集构建过程包括从Common Crawl中召回文档、提取问答对并进行质量优化。数据集包含多个字段,如原始问题、原始答案、优化后的问题和答案等。数据集的大小和来源也在README中进行了详细说明。
WebInstruct数据集是MAmmoTH2项目的一部分,主要用于通过指令调优提升大语言模型(LLM)的性能。该数据集主要来源于StackExchange和Socratic等论坛,包含高质量的问答对。数据集构建过程包括从Common Crawl中召回文档、提取问答对并进行质量优化。数据集包含多个字段,如原始问题、原始答案、优化后的问题和答案等。数据集的大小和来源也在README中进行了详细说明。
提供机构:
TIGER-Lab原始信息汇总
数据集概述
数据集名称
- WebInstruct
语言
- 英语(en)
许可证
- Apache-2.0
- CC BY-NC 4.0(仅适用于来自Socratic的数据)
大小分类
- 1M<n<10M
任务分类
- 问答(question-answering)
数据集特征
- orig_question (字符串)
- orig_answer (字符串)
- question (字符串)
- answer (字符串)
- source (字符串)
- index (整数64位)
数据集拆分
- train
- 数据大小: 6215888891 字节
- 示例数量: 2335220
- 下载大小: 3509803840 字节
数据来源
- MathStackExchange
- ScienceStackExchange
- Socratic
数据集构建
- 数据集通过从Common Crawl中召回文档,提取Q-A对,并对其进行质量精炼的三步流程构建。
- 总共产生了1000万个指令-响应对。
数据集用途
- 用于提升大型语言模型(LLM)通过指令调优的性能。
搜集汇总
数据集介绍
构建方式
WebInstructSub 数据集源自大规模网络语料库,其构建遵循一种系统化的三阶段流水线。首先,研究团队从 Common Crawl 中检索涵盖数学与科学等多领域的网页文档;随后,基于启发式规则与语言模型从这些文档中提取原始的问答对;最后,通过精细化处理与质量筛选,将原始问答对转化为更符合指令微调需求的高质量格式。该子集主要聚焦于 StackExchange 系列论坛(如数学、物理、化学、生物学及计算机科学)与 Socratic 平台,最终汇聚了约 233 万条精心提炼的指令-响应样本。
使用方法
WebInstructSub 以 HuggingFace Datasets 格式发布,用户可通过加载 'TIGER-Lab/WebInstructSub' 直接使用。数据集仅包含训练集,字段包括 'orig_question'、'orig_answer'、'question'、'answer'、'source' 与 'index'。在指令微调场景中,推荐使用精炼后的 'question' 与 'answer' 字段作为输入-输出对。用户可根据需求按 'source' 字段筛选特定领域的子集,或结合原始问答进行对比实验。该数据集采用 Apache-2.0 与 CC BY-NC 4.0 混合许可,非商业用途需注意 Socratic 数据的限制。
背景与挑战
背景概述
WebInstructSub数据集由TIGER-AI-Lab团队于2024年创建,旨在解决大语言模型(LLM)指令微调中高质量监督数据的稀缺问题。该数据集源自MAmmoTH2项目,核心研究问题在于如何从海量网络语料中自动挖掘并构建高质量的指令-回答对,以提升LLM的推理与泛化能力。通过从Common Crawl中提取StackExchange、MathStackExchange及Socratic等论坛的问答内容,并经精细清洗与优化,最终形成包含约233万个样本的子集。该数据集在NeurIPS 2024发表,为指令微调领域提供了一种可扩展的数据构建范式,显著推动了LLM在数学、科学及人文等多学科任务上的性能提升。
当前挑战
WebInstructSub所解决的领域问题在于指令微调数据的高成本人工标注与领域覆盖不足。现有数据集多依赖人工编写或有限来源,难以兼顾规模与多样性。构建过程中面临的挑战包括:从非结构化网络文本中准确识别并提取问答对,尤其需处理论坛中多轮对话、非标准格式及噪声内容;设计有效的过滤与精炼策略以剔除低质量或重复样本;确保跨领域(如数学、物理、化学)数据的均衡性与代表性,避免模型偏见;同时需遵守不同来源的许可证约束(如Apache-2.0与CC BY-NC 4.0),平衡数据开放性与合规性。
常用场景
经典使用场景
WebInstructSub数据集最经典的使用场景在于为大语言模型提供高质量、多领域的指令微调数据。该数据集从数学、物理、生物、化学及计算机科学等学科的网络论坛与教育平台中提取并精炼出问答对,旨在增强模型在科学推理与数学问题求解方面的能力。研究者常将其作为指令微调的核心语料,以提升模型对复杂结构化问题的理解与生成能力,尤其适用于需要严谨逻辑推导与多步计算的任务场景。
解决学术问题
该数据集有效解决了学术研究中大语言模型在科学领域指令微调数据匮乏与质量参差不齐的问题。传统数据集多依赖人工标注或有限来源,难以覆盖广泛学科且成本高昂。WebInstructSub通过自动化流水线从海量网络文本中挖掘并精炼指令数据,显著降低了数据构建门槛,推动了模型在数学推理、科学问答等任务上的性能突破。其意义在于验证了网络语料作为大规模指令数据来源的可行性与高效性,为后续研究提供了可复现的范式。
实际应用
在实际应用中,WebInstructSub数据集被广泛用于开发具备强大学科知识问答能力的智能助手与教育工具。例如,基于该数据微调的模型可辅助学生解答数学难题、解释物理现象或梳理化学方程式,在在线教育平台中充当个性化导师角色。此外,其数据也可用于构建科学文献摘要系统或技术文档问答引擎,提升知识检索与信息整合的自动化水平,助力科研与教育领域的数字化转型。
数据集最近研究
最新研究方向
WebInstructSub数据集聚焦于从网络语料中规模化提取高质量指令数据以增强大语言模型(LLM)的指令微调能力,其最新研究方向关联到MAmmoTH2项目中提出的“从网络扩展指令”范式。该数据集通过从Common Crawl等大规模网页资源中,经三阶段流水线(文档召回、问答对提取、质量精炼)自动构建了超过230万条覆盖数学、物理、生物、化学及计算机科学等多学科的高质量问答对,显著降低了传统人工标注成本。这一工作呼应了当前LLM领域对数据规模与质量平衡的迫切需求,尤其在提升模型在科学推理和复杂问答任务上的泛化性能方面具有里程碑意义。WebInstructSub的发布不仅为指令微调提供了可扩展的替代方案,还推动了开源社区对网络数据挖掘技术的探索,对实现更通用、更高效的AI模型训练具有深远影响。
以上内容由遇见数据集搜集并总结生成



