WebInstruct-verified
收藏资源简介:
WebInstruct-verified是一个大规模、高质量的数据集,包含约230,000个具有可验证答案的推理问题,涵盖广泛的学科领域。该数据集是通过从网络资源中精心爬取和过滤高质量的推理问题而构建的,这些资源基于WebInstruct数据集。数据集的内容包括多种答案格式,如选择题、数值表达式、矩阵等,涵盖了数学、物理、化学、金融、经济、历史、生物学等多个学科。数据集的创建过程包括数据爬取、问题提取、答案验证和元数据标注等步骤。WebInstruct-verified旨在解决现有推理模型在非数学领域适用性和鲁棒性不足的问题,为提高大型语言模型在多领域推理能力提供基础。
WebInstruct-verified is a large-scale, high-quality dataset containing approximately 230,000 reasoning questions with verifiable answers, spanning a wide range of academic disciplines. This dataset is constructed by carefully crawling and filtering high-quality reasoning questions from web resources based on the original WebInstruct dataset. It covers diverse answer formats including multiple-choice questions, numerical expressions, matrices and more, across multiple fields such as mathematics, physics, chemistry, finance, economics, history and biology. The dataset creation process includes steps such as data crawling, question extraction, answer verification and metadata annotation. WebInstruct-verified aims to address the insufficient applicability and robustness of existing reasoning models in non-mathematical domains, providing a foundational resource to improve the multi-domain reasoning capabilities of large language models.
General-Reasoner 数据集概述
数据集基本信息
- 名称: General-Reasoner
- 开发者: Xueguang Ma, Qian Liu, Dongfu Jiang, Ge Zhang, Zejun Ma, Wenhu Chen
- 机构: 滑铁卢大学, Vector Institute, TikTok新加坡, M-A-P
- 联系邮箱: x93ma@uwaterloo.ca, wenhuchen@uwaterloo.ca
- 论文链接: arXiv:2505.14652
数据集内容
- 规模: 230K 高质量推理问题
- 领域覆盖: 数学、物理、化学、金融、社会科学、人文科学等
- 数据来源: 从WebInstruct中筛选,原始数据来自StackExchange和教育门户网站
- 数据特点:
- 问题具有可验证的答案
- 答案类型多样
- 经过严格的质量过滤
数据构建流程
- 初始筛选: 从约500万条网络爬取指令中提取问题-答案对
- 质量保证: 仅保留具有明确人类编写答案的问题
- 可验证性筛选: 使用Gemini-1.5-Pro识别可验证问题
- 元数据标注: 使用Gemini-2.0-Flash标注答案类型和难度
- 平衡处理: 对简单数学问题进行降采样
- 最终过滤:
- 移除所有8个候选答案均失败的问题
- 移除所有8个答案均正确的简单问题
验证器
- 名称: General-Verifier
- 类型: 生成式模型验证器
- 参数量: 1.5B
- 基础模型: Qwen2.5-Math-1.5B
- 特点:
- 支持思维链验证
- 支持上下文感知
- 能够处理多样化的答案格式
性能表现
- 基准测试:
- MMLU-Pro: 58.9% (Qwen2.5-7B-Base)
- GPQA: 56.1% (Qwen3-14B)
- TheoremQA: 54.4% (Qwen3-14B)
- 比较优势:
- 超越基础模型和监督模型
- 在数学相关任务中表现优异
- 在多样化领域展现强大推理能力
引用格式
bibtex @article{general-reasoner, title={{G}eneral-{R}easoner: Advancing {LLM} Reasoning Across All Domains}, author={Xueguang Ma and Qian Liu and Dongfu Jiang and Ge Zhang and Zejun Ma and Wenhu Chen}, year={2025}, journal={arXiv:2505.14652}, url={https://arxiv.org/abs/2505.14652}, }

- 1General-Reasoner: Advancing LLM Reasoning Across All Domains滑铁卢大学 · 2025年



