How2Everything
收藏资源简介:
How2Everything是一个包含多个数据集的集合,用于评估和改进大型语言模型(LLMs)。How2Mine是一个多阶段管道,从网页文档中挖掘结构化程序(目标+资源+步骤),在约100万页面上运行后,生成了14个主题的351K个程序。How2Bench是一个7K示例的评估基准,涵盖了多个主题,并包含How2Score和How2Judge两个评估协议。How2Train是剩余的挖掘程序,用作强化学习的训练数据。
How2Everything is a collection of multiple datasets dedicated to evaluating and enhancing Large Language Models (LLMs). How2Mine is a multi-stage pipeline that mines structured programs (comprising objectives, resources, and steps) from web documents. After being applied to approximately 1 million web pages, it has produced 351,000 programs spanning 14 distinct topics. How2Bench is an evaluation benchmark containing 7,000 examples across diverse topics, and incorporates two evaluation protocols: How2Score and How2Judge. How2Train consists of the remaining mined program samples, which serve as training data for reinforcement learning tasks.
How2Everything 数据集概述
数据集简介
How2Everything 是一个用于评估和改进大型语言模型生成“如何做”类程序性文本能力的资源集合。它通过从网络挖掘真实操作流程,构建评估基准,并利用该信号训练更好的模型,形成了一个完整的实践闭环。
核心组件
1. How2Mine
- 描述:一个多阶段流水线,用于从网络文档中挖掘结构化的操作流程(目标 + 资源 + 步骤)。
- 规模:在约 100 万网页上运行,产生了涵盖 14 个主题的 351,000 个流程。
- 访问地址:https://huggingface.co/datasets/how2everything/how2mine
2. How2Bench
- 描述:一个包含 7,000 个示例的评估基准,在各个主题间保持平衡。
- 子组件:
- How2Score:一个使用 LLM 作为评判员的协议,用于检查生成的流程是否包含任何会阻碍目标达成的关键性失败。
- How2Judge:一个开源的 80 亿参数评判模型(从 GPT-5 蒸馏而来),与人类标注者的一致性达到 80.5%,支持低成本、可复现的评估。
- 访问地址:https://huggingface.co/datasets/how2everything/how2bench
3. How2Train
- 描述:剩余的被挖掘流程用作强化学习训练数据。使用 How2Score 作为奖励信号,可在 12 个标准基准上不出现性能倒退的情况下,将三个模型在 How2Bench 上的性能提升超过 10 个百分点。
- 访问地址:https://huggingface.co/datasets/how2everything/how2train
其他发布成果
1. How2Judge 模型
- 描述:开源的 80 亿参数评判模型。
- 访问地址:https://huggingface.co/how2everything/how2judge
2. 附带标注数据集
- WildChat labeled:由 OpenAI 查询类型分类器标注的 WildChat 数据。
- 访问地址:https://huggingface.co/datasets/how2everything/WildChat-4.8M
- lmsys-chat labeled:由 OpenAI 查询类型分类器标注的 lmsys-chat 数据。
- 访问地址:https://huggingface.co/datasets/how2everything/lmsys-chat-1m
相关资源
- 论文:https://arxiv.org/pdf/2602.08808
- 博客文章:https://allenai.org/blog/how2everything
- HuggingFace 集合:https://huggingface.co/collections/how2everything/how2everything
- 引用信息: bibtex @misc{chang2026how2everythingminingwebhowto, title={How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs}, author={Yapei Chang and Kyle Lo and Mohit Iyyer and Luca Soldaini}, year={2026}, eprint={2602.08808}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2602.08808}, }




