遇见数据集

zhiminy/EvalEng

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

EvalEng数据集是从57个机器学习评估工具中收集的GitHub问题,并标注了工作流阶段、根本原因和评估策略标签。

--- 数据集名称: EvalEng 语言: - 英语 许可证: MIT协议 任务类别: - 文本分类 - Token分类(Token Classification) - 摘要生成 任务子类: - 多分类 - 多标签分类 标签: - 软件工程 - 评估测试套件(evaluation harness) - GitHub议题 - 议题分类 - 实证软件工程 - 大语言模型评估(LLM evaluation) - 基准工程 - MLOps - 数据集挖掘 - 文本数据 - 表格数据 - arXiv预印本编号:2605.24213 数据规模: - 10000 < 样本量 < 100000 标注者类型: - 机器生成标注 - 专家生成标注 源数据集: - 原生数据集 项目主页: https://github.com/zhimin-z/EvalEng PapersWithCode ID: 无 数据集信息: 特征: - 字段名: harness_name 数据类型: 字符串 - 字段名: github_repo 数据类型: 字符串 - 字段名: issue_title 数据类型: 字符串 - 字段名: issue_body 数据类型: 字符串 - 字段名: issue_url 数据类型: 字符串 - 字段名: issue_created_at 数据类型: int64 - 字段名: issue_closed_at 数据类型: int64 - 字段名: is_related 数据类型: float64 - 字段名: stage 数据类型: float64 - 字段名: step 数据类型: 字符串 - 字段名: strategy 数据类型: float64 - 字段名: root_cause_label 数据类型: 字符串 - 字段名: issue_comments 数据类型: 字符串序列 - 字段名: issue_labels 数据类型: 字符串序列 - 字段名: issue_cross_referenced 数据类型: 字符串序列 配置: - 配置名称: default 数据文件: - 拆分集: train 路径: train.jsonl 数据集查看器: 启用 --- # EvalEng 数据集 本数据集收集自57个机器学习评估测试套件(evaluation harness)的GitHub议题,已标注工作流阶段、根本原因及评估策略标签。 ## 数据集详情 - **论文**:《迈向评估工程》(https://arxiv.org/abs/2605.24213) - **代码仓库**:https://github.com/zhimin-z/EvalEng - **许可证**:MIT协议 ## 字段说明 | 字段名 | 数据类型 | 字段描述 | |-------|---------|----------| | `harness_name` | 字符串 | 机器学习评估测试套件名称 | | `github_repo` | 字符串 | GitHub仓库(格式为`所有者/仓库名`) | | `issue_title` | 字符串 | 议题标题 | | `issue_body` | 字符串 | 议题正文文本 | | `issue_url` | 字符串 | GitHub议题直接访问链接 | | `issue_created_at` | int64 | 议题创建时间戳(距纪元的毫秒数) | | `issue_closed_at` | int64 | 议题关闭时间戳(距纪元的毫秒数) | | `is_related` | float64 | 议题与评估的相关性标记(1.0代表相关) | | `stage` | float64 | 工作流阶段数值标签 | | `step` | 字符串 | 工作流步骤标签 | | `strategy` | float64 | 评估策略数值标签 | | `root_cause_label` | 字符串 | 根本原因分类标签 | | `issue_comments` | 列表[string] | 议题评论文本列表 | | `issue_labels` | 列表[string] | 议题附带的GitHub标签列表 | | `issue_cross_referenced` | 列表[string] | 交叉引用的议题/拉取请求链接列表 | ## 引用格式 bibtex @article{zhao2025evaleng, title={Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild}, author={Zhimin Zhao and Zehao Wang and Abdul Ali Bangash and Bram Adams and Ahmed E. Hassan}, year={2026}, eprint={2605.24213}, archivePrefix={arXiv}, primaryClass={cs.SE}, url={https://arxiv.org/abs/2605.24213}, }

提供机构:
zhiminy
二维码
社区交流群
二维码
科研交流群
商业服务