遇见数据集

openclaw-classification-dataset

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

OpenClaw GitHub兴趣分类数据集是一个专门用于改进OpenClaw平台GitHub拉取请求(PR)和问题(issue)自动分类的小型、可维护数据集。该数据集与通知器运行时分离设计,支持本地编辑、源代码版本控制,并可托管为Hugging Face数据集仓库。数据集的核心是seed.jsonl文件,其中包含标注的GitHub项目实例,每个实例采用JSON格式,包含项目ID、仓库名称、项目类型(github_pr或github_issue)、编号、URL、标题、状态、作者、标签、正文内容、评论、变更文件数量、变更文件列表、差异对比等详细字段。数据集定义了两种关键标注:topics_of_interest表示适用于该PR或issue的有效主题标签(多标签分类),keywords则是解释这些主题适用的具体关键词短语。数据集明确排除了通知路由、编辑兴趣和标注工作流等策略性字段,专注于主题分类任务。数据集还包含主题分类体系文件(topic_keywords.json)、行数据模式定义(row.schema.json)、回归测试集(regression-set.json)以及完整的验证、评估和上下文更新脚本。该数据集适用于多标签文本分类任务,特别是GitHub项目内容的主题自动识别和分类,可用于构建智能通知路由系统的分类器训练和评估。

The OpenClaw GitHub Interest Classification Dataset is a small, maintainable dataset specifically designed to improve automatic classification of GitHub pull requests (PRs) and issues on the OpenClaw platform. It is decoupled from the notifier runtime, supports local editing, source code version control, and can be hosted as a Hugging Face dataset repository. The core of the dataset is the seed.jsonl file, which contains annotated GitHub project instances, each in JSON format with detailed fields such as project ID, repository name, project type (github_pr or github_issue), number, URL, title, status, author, labels, body content, comments, number of changed files, list of changed files, and diff comparisons. The dataset defines two key annotations: topics_of_interest indicates valid topic labels applicable to the PR or issue (multi-label classification), and keywords are specific keyword phrases that explain why these topics apply. It explicitly excludes strategic fields like notification routing, editorial interest, and annotation workflows, focusing on topic classification tasks. The dataset also includes a topic taxonomy file (topic_keywords.json), a row schema definition (row.schema.json), a regression test set (regression-set.json), and comprehensive scripts for validation, evaluation, and context updates. This dataset is suitable for multi-label text classification tasks, particularly for automatic topic identification and classification of GitHub project content, and can be used to train and evaluate classifiers for intelligent notification routing systems.

创建时间:
2026-05-21
原始信息汇总

数据集概述:OpenClaw GitHub Interest Classification Dataset

该数据集用于改进 OpenClaw 项目的 GitHub PR 和 Issue 分类,专注于多标签文本分类任务。

  • 许可证:MIT
  • 任务类型:文本分类(多标签分类)
  • 语言:英文
  • 标签:github, openclaw, multi-label-classification, notification-routing
  • Hugging Face 地址:https://huggingface.co/datasets/dutifuldev/openclaw-classification-dataset

核心内容

数据集主要标记两类信息:

  • topics_of_interest:针对 PR 或 Issue 的有效主题标签。
  • keywords:解释为何应用这些主题标签的灵活短语。

文件结构

数据集包含以下核心文件:

  • seed.jsonl:主要数据集文件,包含标记好的示例。
  • row.schema.json:JSONL 行数据的 JSON Schema。
  • topic_keywords.json:有效的主题分类和关键字提示。
  • validate.mjs:本地验证脚本(无需外部包)。
  • regression-set.json:用于快速回归检查的小型固定集。
  • eval.mjs:本地分类器评估脚本。
  • hydrate.mjs:用于重新获取 GitHub 正文、评论、变更文件和差异的脚本。
  • prompts/:包含所有提示快照、候选提示和提示相关工件的规范文件夹,内附 README 文件说明。

数据行格式

数据集中的每一行(seed.jsonl)是一个 JSON 对象,包含以下字段(示例):

  • id: 唯一标识符(例如 "openclaw-openclaw-77053"
  • repo: 仓库名称(例如 "openclaw/openclaw"
  • item_type: 项目类型(例如 "github_pr"
  • number: 编号(例如 77053
  • url: GitHub 链接(例如 https://github.com/openclaw/openclaw/pull/77053
  • title: 标题(例如 "feat(lmstudio): opt-in idle TTL via native load API"
  • state: 状态(例如 "MERGED"
  • author: 作者(例如 "example-user"
  • labels: 标签列表(例如 []
  • body: 正文内容
  • comments: 评论列表
  • changed_file_count: 变更文件数量
  • changed_files: 变更文件路径列表
  • diff: 差异内容
  • context_caveats: 上下文注意事项列表
  • keywords: 关键字列表(例如 ["lmstudio", "idle ttl", "native load api", "vram"]
  • topics_of_interest: 感兴趣的主题列表(例如 ["local_models", "config"]

维护流程

  1. seed.jsonl 中添加或编辑行。
  2. 使用 keywords 字段存储解释标签的具体短语。
  3. 优先为常见误报情况添加明确的负面示例。
  4. 在将新主题用于 seed.jsonl 之前,先在 topic_keywords.json 中添加该主题。
  5. 运行验证脚本:node /home/bob/oc/openclaw-classification-dataset/validate.mjs
  6. 运行快速回归检查:node /home/bob/oc/openclaw-classification-dataset/eval.mjs --sample regression --output /tmp/openclaw-classifier-regression.json
  7. 运行分层样本评估:node /home/bob/oc/openclaw-classification-dataset/eval.mjs --sample stratified --limit 80 --output /tmp/openclaw-classifier-sample.json
  8. 评估脚本会报告主题精确匹配、微观精确率、微观召回率、微观 F1、最弱主题和最大遗漏项。
  9. 如需刷新 GitHub 上下文字段,运行:node /home/bob/oc/openclaw-classification-dataset/hydrate.mjs

使用方式

数据集 JSONL 文件可直接用于 load_dataset("json", data_files="seed.jsonl")

此外,数据集中还发布了提示来源,相关文件包括:

  • prompts/README.md
  • prompts/localpager-openclaw-routing-v8-production.prompt.md
  • prompts/2026-05-30-ds4-runtime-template-placeholder.md
  • prompts/2026-05-30-ds4-runtime-rendered-row-0001.md
  • prompts/2026-05-30-ds4-runtime-rendered-prompts.jsonl
  • scripts/generate_deepseek_localagent_dataset.mjs

运行时模板快照通过运行 scripts/generate_deepseek_localagent_dataset.mjs 生成,用于展示生成器实际发出的提示形状。

搜集汇总
数据集介绍
openclaw-classification-dataset 数据集图片
构建方式
OpenClaw分类数据集专为GitHub议题与拉取请求的文本分类任务而设计,旨在提升OpenClaw项目的通知路由精度。该数据集以seed.jsonl为主要载体,每一行采用JSON格式,存储了包括仓库名、条目类型、编号、标题、状态、作者、标签、正文、评论、变更文件统计、差异内容、关键词以及兴趣主题在内的结构化信息。构建时严格遵循维护工作流:用户可手动编辑或新增数据行,通过keywords字段提供解释标签的具体短语,并优先添加显式负例以抑制常见误报。所有使用的主题须先在topic_keywords.json中注册,再于seed.jsonl中引用,确保分类体系的一致性与可扩展性。数据集配备本地校验脚本validate.mjs及评估脚本eval.mjs,支持快速回归测试与分层抽样评估,同时通过hydrate.mjs从GitHub API拉取最新的上下文信息,实现数据集的动态更新与维护。
特点
该数据集的核心特点在于其轻量级、可维护性与明确的边界定义。它仅关注topics_of_interest和keywords两个标签集,不存储通知路由、编辑兴趣或注释工作流等策略决策字段,从而保持数据集的纯净与专注。数据集配备了详尽的辅助文件,包括JSON模式定义row.schema.json、主题关键词映射topic_keywords.json、固定回归测试集regression-set.json以及多个评估与维护脚本,形成了完整的工具链。此外,数据集还发布了prompts目录,保存了运行时提示模板的快照与渲染后的提示数据,为模型推理提供透明的可追溯性。数据集的构建鼓励显式负例的加入,有效提升分类器在常见混淆场景下的鲁棒性,而其与运行时代码的分离设计使得数据集可以在本地进行版本控制并独立审阅。
使用方法
使用该数据集时,可直接通过Hugging Face的load_dataset函数加载seed.jsonl文件,例如load_dataset("json", data_files="seed.jsonl")。开发者可运行validate.mjs进行数据格式校验,确保每一行符合schema定义。分类模型的训练与评估可通过eval.mjs脚本执行,支持--sample参数选择回归集或分层抽样,并输出包括主题精确匹配、微观精度、召回率、F1分数及最弱主题在内的详细指标。若要更新GitHub上下文字段,可运行hydrate.mjs从远程仓库拉取最新正文、评论、变更文件及差异内容。提示模板相关的生成脚本scripts/generate_deepseek_localagent_dataset.mjs可用于生成运行时的实际提示形状,便于开发者在不启动完整系统的情况下进行离线验证与调试。
背景与挑战
背景概述
OpenClaw Classification Dataset是一个面向GitHub平台Pull Request与Issue多标签文本分类任务的专业数据集,由dutifuldev团队于近年创建并维护于HuggingFace平台。该数据集旨在解决开源项目管理中通知路由与编辑兴趣判断的自动化难题,通过定义清晰的标签体系(如topics_of_interest和keywords),为分类器训练提供高质量的种子样本。其核心研究问题聚焦于如何利用结构化上下文(包括代码变更、评论及差异内容)精准推断开发者关注的技术主题,从而降低大型开源仓库(如OpenClaw)中人工分流通知的认知负载。该数据集通过独立于运行时环境的维护机制,支持本地编辑与版本控制审计,开创了将标注数据、验证脚本与提示模板整合为可溯源数据集的范式,对开源协作效率提升与LLM驱动的代码库智能体研究具有显著启发性。
当前挑战
该数据集所应对的核心领域挑战在于多标签文本分类在代码审查场景中的细粒度与歧义性——同一Pull Request可能同时涉及多个技术主题(如本地模型配置与资源管理),且开发者使用的非正式语言(如缺失代码片段或上下文)增加了标签准确判别的难度。构建过程中面临的具体挑战包括:1) 负面样本的稀缺性导致分类器易产生假阳性,需刻意构造显式否定样例;2) GitHub数据字段(如diff、评论)的异构性和实时更新要求持续的水化(hydrate)流程以保持数据时效性;3) 提示工程(prompt engineering)的版本迭代需同步更新数据集模板,避免运行时与标注逻辑的脱节;4) 验证与评估工具(如validate.mjs和eval.mjs)需跨平台兼容且零外部依赖,以确保社区贡献的低门槛与可复现性。
常用场景
经典使用场景
在开源协作与软件工程交叉的研究领域,准确理解GitHub上的Pull Request和Issue内容对于自动化工作流至关重要。OpenClaw分类数据集专为多标签文本分类任务而设计,其核心使用场景在于训练能够识别开发者兴趣主题的智能分类器。该数据集提供了结构化的GitHub问题与PR样本,每条记录包含标题、正文、评论、变更文件及差异代码等丰富上下文,配合精心定义的主题标签体系(如local_models、config等)与关键词解释,使得机器学习模型能够从异构的代码协作信息中提炼出开发者真正关注的技术领域。研究者可借助该数据集构建高效的主题预测模型,从而实现GitHub通知的智能过滤与路由,将大量冗余的代码审查请求精准分发给感兴趣的相关人员。
衍生相关工作
围绕OpenClaw分类数据集,衍生了一系列与之配套的工具与研究工作,形成了完整的机器学习运维生态。数据集中包含了种子样本、主题关键词词典以及验证与评估脚本,为快速搭建分类基准提供了标准框架。基于此,研究者开发了局部分类器(localpager-openclaw-routing)来演示通知路由的具体实现,并发布了包含提示工程快照的运行时模板,用于探索大语言模型在代码协作场景中的少样本学习能力。此外,还提供了Hydrate工具用于从GitHub刷新实时上下文字段(如正文、评论与差异代码),使得数据集能够动态扩展并适配最新的项目状态。这些衍生工作共同构成了一个从数据标注、模型训练到生产部署的完整闭环,为软件工程中智能协作系统的实际落地提供了可复用的参考蓝本。
数据集最近研究
最新研究方向
当前,面向开源协作的智能通知路由与议题分类正成为开发者工具链的前沿攻坚领域。OpenClaw分类数据集聚焦GitHub拉取请求与议题的多标签文本分类任务,通过精细标注主题标签与关键词解释,为社区驱动的分类器迭代提供了可复现的基准语料。其设计深度契合开源维护中对高噪声通知的精准过滤需求,在LMStudio等插件场景下测试空闲TTL等策略时,展现了本地模型与配置管理等多个维度的交叉判别能力。该数据集不仅强化了OpenClaw生态的自动化运维,更通过明确的负面样本策略与回归检验机制,为分布式版本协作中分类器的长尾鲁棒性奠定了基础,是开源智能化发展中的重要实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务