遇见数据集

rules

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

该数据集收集了来自公共GitHub仓库的自然语言LLM智能体规则文件,包括AGENTS.md、CLAUDE.md、.cursor/rules/*.mdc等文件类型,内容以文本形式内联存储。每个数据行对应一个规则文件,并固定到读取时的提交SHA,确保链接始终指向文件的确切字节。数据集包含约1万至10万条记录,适用于文本生成任务,特别是代码智能体规则的学习与生成。数据列包括:file(规则文件全文)、content_sha256(文件SHA-256哈希值)、path(源仓库内路径)、link(固定提交的永久链接)、repo(源仓库的owner/name格式)、stars(爬取时的仓库星标数)、crawled_time(文件爬取时间戳)。数据通过GitHub代码搜索API发现仓库,使用GraphQL固定提交,通过Git Trees API枚举文件树,并从raw.githubusercontent.com获取文件内容。每个文件遵循其源仓库的许可证,数据集整体无统一许可证。

This dataset collects natural language LLM agent rule files from public GitHub repositories, including file types such as AGENTS.md, CLAUDE.md, .cursor/rules/*.mdc, with content stored inline as text. Each data row corresponds to a rule file and is pinned to the commit SHA at the time of reading, ensuring that links always point to the exact bytes of the file. The dataset contains approximately 10,000 to 100,000 records and is suitable for text generation tasks, particularly for learning and generating code agent rules. Data columns include: file (full text of the rule file), content_sha256 (SHA-256 hash of the file), path (path within the source repository), link (permanent link to the fixed commit), repo (source repository in owner/name format), stars (number of repository stars at crawl time), crawled_time (timestamp of file crawling). Data is collected by discovering repositories via the GitHub code search API, using GraphQL to pin commits, enumerating file trees via the Git Trees API, and fetching file content from raw.githubusercontent.com. Each file follows the license of its source repository, and the dataset as a whole has no unified license.

创建时间:
2026-07-26
原始信息汇总

数据集:rules

该数据集包含了从公开GitHub仓库中爬取的自然语言LLM智能体规则文件(如AGENTS.mdCLAUDE.md.cursor/rules/*.mdc等),文件内容以内联形式存储。

基本信息

  • 语言:英语
  • 规模:10K < 样本数 < 100K
  • 任务类型:文本生成
  • 标签:代码、智能体、agents-md、cursor-rules、GitHub

数据列说明

列名 类型 描述
file 字符串 规则文件的完整文本内容
content_sha256 字符串 文件内容的SHA-256哈希值
path 字符串 源仓库中的文件路径
link 字符串 指向固定提交版本文件的永久链接
repo 字符串 源仓库的所有者/名称
stars 整数 爬取时源仓库的星标数
crawled_time 时间戳 文件被获取的时间

数据格式

  • 配置名称:default
  • 数据文件路径:data/*.parquet(训练集)

数据收集方式

  1. 通过GitHub Code Search API发现仓库
  2. 通过GraphQL固定到某个提交版本
  3. 使用Git Trees API枚举文件
  4. raw.githubusercontent.com获取该提交版本下的文件内容
  5. 过滤掉整个内容仅为指向其他文件的指针(如@AGENTS.md)的文件

许可说明

每个文件保留其原始仓库的许可协议,linkrepo字段标识了来源。整个数据集不适用单一许可协议。

使用示例

python from datasets import load_dataset ds = load_dataset("Andwwy/rules", split="train")

或通过DuckDB直接查询Parquet文件: sql INSTALL httpfs; LOAD httpfs; SELECT repo, path, stars FROM read_parquet(hf://datasets/Andwwy/rules/data/*.parquet) WHERE path ILIKE %AGENTS.md ORDER BY stars DESC LIMIT 20;

搜集汇总
数据集介绍
rules 数据集图片
构建方式
该数据集通过GitHub代码搜索API发现公共仓库,利用GraphQL将文件绑定至特定提交哈希,再借助Git Trees API枚举仓库中的规则文件,最终从raw.githubusercontent.com获取文件内容。若文件正文仅为指向其他文件的指针(如@AGENTS.md),则予以剔除。每条记录对应一个规则文件,确保数据来源的精确性与可追溯性。
特点
数据集聚焦于自然语言形式的大型语言模型代理规则文件,涵盖AGENTS.md、CLAUDE.md、.cursor/rules/*.mdc等类型。每条记录包含文件全文、SHA-256哈希、仓库路径、永久链接、源仓库名称及爬取时的星标数,时间戳记录获取时刻。文件始终遵循源仓库许可协议,整体数据集不适用单一许可证,体现了对原始版权的尊重。
使用方法
用户可通过HuggingFace datasets库直接加载数据集:datasets.load_dataset('Andwwy/rules', split='train')。此外,支持通过DuckDB直接查询Parquet文件而无需下载,例如使用SQL语句SELECT repo, path, stars FROM read_parquet('hf://datasets/Andwwy/rules/data/*.parquet'),便于高效筛选与分析。
背景与挑战
背景概述
在大语言模型与代码智能体迅猛发展的背景下,模型的行为引导与工具调用能力愈发依赖于显式的规则配置文件。2024年,由研究者及社区贡献者创建的‘rules’数据集应运而生,旨在系统化收集并公开GitHub仓库中的自然语言智能体规则文件(如AGENTS.md、CLAUDE.md及Cursor规则文件),为模型对齐与行为约束研究提供真实的原始语料支撑。该数据集由Andwwy等主导,通过整合多元仓库的规则文本,填补了结构化代码行为指令领域的资源空白,推动了大模型在自主编程助手、安全对齐及可解释性机制等方面的实证研究,成为相关社区广泛引用的基础性基准。
当前挑战
该数据集所涉领域面临的核心挑战包括:其一,如何从海量且异构的GitHub仓库中高效、精准地提取规则文件,并保证内容与提交版本的严格对应,避免版本混淆;其二,规则文件本身质量参差不齐,部分文件仅为指向其他文件的指针(如@AGENTS.md),需在构建时过滤以维护数据纯净性;其三,采集过程依赖公开API调用,受速率限制与搜索覆盖度影响,难以保证数据集的全局代表性;其四,各仓库许可证各异,在公开分发时需对每份文件的归属与使用边界做出明确标识,避免法律风险。
常用场景
经典使用场景
在大型语言模型与代码智能体迅猛发展的当下,自然语言指令文件(如AGENTS.md、CLAUDE.md)已成为指导模型行为、定义交互规则的关键载体。rules数据集通过系统爬取公开GitHub仓库中的这类规则文件,并以行内形式存储完整内容,为研究者提供了规模达数万条的结构化语料库。其最经典的使用场景聚焦于文本生成任务,尤其是面向代码智能体的指令微调与规则学习。每一行记录对应一个规则文件,并锚定至特定提交哈希,确保数据可追溯、可复现。研究者可利用该数据集训练语言模型理解并生成类似格式的规则文本,从而增强模型在代码协作、工具调用等场景下的行为一致性。数据集的高质量链接与星级信息,更支持对流行规则模式的统计分析与迁移学习。
实际应用
rules数据集在实际应用中展现出显著的多维价值。在软件开发领域,它赋能下一代代码智能体(如GitHub Copilot、Cursor)自动理解和遵循项目级规则文件,从而精准控制代码生成风格、接口调用规范及协作流程。技术团队可基于该数据集微调私有模型,使其在阅读仓库的AGENTS.md后自动适配团队编码约定。在自动化运维场景中,该数据集为构建通用规则解析引擎提供语料,支持跨仓库规则一致性检查与冲突检测。此外,数据集的星级字段允许企业聚焦于高流行度开源项目的实践经验,将社区最佳实践(如安全约束、错误处理范式)融入内部工具链。对于AI安全从业者,通过分析规则文件中隐含的约束语义,可设计出更精细的模型行为护栏,在代码审查、终端交互等高风险场景中降低误操作概率,实现从人工规则到智能合规的跨越。
衍生相关工作
rules数据集催生了多个方向的前沿探索。在数据层面,研究者基于其收集框架扩展出跨平台规则元数据集,引入GitLab、Bitbucket等生态,并联合Git提交历史构建时间维度的规则演化语料。在模型层面,衍生工作聚焦于规则感知的代码生成模型,例如通过对比学习将对规则文件的注意力权重注入Transformer层,实现上下文敏感的不动点约束。在评估标准上,该数据集被用于构建规则遵循基准(RuleBench),系统测试不同规模语言模型对多规则冲突、隐式继承等复杂场景的处理能力。此外,基于数据集中的链接和SHA指纹,学术界衍生出规则溯源图谱技术,可自动追踪同一条规则在不同仓库间的演化和传播路径,为开源协作中的规则复用与标准化提供数据驱动方法。这些工作共同将规则学习从静态语料消耗推向动态知识发现的前沿。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务