agent-reliability-corpus
收藏资源简介:
该数据集包含四个主要配置:1) cross_links:包含节点关联数据,字段包括node_id、corpus_id、external_id、相似度分数和方法;2) frameworks:记录软件框架信息,包含slug标识、代码库地址、显示名称和主页链接;3) issues:详细的issue跟踪数据集,包含框架标识、issue编号、标题、正文、URL、标签、状态、PR标记、时间戳(创建/更新/关闭)、评论数,以及问题定位、阶段、症状、根本原因等分类字段,还包括分类器元数据和置信度评分;4) taxonomy:分类体系定义数据,包含分类轴心、标签名称、定义文本和来源引用。数据集规模方面,frameworks包含12个样本,issues包含677个样本,taxonomy包含28个分类条目,cross_links当前示例数为0。该数据集特别适用于软件工程研究、issue分类系统开发、框架元数据分析等应用场景。
This dataset includes four main configurations: 1) cross_links: contains node association data with fields such as node_id, corpus_id, external_id, similarity scores, and methods; 2) frameworks: records software framework information, including slug identifiers, repository URLs, display names, and homepage links; 3) issues: a detailed issue tracking dataset with fields like framework identifier, issue number, title, body, URL, labels, status, PR flags, timestamps (created/updated/closed), comment counts, and classification fields for problem location, stage, symptoms, root causes, along with classifier metadata and confidence scores; 4) taxonomy: defines a classification system with fields for classification axes, label names, definition texts, and source citations. In terms of scale, frameworks contain 12 samples, issues contain 677 samples, taxonomy has 28 classification entries, and cross_links currently has 0 examples. This dataset is particularly suitable for software engineering research, issue classification system development, framework metadata analysis, and other application scenarios.
根据您提供的README文件内容,以下是该数据集(agent-reliability-corpus)的详细总结:
数据集概述
该数据集包含四个主要配置(configs),每个配置代表一个独立的数据子集,用于不同的研究或分析目的。
1. cross_links(交叉链接)
- 特征字段:node_id、corpus_id、external_id、similarity、method
- 数据规模:训练集包含0个样本(数据量为0字节)
- 用途:可能用于存储不同实体或文档之间的相似度链接关系及计算方法。
2. frameworks(框架)
- 特征字段:slug、repo、display_name、homepage
- 数据规模:训练集包含12个样本,数据量1147字节
- 用途:记录了不同框架的基本信息,包括名称、仓库地址、显示名称和主页链接。
3. issues(问题/议题)
- 特征字段:包括问题编号、标题、正文、URL、标签、状态、是否为拉取请求、创建/更新/关闭时间、评论数,以及分类信息(locus、phase、symptom、root_cause、confidence、reasoning)和分类器元数据(classifier_tier、classifier_model、classifier_version、classified_at、needs_review)
- 数据规模:训练集包含677个样本,数据量2.8MB
- 用途:较大规模子集,用于存储和分类软件项目中的问题或议题,每个问题附带详细的分类标签和置信度评估。
4. taxonomy(分类体系)
- 特征字段:axis、label、definition、derived_from
- 数据规模:训练集包含28个样本,数据量4041字节
- 用途:定义了分类体系的维度、标签及其定义,并记录每个标签的派生来源。
数据文件结构
所有配置均采用单一训练集分割(train),数据文件以Parquet格式存储,路径模式为 {config_name}/train-*,支持按配置名称加载。
数据总量
| 配置名称 | 样本数 | 数据量 |
|---|---|---|
| cross_links | 0 | 0 |
| frameworks | 12 | 1.1 KB |
| issues | 677 | 2.8 MB |
| taxonomy | 28 | 4.0 KB |
| 总计 | 717 | 约2.8 MB |




