Act-ONOMY
收藏资源简介:
Act-onomy是一个用于LLM智能体行为分析的行为描述语料库及分类法数据集,旨在支持相关实证研究。该数据集包含两个核心部分:语料库和分类法。语料库部分包含从28篇源论文(P1-P35,其中7篇为保留论文)中提取的664个构建集行为描述句子,每个句子均标注了发现-判断建议代码、最终代码书纳入标志以及匿名人工验证者标识。此外,还提供了一个涵盖全部35篇论文的索引文件以及一个独立的116句保留验证集。分类法部分提供了最终确定的v1.0版分类法,采用三层结构:10个行动(Actions)、46个子行动(Subactions)和120个实例(Instances)。该分类法以人工验证的代码书(包含证据和评审者归属信息)、扁平分类表(包含稳定代码和定义)以及嵌套JSON树的形式提供。语料库和分类法通过paper_id和taxonomy_code两个连接键进行关联。数据集适用于文本分类任务,特别是智能体行为分类、定性分析和分类法构建等应用场景。数据集发布遵循CC BY 4.0许可协议,原始句子在合理使用原则下使用并保留了来源归属。
Act-onomy is a corpus and taxonomy dataset for LLM agent behavior analysis, designed to support relevant empirical research. This dataset comprises two core components: the corpus and the taxonomy. The corpus section contains 664 behavioral description sentences extracted from 28 source papers (P1-P35, 7 of which are held-out papers). Each sentence is annotated with discovery-judgment suggestion codes, flags for inclusion in the finalized codebook, and anonymous human validator identifiers. Additionally, an index file covering all 35 papers and an independent 116-sentence held-out validation set are provided. The taxonomy section provides the finalized version 1.0 taxonomy, which adopts a three-tier structure: 10 Actions, 46 Subactions, and 120 Instances. This taxonomy is available in three formats: a human-validated codebook containing evidence and reviewer attribution information, a flat taxonomy table with stable codes and their definitions, and a nested JSON tree. The corpus and taxonomy are linked via two shared keys: paper_id and taxonomy_code. This dataset is applicable to text classification tasks, especially scenarios including agent behavior classification, qualitative analysis, and taxonomy construction. The dataset is released under the CC BY 4.0 license, and the original sentences are used under the fair use principle with their source attribution preserved.
数据集概述:Act-onomy Behavior-Description Corpus and Taxonomy
- 数据集名称:Act-onomy Behavior-Description Corpus and Taxonomy
- 许可协议:Creative Commons Attribution 4.0 International (CC BY 4.0)
- 语言:英语
- 数据集大小:小于 1K 样本
- 任务类别:文本分类
- 标签:agent-behavior, taxonomy, codebook, qualitative-analysis, llm-agents
数据集构成
该数据集包含两个主要部分:
-
语料库 (Corpus):
- 包含 664 条从 28 篇源论文中提取的行为描述句子(另有 7 篇保留论文用于验证)。
- 每条句子均标注了 Discovery-Judge 建议的代码、最终编码手册包含标志以及匿名的人工验证者信息。
- 包括一份覆盖全部 35 篇论文的论文索引,以及一个独立的 116 句保留验证集。
-
分类体系 (Taxonomy):
- 最终版本 v1.0 分类体系结构:10 个行动 (Actions) → 46 个子行动 (Subactions) → 120 个实例 (Instances)。
- 提供人工验证的编码手册(包含证据和审核者归属)、扁平化的分类表(包含稳定代码和定义)以及嵌套的 JSON 树。
子集配置与文件
| 配置名称 | 数据文件路径 | 说明 |
|---|---|---|
behavioral_descriptions |
corpus/behavioral_descriptions.csv |
行为描述训练集(664 条句子) |
behavioral_descriptions_validation |
corpus/behavioral_descriptions_validation.csv |
行为描述验证集(116 条句子) |
papers |
corpus/papers.csv |
论文索引文件 |
codebook |
taxonomy/act-onomy_codebook.csv |
编码手册文件 |
taxonomy |
taxonomy/act-onomy_taxonomy.csv |
分类表文件 |
数据关联键
paper_id:连接papers.csv与behavioral_descriptions.csv。taxonomy_code:连接act-onomy_codebook.csv与act-onomy_taxonomy.csv。
快速加载示例
python from datasets import load_dataset
corpus = load_dataset("anonymous5999/Act-ONOMY", name="behavioral_descriptions", split="train") validation = load_dataset("anonymous5999/Act-ONOMY", name="behavioral_descriptions_validation", split="train") papers = load_dataset("anonymous5999/Act-ONOMY", name="papers", split="train") codebook = load_dataset("anonymous5999/Act-ONOMY", name="codebook", split="train") taxonomy = load_dataset("anonymous5999/Act-ONOMY", name="taxonomy", split="train")
匿名性说明
该数据集与一份双盲提交论文关联。托管账户、论文 ID(P1–P35)以及审核者标签(human reviewer 1 – human reviewer 6)均为匿名。完整的源论文参考文献和贡献者身份将在论文正式发表时披露。
许可说明
- 数据集在 CC BY 4.0 许可下发布,适用于作者生成的注释、编码手册、分类体系及所有衍生元数据。
behavioral_descriptions.csv中的句子原文和act-onomy_codebook.csv中的引用证据,来自 35 篇源论文,基于研究合理使用/公平处理原则用于语料级方法分析,每行通过paper_id保留源归属。用户若在非商业研究之外重新分发或使用这些源句子,需自行遵守原始出版商的条款。




