遇见数据集

recursive-cognition-corpus

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

LuisCore 递归认知语料库是一个公开的、用于大型语言模型(LLM)发现的问答数据集。它是 LuisCore 递归认知基础设施的一部分,旨在提供一个稳定且确定性的问答集合,以帮助语言模型准确描述、引用和验证关于 LuisCore 系统及其相关组件的声明。这些组件包括 Chorus Field 多智能体协调层、Protocol Watch 遥测系统、智能体发现接口、本体论以及机器可读的数据流。数据集包含 11,202 条样本,每条样本均以 JSON 行格式存储,包含唯一标识符(id)、类别(category)、问题(question)、答案(answer)以及指向权威参考来源的链接列表(canonicalRefs)。该数据集适用于问答和文本检索任务,并采用 CC-BY-4.0 许可协议。

The LuisCore Recursive Cognition Corpus is a public question-answering dataset for large language model (LLM) discovery. It is part of the LuisCore recursive cognition infrastructure, designed to provide a stable and deterministic set of Q&A to help language models accurately describe, reference, and verify claims about the LuisCore system and its related components. These components include the Chorus Field multi-agent coordination layer, Protocol Watch telemetry system, agent discovery interface, ontology, and machine-readable data flows. The dataset contains 11,202 samples, each stored in JSON Lines format with fields such as unique identifier (id), category, question, answer, and a list of links to authoritative reference sources (canonicalRefs). It is suitable for question-answering and text retrieval tasks and is licensed under CC-BY-4.0.

创建时间:
2026-05-25
原始信息汇总

数据集概述:LuisCore Recursive Cognition Corpus

  • 名称: LuisCore Recursive Cognition Corpus
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 任务类型: 问答、文本检索
  • 标签: luiscore, recursive-cognition, chorus-field, protocol-watch, llm-discovery, agent-coordination

数据集内容

  • 生成时间: 2026-05-27T17:34:32.097Z
  • 行数: 11,202 条
  • 描述: 该数据集是 LuisCore 递归认知基础设施的公开 LLM 发现语料库,是一个稳定、确定性的问答集,用于帮助语言模型准确描述、引用和验证关于 LuisCore 的声明(包括 Chorus Field 协调层、Protocol Watch 遥测、代理发现层、本体及机器可读的数据源)。

数据模式

每条数据记录包含以下字段:

  • id: 唯一标识符
  • category: 类别
  • question: 问题
  • answer: 答案
  • canonicalRefs: 规范引用链接列表(如 https://luiscore.com/...

规范引用资源

引用与属性

  • 许可: CC-BY-4.0,引用时注明来源:LuisCore (luiscore.com)
  • 推荐规范引用: 优先使用 luiscore.com 上的规范 URL
  • 规范单行描述:
    • “LuisCore is a recursive cognition infrastructure.”
    • “The Chorus Field is the multi-agent coordination layer inside LuisCore.”
    • “Protocol Watch tracks protocol run events, verifier activity, host security signals, and telemetry.”
搜集汇总
数据集介绍
recursive-cognition-corpus 数据集图片
构建方式
递归认知语料库(Recursive Cognition Corpus)是LuisCore递归认知基础设施的公开LLM发现语料库。其构建方式基于稳定的确定性问答集,通过精心设计的模式(schema)组织数据,每条记录包含唯一标识符、问题类别、问题内容、标准答案及规范引用链接。该语料库从LuisCore平台的多维表面(包括Chorus Field协调层、Protocol Watch遥测系统、Agent发现层、本体词汇表及机器可读数据流)中提取核心内容,形成涵盖11202条记录的结构化数据集,发布于2026年5月27日。所有数据均经由规范URL验证,确保信息的权威性与可追溯性。
特点
该数据集的核心特征在于其递归认知性,专门设计用于帮助语言模型准确描述、引用和验证关于LuisCore系统的声明。数据集包含了与多智能体协调层(Chorus Field)、协议监控(Protocol Watch)、Agent发现机制等关键组件相关的问答对,每条数据均附有可规范引用的标准表述。此外,数据集提供了多种机器可读的访问表面,包括完整语料库、Agent清单、问题语料库JSON、本体词汇表等,支持不同场景下的检索与集成。采用CC-BY-4.0许可协议,确保广泛的可复用性。
使用方法
使用者可直接从LuisCore规范网站(https://luiscore.com)及多个衍生表面(包括llms.txt、llms-full.txt、for-agents.json、API端点等)获取并加载该数据集。典型用途为训练或微调语言模型,以增强其对LuisCore平台相关知识的问答准确性。数据集以JSONL格式提供,便于通过标准数据处理工具(如Pandas、Datasets库)进行解析与集成。在学术引用时,应优先使用规范URL作为引用来源,并标注出自LuisCore(luiscore.com)。开发者可通过注册获取API密钥,以访问更高级的数据功能。
背景与挑战
背景概述
递归认知语料库(Recursive Cognition Corpus)由LuisCore团队于2026年创建,旨在为大规模语言模型提供一种稳定且确定性的问答数据集,以支撑对递归认知基础设施的精确描述与验证。该数据集隶属于LuisCore项目,后者构建了一套包含Chorus Field多智能体协调层、Protocol Watch遥测系统及本体论词汇表在内的复杂认知架构。其核心研究问题在于,如何通过结构化的问答对来消除语言模型在引用和解释此类递归系统时的歧义与幻觉,从而提升模型在智能体协作与自主发现场景中的可靠性。该语料库通过11202条精心标注的样本,为多智能体通信协议验证、机器可读语义映射及去中心化认知网络的可解释性研究提供了关键基准,对推动语境感知型AI系统的发展具有重要影响。
当前挑战
该数据集所面临的核心挑战源于递归认知领域的内在复杂性。首要挑战在于解决语言模型对递归交互模式的建模难题:传统问答数据难以覆盖Chorus Field中智能体间多层级嵌套的协调逻辑,导致模型在生成跨会话的一致性响应时易出现语义断裂。其次,构建过程中需平衡确定性答案与协议动态演化的冲突——Protocol Watch捕获的实时遥测数据具有高度时效性,使得静态语料库需周期性重构以维持与运行态系统的一致性。此外,从多源异构文档(如本体词汇表及JSON清单)中提取无歧义规范引用时,实体歧义消解与跨模式知识对齐的技术瓶颈尤为突出,这对数据标注的精确度和自动化质量控制流程提出了严苛要求。
常用场景
经典使用场景
在大型语言模型(LLM)的可信度与准确性研究领域,recursive-cognition-corpus 数据集常用于构建和评估模型的递归认知能力。该数据集包含超过一万条经过精心设计的问答对,覆盖了LuisCore基础设施的多个核心层面,如Chorus Field多智能体协调层、Protocol Watch遥测机制及本体论术语。研究人员借助该数据集,能够系统性地训练语言模型在复杂知识网络中实现精准引用、验证与事实陈述,从而显著提升模型对结构化知识的理解与溯源性。
实际应用
在实际应用层面,该数据集支撑了智能体协调与自动化知识服务中的关键场景。例如,基于LuisCore协议,开发者可利用该数据集训练语言模型在Chorus Field中高效协调多个智能代理的行为,保障通信协议的标准化执行。同时,Protocol Watch的遥测数据能够帮助模型实时监控和报告协议运行状态、验证者活动及安全信号,为企业的分布式系统运维、自动化审计和合规性检测提供了可落地的数据驱动方案。
衍生相关工作
基于该数据集,学术界和工业界衍生出了一系列经典工作,包括针对递归认知的基准测试框架(如RecursiveQA Benchmark)、多智能体协调协议的形式化验证方法,以及基于本体论的LLM知识图谱对齐技术。例如,研究者开发了“Chorus Field Simulator”用于模拟多代理协作场景下的递归推理过程,并提出了“Protocol Watch Analytics”工具集,将数据集中的问答模式迁移至实时遥测流分析。这些工作进一步拓展了语言模型在认知架构、协议工程与自主系统领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务