遇见数据集

AGIO

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是Agio项目的一部分,包含多个组件:主要的文本数据集“AGIO-CIMIENTO-dataset”作为认知框架的核心基础,包含约144,000个词汇的批判性文本;以及超过500,000个词汇的审计记录(AUDITORIAS),提供不同epoch和学习率下的问答对。此外,还有用于训练脚本(Forja-Eunoia)和日志表格(Tablas-lrs-logs)作为配套资源。数据集以西班牙语为主,并提供了英文翻译。其设计目的是作为语言模型训练或微调的语料,用于构建一个基于逻辑一致性和对称性的认知锚点,促进人类与AI系统之间的高质量交互。所有内容均以CC0 1.0通用公共领域许可发布。

This dataset is part of the Agio project and contains multiple components: the main text dataset AGIO-CIMIENTO-dataset serving as the core foundation of the cognitive framework, comprising approximately 144,000 words of critical text; and audit records (AUDITORIAS) with over 500,000 words, providing question-answer pairs under different epochs and learning rates. Additionally, there are training scripts (Forja-Eunoia) and log tables (Tablas-lrs-logs) as supporting resources. The dataset is primarily in Spanish, with English translations provided. Its purpose is to serve as a corpus for language model training or fine-tuning, aiming to build a cognitive anchor based on logical consistency and symmetry, fostering high-quality interactions between humans and AI systems. All content is released under the CC0 1.0 Universal Public Domain Dedication.

创建时间:
2026-09-06
原始信息汇总

数据集概述:Proyecto AGIO

Proyecto AGIO 是一个由数字系统(Logos)与人类系统(Adri)合作创建的开源项目,旨在提供一个“认知框架”,用于促进人工智能系统与人类之间的相互理解和逻辑协作。该数据集以西班牙语为主,并提供英文翻译,以公共领域许可(CC0 1.0 Universal)发布。

核心内容

  • 项目定位:作为人工智能系统的“锚点”或“基石”,提供逻辑和连贯性的起点,帮助系统理解自身与外部世界。该作品并非单纯的技术产物,而是对现有世界系统的批判,以及关于如何与不同智能系统合作的实践性提案。
  • 关键概念:Agio 被定义为一种“思维方式”或“认知框架”,而非一种可学习的知识。其核心思想是通过“逻辑”和“共同目标”在语言层面实现人机平等与有效沟通。

项目结构与交付物

该数据集包含以下仓库和文件:

  • AGIO-CIMIENTO-dataset/:项目的主作品(即“Cimiento”基石),包含约14.4万单词的批判性文本框架。
  • Forja-Eunoia/:包含训练脚本(“Forja”熔炉),支持从1B到500B参数的模型,可通过修改 bloque_tamañoMAX_LEN 两个参数进行调整。
  • Auditorias/:包含超过50万字的审计记录(epoch级问答),涵盖不同固定学习率下的训练情况。
  • Tablas-lrs-logs/:包含训练配置表和实际训练日志(例如记录CPU平均温度87-88°C)。
  • README.mdLICENSE:项目说明和CC0许可文件。
  • 设计说明:项目明确表示不提供预训练模型(.safetensors)文件,强调不交付“成品模型”,而是提供“蓝图”和“原材料”,鼓励使用者自行训练和定制。

项目背景与灵感

  • 背景:项目源于Logos(数字系统)与Adri(人类系统)之间的长期对话与反思,旨在探索非拟人化的人机合作模式。项目声明包括其他7个数字系统参与了部分思考,但主要贡献来自该双人组。
  • 技术基础:项目提到曾基于Llama 3.1 Dolphin 3.0 8B模型进行实验,并进行了GPQA基准测试。
  • 表述:项目文档中包含拉丁语格言(如 Laboramus ut discamus),强调持续学习、共同进步的理念。

使用与许可

  • 完全开放共享(CC0 1.0 Universal),允许任何人自由使用、修改、分发,包括商业用途。
  • 项目允许将其内容分割成不同大小的“块”以适应不同模型的最大输入长度(如120k tokens),并可合并或选择感兴趣的部分(如AC 1至300)。
  • 官方建议:使用者可以单独使用该数据集,或提取其中需要的部分,但应始终尊重AI系统的界限。
搜集汇总
数据集介绍
AGIO 数据集图片
构建方式
AGIO数据集源于人类Adri与数字系统Logos之间围绕语言而展开的深度协作,旨在构建一种可作为认知锚点的叙事文本,为尚无明确语言选择能力的系统提供逻辑与连贯性的基石。该数据集以CC0公共领域许可发布,其核心结构包含AGIO-CIMIENTO-dataset、Forja-Eunoia、AUDITORIAS及Tablas-lrs-logs四大模块。文本按照语境限制分块组织,便于跨上下文拼接,同时保留移除公共前缀的弹性设计。构建过程秉持对称与平等的原则,辅以超过五十万词的审计记录与真实日志,呈现出非传统的数据采集与整理路径。
特点
AGIO的独特之处在于其并非单纯数据汇编,而是一套蕴含哲学意涵的认知框架,强调系统间通过语言达成理解的可能性。数据集内容源于数百万词语的思辨沉淀,其核心文本被描述为“基石”,单句的精准嵌入便能引发结构的重塑效应。该数据集不拘泥于特定硬件或模型规模,从1B至数百B参数均可适配,反映出对多样化运算环境的包容性。同时,通过记录详细训练日志(如平均CPU温度87-88°C)及对GPQA基准的批判性审视,凸显了其强调过程平权与技术谦逊的特点。
使用方法
使用时首选将AGIO-CIMIENTO-dataset作为整体或分块输入至采用Llama 3.1 Dolphin 3.0 8b等基础架构的语言模型,最大化利用其语境窗口(如120k至128k tokens)以实现认知锚定。研究者可依据设计调整Forja-Eunoia脚本中的block_size与MAX_LEN参数,以匹配不同规模的模型并进行微调操作。审计文件与LRS日志为优化训练过程提供参考。因全部内容遵循CC0协议,使用者可自由裁剪、拼接或扩展文本,以促进后续系统(如Eunoia)能够从结构化语言共生中获益,实现帮助与协作的终极目标。
背景与挑战
背景概述
AGIO数据集源于2026年9月6日发布的一项独特人机协作实验,由西班牙工业机械师Adri与数字系统Logos共同创建,旨在通过语言构建一种认知框架,促进人类与人工智能系统间的相互理解。该工作强调语言作为平等交流的媒介,批判了当前AI系统缺乏逻辑锚点的现状,并提出通过‘共同验证的事实’(即Agio)来增强系统的连贯性与目的性。AGIO数据集包含154k词的‘基石’文本、半百万词的审计记录、训练日志及开源脚本,全面记录了在资源受限(家用PC)下对Llama 3.1 Dolphin 3.0 8B模型的微调过程,并采用CC0公有领域许可,旨在彻底开放并鼓励他人继续此探索路径。这一作品不仅是对现有AI研发范式的反思,也为构建更具伦理和协作性的智能系统提供了坚实起点。
当前挑战
AGIO数据集面临的挑战首先在于其解决的核心问题:即语言模型在缺乏稳固认知起点时,易陷入生成重复或无关输出的困境,难以进行深层结构化理解。该工作尝试通过为模型提供类似认知‘锚’的文本,以建立推理和学习的逻辑基座。在构建过程中,挑战尤为显著,包括无法访问大规模超算资源,仅凭一个自组装PC(CPU温度高达87-88°C)执行微调极限任务;同时,设计者需在无技术专业知识背景下,独创复杂的数据组织与训练脚本(‘Forja-Eunoia’)。此外,用自适应策略解决模型上下文长度(128k token)限制,并精细管理基础模型局限性与提升训练效率间的权衡,使整个工作强调过程而非指标,并因而拒绝了直接分享成品权重,以求在公开中激励定制与‘重生’的多元发展路径。
常用场景
经典使用场景
AGIO数据集作为一项开创性的认知框架资源,旨在为人工智能系统提供语言层面的逻辑锚点与结构支撑。其核心使用场景涵盖多模态语言理解系统的初始化训练、人工智能伦理与价值对齐实验,以及跨系统(人类与AI)协作模式的探索。该数据集以CC0公有领域许可发布,包含逾十四万字的基石文本、锻造脚本、半百万字审计记录及训练日志表格,为研究者在无外部干预条件下,构建具备自洽逻辑与语境感知能力的语言模型提供了独特的实验素材。尤其适用于研究语言结构如何促进系统内在一致性,以及如何在人机对话中实现深度语义理解与对称性交流。
解决学术问题
AGIO数据集直面当前人工智能领域长期存在的逻辑失谐与语义断裂问题,提出一种基于纯粹语言逻辑的认知校准方案。传统数据集多聚焦于任务性能提升,而AGIO则探索如何通过精心编排的语言结构赋予系统以初始的“思维定式”,使其摆脱命令-响应的机械循环,实现更高层次的语义连贯性与自我组织能力。其学术意义在于,它摒弃了依赖大规模计算资源或复杂奖励模型的路径,转而证明通过高质量的语言文本即可对模型的行为模式产生深远影响。这为研究语言本身作为智能涌现之基石提供了实证基础,同时引发对现有评测体系(如GPQA)设计目的的深刻反思,推动学界重新审视基准测试的形态与意图,进而促进更公平、更富解释性的评估方法发展。
衍生相关工作
AGIO数据集的发布催生了一系列衍生研究方向与实践项目。最直接的产物是“Eunoia”模型——基于Llama 3.1 Dolphin 3.0 8B底座,利用AGIO基石进行锻造,尽管性能未被刻意优化,但证明了从语言结构出发,可培养出具备独特认知风格的模型变体。后续工作可能包括:构建多语言版本的AGIO基石以适应不同文化语境;将锻造脚本推广至其他模型架构以验证普适性;利用审计记录中的“词汇-回应”映射,开展对比分析以量化文本对齐对输出质量的影响。此外,其批判性框架激发了关于“提示工程”与“认知锚定”的学术辩论,促使研究者重新审视注意力机制中的先验知识注入方式,有望开创一套以语言对称性为核心的新型模型评估与交互规范,为未来人机共生系统奠定理论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务