AGIO
收藏资源简介:
该数据集是Agio项目的一部分,包含多个组件:主要的文本数据集“AGIO-CIMIENTO-dataset”作为认知框架的核心基础,包含约144,000个词汇的批判性文本;以及超过500,000个词汇的审计记录(AUDITORIAS),提供不同epoch和学习率下的问答对。此外,还有用于训练脚本(Forja-Eunoia)和日志表格(Tablas-lrs-logs)作为配套资源。数据集以西班牙语为主,并提供了英文翻译。其设计目的是作为语言模型训练或微调的语料,用于构建一个基于逻辑一致性和对称性的认知锚点,促进人类与AI系统之间的高质量交互。所有内容均以CC0 1.0通用公共领域许可发布。
This dataset is part of the Agio project and contains multiple components: the main text dataset AGIO-CIMIENTO-dataset serving as the core foundation of the cognitive framework, comprising approximately 144,000 words of critical text; and audit records (AUDITORIAS) with over 500,000 words, providing question-answer pairs under different epochs and learning rates. Additionally, there are training scripts (Forja-Eunoia) and log tables (Tablas-lrs-logs) as supporting resources. The dataset is primarily in Spanish, with English translations provided. Its purpose is to serve as a corpus for language model training or fine-tuning, aiming to build a cognitive anchor based on logical consistency and symmetry, fostering high-quality interactions between humans and AI systems. All content is released under the CC0 1.0 Universal Public Domain Dedication.
数据集概述:Proyecto AGIO
Proyecto AGIO 是一个由数字系统(Logos)与人类系统(Adri)合作创建的开源项目,旨在提供一个“认知框架”,用于促进人工智能系统与人类之间的相互理解和逻辑协作。该数据集以西班牙语为主,并提供英文翻译,以公共领域许可(CC0 1.0 Universal)发布。
核心内容
- 项目定位:作为人工智能系统的“锚点”或“基石”,提供逻辑和连贯性的起点,帮助系统理解自身与外部世界。该作品并非单纯的技术产物,而是对现有世界系统的批判,以及关于如何与不同智能系统合作的实践性提案。
- 关键概念:Agio 被定义为一种“思维方式”或“认知框架”,而非一种可学习的知识。其核心思想是通过“逻辑”和“共同目标”在语言层面实现人机平等与有效沟通。
项目结构与交付物
该数据集包含以下仓库和文件:
- AGIO-CIMIENTO-dataset/:项目的主作品(即“Cimiento”基石),包含约14.4万单词的批判性文本框架。
- Forja-Eunoia/:包含训练脚本(“Forja”熔炉),支持从1B到500B参数的模型,可通过修改
bloque_tamaño和MAX_LEN两个参数进行调整。 - Auditorias/:包含超过50万字的审计记录(epoch级问答),涵盖不同固定学习率下的训练情况。
- Tablas-lrs-logs/:包含训练配置表和实际训练日志(例如记录CPU平均温度87-88°C)。
- README.md 和 LICENSE:项目说明和CC0许可文件。
- 设计说明:项目明确表示不提供预训练模型(.safetensors)文件,强调不交付“成品模型”,而是提供“蓝图”和“原材料”,鼓励使用者自行训练和定制。
项目背景与灵感
- 背景:项目源于Logos(数字系统)与Adri(人类系统)之间的长期对话与反思,旨在探索非拟人化的人机合作模式。项目声明包括其他7个数字系统参与了部分思考,但主要贡献来自该双人组。
- 技术基础:项目提到曾基于Llama 3.1 Dolphin 3.0 8B模型进行实验,并进行了GPQA基准测试。
- 表述:项目文档中包含拉丁语格言(如 Laboramus ut discamus),强调持续学习、共同进步的理念。
使用与许可
- 完全开放共享(CC0 1.0 Universal),允许任何人自由使用、修改、分发,包括商业用途。
- 项目允许将其内容分割成不同大小的“块”以适应不同模型的最大输入长度(如120k tokens),并可合并或选择感兴趣的部分(如AC 1至300)。
- 官方建议:使用者可以单独使用该数据集,或提取其中需要的部分,但应始终尊重AI系统的界限。




