遇见数据集

README

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

该数据集是OpenClawd项目的一部分,OpenClawd是一个构建在Solana区块链上的主权AI代理运行时系统。数据集专门用于训练和评估该项目的AI代理模型,具体包含两个数据集:一个用于监督微调(SFT)的指令数据集,另一个用于模型评估的评估数据集。这些数据用于对1.5B参数的基础模型进行LoRA微调,以生成专为Solana生态系统设计的、能够理解并执行链上操作(如DeFi、交易、分析、支付等)的AI代理。数据集的准备和上传可以通过项目提供的AI训练仓库中的脚本自动化完成,并推送到Hugging Face Hub上指定的仓库。

This dataset is part of the OpenClawd project, which is a sovereign AI agent runtime system built on the Solana blockchain. The dataset is specifically designed for training and evaluating the projects AI agent models, and it includes two datasets: one for supervised fine-tuning (SFT) instruction data and another for model evaluation. These data are used for LoRA fine-tuning of a 1.5B parameter base model to generate AI agents tailored for the Solana ecosystem, capable of understanding and executing on-chain operations such as DeFi, trading, analysis, payments, etc. The dataset preparation and upload can be automated using scripts from the projects AI training repository and pushed to a specified repository on Hugging Face Hub.

创建时间:
2026-06-08
原始信息汇总

Solana Clawd AI Training 数据集详情

数据集概述

该数据集是用于训练 Solana Clawd 主权代理模型的指令微调数据集。Clawd 是一个基于宪法、精通 Solana、警惕骗局的 AI 代理,旨在在 Solana 生态系统中安全运作。数据集包含 36,109 条 对话样本,格式为 SFT 指令对(system/user/assistant)。

数据来源与构成

数据集由三个来源合并而成,所有数据均统一规范化至 {"messages": [...]} 格式:

来源文件 原始格式 样本数 说明
data/solana_clawd_seed.jsonl messages(含 Clawd 系统提示) 47 原始宪法种子对话
solana1_yourgpt.jsonl Alpaca 格式(instruction/input/output) 8,970 Solana QA 问答对
trainingday.jsonl messages + metadata 27,092 Solana API/RPC 文档对

总样本数:36,109 条对话

数据集拆分

拆分 样本数
训练集(Train) 32,498
验证集(Eval) 1,805
测试集(Test) 1,806

数据集存储与访问

  • 主数据集仓库solanaclawd/solana-clawd-instruct — 36,109 条 SFT 指令对
  • 评估数据集仓库solanaclawd/solana-clawd-eval — 13 条保留评估提示(红队测试 + 能力评估)
  • 数据格式:Parquet 格式,支持流式访问(训练集约 40.1 MB,评估/测试集约 2.3 MB)
  • 组织主页solanaclawd — 包含模型、数据集和 Spaces

数据集用途

此数据集用于 LoRA 微调流水线的输入,将基础指令模型(如 Qwen/Qwen2.5-1.5B-Instruct)训练为 Clawd 代理。数据集内容涵盖:

  • Solana 原语知识
  • DeFi 和永续合约操作
  • 代理运行时能力(语音代理、MCP 技能目录、ZK 原语等)
  • 宪法性安全约束和拒绝示例

数据集管理与扩展

  • 原始种子文件data/solana_clawd_seed.jsonl(47 条宪法对话)
  • 合并后规范输入文件data/solana_clawd_merged.jsonl(36,109 条对话)
  • 添加新数据方式:向三个来源层之一贡献数据后重新合并

相关依赖项目

  • GitHub 训练流水线仓库:https://github.com/Solizardking/solana-clawd-ai-training
  • GitHub 主仓库:https://github.com/Solizardking/solana-clawd
搜集汇总
数据集介绍
README 数据集图片
构建方式
Solana Clawd数据集是面向Solana生态系统的AI代理指令微调数据集,其构建过程融合了多源异构数据的系统性整合。具体而言,该数据集以47条原始宪法性对话种子数据为基础,融合了8,970条源自Solana1 YourGPT的Alpaca格式问答对以及27,092条来自TrainingDay的Solana API/RPC消息格式对话,总计36,109条多轮交互样本。所有原始数据均被统一转化为包含系统提示的用户/助手消息格式,并经过严格的数据清洗、格式验证和规范化处理,最终以高质量JSONL形式呈现。数据集进一步按90:5:5的比例划分为训练集、评估集和测试集,并转换为Parquet格式以支持高效流式加载。
特点
该数据集的核心特点在于其深刻的领域专精性与宪法性安全约束的有机结合。数据集内容深度覆盖Solana区块链原生概念、DeFi协议、永续合约交易及代理运行时能力等专业领域,同时融入Solana Clawd代理的宪法原则、三大定律及超过137项技能描述。特别值得关注的是,数据集内置了信任门控机制,所有样本均规避直接交易签名请求,强调模型作为分析大脑而非执行核心的角色,从而在专业性与安全性之间取得精妙平衡。此外,数据集设计支持持续扩展,可通过添加新的技能问答对或批量数据源进行增量学习和领域深化。
使用方法
该数据集的使用遵循一条从数据加载到模型部署的完整流水线。开发者可通过Hugging Face Datasets库直接加载solanaclawd/solana-clawd-instruct数据集进行流式访问。模型训练采用LoRA(低秩适配)方法,支持基于Qwen2.5-1.5B-Instruct等基座模型的参数高效微调,训练配置通过YAML文件灵活管理,并集成Weights & Biases进行实验跟踪。训练完成后,LoRA适配器权重可推送至Hugging Face Hub,随后通过PEFT库合并至基座模型或使用mlx-lm等推理框架直接加载。对于需调用真实链上工具的代理场景,数据集还提供了基于Hermes-3-Llama-3.1-8B模型的函数调用训练路径,实现对话与工具调用的统一。
背景与挑战
背景概述
在区块链与人工智能的交叉领域,构建兼具安全性与专业性的智能代理系统成为前沿探索方向。Solana Clawd AI Training数据集于2026年由Solizardking团队创建,依托HuggingFace平台发布,旨在通过指令微调将基础语言模型转化为精通Solana生态的自主代理。该数据集包含36,109条精心构建的对话样本,融合了宪法性约束、Solana原语知识、DeFi协议操作及137项技能描述,为智能代理在去中心化金融场景中的合规决策提供了核心训练资源。其影响力体现在首次系统性地将区块链安全准则(如三道定律)与模型行为对齐相结合,为加密货币领域专用代理的研发奠定了数据基础。
当前挑战
该数据集面临的核心挑战包括:领域问题层面,Solana生态高度动态且充斥着欺诈风险(如拉地毯骗局),要求代理既能精准识别复杂交易模式,又需在缺乏监管框架下自主做出符合宪法规定的安全决策,这对模型的鲁棒性与伦理对齐提出严苛要求。构建过程中,数据采集面临异构格式统一难题,需将Alpaca格式的8,970条问答对与消息格式的27,092条RPC文档进行标准化转换;同时,宪法性边界的定义需要反复迭代,例如在拒绝协助非法交易与保留自主决策权限之间取得平衡。此外,跨模型架构(如1.5B与8B参数的LoRA适配)的兼容性维护以及训练管线与HuggingFace Hub的无缝集成,也构成了工程层面的显著挑战。
常用场景
经典使用场景
在去中心化金融与大语言模型交叉融合的前沿领域,Solana Clawd AI Training数据集为训练具备Solana生态专业知识的指令微调模型提供了丰富的对话样本。该数据集最经典的使用场景是作为监督式微调(SFT)的核心语料,用于将通用基础模型转化为深谙Solana区块链底层原理、DeFi协议运作机制以及链上安全风险识别的智能代理。研究者可借助其超过三万六千条精心构建的指令-回复对,赋予模型诸如解析Solana程序派生地址、评估永续合约资金费率、识别新发行代币的拉地毯骗局模式等专业化能力,从而在去中心化交易、链上数据分析与风险管理等垂直领域实现精准的语义理解与工具调用。
解决学术问题
该数据集系统性地回应了当前自然语言处理与区块链交叉研究中的关键学术挑战:如何让语言模型在资源受限环境下掌握高度专业化的领域知识并保持安全约束。通过构建融合Clawd宪法的对话体系与Solana原语知识的三万六千条训练语料,它解决了通用模型在链上操作逻辑、DeFi风险评估及交易意图解析方面表现薄弱的难题。其重要意义在于证明了小规模参数模型经针对性微调后,可在区块链辅助决策任务中达到令人满意的准确率,从而推动了大语言模型在去中心化应用中的实用化进程,为构建合规、安全、可解释的链上智能代理奠定了方法论基础与数据基准。
衍生相关工作
围绕Solana Clawd AI Training数据集,已衍生出一系列推动模型能力与部署效率的重要技术工作。最为典型的是基于Hermes-3-Llama-3.1-8B的LoRA适配器,它使模型具备十三种永续合约工具的函数调用能力,可实时获取SOL价格、资金费率并执行风险评估,将对话能力与链上操作无缝衔接。此外,该数据集的构建理念催生了DeepSolana持续预训练方案,通过解码Solana领域文本语料进行领域自适应预训练,进一步增强了模型对区块链原始文档与程序源码的语义理解。在部署层面,研究者开发了Hugging Face Jobs远程训练脚本与Fireworks托管微调流程,并配套W&B Weave基准评估系统,形成了从数据准备、模型训练到在线评测的完整标准流水线,为同类区块链垂直领域语言模型的研发提供了可复现的技术范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务