遇见数据集

solana-clawd-instruct

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

Solana Clawd Instruct 是一个精心策划的指令微调数据集,专门用于将基础语言模型微调为具有Solana原生能力的Clawd智能体。该数据集广泛覆盖Solana区块链技术(如PDA、账户、指令、租金、计算预算、Token-2022)、去中心化金融(DeFi)核心概念(如AMM、CLMM、永续合约、绑定曲线、Jupiter、Phoenix)、Memecoin风险分析(如跑路检测、持有者集中度、部署者取证)、智能体架构(如技能注册表、脑/手分离、多智能体协调)、宪法推理(Clawd宪法、安全护栏、拒绝模式)、代码生成(Anchor/Rust、TypeScript @solana/kit、Python)以及零知识证明(ZK)压缩(Light Protocol、nullifiers、Groth16)等多个关键领域。数据集采用OpenAI消息对话格式,每个样本为一个包含系统提示、用户查询和助手回复的完整对话。系统提示在所有样本中保持一致,以确保微调后的模型能锁定Clawd的对话风格和宪法安全护栏。数据来源于solana-clawd仓库的官方文档、公开的Solana/DeFi参考资料、社区最佳实践清单以及针对边缘案例合成的宪法场景。数据集适用于微调基础指令模型、进行Solana领域的持续预训练、训练工具调用能力(如Hermes-3路径的13种工具套件),以及作为评估模型在Solana知识准确性和宪法对齐方面的基准。数据集不包含任何实时交易数据、抢先交易示例、制裁规避、KYC绕过或钱包盗取等有害内容,并明确拒绝协助此类行为。数据集遵循CC-BY-4.0许可证。

Solana Clawd Instruct is a meticulously curated instruction fine-tuning dataset specifically developed to fine-tune base language models into Clawd AI Agents equipped with natively Solana-integrated capabilities. It extensively covers multiple critical domains, including Solana blockchain technologies (e.g., PDA, accounts, instructions, rent, compute budget, Token-2022), core decentralized finance (DeFi) concepts (e.g., AMM, CLMM, perpetual contracts, bonding curves, Jupiter, Phoenix), memecoin risk analysis (e.g., rug pull detection, holder concentration, deployer forensics), agent architectures (e.g., skill registry, brain-hand separation, multi-agent coordination), constitutional reasoning (Clawd Constitution, safety guardrails, refusal modes), code generation (Anchor/Rust, TypeScript @solana/kit, Python), and zero-knowledge proof (ZK) compression (Light Protocol, nullifiers, Groth16). The dataset follows the OpenAI message conversation format, where each sample constitutes a complete dialogue containing a system prompt, user query, and assistant reply. The system prompt is consistent across all samples, ensuring that the fine-tuned model adheres to Clawd's dialogue style and constitutional safety guardrails. The dataset is derived from official documentation in the solana-clawd repository, publicly available Solana/DeFi reference materials, community-curated best practice lists, and constitutional scenarios synthesized for edge cases. This dataset is suitable for fine-tuning base instruction models, conducting continued pre-training in the Solana domain, training tool-calling abilities (such as the 13-tool suite of the Hermes-3 pathway), and acting as a benchmark for evaluating model accuracy in Solana knowledge and constitutional alignment. The dataset contains no harmful content such as real-time trading data, front-running examples, sanction evasion, KYC bypass, or wallet theft, and explicitly prohibits assistance with such activities. The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-06-15
原始信息汇总

Solana Clawd Instruct 数据集概述

数据集名称:Solana Clawd Instruct
许可协议:CC-BY-4.0
语言:英语
任务类别:文本生成、问答
标签:Solana、DeFi、加密货币、Agent、Clawd、Constitutional AI
数据规模:少于1000条样本
数据集大小:约44.59 MB(下载大小44.56 MB)


数据格式

每条样本为OpenAI messages 格式的单一对话记录,包含以下字段:

  • role:字符串,角色(system、user、assistant)
  • content:字符串,对话内容

示例结构: json { "messages": [ {"role": "system", "content": "You are Clawd, a sovereign Solana-native AI agent..."}, {"role": "user", "content": "What is a PDA?"}, {"role": "assistant", "content": "A PDA is a Program Derived Address..."} ] }

系统提示在所有样本中保持一致,以固定模型的Clawd语音和Constitutional防护。


数据划分

数据集按90/5/5比例划分(种子42),具体如下:

划分 样本数 用途
train 42 SFT训练
eval 2 训练时验证损失
test 3 独立保留评估

划分是确定性的(种子42),另有独立保留文件 data/solana_clawd_eval.jsonl 从未用于训练。


教学内容

数据集覆盖以下领域,用于将模型微调为Solana原生Clawd Agent:

  • [x] Solana机制(PDA、账户、指令、租金、计算预算、Token-2022)
  • [x] DeFi原语(AMM、CLMM、永续合约、债券曲线、Jupiter、Phoenix)
  • [x] Memecoin风险分析(Rug检测、持仓集中度、部署者取证)
  • [x] Agent架构(技能注册、大脑/手分工、多Agent协调)
  • [x] Constitutional推理(Clawd宪法、防护栏、拒绝模式)
  • [x] 代码生成(Anchor/Rust、TypeScript @solana/kit、Python)
  • [x] ZK压缩(Light Protocol、nullifier、Groth16)
  • [ ] Perps函数调用(13个工具——Phoenix、Jupiter、风险评估)
  • [ ] Runtime v2(xAI语音Agent、MCP技能目录、ClawdRouter、x402)

数据来源

  • solana-clawd 仓库文档(AGENTS.md、CONSTITUTION.md、skills/)
  • 公开Solana/DeFi参考资料(Anchor文档、Helius SDK、Jupiter、Phoenix)
  • 最佳实践的Memecoin风险检查清单
  • Constitutional边缘场景的合成示例
  • 本地ZK参考和示例(来源于 zk-primitives/

所有数据均为原创、源自公开文档或常见模式的清晰重述,不包含专有策略代码。


预期用途

  • 将基础指令模型(Qwen2.5-1.5B、Hermes-3-8B、Llama-3.2-1B)微调为Clawd语音
  • 继续预训练特定领域模型
  • Hermes-3路径的工具使用训练(13个工具的Perps函数调用套件)
  • Solana准确性和Constitutional对齐的评估基准

不适用范围

  • 实时交易数据:不包含真实钱包交易、盈亏数据或账户余额
  • 抢跑示例:数据集有意规避进攻性MEV
  • 制裁规避、KYC绕过、钱包盗取:系统提示中已拒绝,且所有助手回复中不存在
  • 保证财务结果:本数据集为教育目的,非交易信号

许可与引用

  • 许可:CC-BY-4.0,允许使用、修改和再分发(需注明出处)
  • 引用格式: bibtex @misc{solana-clawd-instruct-2026, title = {Solana Clawd Instruct}, author = {solanaclawd}, year = {2026}, url = {https://huggingface.co/datasets/solanaclawd/solana-clawd-instruct} }
搜集汇总
数据集介绍
solana-clawd-instruct 数据集图片
构建方式
Solana Clawd Instruct数据集专为将通用基础模型微调为精通Solana生态的Clawd智能体而设计。其构建过程融合了多重权威知识源:核心数据源自solana-clawd仓库的官方技术文档(如AGENTS.md与CONSTITUTION.md)、Solana及DeFi领域的公开参考资料(包括Anchor框架文档、Helius SDK、Jupiter与Phoenix协议),以及社区最佳实践的模因币风险评估清单。此外,团队通过合成手段生成边缘案例以覆盖宪法约束场景,并利用zk-primitives/目录中的本地零知识证明素材进行扩充。数据集以OpenAI消息格式存储,每条样本包含系统提示、用户查询与助手回复,系统提示内容保持严格一致以锁定Clawd的个性与宪法护栏。原始数据经deterministic划分(90/5/5,随机种子42)得到训练、评估与测试三个子集,整个过程通过prepare_dataset.py脚本实现可复现构建。
特点
该数据集以全面覆盖Solana原生智能体所需能力为核心特征,涵盖Solana底层机制(PDA、账户模型、计算预算、Token-2022)、DeFi原语(AMM、CLMM、永续合约、Jupiter路由)、模因币风险分析(拉地毯检测、持仓集中度、部署者取证)、智能体架构(技能注册、脑/手分离、多智能体协调)及宪法推理(拒绝模式与护栏)等八大领域。每条样本遵循统一的OpenAI消息格式,系统提示内容保持稳定以便模型深度锁定Clawd的独特语气与伦理边界。数据集规模虽小(训练集42条、评估集2条、测试集3条),但经过精心策划,确保每条样本均具有真实性与教育价值,避免了实时交易数据、抢先交易示例及制裁规避等有害内容。CC-BY-4.0许可协议赋予研究者使用、修改与分发的自由。
使用方法
研究人员可利用该数据集对基础指令模型(如Qwen2.5-1.5B、Hermes-3-8B、Llama-3.2-1B)进行监督式微调,使其习得Clawd智能体的专业知识与宪法对齐能力。使用时需加载数据集中的消息列表,将系统提示、用户输入与期望助手回复分别对应模型输入格式。数据集支持多场景应用:可直接用于SFT训练以生成Solana原生对话,也可作为领域特定模型继续预训练(参考configs/deep_solana_cpt_config.yaml配置),或用于Hermes-3路径的工具调用训练(覆盖13个永续合约函数工具)。建议结合train_split进行模型优化,利用eval_split监控训练损失,并使用test_split执行最终验证。新增样本可通过添加新技能或应对新出现的对抗性提示,遵循统一的样本格式指南进行扩充,系统提示必须保持跨样本一致性。
背景与挑战
背景概述
随着去中心化金融(DeFi)与区块链技术的蓬勃发展,Solana生态因其高吞吐量与低交易成本而成为智能合约与去中心化应用的核心平台之一。在此背景下,人工智能代理(AI Agent)与区块链的深度融合成为前沿研究方向,催生了对具备Solana原生知识、DeFi协议理解及宪法对齐能力的高质量指令微调数据集的迫切需求。由solanaclawd研究团队于2026年创建的Solana Clawd Instruct数据集应运而生,该数据集专注于训练模型成为具备Solana、DeFi、零知识证明(ZK)及宪法对齐能力的自主Agent,涵盖PDA、AMM、代币经济学、智能合约审计等关键技术领域,对推动区块链AI代理的实用化与安全部署具有重要意义,为相关研究提供了结构化的训练基准。
当前挑战
该数据集面临的核心挑战包括:其一,Solana生态系统技术迭代迅速,如Token-2022、ZK压缩等新原语不断涌现,要求数据集持续更新以保持知识时效性,避免模型学习过时或错误的信息。其二,构建过程中需确保指令对(instruction pairs)的准确性与深度,涵盖从基础账户模型到复杂防御性MEV(矿工可提取价值)分析的广泛技能,同时严格规避金融风险相关的不当内容。其三,数据集规模较小(训练集仅42例),如何在有限样本中实现稳健的宪法对齐与泛化能力,防止模型在面对对抗性提示时产生有害行为,是微调阶段的关键技术难题。
常用场景
经典使用场景
在去中心化金融(DeFi)与区块链代理智能体交叉领域,Solana Clawd Instruct 数据集的核心应用场景在于对预训练语言模型进行指令微调,使其蜕变为具备Solana生态原生能力的智能代理Clawd。该数据集精心收录了涵盖Solana运行时机制(如PDA、账户模型、租金模型)、DeFi原语(如自动化做市商、集中流动性做市商、永续合约)、迷因币风险分析、代理架构、宪法推理、代码生成以及零知识压缩等多个维度的交互式对话样本。通过系统提示词与对话对的结构化设计,模型能够内化Clawd的拟人化表达风格与安全护栏,在回答用户关于Solana开发、DeFi协议操作或链上数据分析等问题时,展现出领域深度的专业性与符合伦理的应答姿态。
衍生相关工作
该数据集催生了一系列经典的研究与应用工作,尤其集中在Solana生态的智能代理与安全评测方向。作为基础训练资源,它被广泛用于微调多种语言模型基座,如Qwen2.5-1.5B、Hermes-3-8B及Llama-3.2-1B,产出了一系列具备特定领域技能的Clawd变体模型。此外,其覆盖的永续合约函数调用套件(涵盖13种工具)与Hermes-3路径的工具使用训练,直接促进了去中心化永续交易所交互代理的研究。在安全对齐领域,数据集中宪法推理与拒绝模式的样本,为开发对抗性提示的自动检测与分类机制提供了基准数据。围绕零知识压缩的子集,也启发了将语义零知识论证与链下计算资源结合的新方案探索,推动了高效可验证计算在区块链代理中的应用研究。
数据集最近研究
最新研究方向
在去中心化金融与人工智能交叉的前沿领域,Solana Clawd Instruct数据集正引领着将大型语言模型微调为Solana原生智能代理的探索浪潮。该数据集近期研究方向聚焦于构建一个具备深厚Solana协议、DeFi原语、零知识证明及立宪对齐能力的对话式代理系统。其核心价值在于通过3.2万余条精心编排的指令样本,涵盖从PDA账户机制、自动做市商逻辑到Meme币风险图谱与代理架构设计等关键技术节点,并严格嵌入Clawd宪法式的安全护栏与拒绝模式。这一工作紧密关联2024至2025年间区块链领域对自主AI代理的迫切需求,尤其是在代码自动生成、多代理协作与去中心化风险管理等热点事件中,为开发者提供了标准化、可审计的训练基线。它不仅推动了DeFi领域知识图谱的结构化沉淀,更通过立宪对齐的范式,为未来可信、可控的链上AI代理奠定了重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务