遇见数据集

Fable-5-Max-Reasoning-Filtered

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

Fable 5 Distill Reasoning Data 是一个专注于金融科技架构安全的高质量合成推理数据集,旨在通过监督微调提升模型在复杂安全场景下的领域精度、严格格式遵循和上下文逻辑能力。数据集包含100个非重复的、经过过滤的详细架构痕迹,这些痕迹映射了涵盖法币和加密货币基础设施的混合全球银行系统的安全实现方案。数据规模估计为600万令牌,原始JSONL格式负载为24 MB。数据经过qwen 2.5 7B模型过滤和分类以移除低质量条目,并由GLM 5.2模型改进,确保100%的信号质量。每个架构痕迹连接高层次的业务与合规约束同多个关键领域的技术工程实现,具体覆盖:威胁建模、内核级微分割、机器身份与临时秘密、运行时防御系统以及全球合规框架。数据集采用与ShareGPT兼容的`conversations`块结构,便于直接集成到指令微调流程中。

Fable 5 Distill Reasoning Data is a high-quality synthetic reasoning dataset focused on fintech architecture security. It aims to enhance model performance in complex security scenarios through supervised fine-tuning, improving domain accuracy, strict format adherence, and contextual logic capabilities. The dataset contains 100 non-repetitive, filtered detailed architecture traces that map security implementation schemes for a hybrid global banking system covering fiat and cryptocurrency infrastructure. The estimated data scale is 6 million tokens, with a raw uncompressed JSONL payload of 24 MB. Data is filtered and classified by the qwen 2.5 7B model to remove low-quality entries and improved by the GLM 5.2 model, ensuring 100% signal quality. Each architecture trace connects high-level business and compliance constraints with technical engineering implementations across key areas, including threat modeling, kernel-level microsegmentation, machine identity and ephemeral secrets, runtime defense systems, and global compliance frameworks. The dataset uses a ShareGPT-compatible `conversations` block structure for easy integration into instruction fine-tuning pipelines.

创建时间:
2026-07-12
原始信息汇总

数据集概述

  • 名称: Fable 5 Distill Reasoning Data
  • 许可证: Apache-2.0
  • 语言: 英语
  • 任务类别: 文本生成
  • 数据集大小: 少于1000条样本
  • 总规模: 24 MB(未压缩原始JSONL文件)

数据集统计

指标 数值 详情
总样本数 100条架构追踪 经过过滤的非重复架构场景
平均单条规模 约240 KB 高密度条目,包含完整配置
领域范围 金融科技架构 涵盖全球司法管辖区、SWIFT和Web3基础设施
Token质量比 100%信号 排除对话填充和占位代码

数据集内容与覆盖范围

每条追踪记录将高层业务及合规约束与技术工程实现相连接,覆盖以下关键领域:

  • 威胁建模: 多向量风险评分矩阵,映射至基础设施缓解措施。
  • 内核级微隔离: 完整的Cilium eBPF网络策略、Istio服务网格清单及严格mTLS边界配置。
  • 机器身份与临时密钥: SPIFFE/SPIRE架构布局,集成HashiCorp Vault实现动态数据库凭证轮换。
  • 运行时防御系统: 自定义Falco eBPF安全规则块,用于在高安全环境中检测进程劫持。
  • 全球合规框架: 将平台逻辑与PCI-DSS 4.0、GDPR数据粉碎策略、PSD2 SCA验证模式和SOX分类账追踪规则对齐。

数据集结构与示例

数据集采用ShareGPT兼容的conversations块结构格式化,旨在直接集成到指令微调管线中。

生成方式

  • 数据基于Fable 5数据,包含约600万估计token,经Qwen 2.5 7B过滤并分类以移除低质量条目,再由GLM 5.2改进。
  • 该数据集绕过了基本对话填充,旨在监督微调期间提升模型的领域精度、严格格式遵循能力和上下文逻辑。
搜集汇总
数据集介绍
Fable-5-Max-Reasoning-Filtered 数据集图片
构建方式
本数据集名为Fable-5-Max-Reasoning-Filtered,基于fable 5推理数据集精心筛选与构建而成。其构建过程首先利用Qwen 2.5 7B模型对原始数据进行过滤与分类,剔除质量低劣的条目;随后通过GLM 5.2模型对保留内容进行优化提升,从而确保每一条数据均具备高精度的领域专业知识、严格的格式遵循能力以及上下文逻辑推理能力。最终形成包含100条非重复、高密度架构轨迹的精选数据集,每条轨迹平均大小约240KB,总规模达24MB,专为监督微调场景设计。
使用方法
数据集以ShareGPT兼容的conversations块结构存储,采用JSONL格式,可直接接入指令微调工作流进行模型训练。使用时,用户可通过HuggingFace数据集加载工具读取train.jsonl文件,每条数据包含完整的多轮对话结构,适用于监督式微调(SFT)与推理链(CoT)训练。建议在训练过程中结合模型的任务特性,利用本数据集的高信号密度特性,重点提升模型在金融科技架构设计、安全策略实施与合规逻辑推导等方面的专业表现。
背景与挑战
背景概述
在金融科技(FinTech)领域,混合全球银行系统整合了传统法币与加密货币基础设施,其安全实现面临前所未有的复杂性。Fable-5-Max-Reasoning-Filtered数据集由匿名研究团队于近期创建,旨在通过精细化的推理数据提升大语言模型在安全架构设计中的领域精度。该数据集包含100条非重复的高密度架构跟踪记录,覆盖全球司法管辖区、SWIFT及Web3基础设施,总计约600万token。它专注于监督微调(SFT),通过严格格式化与上下文逻辑训练,推动模型在威胁建模、内核级微分割、机器身份管理及全球合规框架等关键领域的推理能力。其发布为FinTech安全领域提供了高质量、低噪声的训练资源,有望加速模型在专业场景中的部署与应用。
当前挑战
该数据集主要面临两大挑战。首先,在领域问题层面,混合银行系统的安全实现需兼顾多向量威胁建模、eBPF网络策略、动态密钥轮换及PCI-DSS 4.0等复杂合规要求,现有模型因缺乏结构化推理能力而难以精准生成完整架构。此数据集通过构建高信号、无填充的推理跟踪记录,直接针对这一技术短板进行强化。其次,在构建过程中,研究者遭遇了数据质量控制的难题:原始Fable 5数据中存在大量低质量条目,需借助Qwen 2.5 7B进行过滤分类,再经GLM 5.2改进优化,最终仅保留100条高密度样本。这一过程在确保token信号纯度达100%的同时,也突显了大规模合成数据自动清洗与人工验证间的平衡难点。
常用场景
经典使用场景
Fable-5-Max-Reasoning-Filtered数据集的核心应用在于对大型语言模型进行监督微调(SFT),以增强其在复杂推理任务中的表现。该数据集精心筛选了100条高度密集的技术架构轨迹,覆盖威胁建模、内核级微隔离、机器身份管理及运行时防御等高端领域。这些数据避开了常见的对话填充和占位码,使模型能够专注于精准的领域推理和严格的格式遵循,从而在金融科技与网络安全等专业场景中实现更深度的逻辑理解和上下文关联。
解决学术问题
该数据集致力于解决当前大语言模型在专业领域推理中存在的“浅层泛化”与“逻辑错误”问题。传统训练数据常包含大量噪声和无关填充,导致模型在复杂金融系统安全架构、合规性分析等任务中难以生成准确且结构化的回答。Fable-5-Max-Reasoning-Filtered通过纯净且高密度的领域知识注入,迫使模型学习从细粒度业务约束到技术实现的系统性映射,为提升模型的因果推理能力和专业术语准确性提供了新的研究范式。
实际应用
在实际应用层面,该数据集可赋能金融科技平台与网络安全系统的智能化升级。例如,用于微调后的模型能够辅助架构师自动生成符合PCI-DSS 4.0和GDPR法规的混合银行系统安全策略,或者动态解析SWIFT与Web3基础设施中的风险矩阵。此外,它还能在DevSecOps流程中提供即时的运行时防御规则建议,帮助组织应对零信任架构下的身份管理和微隔离挑战,显著降低人工审计的认知负担。
数据集最近研究
最新研究方向
该数据集聚焦于金融科技与网络安全交叉领域的前沿推理研究,特别是在混合型全球银行系统(涵盖法币与加密货币基础设施)中,通过高密度架构追踪和威胁建模,推动大语言模型在严格合规框架下的监督微调。其核心价值在于,利用合成的高质量推理数据(如eBPF网络策略、SPIFFE/SPIRE机器身份管理、运行时防御规则)提升模型在复杂金融场景中的领域精度与逻辑一致性。当前热点事件包括全球范围内对数字资产监管框架的强化(如PCI-DSS 4.0、GDPR、PSD2),这一数据集为训练模型处理这类多司法管辖区的合规与安全约束提供了关键资源,标志着合成推理数据从通用对话向专业化、结构化知识的范式转移。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务