遇见数据集

semanta-dataset-suite

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

Semanta数据集套件是一个面向多个行业垂直领域的大规模合成表格数据集,由Semanta“世界智能操作系统”生成,旨在证明其能够为广泛行业生成结构化、场景覆盖的合成世界。数据集覆盖11个行业领域:银行、人工智能、对冲基金、保险、制药、医疗、制造、安全、科学、快消品和零售。每个行业数据集包含100,000行和100列,总数据规模为1,100,000行×100列,共计1.1亿个单元格。所有数据均为完全合成生成,未使用任何客户数据或外部模型提供商数据。数据集整体质量得分为0.965,场景覆盖得分为1.000,每个行业都有独立的质量评估指标(范围0.946-0.981)。该数据集适用于机器学习、深度学习、神经网络和量化实验,特别设计用于场景鲁棒性测试、漂移原型设计以及模型训练前的验证。通过提供行业特定的模拟场景(如信用风险、交易异常、流动性模拟、提示复杂性评估、因子制度变化、索赔频率、试验信号、患者流、缺陷检测、攻击强度、假设强度、促销弹性、客户流失等),使组织能够在历史证据不足或现实成本过高的情况下,提前测试和训练其模型系统。数据集配套提供机器可读的列合约和语义类型模式文件、统计质量和覆盖度指标文件、可重复性证据谱系文件以及发布清单文件。

The Semanta dataset suite is a large-scale synthetic tabular dataset for multiple industry verticals. It is generated by Semantas World Intelligent Operating System to demonstrate its ability to produce structured, scenario-covered synthetic worlds across a wide range of industries, rather than a single demo dataset. The dataset includes 11 industry domains: banking, AI, hedge funds, insurance, pharmaceuticals, healthcare, manufacturing, security, science, FMCG, and retail. Each industry dataset contains 100,000 rows and 100 columns, with a total data scale of 1,100,000 rows × 100 columns, amounting to 110 million cells. All data is fully synthetic, with no use of customer data or external model provider data. The overall dataset quality score is 0.965, and the scenario coverage score is 1.000, with independent quality assessment metrics for each industry (ranging from 0.946 to 0.981). The dataset is suitable for machine learning, deep learning, neural networks, and quantitative experiments, specifically designed for scenario robustness testing, drift prototyping, and pre-training model validation. By providing industry-specific simulation scenarios (such as credit risk, transaction anomalies, liquidity simulations, prompt complexity assessment, factor regime changes, claim frequency, trial signals, patient flow, defect detection, attack intensity, hypothesis strength, promotion elasticity, customer churn, etc.), it enables organizations to test and train their model systems in advance when historical evidence is insufficient or real-world costs are prohibitive. The dataset is accompanied by machine-readable column contracts and semantic type schema files, statistical quality and coverage metric files, reproducibility evidence lineage files, and release manifest files.

创建时间:
2026-06-16
原始信息汇总

Semanta Dataset Suite 数据集概述

基本信息

  • 数据集名称: Semanta Dataset Suite - Industry Vertical Synthetic Worlds
  • 许可证: MIT
  • 语言: 英语
  • 数据集大小: 1M < n < 10M
  • 任务类别: 表格分类、表格回归、时间序列预测
  • 标签: 合成数据、世界原生数据、表格数据、银行、人工智能、对冲基金、保险、制药、医疗、制造、安全、科学、快消品、零售

数据集规模

  • 仓库中发布的合成数据总行数:2,370,621
  • 行业垂直套件行数:1,100,000
  • 涵盖行业数:11
  • 每个行业列数:100
  • 总单元格数:110,000,000
  • 综合质量评分:0.965
  • 场景覆盖评分:1.000

数据来源与特性

  • 纯合成数据,不使用任何客户数据
  • 不涉及外部模型提供商
  • 为机器/深度学习、神经网络、量化实验、场景鲁棒性、漂移原型及StarForge/Gamma训练交接设计

可下载内容

内容 说明
data/industry_vertical_suite/<行业>/*.csv.gz 按行业划分的训练就绪合成表格数据世界
schemas/industry_vertical_suite/*.json 机器可读的字段合约与语义类型
metrics/industry_vertical_suite/*_quality_metrics.json 各垂直领域统计质量与覆盖度指标
metrics/industry_vertical_suite/suite_scorecard.json 执行层面的套件就绪度与质量评分卡
semanta/industry_vertical_suite/lineage.json 可复现性与源策略证据
semanta/industry_vertical_suite/publication_manifest.json 发布清单、文件及声明边界

行业数据集详情

1. 银行 (Banks)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.968
  • 主要用例: 信用风险、交易异常、流动性与操作风险模拟
  • 数据文件: data/industry_vertical_suite/banks/semanta_banks_world_native_synthetic_100000x100.csv.gz

2. 人工智能 (AI)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.973
  • 主要用例: 提示复杂度、评估难度、幻觉风险与工具使用场景生成
  • 数据文件: data/industry_vertical_suite/ai/semanta_ai_world_native_synthetic_100000x100.csv.gz

3. 对冲基金 (Hedge Funds)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.978
  • 主要用例: 因子体制、回撤、流动性与阿尔法衰减场景生成
  • 数据文件: data/industry_vertical_suite/hedge_funds/semanta_hedge_funds_world_native_synthetic_100000x100.csv.gz

4. 保险 (Insurance)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.977
  • 主要用例: 理赔频率、损失严重性、准备金充足率与巨灾尾部模拟
  • 数据文件: data/industry_vertical_suite/insurance/semanta_insurance_world_native_synthetic_100000x100.csv.gz

5. 制药 (Pharma)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.961
  • 主要用例: 试验信号、安全性、监管延迟与上市准备场景生成
  • 数据文件: data/industry_vertical_suite/pharma/semanta_pharma_world_native_synthetic_100000x100.csv.gz

6. 医疗 (Medicine)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.967
  • 主要用例: 患者流动、诊断不确定性、治疗反应与容量风险模拟
  • 数据文件: data/industry_vertical_suite/medicine/semanta_medicine_world_native_synthetic_100000x100.csv.gz

7. 制造 (Manufacturing)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.957
  • 主要用例: 缺陷、停机、传感器漂移、吞吐量与供应商风险模拟
  • 数据文件: data/industry_vertical_suite/manufacturing/semanta_manufacturing_world_native_synthetic_100000x100.csv.gz

8. 安全 (Security)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.981
  • 主要用例: 攻击强度、告警噪声、响应延迟与资产关键性模拟
  • 数据文件: data/industry_vertical_suite/security/semanta_security_world_native_synthetic_100000x100.csv.gz

9. 科学 (Science)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.946
  • 主要用例: 假设强度、实验噪声、复现性与发现潜力模拟
  • 数据文件: data/industry_vertical_suite/science/semanta_science_world_native_synthetic_100000x100.csv.gz

10. 快消品 (FMCG)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.952
  • 主要用例: 促销、需求弹性、缺货、渠道转移与定价场景生成
  • 数据文件: data/industry_vertical_suite/fmcg/semanta_fmcg_world_native_synthetic_100000x100.csv.gz

11. 零售 (Retail)

  • 行数: 100,000 | 列数: 100 | 质量评分: 0.957
  • 主要用例: 购物篮、流失、客流、降价、库存与客户行为模拟
  • 数据文件: data/industry_vertical_suite/retail/semanta_retail_world_native_synthetic_100000x100.csv.gz

运行凭证

  • 运行ID: industry-suite-20260618-01
  • 规范版本: v3.7 Final
  • 生产烟雾门: 13/13 公共证明目标已通过
搜集汇总
数据集介绍
semanta-dataset-suite 数据集图片
构建方式
Semanta Dataset Suite 是 Semanta“世界智能操作系统”面向市场的一款综合性行业合成数据集。该数据集完全基于合成技术构建,未使用任何真实客户数据或外部模型提供者(如 DeepSeek、Gamma)的数据。其构建核心在于通过系统化的场景覆盖方法论,为金融、医疗、制造等11个垂直行业各生成包含10万行、100列的结构化表格世界。每个行业包均配备完整的机器可读列合约(JSON 格式)、统计质量指标与可复现性溯源证据,确保数据生成过程的透明性与可审计性。整个套件总计发布237万行数据,其中行业垂直套件贡献110万行,总体质量评分高达0.965,场景覆盖率指标达到满分1.000。
特点
该数据集最显著的特征在于其跨行业覆盖的广度与深层场景构建能力。它并非单一领域的窄演示数据集,而是横跨银行、对冲基金、保险、医药、零售等11个高度多样化的垂直领域,每个领域都针对特定的商业痛点设计,如信用风险、因子轮动、理赔极端值、临床试验瓶颈等。每个行业包均经由13/13的生产级烟雾测试门禁验证,并提供完整的质量评分卡、溯源清单与发布声明。数据原生设计用于机器学习、深度学习及神经网络实验,特别适合场景鲁棒性测试、漂移原型开发以及 StarForge 或 Gamma 训练交接,体现了从真实数据的“一维切片”到“360度操作空间”的范式跃迁。
使用方法
用户可通过 Hugging Face 仓库直接下载使用。仓库中提供按行业组织的 CSV.GZ 压缩数据文件(路径如 data/industry_vertical_suite/<行业名>/*.csv.gz),以及对应的 JSON 格式列合约与质量指标。数据可直接加载至 Python 的 Pandas 或 PyTorch 等主流框架中,用于分类、回归或时间序列预测任务。建议用户优先查阅各行业的质量指标文件(metrics/industry_vertical_suite/*_quality_metrics.json)以评估数据对特定下游任务的适用性。此外,开发者可通过 Semanta 公开 API(api-staging.semanta.xyz)访问实时生成接口与无登录证据包,或通过 Studio 引导式演示界面探索交互式工作流。详细 API 文档与投资摘要亦随附于仓库文档目录中。
背景与挑战
背景概述
Semanta Dataset Suite是由Semanta团队于2026年6月发布的合成数据集系列,旨在为银行、保险、医药、制造等11个行业提供大规模、结构化的世界原生数据。该数据集由Semanta智能操作系统自动生成,涵盖100万行以上、每行业100列的表征数据,整体质量评分达0.965。其核心研究问题在于解决真实企业数据仅能观测到有限现实片段的困境,通过合成技术扩展出包含多种情景、冲击与尾部事件的完整操作空间,使机器学习与深度学习系统能够在更全面的现实可能性中训练与测试。该数据集对金融风控、量化交易、临床AI、工业预测等领域的模型稳健性与场景覆盖研究产生了重要影响,尤其为缺乏极端事件历史数据的行业提供了可复现的基准测试环境。
当前挑战
当前数据集面临的核心挑战包括:一是应对真实世界数据稀缺且偏态分布的领域问题,例如银行信贷危机、保险巨灾损失等尾部事件在历史记录中极少出现,导致传统模型无法充分学习风险模式;二是构建过程中需确保合成数据的高保真度与场景覆盖率,平衡各行业100个变量间的复杂依赖关系,同时保持统计性质的真实性;三是需在无真实客户数据参与的前提下,生成能够模拟监管延迟、传感器漂移、诊断不确定性等专业领域细微动态的数据,这对语义建模与因果结构提出了极高要求。此外,数据集的跨行业泛化能力和可解释性验证也是持续面临的挑战。
常用场景
经典使用场景
在机器学习和深度学习的研究范式中,高质量的合成数据扮演着不可或缺的角色。Semanta Dataset Suite 的核心价值在于为多个垂直行业提供大规模、结构化、情景覆盖的合成世界数据。其最经典的使用场景包括分类与回归任务的模型训练,例如在银行领域进行信用风险评估与交易异常检测,在保险领域进行索赔频率与损失严重度的预测建模。此外,该数据集亦广泛用于时间序列预测任务,如对冲基金领域的因子制度与流动性冲击模拟,以及制造业中传感器漂移与设备停机时间的预测。通过覆盖11个行业的10万行100列的标准表格数据,研究者能够获得一个可直接用于监督学习与无监督学习的理想训练与测试平台。
实际应用
在实际产业应用中,Semanta Dataset Suite 为金融机构、医疗系统、消费品制造商等提供了在真实数据暴露风险之前验证业务模型的有效途径。银行可利用该合成数据对信贷与反欺诈系统进行压力测试,模拟市场制度突变下的流动性风险,而无需等待历史数据积累。医院能够在不涉及患者隐私的前提下,测试分诊与再入院模型的承载能力,并评估容量冲击下的系统表现。消费品公司可以通过该数据集模拟需求弹性和渠道转移,优化促销策略与库存管理,避免实际贸易支出后的意外损失。这种数据驱动的决策演练机制,有效降低了模型上线后的失败成本,成为企业数字化转型中风险控制与合规验证的重要基础设施。
衍生相关工作
围绕 Semanta Dataset Suite 的推出,已经衍生出一系列具有启发性的相关研究与技术工作。其中,数据质量指标与场景覆盖度评估框架为该领域树立了可量化的合成数据质量标准,使得研究者能够系统地衡量数据的可信度与多样性。基于该套件中的行业专用场景,业界涌现了针对金融领域流动性危机的策略脆弱性分析方法,以及在保险业中灾难尾部事件下的准备金充足度模拟算法。此外,该数据集为世界原生数据的生成与复现技术提供了完整的血统与可复现性证据链,推动了合成数据在模型鲁棒性训练与分布漂移原型测试中的进一步应用,后续工作可围绕其多行业覆盖特性,探索跨行业迁移学习与通用智能体的评估基准构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务