遇见数据集

TSAI-MetaFraud

收藏
arXiv2026-07-10 更新2026-07-13 收录
数据链接:
官方服务:

资源简介:

TSAI-MetaFraud是由新不伦瑞克大学可信与安全人工智能实验室创建的多模态、多任务基准数据集,旨在支持虚拟经济中的欺诈分析研究。该数据集整合了行为、交易和图结构信息,包含936个活跃虚拟化身的行为轨迹、交易记录和交互网络,并注入了自动化机器人、欺诈交易等真实恶意场景。其构建基于OpenSimulator虚拟环境,通过脚本记录化身行为与服务器日志捕获金融事件,并利用公开击键动态数据建模人类行为分布。该数据集主要应用于元宇宙生态系统中的欺诈检测、行为风险分析、图挖掘及可信人工智能领域,致力于解决虚拟经济中多模态欺诈行为识别与安全威胁评估的挑战。

TSAI-MetaFraud is a multimodal, multi-task benchmark dataset created by the Trusted and Secure Artificial Intelligence Lab at the University of New Brunswick, designed to support fraud analysis research in virtual economies. This dataset integrates behavioral, transactional, and graph-structured information, containing behavioral trajectories, transaction records, and interaction networks of 936 active virtual avatars, and injects real malicious scenarios such as automated bots and fraudulent transactions. It is constructed based on the OpenSimulator virtual environment, where avatar behaviors are recorded via scripts and financial events are captured through server logs, and human behavioral distributions are modeled using public keystroke dynamics data. This dataset is mainly applied in the fields of fraud detection, behavioral risk analysis, graph mining, and trustworthy artificial intelligence in metaverse ecosystems, aiming to address the challenges of multimodal fraud behavior recognition and security threat assessment in virtual economies.

创建时间:
2026-07-10
原始信息汇总

数据集概述:MetaFraud

MetaFraud 是一个面向虚拟经济中金融欺诈与行为风险检测的多模态、多任务基准数据集。该数据集源自使用 OpenSimulator (OpenSim) 构建的模拟元宇宙环境,整合了行为遥测、金融交易和异构图表结构。

数据格式

数据集提供两种格式以满足不同研究需求:

  1. 模块化图格式: 包含表示虚拟化身、会话和交易边的关系型表格,适用于图神经网络(GNN)。
  2. 统一表格格式: 一个扁平的、以交易为中心的合并表格 (tabular_benchmark_dataset.csv),适用于传统机器学习模型(如 XGBoost、随机森林)。

核心统计

统计项 数值
活跃虚拟化身 (Avatars) 936
行为会话 (Sessions) 936
金融交易 (边/Edges) 74,671
行为交互 (事件/Events) 230,490
数据采集时长 24 小时

类别分布

数据集呈现高度不平衡的类别分布,模拟真实的金融欺诈场景。

虚拟化身节点类别 (node_avatars_classes.csv)

类别 数量 描述
真实 (Real) 465 合法的人类玩家
未知 (Unknown) 400 未标记/背景账户
行为欺诈 (Behavioral Fraud) 45 自动化脚本(隐形/普通机器人)
金融欺诈 (Financial Fraud) 16 参与非法金融活动的账户
混合 (Both) 10 自动化金融欺诈混合账户
总计 936

交易边类别 (edge_transactions.csvtabular_benchmark_dataset.csv)

类别 数量 描述
真实 (Real) 37,081 合法的世界内资产交易
未知 (Unknown) 31,825 未标记的背景交易
行为欺诈 (Behavioral Fraud) 3,630 由自动化机器人账户发起的交易
金融欺诈 (Financial Fraud) 1,310 非法/洗钱金融转账
混合 (Both) 825 涉及自动化欺诈混合账户的交易
总计 74,671

基准任务

MetaFraud 支持以下四项关键基准任务:

  1. 任务一:交易欺诈检测

    • 描述: 归纳式边分类任务。区分良性交易与涉及未见账户的行为欺诈、金融欺诈和混合欺诈类别。
    • 评估指标: Macro F1, AUROC, AUPRC。
  2. 任务二:跨模态节点分类

    • 描述: 多类别节点分类。通过结合会话级别的生物特征遥测和图级别的结构中心性,识别用户画像(良性人类、自动化脚本、金融欺诈者或混合型)。
    • 评估指标: Macro F1, AUROC, AUPRC。
  3. 任务三:时序链接预测

    • 描述: 预测时序图切片序列上未来金融交易的形成。
    • 评估指标: AUROC, Average Precision (AP), HR@K。
  4. 任务四:弱监督欺诈检测

    • 描述: 在严重的标签稀缺(90% 的标签被遮蔽)条件下,预测虚拟化身群体的多类别欺诈标签。
    • 评估指标: Macro Precision, Macro Recall, Macro F1。

顶级目录结构

. ├── edge_transactions.csv # 交易边属性和目标 ├── node_avatars.csv # 虚拟化身特征(账户年龄、中心性) ├── node_sessions.csv # 会话特征(时长、活动指标) ├── node_avatars_classes.csv # 虚拟化身节点的多类别标签 ├── tabular_benchmark_dataset.csv # 用于机器学习模型的统一扁平表格数据集 ├── LICENSE # Creative Commons Attribution 4.0 License ├── images/ # 可视化图和流程示意图 └── README.md # 本文件

许可与引用

  • 许可协议: Creative Commons Attribution 4.0 License。
  • 引用: 使用该数据集时,请引用论文《TSAI-MetaFraud: a benchmark dataset for financial fraud transaction and behavioral risk detection in metaverse ecosystems》,DOI: 10.48550/arxiv.2607.09528。
搜集汇总
数据集介绍
TSAI-MetaFraud 数据集图片
构建方式
TSAI-MetaFraud数据集构建于基于OpenSimulator的虚拟世界环境中,模拟了一个包含商业区、交易区和住宅区的多区域元宇宙经济体。数据采集通过多层级管线实现:利用内嵌的Linden脚本语言实时记录化身移动轨迹、物体交互与用户行为,同时服务器端交易日志捕获所有财务事件的完整信息。为模拟真实用户行为,从公开KMT击键动态数据集中提取人类行为时序分布,并拟合高斯核密度估计以生成良性化身的行为特征。恶意账户分为两类:朴素机器人遵循固定时序分布,而隐匿机器人从人类派生分布中采样但保持较低行为方差,从而制造了良性行为与恶意行为之间的有意义重叠,防止简单的类别分离。
使用方法
该数据集定义了四个基准任务以支持可重复评估。交易欺诈检测任务要求对涉及未见账户的交易边缘进行多分类;跨模态节点分类任务结合会话级行为特征与图结构属性对化身类别进行识别;时序链接预测任务基于历史交易图快照预测未来交易概率;弱监督欺诈检测模拟实际调查场景,在仅保留10%标签的条件下评估模型从长尾分布中传播信号的能力。数据以图格式(包含化身属性、会话生物特征、交易边缘及标签)和表格格式(24维特征向量)公开发布,并提供了逻辑回归、随机森林、XGBoost及GraphSAGE等基线模型的结果,为多模态学习与图挖掘研究建立了参照性能水平。
背景与挑战
背景概述
随着元宇宙生态系统的迅猛发展,虚拟经济体系逐渐成为数字世界的重要组成部分,然而,随之而来的金融欺诈、自动化机器人行为及非法金融活动对平台的安全性与可信度构成了严峻挑战。现有数据集往往孤立地聚焦于用户行为、身份认证或金融交易中的单一维度,难以支撑多模态欺诈检测方法的可重复评估与系统性研究。为弥合这一关键空白,加拿大新不伦瑞克大学可信与安全人工智能实验室(TSAI Lab)的Refat Ishrak Hemel、Ehsan Hallaji与Roozbeh Razavi-Far于2026年推出了TSAI-MetaFraud基准数据集。该数据集基于OpenSimulator模拟的元宇宙环境,同步捕获行为轨迹、金融交易与图结构信息,并嵌入真实欺诈与自动化机器人场景,为虚拟经济中的多模态学习、图挖掘及可信人工智能研究提供了统一的实验平台。TSAI-MetaFraud的发布不仅填补了元宇宙欺诈分析领域缺乏综合性基准的空白,还通过定义四类标准任务推动了相关领域的可重复研究。
当前挑战
TSAI-MetaFraud所面临的挑战可从两个层面加以审视。其一,在领域问题层面,该数据集旨在解决元宇宙虚拟经济中欺诈检测的复杂难题:金融交易与化身行为、社交互动及移动模式紧密交织,恶意行为者可同时利用行为与金融通道实施攻击,传统的单一模态检测方法难以应对这种异质信息融合需求;此外,真实世界中的欺诈标签极为稀缺,且类别严重不平衡,使得模型在弱监督条件下难以有效泛化。其二,在构建过程中,研究人员需克服模拟环境中真实性、可控性与多样性之间的平衡难题:如何设计逼真的交互场景以模拟正常与恶意行为,如何生成具有隐蔽性与多样性的自动化机器人账户以避免简单阈值分离,以及如何在保证隐私伦理的前提下完成大规模数据采集与标注,均是构建该基准时面临的核心挑战。
常用场景
经典使用场景
在元宇宙生态系统的虚拟经济中,欺诈检测与行为风险分析是核心挑战。TSAI-MetaFraud作为首个多模态基准数据集,整合了行为活动、金融交易和图结构信息,支持交易欺诈检测、跨模态节点分类、时序链路预测及弱监督欺诈检测等经典任务。其设计体现了虚拟世界中行为与金融数据的交织特性,为评估多模态和图学习方法在欺诈分析中的性能提供了统一平台。
解决学术问题
该数据集填补了元宇宙领域缺乏统一多模态欺诈基准的空白,解决了现有资源孤立关注行为、交易或网络结构的局限。通过模拟真实欺诈、自动机器人和混合攻击场景,它促使研究者探索行为与交易特征的互补性,揭示了图神经网络在捕捉复杂欺诈模式中的优势,以及传统模型在金融欺诈检测上的不足。其高不平衡性和标签稀缺性为推动半监督、弱监督及图学习研究提供了严苛的测试床。
实际应用
实际应用中,TSAI-MetaFraud模拟了元宇宙平台(如虚拟商业和数字资产交易环境)中的安全监控场景。它可用于开发智能反欺诈系统,实时区分真实用户与恶意机器人,识别结构化洗钱和混合攻击行为,并预测未来可疑交易链路。该数据集直接服务于虚拟经济的安全运营,帮助平台提升对欺诈行为的自动化防御能力,降低金融犯罪风险。
数据集最近研究
最新研究方向
TSAI-MetaFraud作为首个融合行为轨迹、金融交易与图结构信息的元宇宙欺诈分析多模态基准数据集,为虚拟经济中的可信AI研究提供了关键支撑。该数据集通过模拟真实虚拟世界中的欺诈交易、自动化机器人活动及混合攻击场景,开创了从单模态分析向多模态协同检测的前沿范式。当前研究核心聚焦于四个方向:面向跨模态节点分类的异构图神经网络架构设计,以捕捉行为特征与交易关系间的深层耦合;基于时序图快照的演化链接预测,应对虚拟经济中动态非平稳的欺诈模式;以及极低标注率下的弱监督学习,通过标签传播与自监督对比学习克服长尾分布与标签稀缺的双重挑战。该基准的发布标志着元宇宙安全研究从孤立数据集迈向标准化、可复现的评估体系,对推动多模态图学习、行为风险建模及虚拟世界金融安全监管具有奠基性意义。
相关研究论文
  • 1
    TSAI-MetaFraud: A Benchmark Dataset for Financial Fraud Transaction and Behavioral Risk Detection in Metaverse Ecosystems新不伦瑞克大学·计算机科学学院·可信与安全人工智能实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务