遇见数据集

multilingual-fraudchat

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多语言对话数据集,专门用于分析和识别对话中的特定模式。数据集包含10657个对话样本,划分为训练集(7559样本)、验证集(1540样本)和测试集(1558样本)。每个样本代表对话中的一个轮次,包含以下字段:conversation_id(唯一对话标识符)、turn_id(对话轮次序号)、text(对话文本内容)、label(样本标签)、language(对话语言)、speaker_role(说话者角色,如诈骗者或受害者)、tactic_labels(对话中使用的策略或技巧标签)、scam_type(诈骗类型分类)。数据集适用于自然语言处理任务,特别是对话分析、意图识别、欺诈检测和策略分类等场景。

This multilingual dialogue dataset is specifically developed for analyzing and recognizing specific patterns within conversational content. Comprising a total of 10,657 dialogue samples, the dataset is divided into three subsets: training set (7,559 samples), validation set (1,540 samples), and test set (1,558 samples). Each sample corresponds to a single dialogue turn, and contains the following fields: conversation_id (unique conversation identifier), turn_id (serial number of the dialogue turn), text (dialogue text content), label (sample label), language (language of the conversation), speaker_role (role of the speaker, such as scammer or victim), tactic_labels (labels of strategies or tactics employed in the dialogue), and scam_type (fraud type classification). This dataset is suitable for natural language processing tasks, particularly in scenarios including dialogue analysis, intent recognition, fraud detection, and tactic classification.

创建时间:
2026-05-30
原始信息汇总

数据集概述:Multilingual Fraudchat

数据集地址: https://huggingface.co/datasets/faruqolami/multilingual-fraudchat

许可协议: MIT

数据集简介: 该数据集为一个多语言欺诈对话数据集,包含日常对话中被标注为欺诈企图的文本内容。数据集的完整描述、来源和构建方法,建议通过数据集主页获取。

数据集结构与特征

数据集包含以下特征字段:

  • conversation_id: 对话的唯一标识符 (string)
  • turn_id: 在对话中的轮次编号 (int64)
  • text: 对话的文本内容 (string)
  • label: 对话标签 (string)
  • language: 文本语言 (string)
  • speaker_role: 说话者角色 (string)
  • tactic_labels: 欺诈策略标签 (string)
  • scam_type: 欺诈类型 (string)
  • index_level_0: 索引字段 (int64)

数据集划分与规模

数据集总大小为 1,669,327 字节,共包含三个子集:

划分 样本数量 大小 (字节)
训练集 (train) 7,559 1,186,224
验证集 (val) 1,540 240,598
测试集 (test) 1,558 242,505

总计: 10,657 条对话样本

数据文件

数据集采用单个配置 default,数据文件存储在 data/ 目录下,并按照划分进行组织:

  • 训练集: data/train-*
  • 验证集: data/val-*
  • 测试集: data/test-*
搜集汇总
数据集介绍
multilingual-fraudchat 数据集图片
构建方式
在数字通信日益频繁的当下,欺诈性对话已成为网络安全领域的一大隐患,而高质量的多语言欺诈对话数据集却十分稀缺。multilingual-fraudchat数据集应运而生,其构建过程精心搜集了来自多种语言的真实或模拟欺诈对话,涵盖了对话ID、轮次编号、文本内容、标签、语言种类、说话者角色、策略标签以及欺诈类型等丰富字段。数据集被划分为训练集(7559条)、验证集(1540条)和测试集(1558条),确保模型训练与评估的完整性。每条对话均经过细致标注,以捕捉欺诈行为的微妙特征,为后续研究奠定坚实基础。
特点
该数据集的核心特色在于其多语言覆盖与结构化标注的深度结合。它囊括了多种语言的欺诈对话实例,旨在提升跨语言场景下的欺诈检测能力。标签体系尤为细致,包含对话级标签(如欺诈类型)、轮次级标签(如说话者角色)以及策略级标签(如心理操纵手法),这种多层次标注使得模型能够从微观对话动态到宏观欺诈模式进行全面学习。数据集的规模虽不大,但每一条记录都经过精雕细琢,确保了标注一致性与领域相关性。
使用方法
使用者可借助HuggingFace Datasets库便捷加载该数据集,通过指定配置名'default'及所需数据分割(如'train'、'val'、'test')即可访问。典型应用场景包括训练基于文本的分类模型以识别欺诈对话,或利用轮次级信息分析欺诈者的话术演变。建议将'text'字段作为模型输入,结合'label'或'scam_type'进行监督学习;'tactic_labels'字段则可用于多标签分类任务。此外,'speaker_role'字段有助于构建角色感知的序列模型,而'language'字段支持跨语言迁移学习实验。
背景与挑战
背景概述
在全球化与数字化深度交融的当下,跨语言欺诈行为(如电信诈骗、网络钓鱼)日益猖獗,对个人隐私与财产安全构成严峻威胁。为此,多语言欺诈对话数据集(multilingual-fraudchat)应运而生。该数据集由致力于安全人工智能研究的机构创建,发布于HuggingFace平台,其核心研究问题聚焦于构建可自动识别与解构多语言欺诈对话模式的计算模型。通过收录涵盖多种语言的欺诈对话样本,并精细标注speaker_role、tactic_labels与scam_type等关键信息,该数据集为欺诈检测、对话分析与多语言自然语言处理领域提供了标准化评估基准,显著推动了人机交互中欺诈行为的自动化识别研究。
当前挑战
该数据集所应对的核心领域挑战在于欺诈手法的多语言变异与动态演化——不同文化语境下的欺诈策略(如社会工程学技巧)差异显著,且欺诈者频繁更新术语与话术,致使传统单语言或静态规则模型难以有效泛化。在构建过程中,数据收集面临隐私保护与样本真实性的两难困境:真实欺诈对话涉及敏感信息,需在脱敏与保留语义特征间取得平衡;此外,对话标注需跨语言专家协作,确保tactic_labels与scam_type在多种语言中具有一致的语义定义,这大幅增加了数据清洗与标注的难度与成本。
常用场景
经典使用场景
在网络安全与对话智能的交叉领域中,多语言欺诈对话检测是极具挑战性的课题。multilingual-fraudchat数据集以真实世界中的多语言欺诈对话为核心,精心标注了话轮、说话人角色、欺诈类型及具体策略标签,为研究者提供了一个标准化的基准。其最经典的使用场景在于训练和评估面向多语种环境的欺诈对话识别模型,特别适合用于序列标注与对话级分类任务,以捕捉欺诈者逐步诱导受害者的语言模式。
解决学术问题
该数据集直接回应了当前学术界在跨语言欺诈检测中面临的语料匮乏与标注不一致的难题。通过提供涵盖多种语言的高质量对话样本,它支持研究者深入分析不同文化背景下欺诈话术的共通性与特异性,推动从单一语言模型向多语言泛化模型的跨越。这一资源对于理解欺诈行为的动态演化机制、提升模型在低资源语言上的鲁棒性,具有重要的理论价值与范式意义。
衍生相关工作
该数据集催生了一系列前沿研究方向,包括多任务学习框架下的欺诈策略识别、基于跨语言对抗训练的鲁棒性提升方法,以及融合图神经网络的对话结构分析。相关工作已围绕细粒度的说话人角色建模与欺诈时序模式展开,推动了从文本内容到对话行为意图的深层理解。这些探索不仅丰富了对话安全领域的技术工具箱,也为后续构建可解释的金融风控模型奠定了数据与方法基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务