遇见数据集

cyber-investigator

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集名为“cyber-investigator”,是一个专为AI助手训练设计的LoRA兼容数据集,用于评估案件事实并推荐符合菲律宾网络犯罪法(如RA 10175、RA 11934)的调查行动。数据集使用英语和Taglish(菲律宾语混合英语)。数据内容由两部分组成:1. 人工策划数据(99条):高质量、人工编写的事件报告风格示例,包含分类、推荐行动、证据优先级和下一步措施。2. 合成数据(1700条):从官方事件报告生成,经过清洗和分块处理,分为模板生成和LLM生成两步。数据字段包括id、scenario_type、domain、risk_level、requires_referral、refusal_safe、instruction、input、analysis、output、source。数据规模:训练集共2011条样本,总大小约2.65MB。适用任务:文本生成、问答,特别适用于LoRA/QLoRA微调Qwen2.5-7B-Instruct系列模型,以及检索增强推理。输出应为草稿材料,需经合格人类调查员审核。注意事项:数据集非法律权威,合成数据占多数,语料库仅39份IR文件,未进行评估集划分,存在精度权衡,语言覆盖不均衡。

The dataset named cyber-investigator is a LoRA-compatible dataset designed for training AI assistants to evaluate case facts and recommend investigative actions in compliance with Philippine cybercrime laws (e.g., RA 10175, RA 11934). It uses English and Taglish (a mix of Tagalog and English). The data consists of two parts: 1. Human-curated data (99 samples): high-quality, manually written incident report-style examples with classifications, recommended actions, evidence priorities, and next steps. 2. Synthetic data (1700 samples): generated from official incident reports indexed in a local Qdrant vector store, cleaned and chunked, with two generation steps (template-based and LLM-based). Fields include id, scenario_type, domain, risk_level, requires_referral, refusal_safe, instruction, input, analysis, output, source. Size: 2011 training samples, ~2.65 MB. Suitable for text generation, QA, especially for LoRA/QLoRA fine-tuning of Qwen2.5-7B-Instruct models and retrieval-augmented reasoning. Outputs are draft materials requiring human review. Note: not legal authority, dominated by synthetic data, corpus only 39 IR files, no evaluation split, precision trade-offs with 4-bit base models, unbalanced language coverage.

创建时间:
2026-08-07
原始信息汇总

数据集概述:cyber-investigator

基本信息

  • 语言:英语(en)、菲律宾语(fil)
  • 许可证:MIT
  • 任务类型:文本生成、问答
  • 数据规模:小于1K条(实际为1,799条)
  • 标签:法律、网络犯罪、菲律宾法律、调查员训练、LoRA、合成数据、RAG、菲律宾语、他加禄语

数据内容

该数据集用于训练AI助手评估案件事实并依据菲律宾网络犯罪法律(如RA 10175、RA 11934)推荐调查行动,支持英语和Taglish(英语与他加禄语混合)两种语言。数据来自两个来源:

  1. 人工策划数据(99条):高质量、人工撰写的事件报告风格示例,包含分类、建议行动、证据优先级和下一步调查步骤。
  2. 合成数据(1,700条,ID以synth-开头):基于官方事件报告(IRs)生成,这些报告存储在本地Qdrant向量数据库中。合成过程分为两阶段:
    • 模板阶段(850条):使用静态模板生成(指令/输入/输出)。
    • LLM阶段(850条):使用Cybercop AI的LoRA适配器(Qwen2.5-7B-Instruct-bnb-4bit + LoRA r=16)生成多样化、与主题相关的输出内容。

数据模式(Schema)

每个数据条目包含以下字段:

  • id(字符串):唯一行ID;策划数据使用真实ID,合成数据以synth-开头
  • scenario_type(字符串):场景类型(如分类、报告起草、IOC提取等)
  • domain(字符串):固定为cyber_investigation
  • risk_level(字符串):合成数据标记为unverified
  • requires_referral(布尔值):固定为true(始终需人工复核)
  • refusal_safe(布尔值):固定为true
  • instruction(字符串):提示/任务描述
  • input(字符串):经过净化的事件报告摘录
  • analysis(字符串):元注释;合成数据标注为(synthesized from Qdrant IR chunk; verify before use)
  • output(字符串):推荐的响应/分类/行动
  • source(字符串):合成数据来源为sanitized IRs;策划数据有各自来源

数据净化措施

所有来源事件报告和合成数据均已清除所有单位/工作组/地区办公室/机构标识,包括单位名称、代码、地区办公室代码和机构名称(如国家警察)。净化措施包括:

  • 在摄入时(Qdrant)通过正则表达式将已知单位标识替换为中性占位符
  • 合成器在最终阶段再次净化文本
  • 全数据集grep验证返回0个单位泄露匹配

数据划分

  • 训练集:1,799条示例,文件大小约2.65 MB
  • 下载大小:约228 KB

预期用途

  • LoRA/QLoRA微调:适用于Qwen2.5-7B-Instruct系列模型的4-bit基础+LoRA微调
  • 检索增强生成(RAG):推理时结合向量数据库的上下文使用
  • 草稿/分类材料:生成分类、建议行动、证据优先级和下一步调查步骤

局限性

  • 非法律权威:输出仅为建议,行动前需经过合格调查人员审查
  • 合成数据占多数:约1,700/1,799条为合成数据,主要教授格式、语气和结构
  • 来源语料较小:仅39份事件报告文件,256个唯一文本块,多样性有限
  • 单一适配器LLM生成:合成器使用同一小型适配器,输出可能反映其偏差
  • 无评估集:未进行校准或错误率测量
  • 语言覆盖不均:英语和Taglish/他加禄语覆盖不均衡

范围之外的内容

  • 不包含39份源事件报告以外的实时案件数据
  • 不包含受害者身份识别信息(PII)
  • 数据和输出中不含任何单位归属信息
搜集汇总
数据集介绍
cyber-investigator 数据集图片
构建方式
该数据集融合了人工策展与自动化合成两种途径,构建了一套专用于菲律宾网络犯罪调查助手微调的训练语料。其中,99条人工撰写的案例涵盖了分类、报告起草及IOC提取等场景,严格遵循RA 10175等法律框架。另有1700条合成数据源自经脱敏处理的官方事件报告,这些报告在摄入时即通过正则表达式清洗去除所有单位标识,并经由模板生成与大型语言模型生成两轮工序,确保了内容的多样性与专业性。
特点
数据集的核心特色在于其双语(英语与Taglish)能力以及严格的隐私保护措施。所有合成数据均经过双重脱敏验证,确保不含任何机构归属信息,满足无归因要求。此外,数据集的元数据结构丰富,包含风险等级、转介需求等字段,便于精细控制模型行为。然而,合成数据占据主导,且来源语料规模有限,可能限制了知识的广度与权威性。
使用方法
该数据集主要面向LoRA/QLoRA微调场景,适用于Qwen2.5-7B-Instruct家族的模型。使用时,建议结合检索增强生成(RAG)上下文,将输出视为草稿或初步分类建议,必须由合格的人类调查员审核后方可采纳。数据集中所有样本均标记为需要转介,且拒绝安全,适合训练保守、谨慎的助手。由于缺乏独立评估集,用户应谨慎对待模型输出的准确性,并依据最新法律进行验证。
背景与挑战
背景概述
cyber-investigator数据集诞生于网络犯罪调查与人工智能交叉领域的迫切需求,由Cybercop AI团队于近期构建,旨在为菲律宾网络犯罪法律(如RA 10175、RA 11934)下的案件事实评估与调查行动推荐提供专业的AI助手训练语料。该数据集融合了99条人工精标的高质量案例与1700条源自真实事件报告(IRs)的合成数据,覆盖英语与Taglish双语,填补了低资源语言环境下法律与网络犯罪领域指令微调数据集的空白。其设计强调人机协同,所有输出均需合格调查员复核,并严格去敏,杜绝单位归属泄露,为构建合规、安全的网络犯罪调查辅助系统奠定了数据基础,对推动该领域AI应用具有示范意义。
当前挑战
该数据集面临多重挑战。领域层面,网络犯罪调查涉及法律解释的复杂性与情境依赖性,要求模型精准理解菲律宾法律条文并生成可操作建议,而低资源语言(Taglish)的稀缺性进一步加剧了模型泛化难度。构建层面,原始IRs为内部操作文件,需在不泄露单位标识的前提下提取有用信息,去敏过程复杂且需严格验证;合成数据虽丰富了样本,但占比过高,可能引入模板化或泛化不足的问题,且仅39个源文件、256个独特文本块限制了多样性;合成过程依赖单一LoRA适配器,可能继承其偏见;数据集缺乏独立测试集,无法量化误差率,限制了可靠性评估。
常用场景
经典使用场景
该数据集专为基于菲律宾网络犯罪法律(如RA 10175、RA 11934)的AI调查助手设计,主要用于LoRA/QLoRA微调训练。其经典使用场景涵盖案件事实评估、犯罪分类、证据优先级排序及后续调查步骤建议,支持英语和塔加洛语(Taglish)双语输入,输出为需经合格调查员复核的草拟材料。数据集中包含人工策划的高质量示例和从真实事件报告(IRs)经脱敏合成的1700条数据,通过模板生成和LLM生成两种方式构建,兼顾了内容的规范性和多样性。
衍生相关工作
该数据集衍生出的相关工作包括:基于Qwen2.5-7B-Instruct的Cybercop AI LoRA适配器,用于生成合成训练数据;利用Qdrant向量库构建的脱敏事件报告索引,支持语义检索;以及数据合成流水线,涉及文档解析、分块、嵌入和模板/LLM生成等环节。此外,该数据集还启发了关于法律NLP中数据脱敏、低资源语言处理、以及人机协同调查流程的研究,并为后续开发多语言网络犯罪助手或扩展至其他司法管辖区提供了基础框架。
数据集最近研究
最新研究方向
该数据集聚焦于菲律宾网络犯罪调查领域,结合了特定法域(如RA 10175)与多语言(英语及他加禄语)的复杂情境,前沿研究方向在于利用合成数据与检索增强生成技术,训练具备初步研判能力的AI调查助手。其核心创新在于通过大规模合成(约1700条基于真实事件报告清洗后的衍生数据)与少量人工精标(99条)的混合策略,在保护隐私(去标识化单元归属)的前提下,拓展了模型对案例事实分析、证据优先级排序及后续行动建议的覆盖度。这一方法契合了法律AI中数据稀缺与隐私合规的双重挑战,并为低资源语言的专业助手微调提供了可复现的范式。此外,强调输出需经人类调查员复核的设计,体现了负责任AI在司法辅助场景中的审慎应用,其对事件报告(IR)的结构化转换与向量检索整合,亦为领域知识注入与模型持续迭代开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务