frodo
收藏资源简介:
一个包含904个条目的开放数据集,其中669个是来自Frida CodeShare的真实Frida脚本(每个脚本通过LLM增强,包含详细摘要、技术类别、用例、调用的确切Frida API、难度评级和质量评分),以及235个条目覆盖完整的Frida JavaScript API参考。适用于检索增强的Frida脚本生成、在动态检测任务上微调或评估代码模型,以及研究常见的移动安全技术。提供三种配置(完整/增强/原始)。
An open dataset containing 904 total entries. Of these, 669 are real Frida scripts sourced from Frida CodeShare; each script is enhanced via Large Language Model (LLM) and attached with detailed annotations including summaries, technical categories, use cases, exact invoked Frida APIs, difficulty ratings, and quality scores. The remaining 235 entries cover the complete Frida JavaScript API reference. This dataset is suitable for retrieval-augmented Frida script generation, fine-tuning or evaluating code models on dynamic detection tasks, as well as researching common mobile security techniques. Three configurations (full/enhanced/raw) are provided.
数据集概述
数据集名称: frodo
发布平台: Hugging Face
数据集地址: 🤗 ichioda/frodo
许可证: MIT (数据集自身代码);收录脚本保留原作者许可证
数据集构成
| 配置名称 | 文件 | 条目数 | 内容 |
|---|---|---|---|
| full (默认) | frodo-enriched-dataset.parquet | 904 | 包含增强后的 CodeShare 脚本 + 完整 Frida API 参考 |
| codeshare-enriched | frida-codeshare-enriched.parquet | 669 | CodeShare 脚本(已增强,有 LLM 生成元数据) |
| codeshare-raw | frida-codeshare-dataset.parquet | 669 | 原始 CodeShare 脚本(未增强) |
数据来源
- Frida CodeShare: 约 669 份社区贡献的 Frida 脚本,通过官方 REST API 抓取
- Frida JavaScript API: 共计 235 条,从官方 TypeScript 定义文件(
frida-gum、frida-java-bridge、frida-objc-bridge)解析,包含精确签名和 JSDoc - GitHub: 通过代码搜索索引已知 Frida API 模式的仓库
数据增强
每条 CodeShare 脚本通过 LLM(Gemini 3.1 Flash Lite,经 OpenRouter)进行增强,添加:
- 详细摘要
- 技术类别
- 用例
- 所调用的精确 Frida API
- 难度评级
- 质量评分
数据模式
每条记录包含以下字段:
| 字段 | 描述 |
|---|---|
| id, title, author | 标识信息 |
| description | 原始作者描述 |
| code | 完整脚本源码 / TypeScript API 定义 |
| source | 来源:codeshare / github / docs |
| source_url, platform, tags, indexed_at | 元数据 |
| summary | LLM 生成的详细描述 |
| category | 主要技术类别(如 ssl-pinning-bypass、root-detection-bypass) |
| use_cases, api_calls | LLM 提取 |
| difficulty, quality | LLM 评级 |
注:列表字段(tags、use_cases、api_calls、enriched_tags)以 JSON 数组字符串存储,需用 json.loads 解析。
加载方式
python from datasets import load_dataset
加载完整数据集
ds = load_dataset("ichioda/frodo", split="train")
加载增强版 CodeShare 脚本
ds = load_dataset("ichioda/frodo", "codeshare-enriched", split="train")
加载原始 CodeShare 脚本
ds = load_dataset("ichioda/frodo", "codeshare-raw", split="train")
用途
- 检索增强的 Frida 脚本生成
- 在动态插桩任务上微调或评估代码模型
- 研究常见的移动安全技术
存储与格式
- 数据以 Parquet 格式存储,使用 Snappy 压缩
- 本地存储基于 SQLite 数据库,配备 FTS5 全文索引
- 导出为 Parquet 文件后发布至 Hugging Face





