ASMA-Tune 数据集
收藏资源简介:
ASMA-Tune 数据集是由南开大学、浙江大学等机构的研究人员创建的,包含407,000个汇编代码与自然语言指令对的指令调优数据集。该数据集通过利用大型语言模型生成与汇编代码相关的描述、对话和推理等任务的数据,旨在增强模型对汇编代码的理解和指令执行能力。数据集的构建过程包括从源代码到汇编代码的转换、汇编代码的表示和分析等步骤。该数据集的应用领域主要是汇编代码的理解和自然语言交互,用于解决如反向工程、漏洞检测和软件优化等关键领域的难题。
The ASMA-Tune dataset is an instruction tuning dataset containing 407,000 pairs of assembly code and natural language instructions, created by researchers from institutions including Nankai University, Zhejiang University and other organizations. It generates training data for tasks such as assembly code-related descriptions, dialogues and reasoning using large language models, aiming to enhance models' understanding of assembly code and their capacity to execute associated instructions. The dataset's construction process includes steps such as source code-to-assembly code conversion, assembly code representation and analysis, among others. Its primary application scenarios focus on assembly code understanding and natural language interaction, to address key challenges in fields like reverse engineering, vulnerability detection and software optimization.

- 1ASMA-Tune: Unlocking LLMs' Assembly Code Comprehension via Structural-Semantic Instruction Tuning南开大学, 浙江大学, 蚂蚁集团, 中国科学院大学, 中国人民大学 · 2025年



