Verus_Training_Data
收藏资源简介:
该数据集为Verus训练数据,用于SAFE和VeruSyn项目。数据集包含两部分:SAFE的SFT数据和VeruSyn的原始轨迹数据。SAFE的SFT数据分为两个文件:`sft_safe_25k.json`包含25K样本(11K证明生成和14K调试),`sft_part1_6.9M.json`包含6.9M样本(5.7M证明生成和1.2M调试),`sft_part2_4557.json`包含4.6K长链思维样本(1.4K证明生成和3.2K调试)。VeruSyn的原始轨迹数据包括`algorithmic_trajectory_9040.jsonl`(成功7396,错误271,超时1373)和`system_trajectory_843.jsonl`(成功609,错误96,超时138)。该数据集适用于证明生成、调试和算法轨迹分析等任务。
This dataset is the training data for Verus, intended for the SAFE and VeruSyn projects. It consists of two parts: the Supervised Fine-Tuning (SFT) data for SAFE and the original trajectory data for VeruSyn. The SFT data for SAFE is divided into three files: 1. `sft_safe_25k.json` containing 25,000 samples (11,000 proof generation samples and 14,000 debugging samples); 2. `sft_part1_6.9M.json` containing 6.9 million samples (5.7 million proof generation samples and 1.2 million debugging samples); 3. `sft_part2_4557.json` containing 4,600 long-chain thinking samples (1,400 proof generation samples and 3,200 debugging samples). The original trajectory data for VeruSyn includes `algorithmic_trajectory_9040.jsonl` (7,396 successful runs, 271 erroneous runs, and 1,373 timeout cases) and `system_trajectory_843.jsonl` (609 successful runs, 96 erroneous runs, and 138 timeout cases). This dataset is applicable to tasks such as proof generation, debugging, and algorithmic trajectory analysis.




