FROM ATOMIC TO COMPOSITE
收藏资源简介:
开源了用于参数化、上下文和互补推理的训练和测试数据。测试数据根据三个泛化难度级别(即I.I.D.、组合、零样本泛化)进行分割。训练数据足以实现优秀的I.I.D.性能。
We open-source the training and test datasets for parametric, contextual, and complementary reasoning. The test dataset is split into three generalization difficulty levels, namely I.I.D., compositional, and zero-shot generalization. The training dataset is sufficient to achieve excellent I.I.D. performance.
数据集概述
数据集名称
From Atomic to Composite
数据集来源
该数据集为论文《From Atomic to Composite: Reinforcement Learning Enables Generalization in Complementary Reasoning》的代码与数据部分。
数据集内容
数据集包含用于生成合成人类传记(个人资料)的代码,以及用于参数化推理、上下文推理和互补推理的训练与测试数据。
数据划分
测试数据根据泛化难度划分为三个级别:
- I.I.D.
- 组合(Composition)
- 零样本泛化(Zero-shot Generalization)
训练数据足以实现优秀的I.I.D.性能。
主要文件描述
build_training_and_testing_data.py: 根据三个泛化难度级别构建训练和测试数据集。data_split_by_portion.py: 将数据集分割为用于监督微调(SFT)和强化学习(RL)的不同比例子集。datagen_profile.py: 用于生成具有丰富属性和关系的合成人类传记(个人资料)的主脚本。relations.py: 定义关系模板和逻辑,用于生成各种关系组合。reshape_q_template.py: 处理和重塑问题模板,为每个关系组合创建最终的问题-答案对。
引用信息
如需使用,请引用以下论文: bibtex @article{cheng2025atomic, title={From Atomic to Composite: Reinforcement Learning Enables Generalization in Complementary Reasoning}, author={Cheng, Sitao and Yin, Xunjian and Zhou, Ruiwen and Li, Yuxuan and Wang, Xinyi and Pan, Liangming and Wang, William Yang and Zhong, Victor}, journal={arXiv preprint arXiv:2512.01970}, year={2025} }




