遇见数据集

基于代码数学解题数据集

收藏
官方服务:

资源简介:

基于代码数学解题数据集主要面向大语言模型(LLM)的代码融合数学推理研究与复杂逻辑求解需求建设,基于闭源大模型初始生成、开源模型微调及自蒸馏扩展技术产生,主要记录了算术、代数、几何、概率组合及综合竞赛题等各难度层级的数学题目,以及包含自然语言说明、可执行Python代码与沙箱真实执行结果的完整交互式推理链。 在背景与意义方面,该数据集致力于提升人工智能在数学领域的严谨性与可解释性,通过将自然语言思维链与编程语言相结合,有效克服了传统大模型在复杂计算中的幻觉问题。 在产生方法上,数据集中于2025年8月至2026年3月期间,依托云端GPU与CPU混合集群构建。项目首先利用先进大模型生成高质量解答,随后通过自蒸馏、多轮温度采样与一致性检查进行数据扩增。所有样本均经过严格的受限CPU沙箱验证,确保其中的Python 3.11代码能够成功执行且输出结果与标准答案完全一致。 在主要内容与结构上,数据集由三个完全去重的 JSONL 文件组成:8万条高质量主干集、自蒸馏扩展集以及聚焦几何与高难度题目的补充集。每条记录采用 system-user-assistant 的标准对话结构,创新性地以文本(text)、代码(code)和执行输出(execution)交替的形式展现解题全过程,并在末尾单独提取最终答案。该数据集遵循 Apache-2.0 许可证完全开源,为数学大模型的训练与评测提供了高质量、高逻辑密度的语料资源。总数据量1GB。

提供机构:
香港中文大学
二维码
社区交流群
二维码
科研交流群
商业服务