遇见数据集

AcroYAMALEX/acro-yamalex-llmjp-4-math-tir

收藏
Hugging Face2026-04-06 更新2026-04-12 收录
官方服务:

资源简介:

--- language: - ja license: mit task_categories: - text-generation tags: - math - tool-integrated-reasoning - tir - code-execution - reasoning - japanese - sft size_categories: - 100K<n<1M --- # acro-yamalex-llmjp-4-math-tir(データセット) 日本語数学推論のためのTool-Integrated Reasoning (TIR) データセットです。 自然言語による推論とPythonコード実行を組み合わせたマルチターン形式のデータセットで、[OpenWebMath](https://huggingface.co/datasets/open-web-math/open-web-math)から抽出・生成した問題に対してDeepSeek V3を用いてTIR形式の解法を生成しました。 本データセットは[FT-LLM2026コンペティション](https://llm-jp.github.io/tuning-competition/)における我々のアプローチの一部として構築されました。 ## データセット概要 | 項目 | 値 | |---|---| | データ件数 | 134,834件 | | 言語 | 日本語 | | ソース | [OpenWebMath](https://huggingface.co/datasets/open-web-math/open-web-math) | | 生成モデル | DeepSeek V3 (deepseek-chat) | | フォーマット | JSONL(マルチターン対話形式) | ## データ作成手法 [OpenMathReasoning](https://arxiv.org/abs/2504.16891)(NVIDIAのAIMO-2優勝手法)の枠組みに基づき、以下の手順で作成しました。 ### Step 1: 問題の作成(OpenWebMathからの抽出) OpenWebMathから日本の高校数学レベルに相当する問題素材を得るため、以下のフィルタリングを実施しました。 1. **ドメインフィルタ**: 数学関連ドメイン(math.stackexchange.com, artofproblemsolving.com等)のみを選定 2. **トピックフィルタ**: DeepSeek V3で各ドキュメントの数学トピックを分類し、高校数学に関連するトピック(代数、幾何、微積分等)を抽出 3. **カリキュラムフィルタ**: 日本の高校数学カリキュラム(数学I/II/III/A/B/C)との適合性を判定 4. **問題生成**: フィルタ通過ドキュメントから2種類の問題を生成 - 式の変形問題: 数式の導出過程を問う問題 - 数値計算問題: 具体的な数値を求める問題 ### Step 2: TIR解法の生成 問題に対してDeepSeek V3を用い、TIR形式の解法を生成しました。プロンプトではPythonコードを用いた段階的な推論を指示し、`<think>`タグ内に思考過程、コードブロック内にPythonコードを記述させています。 ### Step 3: Pythonコード実行 生成されたコードブロックをサンドボックス環境で実行し、出力結果を`` ```output ``ブロックとしてモデルにフィードバックしました。実行エラーが発生した場合もエラーメッセージをフィードバックし、モデルに修正を促しています。 ### Step 4: マルチターンループ 最大5回までコード実行とフィードバックを繰り返し、最終回答(`\boxed{}`形式)が生成されるまで対話を継続しました。 ### Step 5: 回答検証 生成された最終回答を元の正解と以下の3段階で照合しました。 | 手法 | 件数 | |---|---| | LLMジャッジ | 95,689件 | | 文字列一致 | 69,770件 | | 数値比較 | 4,335件 | ### Step 6: 品質フィルタ 正解したデータに対して、コードの新規性(novelty)と重要性(significance)を評価し、低品質なデータを除外しました。 ## データフォーマット 各行は以下のJSON構造を持つJSONLファイルです。TIRデータはマルチターン対話形式で、コード実行結果を含みます。 ```json { "messages": [ { "role": "system", "content": "あなたは「自然言語の推論」と「Pythonコードの実行」を組み合わせて数学問題を解くアシスタントです。..." }, { "role": "user", "content": "正の整数 a_0 に対して数列を次の漸化式で定義する..." }, { "role": "assistant", "content": "<think>\nPython を使ってシミュレーションしよう。\n</think>\n```python\ndef compute_sequence(a0):\n a = a0\n ...\n```" }, { "role": "user", "content": "```output\na_0 = 11, a_1 = 88, ...\n```" }, { "role": "assistant", "content": "<think>\n結果を分析すると...\n</think>\n最終答え: $$\\boxed{42}$$" } ] } ``` ### フィールド説明 | フィールド | 説明 | |---|---| | `messages[0]` (system) | TIR推論の役割を指定するシステムプロンプト | | `messages[1]` (user) | 数学の問題文 | | `messages[2]` (assistant) | 思考過程とPythonコードを含む応答 | | `messages[3]` (user) | Pythonコードの実行結果(`` ```output ``ブロック) | | `messages[4+]` | コード実行とフィードバックの繰り返し(最大5回) | ## 用途 - 日本語数学推論モデルのSFT(教師あり微調整) - Tool-Integrated Reasoning(コード実行を伴う推論)の学習 ## 関連リソース | リソース | リンク | |---|---| | CoTデータセット | [AcroYAMALEX/acro-yamalex-llmjp-4-math-cot](https://huggingface.co/datasets/AcroYAMALEX/acro-yamalex-llmjp-4-math-cot) | | CoTモデル | [AcroYAMALEX/acro-yamalex-llmjp-4-math-cot](https://huggingface.co/AcroYAMALEX/acro-yamalex-llmjp-4-math-cot) | | TIRモデル | [AcroYAMALEX/acro-yamalex-llmjp-4-math-tir](https://huggingface.co/AcroYAMALEX/acro-yamalex-llmjp-4-math-tir) | | 論文 | NLP2026にて発表予定 | ## 参考文献 - Ivan Moshkov et al. "AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset." arXiv:2504.16891, 2025. - Keiran Paster et al. "OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text." arXiv:2310.06786, 2024. - DeepSeek-AI. "DeepSeek-V3 Technical Report." arXiv:2412.19437, 2024. ## 著者 佐々木峻・山本大輝・樋口慎・吉岡駿(アクロクエストテクノロジー株式会社) ## ライセンス MIT License

语言:日语 许可证:MIT许可证 任务类别:文本生成 标签:数学、工具集成推理(Tool-Integrated Reasoning,TIR)、代码执行、推理、日语、监督微调(Supervised Fine-Tuning,SFT) 数据规模:10万<n<100万条 # acro-yamalex-llmjp-4-math-tir(数据集) 这是面向日语数学推理的工具集成推理(Tool-Integrated Reasoning,TIR)数据集。本数据集采用融合自然语言推理与Python代码执行的多轮对话形式,针对从[OpenWebMath](https://huggingface.co/datasets/open-web-math/open-web-math)中提取并生成的问题,使用DeepSeek V3生成工具集成推理形式的解法。 本数据集作为[FT-LLM2026竞赛](https://llm-jp.github.io/tuning-competition/)中我们所采用方案的一部分构建而成。 ## 数据集概况 | 项目 | 数值 | |---|---| | 数据条数 | 134,834条 | | 语言 | 日语 | | 来源 | [OpenWebMath](https://huggingface.co/datasets/open-web-math/open-web-math) | | 生成模型 | DeepSeek V3 (deepseek-chat) | | 格式 | JSONL(多轮对话格式) | ## 数据构建流程 本数据集基于[OpenMathReasoning](https://arxiv.org/abs/2504.16891)(NVIDIA的AIMO-2冠军方案)的框架,按以下步骤构建: ### 步骤1:问题构建(从OpenWebMath提取) 为从OpenWebMath获取对应日本高中数学水平的问题素材,执行了以下筛选流程: 1. **领域筛选**:仅选取数学相关领域(math.stackexchange.com、artofproblemsolving.com等) 2. **主题筛选**:使用DeepSeek V3对各文档的数学主题进行分类,提取与高中数学相关的主题(代数、几何、微积分等) 3. **课程适配筛选**:判定与日本高中数学课程(数学I/II/III/A/B/C)的适配性 4. **问题生成**:从通过筛选的文档中生成两类问题: - 式变形问题:询问数学表达式的推导过程 - 数值计算问题:求解具体数值的问题 ### 步骤2:TIR解法生成 针对问题使用DeepSeek V3生成工具集成推理形式的解法。在提示词中指示模型采用Python代码进行逐步推理,要求在`<think>`标签内写入思考过程,在代码块内编写Python代码。 ### 步骤3:Python代码执行 将生成的代码块置于沙箱环境中执行,将输出结果以`` output ``块的形式反馈给模型。若出现执行错误,也会将错误信息同步反馈,督促模型修正代码。 ### 步骤4:多轮迭代循环 最多重复5次代码执行与反馈流程,直至生成格式为`oxed{}`的最终回答为止。 ### 步骤5:回答验证 将生成的最终回答与原始标准答案按以下三个阶段进行比对: | 验证方法 | 验证数量 | |---|---| | LLM评判 | 95,689条 | | 字符串匹配 | 69,770条 | | 数值比对 | 4,335条 | ### 步骤6:质量筛选 针对验证通过的数据集,评估代码的新颖性(novelty)与重要性(significance),剔除低质量样本。 ## 数据格式规范 每行均为符合以下JSON结构的JSONL文件。工具集成推理数据采用多轮对话形式,包含代码执行结果。 json { "messages": [ { "role": "system", "content": "你是结合自然语言推理与Python代码执行来解答数学问题的助手。..." }, { "role": "user", "content": "对于正整数$a_0$,按以下递推式定义数列:..." }, { "role": "assistant", "content": "<think> 我们来用Python进行模拟吧。 </think> python def compute_sequence(a0): a = a0 ... " }, { "role": "user", "content": "output a_0 = 11, a_1 = 88, ... " }, { "role": "assistant", "content": "<think> 分析执行结果后可知... </think> 最终答案:$$oxed{42}$$" } ] } ### 字段释义 | 字段 | 释义 | |---|---| | `messages[0]` (system) | 指定工具集成推理角色的系统提示词 | | `messages[1]` (user) | 数学问题文本 | | `messages[2]` (assistant) | 包含思考过程与Python代码的助手回复 | | `messages[3]` (user) | Python代码的执行结果(`` output ``块) | | `messages[4+]` | 重复的代码执行与反馈流程(最多5次) | ## 应用场景 - 日语数学推理模型的监督微调(Supervised Fine-Tuning,SFT) - 工具集成推理(伴随代码执行的推理)的学习训练 ## 关联资源 | 资源类型 | 链接 | |---|---| | 思维链(CoT)数据集 | [AcroYAMALEX/acro-yamalex-llmjp-4-math-cot](https://huggingface.co/datasets/AcroYAMALEX/acro-yamalex-llmjp-4-math-cot) | | 思维链(CoT)模型 | [AcroYAMALEX/acro-yamalex-llmjp-4-math-cot](https://huggingface.co/AcroYAMALEX/acro-yamalex-llmjp-4-math-cot) | | 工具集成推理(TIR)模型 | [AcroYAMALEX/acro-yamalex-llmjp-4-math-tir](https://huggingface.co/datasets/AcroYAMALEX/acro-yamalex-llmjp-4-math-tir) | | 相关论文 | 将于NLP2026会议发表 | ## 参考文献 - Ivan Moshkov 等. "AIMO-2冠军方案:基于OpenMathReasoning数据集构建顶尖数学推理模型". arXiv:2504.16891, 2025. - Keiran Paster 等. "OpenWebMath:高质量开源数学网络文本数据集". arXiv:2310.06786, 2024. - DeepSeek-AI. "DeepSeek-V3技术报告". arXiv:2412.19437, 2024. ## 作者 佐佐木峻、山本大辉、樋口慎、吉冈骏(AcroQuest Technology株式会社) ## 许可证 MIT许可证

提供机构:
AcroYAMALEX
二维码
社区交流群
二维码
科研交流群
商业服务