oNo-1/difficult_problem_dataset_v5_500
收藏资源简介:
--- license: odc-by task_categories: - text-generation language: - en size_categories: - n<1K --- # OverView This dataset is a synthetic dataset created using the Scalable Data Generation (SDG) framework. It is structured for use with a thinking model, and the input and output form a set of questions and answers. # Pipeline of Data Generation 1.Process-based Question Generation - A mechanism for automatically generating questions. 2.Curation + Diversity Filter - A step to ensure quality assurance and diversity, rather than simple generation. 3.Expansion via Evolutionary Methods - Improvement of questions, answers, through an evolutionary strategy (a genetic algorithm–like refinement cycle). 4.Automatic Generation of Reasoning Process - Supplementing reasoning, explanation, and grounding. 5.Finally Storage as a Dataset # Dataset Structure ``` { "input": "question", "output": "reasoning and answer", } ``` # Licence ODC-BY 1.0 This work contains data from Microsoft Academic Graph, available under the ODC-BY 1.0 license. Source: https://aka.ms/msracad
许可证:ODC-BY 任务类别:文本生成 语言:英语 数据规模:数据量少于1000条(n<1K) # 概述 本数据集为采用可扩展数据生成(Scalable Data Generation,SDG)框架构建的合成数据集,其架构适配思考型模型使用,输入与输出构成问答对集合。 # 数据生成流程 1. 基于流程的问题生成:一种自动化生成问题的机制。 2. 筛选校验与多样性过滤:用于保障数据质量与多样性的步骤,而非单纯的生成环节。 3. 进化式扩展优化:通过进化策略(类遗传算法的迭代优化循环)对问题与答案进行优化提升。 4. 推理过程自动生成:补充推理逻辑、解释说明与依据锚点。 5. 最终存储为标准数据集。 # 数据集结构 { "input": "question", "output": "reasoning and answer" } # 许可证 ODC-BY 1.0 本作品包含源自Microsoft Academic Graph的数据,该数据采用ODC-BY 1.0许可证发布。来源:https://aka.ms/msracad



