OpenDataArena/OpenDataArena-scored-data-2603
收藏资源简介:
该数据集是一个多配置集合,包含多个子数据集,主要用于代码和数学领域的指令跟随任务。数据集配置包括AM-Thinking-v1-Distilled-code(约323,965个示例)、AM-Thinking-v1-Distilled-math(约558,129个示例)、Code-Feedback(约66,383个示例)、CodeFeedback-Filtered-Instruction(约156,526个示例)、DeepMath-103K(约309,066个示例)、EpiCoder-func-380k(约380,000个示例)和Evol-Instruct-Code-80k-v1(部分列出)。每个示例包含id、source、instruction(指令文本)和output(输出文本),以及processed_scores和raw_scores两个评分结构,涵盖AtheneRM、Cleanliness、LLM_as_Judge_Complexity、Compress_Ratio、Deita_Complexity、Deita_Quality、EmbedSVD_Entropy、Logical_Word_Count、HES、IFD、Instag、MTLD、Normalized_Loss、PPL、Professionalism、Writing_Style、Required_Expertise、Facts_Trivia、Educational_Value、Readability、Reasoning、SkyworkRM_Qwen、SkyworkRM_Llama、Token_Entropy、Token_Length、TreeInstruct_Node、TreeInstruct_Depth、Unique_Token_Ratio、UPD、VOCD-D等多个评估指标,用于量化文本质量、复杂性、专业性和可读性。数据集适用于训练和评估语言模型在代码生成、数学推理和反馈过滤等任务中的性能。
本数据集为多配置集合,包含若干子数据集,主要面向代码与数学领域的指令跟随任务。数据集配置包括AM-Thinking-v1-Distilled-code(约323,965条示例)、AM-Thinking-v1-Distilled-math(约558,129条示例)、Code-Feedback(约66,383条示例)、CodeFeedback-Filtered-Instruction(约156,526条示例)、DeepMath-103K(约309,066条示例)、EpiCoder-func-380k(约380,000条示例)与Evol-Instruct-Code-80k-v1(仅部分列出)。每条示例均包含id、source、instruction(指令文本)、output(输出文本),以及processed_scores与raw_scores两类评分结构,涵盖AtheneRM、Cleanliness、LLM_as_Judge_Complexity、Compress_Ratio、Deita_Complexity、Deita_Quality、EmbedSVD_Entropy、Logical_Word_Count、HES、IFD、Instag、MTLD、Normalized_Loss、PPL、Professionalism、Writing_Style、Required_Expertise、Facts_Trivia、Educational_Value、Readability、Reasoning、SkyworkRM_Qwen、SkyworkRM_Llama、Token_Entropy、Token_Length、TreeInstruct_Node、TreeInstruct_Depth、Unique_Token_Ratio、UPD、VOCD-D等多项评估指标,用于量化文本质量、复杂度、专业性与可读性。本数据集可用于训练与评估语言模型在代码生成、数学推理及反馈过滤等任务中的性能表现。




