遇见数据集

timesorter-scheduler-ko

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

TimeSorter 是一个用于任务调度与优先级排序的韩语数据集,旨在训练模型对给定的韩语待办事项列表进行四维评分(包括紧急性、重要性、依赖性、时间限制,每项评分范围为1-5)并确定其执行顺序的优先级。数据集通过“骨架优先”方法生成:首先程序生成定义任务属性的骨架(包括每个任务的截止日期、是否已过期、依赖链和风险短语等),然后由大语言模型生成自然语言描述和标准化的答案JSON,并经过一套自动骨架规则验证(例如,已过期的任务应排在后面,同一天的任务按时间升序排列,依赖链需连续,高风险任务的重要性评分需≥4等)以确保数据质量。数据集包含多个配置:1) `sft` 配置用于监督微调,包含提示词、优选回答(JSON格式)、人物角色、今日日期、数据来源、元数据骨架和版本信息,并根据数据质量分为`curated`(v3-v5,质量最高)、`rework`(v1/v2重新加工)等不同层级;2) `dpo` 配置用于直接偏好优化,包含优选(chosen)和劣选(rejected)回答对,其中劣选回答为与优选回答格式和长度相似但内容存在特定错误类型的“硬负例”(如日期混淆、粒度交换、依赖关系分散、忽略风险、顺序评分不匹配、对过去事件的幻觉等),并包含一部分从已训练模型实际错误输出中收集的“在线策略”负例对;3) `grpo` 配置用于组级策略优化,仅包含提示词和元数据骨架,可用于构建基于规则验证的确定性奖励函数;4) `eval` 配置为留出评估集,由未在训练中使用的随机种子生成,用于自动评估模型对骨架规则的遵守情况。该数据集支持的任务场景包括韩语任务管理、智能日程助手和决策支持系统的开发。

TimeSorter is a Korean dataset for task scheduling and priority ordering, designed to train models to perform four-dimensional scoring (urgency, importance, dependency, time constraint, each on a scale of 1-5) on given to-do lists and determine their execution priority order. The dataset is generated via a skeleton-first approach: a program first generates skeletons defining task attributes (including deadlines, expiration status, dependency chains, and risk phrases for each task), then a large language model generates natural language descriptions and standardized answer JSON, followed by a set of automated skeleton rule validations (e.g., expired tasks should be ranked later, tasks on the same day sorted in ascending time order, dependency chains must be continuous, high-risk tasks must have an importance score ≥4, etc.) to ensure data quality. The dataset includes multiple configurations for different training and evaluation stages: 1) `sft` configuration for supervised fine-tuning, containing prompts, preferred responses (in JSON format), persona, todays date, data source, metadata skeleton, and version information, with quality tiers such as `curated` (v3-v5, highest quality) and `rework` (reprocessed v1/v2); 2) `dpo` configuration for direct preference optimization, containing chosen and rejected response pairs, where rejected responses are hard negatives with specific error types (e.g., date confusion, granularity swapping, dependency dispersion, ignoring risk, order-score mismatch, hallucinations about past events) similar in format and length to chosen responses, and include some online policy negative pairs collected from actual error outputs of trained models; 3) `grpo` configuration for group-level policy optimization, containing only prompts and metadata skeletons for building deterministic reward functions based on rule validation; 4) `eval` configuration as a held-out evaluation set, generated from random seeds not used in training, for automatic assessment of model compliance with skeleton rules. The dataset supports task scenarios such as Korean task management, intelligent scheduling assistants, and decision support systems.

创建时间:
2026-06-11
原始信息汇总

数据集概述

TimeSorter 是一个韩语日程优先级排序数据集,用于训练模型对任务列表进行四轴评分(紧急度、重要度、依赖性、时间限制,各1-5分),并确定优先级。该数据集专为大语言模型的 SFT → DPO → GRPO 微调流程设计。

  • 语言:韩语 (ko)
  • 许可证:Apache-2.0
  • 任务类型:文本生成 (text-generation)
  • 标签:调度 (scheduling)、优先级排序 (prioritization)、韩语 (korean)、DPO、GRPO、合成数据 (synthetic)

数据集配置与规模

数据集包含6个配置:

配置名 数据切分 行数 用途
sft (默认) train 15,677 SFT 主训练(v2~v5 + rework)
sft_v1_text train 5,999 v1 自由文本数据
dpo train 21,340 DPO 对(v1~v5 累积,含 on-policy 351对)
dpo_v5 train 1,368 DPO v5 实际训练文件(1,368对,含 on-policy 228、hard-negative 940、refusal 200)
grpo train 3,356 GRPO 提示+骨架(v3~v5)
eval test 150 Held-out 自动评估集

各配置详细说明

sft (SFT 主训练)

  • 包含 v2~v5 + rework 的 JSON 架构整合数据。
  • 列包括:prompt(提示)、chosen(正确输出,JSON格式)、persona(角色)、today(今天日期,ISO格式,空字符串表示日期未知场景)、sourcemeta(骨架)、version
  • 层级(tier):curated(v3-v5,persona_fit 4.9-5.0,推荐用于主训练)、rework(v1/v2 重加工)、v2_refusal(拒绝学习)、v2_schedulev2_offformat(不推荐)。
  • 实验效果:使用 curated 数据 + 提示损失掩码学习,held-out 骨架通过率从 56.7% 提升至 77.3%(+20.6%p)。

dpo (DPO 对)

  • 包含 chosen(选择)与 rejected(拒绝)对。
  • v3+ 的 hard negative 在格式上与 chosen 相同(长度比 0.96-0.99),仅在内容上存在错误。错误类型包括:date_confusion(日期混淆)、granularity_swap(粒度交换)、dependency_scatter(依赖分散)、risk_ignore(风险忽略)、order_score_mismatch(顺序分数不匹配)、past_hallucination(过去幻觉)。
  • v5 包含 on-policy 351对,即模型真实违反的输出被收集为 rejected
  • 层级:hard(推荐)、refusaleasy_format(v2,注意长度偏差)、legacy_text(v1,禁止用于 v3+ 训练)。

dpo_v5 (DPO v5 实际训练文件)

  • 直接用于 DPO v5 训练的 1,368对,用于复现实验。
  • 组成:on-policy 228 + v3 hard-negative 重用 940 + refusal 200。

grpo (GRPO 数据)

  • 仅包含 promptmeta(骨架),无 chosen
  • 可通过 verify_chosen 规则构建确定性、零成本的奖励函数(RLVR)。
  • 奖励示例:所有规则通过 +1.0,每违反一次 -0.3,解析失败 -1.0。
  • 完整性:meta 解析率 100%,eval 零泄露,提示无重复。

eval (评估集)

  • 使用未参与训练的随机种子(47)生成,共 150 个 held-out 场景。
  • 用于骨架规则的自动评分基线。

生成方法:场景骨架优先 (Skeleton-First)

  1. 骨架确定性生成:程序确定任务的截止时间、是否已过期、依赖链、风险短语等骨架信息。
  2. LLM 填充:LLM 仅生成文本和正确 JSON(文本由 gpt-5.4-mini 生成,正确答案由 gpt-5.4 或 Claude Sonnet 4.6 生成)。
  3. 自动验证:仅收录通过骨架规则自动验证的数据。规则包括:过期任务排在后面、同一天按时序升序、依赖链连续排列、风险重要性≥4、日期未知时禁止判定“已过期”、无截止任务不能排第一。
  4. 骨架保留:骨架信息保存在 meta 列,用于 DPO 负样本生成、自动评估、GRPO 奖励构建。

场景类型 (v3~v4)

包括:dated_mixed(混合日期)、past_split(按当前日期区分过期/有效)、intraday(上午>下午)、dependency_chain(依赖链)、risk(风险)、am_escalation(利益惩罚条款)、no_today(日期未知的相对排序)、relative(明天/后天换算)。

生成代码

数据集生成代码位于 GitHub 仓库:https://github.com/jung-geun/TimeSorter

搜集汇总
数据集介绍
timesorter-scheduler-ko 数据集图片
构建方式
该数据集的构建遵循“骨架优先”的生成范式。首先,通过程序化方式确定任务场景的骨架信息,涵盖每项任务的截止时间、是否过期、依赖链条及风险提示等结构性要素。随后,由大型语言模型依据该骨架分别生成自然语言描述和标准答案JSON,其中文本生成采用gpt-5.4-mini,答案生成则选用gpt-5.4与Claude Sonnet 4.6。最终,仅收录通过骨架规则自动校验的样本,确保数据在时间逻辑、依赖顺序及风险评分等方面的内在一致性,并将骨架信息持久化保存于meta字段中,为后续的DPO负样本构建、自动评估及GRPO奖励函数设计提供复用的基础。
特点
数据集以韩语任务优先级排序为核心场景,样本基于紧急度、重要度、依赖性及时间约束四个维度进行1至5分的量化评分。数据涵盖多种配置,包括SFT、DPO及GRPO等训练范式所需的不同格式。SFT部分包含经过严格质量筛选的curated层级(persona_fit评分达4.9-5.0)及经重加工的rework数据。DPO配置中集成了难度较高的负样本类型,如日期混淆、粒度交换及依赖分散等,并引入了on-policy采样获取的模型真实错误输出。GRPO部分则提供不含chosen的骨架提示,便于构造确定性奖励函数,同时确保评估集与训练集无数据泄露。
使用方法
该数据集适用于对韩语调度排序任务进行监督微调、偏好优化及强化学习的多阶段训练流程。用户可通过HuggingFace datasets库加载指定的配置,例如使用`sft`配置进行基础指令微调,利用`dpo`或`dpo_v5`配置进行偏好对齐,或借助`grpo`配置实施基于骨架规则的奖励驱动训练。模型训练完毕后,可利用`eval`配置中的150个留出场景进行自动化评估,通过骨架验证规则计算任务完成质量。生成与评估的配套代码已开源在GitHub仓库中,便于复现实验流程与扩展新的场景类型。
背景与挑战
背景概述
时间排序与优先级调度是任务规划与智能决策系统中的核心问题之一,尤其在工作流管理、个人助理及自动化调度领域具有广泛应用。TimeSorter数据集由韩国研究团队于2025年创建,旨在为韩语环境下的日程优先级排序任务提供高质量的监督学习与偏好对齐数据。该数据集围绕紧急度、重要度、依赖性与时间约束四个维度构建,融合了SFT、DPO与GRPO等多种对齐方法,显著提升了模型在结构化调度任务中的表现。其创新性地采用骨架优先(skeleton-first)生成策略与硬负样本挖掘技术,为多模态语义理解与奖励建模提供了可靠基准,对推动韩语调度模型的发展具有重要影响。
当前挑战
数据集所解决的领域问题核心在于如何让语言模型理解并执行多维度的日程优先级排序,这一任务涉及时间推理、依赖关系建模与风险敏感判断,对模型的语义理解与结构化输出能力提出了严峻挑战。构建过程中,团队面临多重困难:首先,需确保生成的排序结果严格遵循骨架规则,如过时任务自动降级、同日内按时序排列等;其次,DPO训练中的硬负样本设计需保持格式一致而内容错误,避免模型习得长度或格式偏置;最后,GRPO奖励函数需完全基于规则自动验证,确保无数据泄露与评估公正。这些挑战的解决为复杂结构化输出任务的数据构建提供了重要参考。
常用场景
经典使用场景
Timesorter-scheduler-ko数据集专为韩语日程优先级排序任务设计,其核心应用场景在于训练大语言模型根据四维评分体系——紧急性、重要性、依赖性及时间约束——对任务列表进行精准排序。该数据集通过sft、dpo和grpo等多种配置,支持监督微调、偏好对齐及强化学习等经典训练范式,是韩语智能日程管理领域极具代表性的基准资源。
解决学术问题
该数据集解决了多维度任务优先级自动排序这一学术难题。传统方法常依赖简单规则或单一指标,难以捕捉任务间复杂的依赖关系与时间约束。timesorter-scheduler-ko通过骨架优先生成策略和硬负例构造,为模型学习细化排序规则提供高质量训练信号,有效提升了排序的合理性,并为韩语自然语言处理中的结构化输出与偏好对齐研究提供了关键评估平台。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于骨架优先生成方法自动构建训练数据的流程,以及利用dpo和grpo进行偏好优化与奖励验证的模型训练范式。此外,其构建的硬负例策略——如日期混淆、粒度交换、依赖分散等——为后续研究提供了可复现的错误模式分析框架,推动了韩语任务排序领域的系统性进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务