timesorter-scheduler-ko
收藏资源简介:
TimeSorter 是一个用于任务调度与优先级排序的韩语数据集,旨在训练模型对给定的韩语待办事项列表进行四维评分(包括紧急性、重要性、依赖性、时间限制,每项评分范围为1-5)并确定其执行顺序的优先级。数据集通过“骨架优先”方法生成:首先程序生成定义任务属性的骨架(包括每个任务的截止日期、是否已过期、依赖链和风险短语等),然后由大语言模型生成自然语言描述和标准化的答案JSON,并经过一套自动骨架规则验证(例如,已过期的任务应排在后面,同一天的任务按时间升序排列,依赖链需连续,高风险任务的重要性评分需≥4等)以确保数据质量。数据集包含多个配置:1) `sft` 配置用于监督微调,包含提示词、优选回答(JSON格式)、人物角色、今日日期、数据来源、元数据骨架和版本信息,并根据数据质量分为`curated`(v3-v5,质量最高)、`rework`(v1/v2重新加工)等不同层级;2) `dpo` 配置用于直接偏好优化,包含优选(chosen)和劣选(rejected)回答对,其中劣选回答为与优选回答格式和长度相似但内容存在特定错误类型的“硬负例”(如日期混淆、粒度交换、依赖关系分散、忽略风险、顺序评分不匹配、对过去事件的幻觉等),并包含一部分从已训练模型实际错误输出中收集的“在线策略”负例对;3) `grpo` 配置用于组级策略优化,仅包含提示词和元数据骨架,可用于构建基于规则验证的确定性奖励函数;4) `eval` 配置为留出评估集,由未在训练中使用的随机种子生成,用于自动评估模型对骨架规则的遵守情况。该数据集支持的任务场景包括韩语任务管理、智能日程助手和决策支持系统的开发。
TimeSorter is a Korean dataset for task scheduling and priority ordering, designed to train models to perform four-dimensional scoring (urgency, importance, dependency, time constraint, each on a scale of 1-5) on given to-do lists and determine their execution priority order. The dataset is generated via a skeleton-first approach: a program first generates skeletons defining task attributes (including deadlines, expiration status, dependency chains, and risk phrases for each task), then a large language model generates natural language descriptions and standardized answer JSON, followed by a set of automated skeleton rule validations (e.g., expired tasks should be ranked later, tasks on the same day sorted in ascending time order, dependency chains must be continuous, high-risk tasks must have an importance score ≥4, etc.) to ensure data quality. The dataset includes multiple configurations for different training and evaluation stages: 1) `sft` configuration for supervised fine-tuning, containing prompts, preferred responses (in JSON format), persona, todays date, data source, metadata skeleton, and version information, with quality tiers such as `curated` (v3-v5, highest quality) and `rework` (reprocessed v1/v2); 2) `dpo` configuration for direct preference optimization, containing chosen and rejected response pairs, where rejected responses are hard negatives with specific error types (e.g., date confusion, granularity swapping, dependency dispersion, ignoring risk, order-score mismatch, hallucinations about past events) similar in format and length to chosen responses, and include some online policy negative pairs collected from actual error outputs of trained models; 3) `grpo` configuration for group-level policy optimization, containing only prompts and metadata skeletons for building deterministic reward functions based on rule validation; 4) `eval` configuration as a held-out evaluation set, generated from random seeds not used in training, for automatic assessment of model compliance with skeleton rules. The dataset supports task scenarios such as Korean task management, intelligent scheduling assistants, and decision support systems.
数据集概述
TimeSorter 是一个韩语日程优先级排序数据集,用于训练模型对任务列表进行四轴评分(紧急度、重要度、依赖性、时间限制,各1-5分),并确定优先级。该数据集专为大语言模型的 SFT → DPO → GRPO 微调流程设计。
- 语言:韩语 (
ko) - 许可证:Apache-2.0
- 任务类型:文本生成 (
text-generation) - 标签:调度 (
scheduling)、优先级排序 (prioritization)、韩语 (korean)、DPO、GRPO、合成数据 (synthetic)
数据集配置与规模
数据集包含6个配置:
| 配置名 | 数据切分 | 行数 | 用途 |
|---|---|---|---|
sft (默认) |
train | 15,677 | SFT 主训练(v2~v5 + rework) |
sft_v1_text |
train | 5,999 | v1 自由文本数据 |
dpo |
train | 21,340 | DPO 对(v1~v5 累积,含 on-policy 351对) |
dpo_v5 |
train | 1,368 | DPO v5 实际训练文件(1,368对,含 on-policy 228、hard-negative 940、refusal 200) |
grpo |
train | 3,356 | GRPO 提示+骨架(v3~v5) |
eval |
test | 150 | Held-out 自动评估集 |
各配置详细说明
sft (SFT 主训练)
- 包含 v2~v5 + rework 的 JSON 架构整合数据。
- 列包括:
prompt(提示)、chosen(正确输出,JSON格式)、persona(角色)、today(今天日期,ISO格式,空字符串表示日期未知场景)、source、meta(骨架)、version。 - 层级(
tier):curated(v3-v5,persona_fit 4.9-5.0,推荐用于主训练)、rework(v1/v2 重加工)、v2_refusal(拒绝学习)、v2_schedule、v2_offformat(不推荐)。 - 实验效果:使用 curated 数据 + 提示损失掩码学习,held-out 骨架通过率从 56.7% 提升至 77.3%(+20.6%p)。
dpo (DPO 对)
- 包含
chosen(选择)与rejected(拒绝)对。 - v3+ 的 hard negative 在格式上与 chosen 相同(长度比 0.96-0.99),仅在内容上存在错误。错误类型包括:
date_confusion(日期混淆)、granularity_swap(粒度交换)、dependency_scatter(依赖分散)、risk_ignore(风险忽略)、order_score_mismatch(顺序分数不匹配)、past_hallucination(过去幻觉)。 - v5 包含 on-policy 351对,即模型真实违反的输出被收集为
rejected。 - 层级:
hard(推荐)、refusal、easy_format(v2,注意长度偏差)、legacy_text(v1,禁止用于 v3+ 训练)。
dpo_v5 (DPO v5 实际训练文件)
- 直接用于 DPO v5 训练的 1,368对,用于复现实验。
- 组成:on-policy 228 + v3 hard-negative 重用 940 + refusal 200。
grpo (GRPO 数据)
- 仅包含
prompt和meta(骨架),无chosen。 - 可通过
verify_chosen规则构建确定性、零成本的奖励函数(RLVR)。 - 奖励示例:所有规则通过 +1.0,每违反一次 -0.3,解析失败 -1.0。
- 完整性:
meta解析率 100%,eval零泄露,提示无重复。
eval (评估集)
- 使用未参与训练的随机种子(47)生成,共 150 个 held-out 场景。
- 用于骨架规则的自动评分基线。
生成方法:场景骨架优先 (Skeleton-First)
- 骨架确定性生成:程序确定任务的截止时间、是否已过期、依赖链、风险短语等骨架信息。
- LLM 填充:LLM 仅生成文本和正确 JSON(文本由 gpt-5.4-mini 生成,正确答案由 gpt-5.4 或 Claude Sonnet 4.6 生成)。
- 自动验证:仅收录通过骨架规则自动验证的数据。规则包括:过期任务排在后面、同一天按时序升序、依赖链连续排列、风险重要性≥4、日期未知时禁止判定“已过期”、无截止任务不能排第一。
- 骨架保留:骨架信息保存在
meta列,用于 DPO 负样本生成、自动评估、GRPO 奖励构建。
场景类型 (v3~v4)
包括:dated_mixed(混合日期)、past_split(按当前日期区分过期/有效)、intraday(上午>下午)、dependency_chain(依赖链)、risk(风险)、am_escalation(利益惩罚条款)、no_today(日期未知的相对排序)、relative(明天/后天换算)。
生成代码
数据集生成代码位于 GitHub 仓库:https://github.com/jung-geun/TimeSorter





