遇见数据集

qualora-workforce-skills-graph

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

Qualora Workforce Skills Graph(代表性样本)是一个基于美国劳工部资助的开放课件(主要遵循CC BY 4.0许可)构建的权利清晰、来源可追溯的职业学习技能图数据集,专为训练后微调和评估设计,而非预训练。该数据集旨在为技能映射、辅导、评估生成和职业路径规划等任务提供密集的标注监督和评估材料。数据集包含多个结构化配置文件:`assessment_items`(评估项,包含问题、布鲁姆分类级别、学习目标、答案原理和来源证据)、`course_skill_edges`(课程-技能边,包含置信度和证据短语)、`career_tasks`(基于O*NET的真实职业任务描述)、`career_esco`(多语言职业标签映射)、`skills`(技能节点)和`courses`(课程及来源信息)。代表性样本聚焦于CNC机械师和医疗编码/HIM两个垂直领域,包含27个评估项、128个课程-技能边等数据。完整许可语料库规模更大,包含约2100门课程、18,700节课、197,000+个布鲁姆分类标注的评估项、28,600+个图边,并映射到447个O*NET职业。数据具有高比例的原理标注(适合奖励模型训练)和干净的来源,可用于构建无污染的评估集。

Qualora Workforce Skills Graph (Representative Sample) is a rights-clear, source-traceable occupational learning skill graph dataset built upon open course materials funded by the U.S. Department of Labor, which primarily adheres to the CC BY 4.0 license. It is designed specifically for post-training fine-tuning and evaluation, rather than pre-training. This dataset aims to provide dense annotated supervision and evaluation materials for tasks including skill mapping, tutoring, assessment generation, and career path planning. The dataset comprises multiple structured profiles: `assessment_items` (assessment items, encompassing questions, Bloom's taxonomy levels, learning objectives, answer rationales, and source evidence), `course_skill_edges` (course-skill edges with confidence values and evidence phrases), `career_tasks` (authentic occupational task descriptions based on O*NET), `career_esco` (multilingual occupational label mapping), `skills` (skill nodes), and `courses` (courses and their source information). The representative sample focuses on two vertical domains: CNC machinists and medical coding/HIM, and contains data such as 27 assessment items and 128 course-skill edges. The full licensed corpus has a larger scale, including approximately 2,100 courses, 18,700 lessons, over 197,000 assessment items annotated with Bloom's taxonomy levels, over 28,600 graph edges, and mapped to 447 O*NET occupations. The data features a high proportion of rationale annotations (ideal for reward model training) and clean source provenance, enabling the construction of pollution-free evaluation sets.

创建时间:
2026-06-30
原始信息汇总

数据集概述:Qualora Workforce Skills Graph (Representative Sample)

这是一个基于约20亿美元美国劳工部资助的开放课件重建的、带有版权保护和来源追踪的职业学习数据集,专为模型的后训练和评估阶段设计,而非预训练。

数据集核心信息

  • 名称: Qualora Workforce Skills Graph (Representative Sample)
  • 语言: 英语 (en)
  • 许可证: 其他 (other),详见于授权协议
  • 大小: 少于1000条 (n<1K),为有界评估样本(包含两个垂直领域:CNC机械师和医疗编码/健康信息管理)
  • 任务类别: 问答 (question-answering)、文本分类 (text-classification)、文本生成 (text-generation)
  • 标签: 教育、劳动力、职业培训、技能、评估、布鲁姆分类法、O*NET、职业、训练数据、技能图谱、评估、来源

数据配置与内容

该样本包含6个配置,可通过load_dataset加载。核心字段均为嵌套JSON结构,具体如下:

配置 (Config) 行数 描述
assessment_items (默认) 27 包含问题、布鲁姆分类级别、学习目标、理据、来源证据、每个项目的验证标志及课程来源。侧重于应用/分析/评估级别。
course_skill_edges 128 切片中每门课程的完整、基于内容的映射:包含课程ID、技能ID、置信度 (0至1)、来源、证据短语
career_tasks 16 基于O*NET 30.3的每个职业的真实工作任务基础数据 (包含任务文本、重要性)。完整图谱包含通过2,480条衍生职业-任务边连接的18,796条任务陈述。
career_esco 10 新增:通过官方ESCO-O*NET映射表实现的多语言互操作 (SKOS匹配类型),包含了德语、法语、西班牙语、波兰语的标签样本。
skills 88 技能节点,包含类别、分类路径、O*NET交叉引用;所有边引用均可解析(无悬垂ID)。
courses 10 标题及来源信息 (机构、许可证、来源项目ID、转换日期)。

完整数据集规模 (需授权获取)

  • 来源课程: 约2,100门
  • 课程内容: 约18,700课 (~8,800万 tokens)
  • 评估项: 197,000+ (布鲁姆分类标记) + 独立的约199,000项考试题库
  • 互动活动: 45,000+ 个分级互动活动
  • 技能图谱: 2,624个技能,映射至447个O*NET职业 (113个完整连接),包含BLS薪资背景
  • 图谱边: 28,600+ 条边
  • 来源机构: 362个

数据集特性与价值主张

  • 版权与来源: 99.6%的源课程采用CC BY 4.0许可证,每个记录均附带一个来源清单(机构、许可证、来源项ID)。坚持使用结构化开源课程,无抓取的网页文本、书籍或服务条款数据。
  • 能力提升: 提供密集的标注监督和评估材料,用于技能映射、辅导、评估生成和职业路径规划行为,并已在受控微调实验中验证。实验表明,在结构化图谱上训练可使保留集上的技能映射F1分数从0.080提升至0.401(5.0倍),而使用原始、token匹配的文本得分仅为0.052,低于未训练基线。
  • 用途: 适用于奖励模型和评判模型的训练(通过带理据的项目),以及通过保留的、有日期的、来源清晰的项目构建无污染的评估集。

数据加载示例

python from datasets import load_dataset

repo = "qualora-data-labs/qualora-workforce-skills-graph"

items = load_dataset(repo, "assessment_items", split="train") edges = load_dataset(repo, "course_skill_edges", split="train") skills = load_dataset(repo, "skills", split="train") courses = load_dataset(repo, "courses", split="train")

从问题和理据生成SFT配对示例

sft = [{"prompt": r["question"], "completion": r["rationale"]} for r in items]

置信度加权的技能映射,首先获取信号最强的边

mapping = sorted(edges, key=lambda e: -(e["confidence"] or 0)) print(mapping[0])

数据集范围与应用

  • 适用阶段: 后训练与评估,非预训练。
  • 提供方: Qualora (Moonlight Capital LLC, d/b/a Qualora)。
  • 获取方式: 公开样本可在Hugging Face浏览;完整数据集及评估套件需通过授权协议获取。详情请访问 qualora.io/data-labs
搜集汇总
数据集介绍
qualora-workforce-skills-graph 数据集图片
构建方式
该数据集基于美国劳工部约20亿美元资助的开放课件资源构建,经过严格的版权清洗与来源追踪,生成了一份标注完善的职业技能学习图谱。其构建过程涵盖课程与课时的清洗、基于布鲁姆分类法标注的评估题库(含答案解析与学习目标),以及内容驱动、经证据短语与置信度分数验证的课程-技能-职业图结构。数据集中所有节点与边均通过明确的来源机构、许可协议与原始标识符进行追溯,确保结构层(标签、评估、图)为原创成果,并以许可协议形式发布。
特点
数据集的核心特色在于其高度结构化的监督信号与评估素材,包含超过19.5万条评估项目(97%带有布鲁姆分类标签,99%附答案解析),以及2.8万条图边,每条边携带置信度与提取证据短语。此外,数据集连接了O*NET 30.3任务体系(18,796条任务陈述)与ESCO多语言职业标准,引入BLS薪资上下文,并具备逐条验证标志与课程来源信息。其受控微调实验表明,基于该结构图训练可将技能映射F1值从0.080提升至0.401(5.0倍),而原始文本训练甚至低于未训练基线。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集的代表性样本,使用`load_dataset`函数访问六个配置(如`assessment_items`、`course_skill_edges`、`skills`等)。典型应用包括构建SFT(监督微调)数据对,如将问题与解析配对形成提示-完成结构,或基于置信度排序选择高信号技能映射边。完整语料库支持按行业车道、职业家族、技能集群或布鲁姆等级进行导出,交付格式为JSONL或Parquet,附带SHA-256清单与PII擦除报告。评估切片、可复现提升工具包及尽职调查文档可通过评估协议获取。
背景与挑战
背景概述
Qualora劳动力技能图谱数据集由Qualora团队构建,源自美国劳工部资助的约20亿美元开放课程资源,发布于2024年。该数据集聚焦于职业教育领域,旨在通过结构化的技能图谱连接课程、评估与职业路径,以解决劳动力技能映射与评估的核心研究问题。其影响力体现在为后训练与评估阶段提供高质量监督数据,填补了现有数据集中缺乏版权清晰、溯源完备的职业教育标注数据的空白,尤其适用于技能映射、智能辅导和职业路由等任务的模型微调与评测。
当前挑战
该数据集面临的核心挑战包括:1) 领域问题层面,现有模型在技能映射任务中表现薄弱,未经结构化的原始文本训练甚至导致性能低于基线(F1从0.080降至0.052),亟需高质量标注数据来提升泛化能力;2) 构建过程中,需从海量开源课程中清洗、标注并构建可溯源的技能图谱,涉及跨机构版权管理(362所院校、99.6%为CC BY 4.0)、评估项多维标注(如Bloom分类标签与非直接映射的技能边)、以及职业标准(O*NET与ESCO)的多语言对齐等复杂挑战,确保数据质量与法律合规性。
常用场景
经典使用场景
在职业技能图谱构建与评估领域,Qualora Workforce Skills Graph作为经过版权清洗、来源可追溯的职业学习数据集,被广泛用于监督式技能映射、试题生成、辅导系统以及职业路径规划等下游任务的训练与评测。其核心用途聚焦于后训练与评估环节,而非预训练语料堆积。典型使用方式包括加载评估条目配置生成指令微调对(问题与解析组合),或基于课程-技能边界的置信度权重进行高置信度技能映射排序,从而为模型赋予结构化的职业技能推理能力。
解决学术问题
该数据集直面职业技能图谱构建中来源混乱与版权不明等核心痛点,通过为每一条记录提供详尽来源清单(362所机构、CC BY 4.0许可证),从根本上解决了法律合规性问题。在学术层面,研究团队通过对比实验证明:在结构化图谱上微调可将持有技能映射F1值从0.080提升至0.401(提升5倍),而同等词量的原始文本训练反而使性能跌至0.052(低于未训练基线)。这一发现有力论证了结构化监督信号相比于原始文本语料在技能推理任务中的决定性优势,为后续数据增效型研究提供了可复现的基准框架。
衍生相关工作
围绕该数据集衍生出的经典工作包括:基于课程-技能边界的置信度加权映射框架,研究者利用2.86万条图谱边及其提取证据短语,开发出可解释的技能推理模型;利用含解析的评估条目构建奖励模型与裁判模型训练管道,推动了大语言模型在职业教育场景中的对齐研究;此外,一个值得关注的工作方向是将OSHA严重伤害叙述映射至技能缺口与补救课程(9,140条候选映射),将职业安全领域的事故分析与技能培训系统联动,开创了技能图谱于安全生产领域的交叉研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务