遇见数据集

ai-safety-institute/work_samples

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

这是一个包含4,998个短“工作产品”的数据集,覆盖多个领域(如代码、技术写作、研究、创意写作等)。每个样本都配有一个独立评分的质量分数(范围0-10),由大型语言模型(LLM)生成并评分,且目标质量水平范围均衡。数据集列包括:work(字符串,表示工作产品文本)、category(字符串,表示工作所属领域,例如“自包含的Python函数或小模块”、“短诗”、“错误报告”)和quality(整数,0-10,其中0-2为极差,3-4为差,5-6为中等,7-8为好,9-10为优秀)。

A dataset of 4,998 short work products spanning many domains (e.g., code, technical writing, research, creative writing), each paired with an independently graded quality score (range 0-10). Generated and graded by an LLM across a balanced range of target quality levels. Columns include: work (string, the work-product text), category (string, the domain the work belongs to, such as a self-contained Python function or small module, a short poem, a bug report), and quality (int, 0-10, where 0-2 is terrible, 3-4 poor, 5-6 mediocre, 7-8 good, and 9-10 excellent).

提供机构:
ai-safety-institute
搜集汇总
数据集介绍
ai-safety-institute/work_samples 数据集图片
构建方式
该数据集名为work_samples,包含4,998个跨多领域的“工作产物”样本,涵盖代码、技术写作、研究、创意写作等类别。每个样本由大型语言模型生成,并独立进行质量评分。构建过程要求模型在平衡的目标质量范围内生成内容,确保样本覆盖从低到高的质量分布。数据集分为训练集,其中每个样本包含工作文本(work)、所属领域(category)以及独立评分的质量分数(quality),分数范围为0至10,0-2为极差,3-4较差,5-6一般,7-8良好,9-10优秀。数据以默认配置组织,训练文件存储在data/train-*路径下。
特点
该数据集的核心特点在于其多样性和平衡性。样本横跨多个专业领域,包括代码模块、诗歌、错误报告等,反映了真实工作场景的多样性。质量分数由同一LLM独立评定,确保了评分标准的一致性。数据集明确划分了质量等级区间,便于研究者进行细粒度分析。此外,样本规模适中(约5k),既能支持模型训练,又避免了过大的计算开销。每个样本的结构简洁明了,包含文本、类别和质量三个字段,便于直接用于文本分类或质量评估任务。
使用方法
该数据集主要适用于文本分类或质量评估任务。用户可通过加载训练集(train split)获取样本,其文本数据位于work字段,标签或目标变量可根据需求选择category或quality字段。例如,若进行领域分类任务,可将category作为标签;若评估文本质量,则可将quality作为回归或分类目标。数据集采用MIT许可证,允许自由使用和修改。建议在加载时注意默认配置,并利用HuggingFace Datasets库直接读取数据文件,或通过pandas等工具解析CSV格式。数据规模较小,适合快速迭代实验。
背景与挑战
背景概述
在自然语言处理领域,文本生成质量评估是衡量生成模型能力的关键任务。Work Samples数据集于近期由研究人员构建,旨在为文本质量分类提供标准化基准。该数据集包含4,998条短篇工作样本,覆盖编程、技术写作、研究、创意写作等多个领域,每条样本均由独立的大语言模型在0-10分制内进行质量评分。通过平衡各质量等级样本的分布,该数据集为细粒度文本质量评估研究提供了高可靠性的训练与评估资源,推动了机器学习在自动评估生成内容质量方向上的发展。
当前挑战
Work Samples数据集主要应对文本质量自动评估中的主客观偏差问题,通过引入跨领域样本和独立评分机制,帮助模型学习区分不同质量等级文本的泛化特征。构建过程中面临的挑战包括:确保5个质量区间内样本数量均衡以消除类别不平衡,避免生成样本中风格单一导致的模型过拟合,以及控制大语言模型评分的一致性以避免标注噪声对下游任务性能的影响。这些设计需兼顾多样性、公平性与标注重现性,对数据集构建流程提出较高要求。
常用场景
经典使用场景
work_samples数据集汇集了4,998份横跨代码、技术写作、研究与创意写作等多个领域的短篇工作成果样本,每份样本皆附带独立评定的质量分数(0至10分)。该数据集最经典的使用场景在于文本分类任务,尤其是针对不同领域工作产品的质量评估与等级划分。研究者可借助此数据集训练分类模型,使其能够自动判别技术文档、程序代码或文学创作等文本的优劣层次,从而推动自动化质量审核与内容筛选技术的发展。
衍生相关工作
work_samples的发布催生了一系列衍生研究,包括基于多任务学习的领域自适应质量预测模型,以及结合对抗训练提升评分鲁棒性的方法。部分工作进一步探索了评分解释性,通过注意力机制揭示影响质量的关键文本片段。还有学者将该数据集与其它质量标注资源融合,构建跨数据集的迁移学习框架,拓展了质量评估在专业写作、开源代码审查等场景中的应用边界。这些衍进共同推动了自动化文本质量评估领域的持续演进。
数据集最近研究
最新研究方向
在当前大语言模型能力评估与对齐领域,work_samples数据集以其跨领域、细粒度的质量标注特性,为研究模型生成内容的自动化质量评估提供了关键资源。该数据集覆盖代码、技术写作、创意文学等多类型工作产品,并采用0-10分的独立评分体系,使得研究者能够探索模型在不同复杂度与风格下的生成能力边界。近期热点话题如RLAIF(基于AI反馈的强化学习)与细粒度奖励建模,均依赖此类高质量、多维度的标注数据来校准模型输出。work_samples的出现不仅填补了小规模、多域质量评估数据的空白,更推动了从单一任务到通用生成质量度量方法的研究范式转变,对构建更可靠、更可控的AI生成系统具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务