遇见数据集

Multi-label-Prompt-Dataset

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

该数据集是一个多标签提示分类语料库,专门用于训练轻量级、CPU高效的机器学习模型(如CatBoost、LightGBM和FastText),以支持提示复杂度估计、任务意图分类、输出令牌长度预测和动态LLM路由。数据集包含1,859个去重后的提示样本,使用23个多标签标签,覆盖四个语义维度:复杂度与推理层级、预期输出令牌长度、执行优先级与计算层级、任务与领域意图。所有样本均为英文,以CSV格式存储,包含两列:`prompt`(原始文本)和`labels`(JSON列表形式的标签数组)。数据集由5个子数据集组成:`clean.csv`(500个结构良好的技术提示)、`noisy.csv`(500个包含拼写错误和口语化表达的提示)、`real.csv`(500个真实开发者和系统管理员工作流查询)、`balance.csv`(471个用于平衡低支持类别的合成样本)、`augment.csv`(350个释义变体和长度扩展提示),最终合并为`master_dataset.csv`。标签分布信息已提供,其中`interactive`(62.5%)和`medium-output`(49.5%)是最常见的标签。该数据集适用于文本分类和特征提取任务,典型应用场景包括在CPU上亚10毫秒内完成提示分类和模型路由,无需调用辅助LLM。数据集遵循MIT许可证。

This dataset is a multi-label prompt classification corpus specifically designed for training lightweight, CPU-efficient machine learning models (e.g., CatBoost, LightGBM, and FastText) to support prompt complexity estimation, task intent classification, output token length prediction, and dynamic LLM routing. It contains 1,859 de-duplicated prompt samples with 23 multi-label tags covering four semantic dimensions: complexity and reasoning level, expected output token length, execution priority and compute level, and task and domain intent. All samples are in English, stored in CSV format with two columns: `prompt` (raw text) and `labels` (a JSON list of tags). The dataset consists of 5 sub-datasets: `clean.csv` (500 well-structured technical prompts), `noisy.csv` (500 prompts with typos and colloquial expressions), `real.csv` (500 real-world developer and sysadmin workflow queries), `balance.csv` (471 synthetic samples for balancing low-support categories), and `augment.csv` (350 paraphrased variants and length-extended prompts), finally merged into `master_dataset.csv`. Label distribution information is provided, with `interactive` (62.5%) and `medium-output` (49.5%) being the most common tags. The dataset is suitable for text classification and feature extraction tasks, with typical use cases including prompt classification and model routing in under 10 milliseconds on CPU without calling an auxiliary LLM. It is licensed under MIT.

创建时间:
2026-08-14
原始信息汇总

数据集概述

Multi-label Prompt Dataset 是一个面向多标签提示词分类的英文语料库,专为训练轻量级、CPU 高效的机器学习模型(如 CatBoost、LightGBM、FastText)而设计,用于提示词复杂度估计、任务意图分类、输出 token 长度预测以及动态 LLM 路由。

基本信息

  • 唯一样本数: 1,859 条去重提示词
  • 标签数量: 23 个多标签类别,覆盖 4 个语义维度
  • 语言: 英语 (en)
  • 格式: CSV(逗号分隔),标签以 JSON 数组形式存储
  • 主要用途: 在 CPU 上实现亚 10 毫秒的提示词分类与模型路由,无需调用辅助 LLM
  • 许可证: MIT License

数据集结构

仓库包含一个统一的主数据集及 5 个组成性子数据集:

文件 行数 说明
master_dataset.csv 1,859 合并所有子数据集、去重并以 seed=42 打乱后的完整数据集
clean.csv 500 结构良好、连贯的技术提示词(软件工程、算法、系统设计、数据库查询)
noisy.csv 500 含拼写错误、口语化表达和非正式语法的真实对话式提示词
real.csv 500 涵盖云服务商、Web 框架与调试场景的实用开发者查询
balance.csv 471 针对低频类别(researchmlopsarchitecture-heavyanalysis)的合成样本
augment.csv 350 改述变体与长度扩展的增强样本

数据模式

每个 CSV 文件包含两列:

列名 类型 说明 示例
prompt string 用户查询或指令的原始文本 "Design a fault-tolerant real-time recommendation engine serving 50M daily users"
labels string (JSON 列表) 分配给该提示词的多标签数组 ["architecture-heavy", "hard", "premium", "background", "reasoning-intensive", "long-output", "infrastructure"]

多标签分类体系(23 个类别)

标签覆盖四个语义维度:

  1. 复杂度与推理层级: easymoderatehardreasoning-lightreasoning-moderatereasoning-intensive
  2. 预期输出 Token 长度: short-output(≤200 tokens)、medium-output(约 500 tokens)、long-output(≥1,200 tokens)
  3. 执行优先级与计算层级: cheapbalancedpremiumrealtimeinteractivebackground
  4. 任务与领域意图: codingdebugginginfrastructurearchitecturearchitecture-heavymlopsanalysisresearch

类别分布(Top 10)

标签 样本数 频率 (%) 类别
interactive 1,161 62.5% 执行优先级
medium-output 920 49.5% 输出长度
reasoning-moderate 734 39.5% 推理深度
moderate 732 39.4% 复杂度层级
hard 714 38.4% 复杂度层级
reasoning-intensive 714 38.4% 推理深度
balanced 628 33.8% 执行优先级
premium 574 30.9% 执行优先级
long-output 517 27.8% 输出长度
coding 505 27.2% 任务意图

基线模型基准(CatBoost)

使用多标签 CatBoostClassifier(One-vs-Rest),基于 5,000 个 TF-IDF 特征(unigram + bigram)和 19 个结构化文本特征训练:

  • 数据划分: 80% 训练(1,487 样本)、20% 测试(372 样本)
  • 基线(阈值 $t=0.50$): Macro F1 = 0.8094,Micro F1 = 0.8282,Hamming Loss = 0.0907
  • 调优阈值后: Macro F1 = 0.8320,Micro F1 = 0.8419,Hamming Loss = 0.0840
  • 推理延迟: CPU 上 < 10ms

使用示例

Hugging Face datasets 加载:

python from datasets import load_dataset import ast

dataset = load_dataset("csv", data_files="data/master_dataset.csv")

def parse_labels(example): example["labels"] = ast.literal_eval(example["labels"]) return example

dataset = dataset.map(parse_labels) print(dataset["train"][0])

pandas 加载:

python import pandas as pd import ast from sklearn.preprocessing import MultiLabelBinarizer

df = pd.read_csv("data/master_dataset.csv") df["labels"] = df["labels"].apply(ast.literal_eval)

mlb = MultiLabelBinarizer() y = mlb.fit_transform(df["labels"])

print(f"Total samples: {len(df)}") print(f"Classes ({len(mlb.classes_)}): {list(mlb.classes_)}")

局限性

  • 领域范围: 数据集聚焦于技术提示词(软件工程、系统架构、云基础设施、机器学习、数学),不适用于一般日常对话或创意写作。
  • 语言: 仅支持英语 (en)。

许可证

数据集基于 MIT License 发布。

搜集汇总
数据集介绍
Multi-label-Prompt-Dataset 数据集图片
构建方式
该数据集通过整合五个子数据集构建而成,涵盖干净、噪杂、真实、平衡和增强五种类型的提示文本。每个子数据集分别从不同角度采集或合成英语提示,最终合并去重并随机打乱,形成包含1,859条唯一样本的主数据集。每条样本由原始提示文本和对应的多标签JSON数组组成,标签覆盖复杂度、输出长度、执行优先级及任务意图四个语义维度,共23个类别。
特点
该数据集的核心特点在于其多标签注释体系,每个提示可同时归属多个类别,细粒度地刻画了提示的复杂性、推理深度、预期输出长度、计算需求及领域意图。此外,数据集覆盖了从简洁查询到复杂架构设计的多层次提示,并包含噪声及真实世界开发人员查询,增强了模型的鲁棒性和实用性。其紧凑的规模与CPU高效性使其适用于轻量级模型训练。
使用方法
该数据集可直接通过Hugging Face的datasets库或pandas加载CSV文件,需使用ast.literal_eval解析标签字段。典型使用流程包括加载数据、解析标签、使用MultiLabelBinarizer进行多标签编码,进而训练CatBoost等分类器进行提示分类、复杂度估计、输出长度预测及动态LLM路由。数据集提供基线模型性能指标,便于用户评估和对比。
背景与挑战
背景概述
Multi-label-Prompt-Dataset 诞生于大语言模型(LLM)路由技术蓬勃发展的浪潮中,旨在应对推理成本与响应延迟的严峻挑战。该数据集由研究团队于2023年精心构建,核心研究问题在于如何在不依赖辅助LLM的前提下,实现亚10毫秒级的CPU端提示词分类与模型路由。通过构建涵盖23个多标签类别的1859条去重提示词,该数据集为训练轻量级机器学习模型(如CatBoost、LightGBM、FastText)提供了高质量语料,在提示词复杂度估计、任务意图识别、输出长度预测及动态路由等方向开辟了新的研究范式,对推动低成本、低延迟的LLM部署具有重要影响力。
当前挑战
构建过程中面临多重挑战:首先,需从真实场景中采集多样化的技术提示词,涵盖软件工程、系统架构、云计算、ML与数学等领域,同时兼顾噪声、口语化等非理想输入,以保证鲁棒性;其次,多标签标注体系的设计要求精准刻画复杂度、推理深度、输出长度、执行优先级及任务意图等多个语义维度,21个标签的长尾分布(如research仅占5.8%)促使采用合成采样与数据增强技术平衡类别;此外,还需确保模型在CPU上的推理延迟低于10毫秒,这要求特征工程与模型选择在精度与速度间取得微妙平衡,从而推动了对高效特征提取与轻量级分类器的深度优化。
常用场景
经典使用场景
多标签提示数据集(Multi-label-Prompt-Dataset)是专为自然语言处理中提示路由与复杂度评估任务精心构筑的语料宝库。其核心应用在于训练轻量级、CPU高效的分类模型,诸如CatBoost、LightGBM与FastText,实现对用户提示的多维度即时分析。该数据集通过丰富的标注体系,将提示划分为复杂度层级、预期输出长度、执行优先级及任务意图四大语义维度,共23个细致标签,为构建亚10毫秒级的提示分类与模型路由系统提供了理想的数据支撑,使不依赖辅助大型语言模型的精准路由成为可能。
实际应用
在实际应用层面,该数据集展现出广阔的前景。它可被集成于大型语言模型服务平台,实现智能的提示路由与资源调度,根据提示的复杂度与预期输出长度,自动选择最适宜的模型(如小型模型处理简单查询,高端模型应对深度推理),从而显著降低运营成本并提升响应速度。此外,在开发者工具与云服务中,该数据集的分类体系有助于构建主动式智能助手,精准预测用户意图(如代码调试、架构设计),提供更精准的诊断与建议,优化用户体验。
衍生相关工作
围绕该数据集,已衍生出一系列富有成效的研究工作。基于其基准性能,研究者们探索了基于TF-IDF与结构特征融合的经典机器学习方法,验证了其在低资源场景下的高效性。更进一步,该数据集被用作提示复杂度预测与输出长度估算等任务的评测基准,推动了模型路由策略的优化研究。其多标签分类体系亦被借鉴于构建更广泛的提示语义理解框架,促进了提示工程的科学化发展,为后续的模型选择与资源分配研究提供了参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务