遇见数据集

nz-research-commons-llama-groq-label-mismatches

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

该数据集包含用于学术论文分类任务评估的数据,由104个样本组成,涵盖论文的元数据信息,包括标题、作者、年份、主题和摘要。核心内容涉及两种分类体系:一种基于预设的分类标签(包含数值标签、字符串标签、置信度及分类原因),另一种基于LLaMA模型生成的分类结果(包含标签、置信度、原因及可能的错误信息)。此外,数据集提供了用于模型比较的评估指标,如精确匹配结果、对比提供方、对比模型、对比类型、提示词版本、样本类型、每类样本数量及随机种子。该数据集适用于自然语言处理中的文本分类模型性能评估、大语言模型(如LLaMA)在学术领域的分类能力分析,以及不同分类方法或模型之间的对比研究。

This dataset contains data for evaluating academic paper classification tasks, consisting of 104 samples that cover metadata information such as title, author, year, topic, and abstract. The core content involves two classification systems: one based on preset classification labels (including numerical labels, string labels, confidence scores, and classification reasons), and another based on classification results generated by the LLaMA model (including labels, confidence scores, reasons, and possible error information). Additionally, the dataset provides evaluation metrics for model comparison, such as exact match results, comparison providers, comparison models, comparison types, prompt versions, sample types, number of samples per category, and random seeds. This dataset is suitable for evaluating the performance of text classification models in natural language processing, analyzing the classification capabilities of large language models (e.g., LLaMA) in the academic domain, and conducting comparative studies between different classification methods or models.

创建时间:
2026-06-22
原始信息汇总

数据集概述

  • 数据集名称:dinushiTJ/nz-research-commons-llama-groq-label-mismatches
  • 数据集链接:https://huggingface.co/datasets/dinushiTJ/nz-research-commons-llama-groq-label-mismatches
  • 数据集大小:下载大小为 166027 字节,数据集大小为 276226 字节
  • 数据集划分:仅包含一个训练集(train),共 107 个样本

数据特征

该数据集包含以下 23 个特征字段:

字段名 数据类型 描述
record_id_hash string 记录 ID 哈希值
sample_id int64 样本 ID
classification_label int64 分类标签(数值)
classification_label_str string 分类标签(字符串)
classification_confidence float64 分类置信度
classification_reason string 分类理由
title string 标题
authors string 作者
year string 年份
subjects string 主题
abstract string 摘要
llama_label string Llama 模型输出的标签
llama_confidence float64 Llama 模型输出的置信度
llama_reason string Llama 模型输出的理由
llama_error null Llama 模型错误信息(为空)
exact_match bool 是否精确匹配
comparison_provider string 比较提供方
comparison_model string 比较模型
comparison_type string 比较类型
prompt_version string 提示版本
sample_type string 样本类型
n_per_class int64 每类样本数量
random_seed int64 随机种子

数据用途

该数据集主要用于比较和评估 Llama 模型(来自 Groq)与原始分类标签之间的差异,特别是标签不匹配(label mismatches)的情况。通过 classification_labelllama_labelexact_match 等字段,可以分析模型预测与原始标签的一致性和差异原因。

搜集汇总
数据集介绍
nz-research-commons-llama-groq-label-mismatches 数据集图片
构建方式
该数据集源于对学术文献元数据的深度挖掘与标签一致性校验,旨在系统性地识别大型语言模型在分类任务中的潜在偏差。构建过程首先从学术数据库中抽取包含标题、作者、年份、主题及摘要的文献记录,随后使用Llama模型对其进行自动分类,生成预测标签及其置信度与推理依据。在此基础上,通过将模型输出与原始的分类标签进行精确匹配比对,筛选出标签不一致的样本,并记录比较方、比较模型及提示版本等元信息,最终汇聚为包含107条训练样本的精选集合。
特点
数据集的核心特点在于其聚焦于标签失配场景的细粒度诊断能力。每条记录不仅保留了文献的原始元数据字段(如标题、摘要),还完整包含了Llama模型的分类结果与置信度,以及精确匹配与否的布尔标识。这种结构化设计使得研究者能够深入剖析模型在哪些学科主题或抽象表述上容易产生分类偏差,同时支持基于‘comparison_type’与‘prompt_version’字段进行跨模型、跨提示策略的对比分析,为理解大语言模型的分类边界提供了实证基石。
使用方法
使用本数据集时,建议研究者首先利用‘exact_match’字段快速筛选出标签一致与不一致的样本子集,开展有监督的误差分析。可对‘llama_confidence’与‘classification_confidence’进行对比,量化模型在失配样本上的置信度分布规律。此外,结合‘abstract’与‘subjects’等文本字段,可以训练针对性的文本分类修正模型或设计提示优化策略。数据集以标准HuggingFace格式提供,通过加载‘train’分割即可直接接入现有的机器学习pipeline,便于复现与扩展研究。
背景与挑战
背景概述
该数据集由新西兰研究机构(NZ Research Commons)与Groq合作创建,专注于识别大语言模型在学术文献分类中的标签错配问题。研究团队利用Llama模型对学术论文的元数据(如标题、作者、年份、主题和摘要)进行自动标注,并与原始分类标签进行对比,以检测模型产生的错误标签。该数据集包含107个样本,涵盖文献的记录哈希、分类标签、模型置信度及推理理由等信息,旨在系统性地评估大模型在学术分类任务中的可靠性。这一工作对于推动自然语言处理技术在科学文献管理中的应用具有重要意义,并为后续改进模型标注的准确性提供了基础数据支持。
当前挑战
数据集面临的核心挑战在于解决大语言模型在学术文献分类中固有的标签错配问题。领域问题上,现有标注系统依赖人工或传统算法,难以应对大规模文献的自动分类需求,而大模型虽能提升效率,却常因语义歧义、领域术语差异或训练数据偏差而产生错误标签。构建过程中,研究团队需面对样本量有限(仅107例)带来的统计代表性不足风险,以及如何确保模型推理理由的可解释性与真实分类逻辑的一致性。此外,跨数据集比较不同模型(如Llama与Groq)的标注性能时,基准标签的准确性验证成为关键难点。
常用场景
经典使用场景
在学术研究与工业应用中,大语言模型(LLM)常被用来进行文本分类任务,例如对学术文献的主题进行分类。nz-research-commons-llama-groq-label-mismatches 数据集专注于捕捉 LLM 分类与真实标签之间的不一致性,它汇集了 107 条样本,每条均包含标题、作者、年份、主题、摘要等丰富的元信息,同时提供了 LLM 给出的分类标签、置信度及推理理由。该数据集的核心使用场景是作为基准或诊断工具,用于评估 LLM 在特定领域(如科研文献分类)中的准确性与可靠性,尤其适用于识别模型容易犯错的模式,从而指导模型微调或提示工程优化。
衍生相关工作
该数据集衍生出了一系列重要的学术与工程工作。首先,它被用于开发针对 LLM 分类误差鲁棒性的基准测试框架,研究人员基于此设计了误差归因算法,将标签失配归类为语义歧义、领域知识缺失或提示敏感性等问题。其次,数据集中标注的置信度与理由催生了“自我纠正”机制的探索,即通过逻辑链校验来减少错误传播。此外,相关工作者还将其与主动学习范式结合,利用低置信度样本筛选出需要人工复核的文献,显著提升了标注效率。这些工作共同推动了大语言模型在科研分类领域的自适应与可解释研究向前发展。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在文本分类任务中的标签偏差检测与校正,前沿方向在于利用Llama等生成式模型对已有标注数据进行交叉验证,通过对比分类标签与模型预测标签的一致性,系统性地识别并量化标注错误。结合当前AI对齐与数据质量的热点事件,该研究对于提升训练数据的纯净度、减少模型偏见、增强可解释性具有深远意义,为解决大规模语料库中标签噪声这一关键瓶颈提供了可复现的评估基准与修正路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务