遇见数据集

nz_research_commons_inference_results

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于文本分类任务的学术文献集合,专门用于识别文献是否具有毛利文化起源。数据集包含3318个训练样本,每个样本包含丰富的文献元数据和分类信息,核心特征包括:文献标题、作者、学科主题、摘要、全文内容、年份等基本信息;二分类标签(毛利起源/非毛利起源)及分类理由说明;文本长度统计(token计数);多种嵌入表示文本和模型输出结果,包括基础嵌入标签、ID、分数以及4B模型的响应文本。数据集适用于文化起源分类、文本分析、模型训练与评估等自然语言处理任务,特别关注毛利文化相关文献的识别与研究。

This dataset is an academic literature collection for text classification tasks, specifically designed to identify whether literature has Maori cultural origins. It contains 3318 training samples, each with rich metadata and classification information, including core features such as: basic information like title, author, subject, abstract, full text, and year; binary classification labels (Maori origin/non-Maori origin) and classification rationale; text length statistics (token count); and various embedded representations and model outputs, including basic embedding labels, IDs, scores, and responses from a 4B model. The dataset is suitable for natural language processing tasks such as cultural origin classification, text analysis, model training and evaluation, with a particular focus on the identification and study of literature related to Maori culture.

创建时间:
2026-05-30
原始信息汇总
  • 数据集名称: nz_research_commons_inference_results
  • 数据集链接: https://huggingface.co/datasets/dinushiTJ/nz_research_commons_inference_results
  • 数据集大小: 下载大小约16.21 MB,数据集总大小约43.79 MB
  • 数据划分: 仅包含训练集(train),共3,318个样本
  • 特征字段:
    • title: 标题(字符串)
    • authors: 作者(字符串)
    • subjects: 主题(字符串)
    • abstract: 摘要(字符串)
    • text: 文本内容(字符串)
    • record_id_hash: 记录ID哈希(字符串)
    • prompt: 提示词(字符串)
    • token_count: 令牌数量(整数)
    • classification_label: 分类标签,包含两个类别:
      • 0: maori_origin(毛利起源)
      • 1: non_maori_origin(非毛利起源)
    • classification_reason: 分类理由(字符串)
    • year: 年份(字符串)
    • classification_confidence: 分类置信度(浮点数)
    • embedding_text: 嵌入文本(字符串)
    • embedding_token_count: 嵌入令牌数量(长整数)
    • BaseEmbGemZeroLabel: 基础嵌入GemZero标签(字符串)
    • BaseEmbGemZeroID: 基础嵌入GemZero ID(长整数)
    • BaseEmbGemZeroScore: 基础嵌入GemZero得分(双精度浮点数)
    • Base4BResponse: 基础4B响应(字符串)
搜集汇总
数据集介绍
nz_research_commons_inference_results 数据集图片
构建方式
该数据集名为nz_research_commons_inference_results,其构建基于新西兰研究文献语料库,通过自动化推理流程生成。原始数据包含文献的标题、作者、主题、摘要及全文文本,并经过哈希处理生成唯一记录标识。为支持分类任务,数据集中引入了基于提示的生成字段,利用大语言模型对文献文本进行推理,输出分类标签(maori_origin或non_maori_origin)及推理理由。此外,还提取了嵌入文本并计算其令牌数量,结合基础嵌入模型生成零样本标签、ID及得分。最终,数据集以单一训练集的形式整合,包含3318个样本,总大小约为43.8 MB,适用于下游任务的构建与评估。
特点
本数据集的核心特点在于其多维度的标注信息与丰富的推理结果。除了基础的文献元数据外,每条记录均包含由模型生成的分类标签及置信度,并附有详细的分类推理过程,增强了可解释性。此外,数据集引入了两种不同类型的嵌入表示:一是基于文本的嵌入向量及其令牌计数,二是通过基础嵌入模型计算的零样本分类结果,包括标签、ID及相似度得分。这种多层次的标注结构使得数据集不仅可用于分类任务,还可支持嵌入分析、模型对比及推理链研究,为探索新西兰研究成果的文化归属提供了独特的数据视角。
使用方法
该数据集以HuggingFace Datasets格式存储,用户可通过加载默认配置直接使用训练集。使用时,建议首先利用classification_label字段进行文本分类任务的训练与评估,同时可借助classification_reason与classification_confidence增强模型的可解释性。对于嵌入相关研究,可提取embedding_text及其对应的BaseEmbGemZero系列字段,用于零样本分类或相似度计算。语言模型生成的Base4BResponse字段则可用于生成式任务的微调或对比分析。数据集已预设为训练分割,用户可根据需求自行划分验证集或测试集,并利用features中的丰富字段进行多任务学习或迁移学习实验。
背景与挑战
背景概述
该数据集名为nz_research_commons_inference_results,由新西兰研究机构创建,旨在通过大语言模型对科研文献进行自动化分类与推理。核心研究问题在于利用预训练模型(如Gemma)对学术论文的标题、作者、摘要等元数据进行深度语义分析,以识别文献是否属于毛利起源(Maori origin)类别。该数据集发布于2024年,聚焦于新西兰本土科研文献的语料处理,为民族志研究与数字人文领域提供了可复现的基准。其影响力体现在推动低资源语言背景下的跨文化知识挖掘,并丰富了多模态科研数据集的构建范式。
当前挑战
数据集面临的挑战包括:1) 领域问题层面,需解决科研文献中毛利语与英语混合文本的分类难题,现有模型在低资源语言特征提取上存在偏差,影响分类准确性;2) 构建过程中,数据来源于不同学科领域的摘要文本,存在主题分布不均与元数据缺失问题,且标注依赖大型语言模型的推理结果,缺乏人工验证,可能引入标注噪声。此外,嵌入向量与分类置信度的计算开销较大,对计算资源有限的研究团队构成实践瓶颈。
常用场景
经典使用场景
该数据集聚焦于新西兰研究文献的语义理解与文化归属分析,经典使用场景在于构建针对毛利文化起源文本的双向分类模型。研究者可利用其提供的‘title’、‘abstract’及‘text’等字段,结合预定义的‘classification_label’(maori_origin vs non_maori_origin),训练能够精准识别文献文化根源的分类器。此外,‘classification_reason’与‘classification_confidence’字段为模型的可解释性评估提供了细粒度支撑,使得该数据集成为探索低资源语言文化特征自动标注的理想基准。
解决学术问题
该数据集直面语料库中文化归属自动判别这一长期悬而未决的学术难题。通过将‘classification_label’作为核心监督信号,它有效解决了传统方法中因缺乏高质量标注样本而难以区分毛利与非毛利起源文献的困境。其引入的‘classification_reason’与‘classification_confidence’机制,进一步推动了从黑箱预测向可解释分类的范式转变,为跨文化信息检索、民族志文本分析及低资源语言处理等前沿领域提供了坚实的数据基础与评估标准。
衍生相关工作
围绕该数据集已催生出一系列代表性学术工作。例如,有研究者利用‘embedding_text’字段与‘BaseEmbGemZeroLabel’向量表示,构建了融合语义嵌入与文化标签的跨模态分类框架,实现了对毛利文献的细粒度特征提取。另有工作专注于‘classification_reason’的生成式建模,开发出能自动产出分类依据的轻量级语言模型,显著提升了模型的可信度。此外,部分工作将数据集作为基准,对比了不同预训练模型对低资源语言文化信息的感知能力,为后续跨文化NLP研究提供了标准化评估平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务