遇见数据集

MohammadKhosravi/cefr-llama3.1-8b-hidden-states-combined

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含从冻结的meta-llama/Llama-3.1-8B-Instruct变压器架构提取的高保真一维潜在表示。它映射了13,837个英语句子到欧洲语言共同参考框架(CEFR)的六个离散熟练度等级(从A1到C2)。该资源专为支持插件和播放语言模型(PPLM)架构的第一阶段而设计,允许研究人员训练下游轻量级线性转向分类器,而无需在多个训练周期中将重型多亿参数语言资产存储在活动GPU内存中。数据集整合了四个不同的开源CEFR数据流,以最大化风格差异、消除高维特征饥饿并构建鲁棒的语言分类边界。数据集结构包括一个训练分割,包含两个核心特征:hidden_vector(通过第31层激活的注意力感知平均池化生成的4096维向量)和cefr_level(目标分类熟练度标签,如A1、A2等,包括标准化+标签)。类别分布遵循高斯分布,其中B1和B2占比最高,A1和C2占比较低。特征提取方法基于确定性并行预填充处理配置,包括模型基线、注意力感知池化、数据清洗和全局随机化。数据集适用于训练独立的单层线性分类矩阵作为PPLM转向头。

This dataset contains high-fidelity 1D latent representations extracted from the frozen meta-llama/Llama-3.1-8B-Instruct Transformer architecture. It maps 13,837 English sentences to six discrete proficiency levels of the Common European Framework of Reference for Languages (CEFR), ranging from A1 to C2. This resource is specifically designed to support the first stage of the Plug-and-Play Language Model (PPLM) architecture, enabling researchers to train downstream lightweight linear steering classifiers without needing to store heavy multi-billion parameter language assets in active GPU memory across multiple training epochs. The dataset integrates four distinct open-source CEFR data streams to maximize stylistic diversity, mitigate high-dimensional feature starvation, and construct robust language classification boundaries. The dataset structure includes a training split with two core features: `hidden_vector` (a 4096-dimensional vector generated via attention-aware average pooling of layer 31 activations) and `cefr_level` (the target classification proficiency label, e.g., A1, A2, etc., including standardized labels). The class distribution follows a Gaussian distribution, with B1 and B2 accounting for the highest proportions, while A1 and C2 have relatively low proportions. The feature extraction method is based on a deterministic parallel prefill processing configuration, including model baselines, attention-aware pooling, data cleaning, and global randomization. The dataset is suitable for training independent single-layer linear classification matrices as PPLM steering heads.

提供机构:
MohammadKhosravi
搜集汇总
数据集介绍
MohammadKhosravi/cefr-llama3.1-8b-hidden-states-combined 数据集图片
构建方式
该数据集通过整合四个源自通用欧洲语言参考框架(CEFR)的开放英文语料库构建而成,具体包括结构化教学文本、日常会话短句、非母语学习者答题文本以及高级官僚文献。利用冻结参数的 Llama-3.1-8B-Instruct 模型,在第31层(倒数第二层)截取隐层状态,并通过注意力感知的平均池化操作,去除填充符伪迹,得到每个句子对应的4096维高保真潜在向量。全部计算在无梯度更新模式下并行完成,并经过张量溢出清洗与全局随机混洗,以保证特征的数值稳定性和分布均匀性。
特点
数据集包含13837个英文句子样本,每个样本由两个核心字段构成:4096维的浮点型隐藏状态向量与对应的CEFR等级标签(A1至C2)。等级分布呈现出理想的高斯钟形曲线特征,中间等级B1与B2占比超六成,而两端A1与C2的样本极为稀疏。这种边缘稀疏特性在后续分类器训练中需引起重视,建议采用类别加权损失函数或过采样策略加以应对。
使用方法
该数据集专为即插即用语言模型框架的第一阶段设计,适用于训练轻量级线性分类器作为语言模型的引导头。研究人员可通过 HuggingFace Datasets 库直接加载数据,提取隐藏状态向量并将其转换为张量,用于训练单层线性分类矩阵。该矩阵可作为独立的文本难度识别模型,或将映射回原始语言模型空间以微调生成行为。由于隐层已预提取并压缩,用户无需重复负担繁重的模型推理过程。
背景与挑战
背景概述
该数据集由MohammadKhosravi研究团队于近期创建,旨在解决低资源语言能力自动评估中大型语言模型部署成本高昂的瓶颈。研究聚焦于将Llama-3.1-8B-Instruct模型的第31层隐藏状态压缩为4096维表征向量,覆盖从A1到C2的完整CEFR等级体系。通过整合四类风格迥异的开源语料(包括标准教材、日常对话、非母语者答案及正式文档),该资源为轻量级线性分类器训练提供了高保真特征空间,显著降低了传统多语言模型在学术场景中的显存占用与计算开销。其公开的MIT许可协议与标准化处理流程,使其成为自然语言处理领域细粒度语言能力建模的重要基准数据集。
当前挑战
当前面临的首要挑战在于CEFR等级分布的非均衡性:A1与C2极端等级仅占样本总量的2.5%和2.7%,导致分类边界易受多数类主导而出现误判。数据来源的异构性亦构成技术难点,四类语料在句法复杂度、语义领域及错误模式上的显著差异,要求特征提取方法必须同时保持跨域一致性与等级敏感性。此外,单层注意力池化策略虽降低了维度灾难风险,但可能丢失深层语义连贯信息,而构建过程中对元伪影的强制过滤与全局随机化操作,亦需验证是否影响原始语言结构的统计显著性。
常用场景
经典使用场景
该数据集为自然语言处理领域中的文本分类任务提供了高保真的隐层表征,经典使用场景是训练轻量级线性分类器以实现基于CEFR语言能力等级(A1至C2)的句子难度自动判定。研究者可直接利用预提取的4096维隐向量,在不加载大规模语言模型的情况下完成分类模型的快速迭代与评估。
衍生相关工作
基于该数据集衍生了多项经典工作,包括在PPLM框架下探索线性探针与轻量分类头的协同优化、利用类别加权交叉熵损失改进长尾分布下的极低资源等级(如A1、C2)分类精度,以及结合隐层表征可视化分析不同语言能力层级在深层神经网络中的几何表征差异,推动了可解释性评估研究的发展。
数据集最近研究
最新研究方向
该数据集聚焦于利用大型语言模型(LLM)的隐层状态进行语言能力等级的细粒度分类,尤其服务于即插即用语言模型(PPLM)架构的第一阶段。通过从Llama-3.1-8B-Instruct的第三十一层提取经注意力感知池化的4,096维低维表征,研究旨在规避全参数模型在GPU内存中的持续驻留与迭代训练,从而显著降低计算开销。数据集整合了四种CEFR标注语料源,涵盖教科书文本、日常对话、非母语学习者错误及正式文档,以最大化风格多样性并构建鲁棒的分类边界。其应用前沿指向轻量级线性分类器的训练,用于语言能力的自动化评估与教育语言学中的适应性学习系统设计,同时也为表示学习与文本特征提取提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务