遇见数据集

automated-research-group/llama2_7b_chat-hellaswag-results

收藏
Hugging Face2023-12-05 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: - config_name: '{''do_sample''=False, ''beams''=10}' features: - name: id dtype: string - name: prediction dtype: string - name: hellaswag_accuracy dtype: bool splits: - name: train num_bytes: 863833 num_examples: 10042 download_size: 237030 dataset_size: 863833 - config_name: '{''do_sample''=False, ''beams''=1}' features: - name: id dtype: string - name: prediction dtype: string - name: hellaswag_accuracy dtype: bool splits: - name: train num_bytes: 835788 num_examples: 10042 download_size: 228433 dataset_size: 835788 - config_name: '{''do_sample''=False, ''beams''=5}' features: - name: id dtype: string - name: prediction dtype: string - name: hellaswag_accuracy dtype: bool splits: - name: train num_bytes: 835788 num_examples: 10042 download_size: 228433 dataset_size: 835788 configs: - config_name: '{''do_sample''=False, ''beams''=10}' data_files: - split: train path: '{''do_sample''=False, ''beams''=10}/train-*' - config_name: '{''do_sample''=False, ''beams''=1}' data_files: - split: train path: '{''do_sample''=False, ''beams''=1}/train-*' - config_name: '{''do_sample''=False, ''beams''=5}' data_files: - split: train path: '{''do_sample''=False, ''beams''=5}/train-*' ---

数据集信息: - 配置名称:{'采样开关(do_sample)'=False, '束搜索束数(beams)'=10} 特征字段: - 名称:id(标识符),数据类型:字符串 - 名称:prediction(预测结果),数据类型:字符串 - 名称:hellaswag_accuracy(HellaSwag准确率),数据类型:布尔值 数据集拆分: - 拆分名称:训练集,字节数:863833,样本数量:10042 下载大小:237030,数据集总存储大小:863833 - 配置名称:{'采样开关(do_sample)'=False, '束搜索束数(beams)'=1} 特征字段: - 名称:id(标识符),数据类型:字符串 - 名称:prediction(预测结果),数据类型:字符串 - 名称:hellaswag_accuracy(HellaSwag准确率),数据类型:布尔值 数据集拆分: - 拆分名称:训练集,字节数:835788,样本数量:10042 下载大小:228433,数据集总存储大小:835788 - 配置名称:{'采样开关(do_sample)'=False, '束搜索束数(beams)'=5} 特征字段: - 名称:id(标识符),数据类型:字符串 - 名称:prediction(预测结果),数据类型:字符串 - 名称:hellaswag_accuracy(HellaSwag准确率),数据类型:布尔值 数据集拆分: - 拆分名称:训练集,字节数:835788,样本数量:10042 下载大小:228433,数据集总存储大小:835788 配置项: - 配置名称:{'采样开关(do_sample)'=False, '束搜索束数(beams)'=10} 数据文件: - 数据拆分:训练集,路径:{'do_sample'=False, 'beams'=10}/train-* - 配置名称:{'采样开关(do_sample)'=False, '束搜索束数(beams)'=1} 数据文件: - 数据拆分:训练集,路径:{'do_sample'=False, 'beams'=1}/train-* - 配置名称:{'采样开关(do_sample)'=False, '束搜索束数(beams)'=5} 数据文件: - 数据拆分:训练集,路径:{'do_sample'=False, 'beams'=5}/train-*

原始信息汇总

数据集配置

配置1

  • 配置名称: {do_sample=False, beams=10}
  • 特征:
    • id: 类型为 string
    • prediction: 类型为 string
    • hellaswag_accuracy: 类型为 bool
  • 分割:
    • train: 字节数为 863833, 样本数为 10042
  • 下载大小: 237030 字节
  • 数据集大小: 863833 字节
  • 数据文件:
    • train: 路径为 {do_sample=False, beams=10}/train-*

配置2

  • 配置名称: {do_sample=False, beams=1}
  • 特征:
    • id: 类型为 string
    • prediction: 类型为 string
    • hellaswag_accuracy: 类型为 bool
  • 分割:
    • train: 字节数为 835788, 样本数为 10042
  • 下载大小: 228433 字节
  • 数据集大小: 835788 字节
  • 数据文件:
    • train: 路径为 {do_sample=False, beams=1}/train-*

配置3

  • 配置名称: {do_sample=False, beams=5}
  • 特征:
    • id: 类型为 string
    • prediction: 类型为 string
    • hellaswag_accuracy: 类型为 bool
  • 分割:
    • train: 字节数为 835788, 样本数为 10042
  • 下载大小: 228433 字节
  • 数据集大小: 835788 字节
  • 数据文件:
    • train: 路径为 {do_sample=False, beams=5}/train-*
搜集汇总
数据集介绍
automated-research-group/llama2_7b_chat-hellaswag-results 数据集图片
构建方式
在自然语言处理领域,常识推理评估是衡量语言模型理解能力的重要维度,HellaSwag数据集正是为此而生。该数据集基于LLaMA2-7B-Chat模型在HellaSwag基准上的推理结果构建,通过配置不同的束搜索参数(beams=1、5、10)并固定do_sample为False,系统化地记录了模型在不同搜索策略下的预测输出。每条数据包含唯一标识符、模型预测文本以及针对HellaSwag准确率的布尔值标签,最终形成三个独立配置的子集,每个子集均包含10,042条训练样本。
特点
该数据集的核心特点在于其多维度比较的架构设计。通过设置三种不同的束搜索宽度,研究者能够直观对比束搜索策略对模型推理准确率的影响,从而深入理解解码参数与常识推理性能之间的关联。数据以布尔型准确率标签作为核心评估指标,简洁明了地反映了每次预测的正确性。此外,数据集保留了完整的预测文本,为后续的误差分析和模型行为研究提供了丰富的原始素材。
使用方法
本数据集适用于评估和比较语言模型在常识推理任务上的表现。使用时,用户可根据研究需求选择特定束搜索配置的子集,通过加载train-*文件获取预测结果与准确率标签。典型应用包括分析不同束搜索宽度对模型推理质量的影响、验证模型改进策略的有效性,或作为基准测试的一部分与其它模型或解码方法进行横向对比。数据集以HuggingFace Datasets格式存储,可直接通过load_dataset函数便捷加载。
背景与挑战
背景概述
该数据集由automated-research-group团队创建,聚焦于评估大型语言模型在常识推理任务上的表现,核心研究问题在于探索不同解码策略(如束搜索束宽)对模型推理准确性的影响。数据集基于HellaSwag基准构建,HellaSwag是一项旨在测试模型对日常情境理解能力的挑战性任务,其设计巧妙规避了统计捷径,迫使模型依赖深层语义推理。通过记录Llama2-7B-Chat模型在不同束搜索配置下的预测结果与准确率,该数据集为分析生成式语言模型的推理鲁棒性提供了宝贵资源,尤其对自然语言处理领域中的模型评估与优化具有重要参考价值。
当前挑战
当前挑战主要体现在两方面:其一,HellaSwag任务本身要求模型具备超越表面模式的常识推理能力,而Llama2-7B-Chat在束搜索参数调整下仍难以完全攻克这一难题,准确率波动揭示了模型对解码策略的敏感性,这凸显了现有语言模型在复杂情境理解上的根本局限。其二,数据集构建过程中需严格控制实验变量,确保不同束宽设置下的公平比较,同时避免采样随机性引入的偏差,这要求精确的日志记录与重复验证,对实验设计与数据质量监控提出了较高要求。
常用场景
经典使用场景
在自然语言处理与常识推理的交叉领域中,HellaSwag基准测试旨在评估模型在复杂语境下完成句子续写的能力。该数据集记录了Llama2-7B-Chat模型在不同束搜索策略下的推理结果,通过对比do_sample=False且beams=1、5、10三种配置的预测准确性,为研究贪婪解码与束搜索宽度对常识推理任务的影响提供了标准化评测工具。研究者可借此分析大语言模型在零样本场景下处理反事实情境与物理常识的鲁棒性边界。
实际应用
在实际应用中,该数据集可指导AI系统的推理引擎优化。例如,在智能客服或教育辅导场景中,开发者可利用不同束搜索配置下的预测模式,选择在准确率与计算成本之间达到最优平衡的解码策略。此外,该数据集的错误预测样本可直接用于构建对抗性训练数据,增强模型在物理常识与逻辑推理任务中的可靠性,进而提升自动驾驶场景模拟或机器人指令理解等下游系统的决策安全性。
衍生相关工作
该数据集衍生了一系列关于解码策略与模型能力评估的经典工作。研究者基于此数据对比了Top-k抽样、核采样等方法的差异,并推动了束搜索贝叶斯优化理论的进展。后续工作进一步将HellaSwag预测结果与模型内部注意力分布进行关联分析,提出了基于束搜索置信度的知识蒸馏方法。这些研究共同构建了从解码算法到常识推理评估的完整技术谱系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务