遇见数据集

llm-econ-memorization

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集是一个多年度、结构化的问题-回答数据集,涵盖1999年至2026年(含部分年份)的样本。数据集中每个样本包含12个字段:唯一标识符(id)、任务类型(task)、截止划分信息(cutoff_split)、年份(year)、时期(period)、变量(variable)、自然语言问题(question)、上下文信息(context)、提示文本(prompt)、答案(answer)、答案类型(answer_type)以及元数据JSON字符串(meta_json)。数据集按年份划分,每年样本量在338至820之间,总样本量约17,000余条。适用于语言模型评估、问答系统训练、时序数据分析等任务,尤其适合研究模型在不同年份、任务类型和变量条件下的表现。

This dataset is a multi-year, structured question-answer dataset covering samples from 1999 to 2026 (including some years). Each sample in the dataset contains 12 fields: unique identifier (id), task type (task), cutoff split information (cutoff_split), year (year), period (period), variable (variable), natural language question (question), context information (context), prompt text (prompt), answer (answer), answer type (answer_type), and metadata JSON string (meta_json). The dataset is divided by year, with annual sample sizes ranging from 338 to 820, and a total sample size of approximately 17,000 entries. It is suitable for tasks such as language model evaluation, question-answering system training, and time-series data analysis, particularly well-suited for studying model performance under different years, task types, and variable conditions.

提供机构:
The Fin AI
创建时间:
2026-06-05
原始信息汇总

数据集概述:llm-econ-memorization

该数据集由 TheFinAI 团队提供,旨在用于评估或分析大语言模型 (LLM) 对经济学相关知识的记忆能力。

基本信息

  • 数据集名称: llm-econ-memorization
  • 提供者: TheFinAI
  • 来源地址: https://huggingface.co/datasets/TheFinAI/llm-econ-memorization

数据规模

  • 总数据集大小: 12,934,932 字节
  • 下载大小: 1,464,580 字节
  • 总样本数量: 约 21,086 条(基于所有 splits 的示例数总和)

数据特征 (Features)

该数据集包含 12 个字段,用于描述每条经济学相关的问答数据:

字段名称 数据类型 描述
id string 样本唯一标识符
task string 任务类型
cutoff_split string 数据截止分割标识
year string 数据对应的年份
period string 数据对应的时间段
variable string 涉及的变量名称
question string 问题文本
context string 相关的上下文或背景信息
prompt string 提供给模型使用的提示词
answer string 标准答案
answer_type string 答案的类型(如单选、多选等)
meta_json string 元数据,格式为 JSON 字符串

数据分割 (Splits)

数据按年份进行分割,涵盖了从 1999 年到 2026 年的经济学数据。每个年份对应一个独立的数据集分割(split),具体分布如下:

  • 1999年: 700 条样本
  • 2000年至2003年: 每年 748 条样本
  • 2004年: 756 条样本
  • 2005年至2009年: 每年 772 条样本
  • 2010年: 784 条样本
  • 2011年: 796 条样本
  • 2012年: 810 条样本
  • 2013年至2024年: 每年 820 条样本
  • 2025年: 818 条样本
  • 2026年: 338 条样本

数据文件配置

数据采用默认配置 (default),每个年份的数据文件存储在 data/ 目录下,文件命名格式为 {年份}-*。例如,1999 年的数据文件位于 data/1999-*

搜集汇总
数据集介绍
llm-econ-memorization 数据集图片
构建方式
llm-econ-memorization数据集旨在评估大型语言模型对经济学文本的记忆程度,其构建融合了时间序列与结构化问答的精密设计。数据源自宏观经济变量与相关历史事件,以年份为核心分割维度,覆盖1999至2026年,每个年份独立存储为数据分片。每条记录包含唯一标识符、任务类型、年份、周期、变量名称、问题、上下文、提示语、标准答案及答案类型等字段,其中meta_json字段存储了丰富的元数据信息。整体基于经济领域真实数据生成,通过将原始经济指标转化为格式化问答对,并明确区分答案形式,构建了一个系统化的模型记忆测试集。
使用方法
研究者在HuggingFace平台上可通过datasets库便捷加载该数据集,支持按年份筛选特定时间分片进行针对性分析。典型的使用方式包括:按年度加载数据,将'question'与'context'字段组合作为输入,利用'prompt'字段提供的模板化提示引导模型生成回答,并通过与'answer'字段比对计算准确率。此外,meta_json字段中的深层元数据可用于探索不同经济变量、周期或问题类型对模型记忆效果的影响,而cutoff_split字段则支持构建训练数据截止点实验,深入研究模型的时序记忆与泛化特性。
背景与挑战
背景概述
llm-econ-memorization数据集诞生于大型语言模型与经济学交叉研究的前沿领域,由关注模型记忆化行为的学者团队构建。该数据集的核心研究问题在于系统性地评估大语言模型对经济统计数据的记忆程度,揭示模型在训练过程中是否过度依赖特定时间序列数据。通过涵盖1999年至2026年间的经济变量与相关问答对,该数据集为量化模型在经济领域的泛化能力与记忆风险提供了独特的基准。其影响力体现在为AI对齐研究中的隐私与数据合规问题开辟了新维度,尤其对金融监管科技发展具有重要参考价值。
当前挑战
该数据集主要面临两重挑战:其一,经济数据本身具有强时间依赖性和政策敏感性,模型可能因记忆2008年金融危机或2020年疫情等特殊年份的异常值而导致对历史事件的过度拟合,进而危害模型在处理未见经济情景时的稳健性;其二,构建过程中需要平衡数据集规模与标注质量,从大量经济文献与统计公报中提取结构化问答对时,需解决跨年度指标定义变更、数据修正等问题,确保28个时间切片的数据一致性,这对数据清洗与标准化流程提出了极高要求。
常用场景
经典使用场景
在经济学与人工智能的交叉领域中,llm-econ-memorization数据集为研究大型语言模型对经济知识的记忆与泛化能力提供了标准化的测评基准。该数据集按年份划分,涵盖了从1999年至2026年间的经济变量、任务类型与问答对,研究者可借助不同时间截断的样本来评估模型在已知与未知经济事实上的表现。经典使用场景包括测试模型对历史经济指标的回忆准确率,以及在对数期跨度下模型能否从训练数据中提取并复现结构性经济规律。这一设计使得数据集成为剖析大模型经济学知识边界与记忆特性的重要工具。
解决学术问题
该数据集精准回应了当前学术界关于大模型是否仅仅是“记忆库”的核心争议。通过引入时间截断的分裂机制,研究者能够系统性地分离模型训练时所见与未见的经济数据,从而量化模型的真实理解程度而非单纯记忆。具体而言,它帮助学界厘清了大模型在经济预测、变量关联推断等任务中是否展现了超出数据表的归纳能力;同时也为评估模型在不同年度经济环境下的知识时效性与更新需求提供了坚实依据。这些研究极大地推动了对大模型认知本质与经济推理机制的深层理解。
实际应用
在金融预测、经济政策模拟及智能投顾等实际场景中,llm-econ-memorization数据集展现出重要的应用价值。金融机构可利用该数据集检验大模型对过去经济周期的记忆与响应模式,从而校准模型在实时经济分析中的可靠性。政策制定者可以借助数据集评估模型在理解历史政策效果方面的能力,辅助经济决策的智能化。此外,在经济学教育领域,该数据集可以用于验证和优化教学用大模型的知识覆盖面与准确性,使得人工智能在经济学实践中的部署更加可信与有效。
数据集最近研究
最新研究方向
llm-econ-memorization数据集的最新研究方向聚焦于探究大语言模型在经济学领域中对时序经济数据的记忆与泛化边界。随着AI模型在金融预测、政策分析等敏感场景的深度渗透,模型是否会机械复现训练集中的经济指标(如GDP、通胀率)而非进行因果推理,成为学界与监管层共同关注的焦点。该数据集通过构建跨年度(1999-2026年)的经济变量问答对,为评估模型对历史经济知识的精确记忆程度提供了标准化基准。前沿工作正利用这一资源系统性地剖析模型参数中蕴含的经济学先验知识,揭示其在处理不同时期经济波动时的隐性记忆特征,这不仅关乎模型可靠性,更对防止经济决策中的算法偏差与数据污染具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务