遇见数据集

ArchitectureIQ

收藏
github2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

ArchitectureIQ是一个用于评估LLMs(和人类)建模直觉的原型基准测试数据集,包含多个数据集家族,如单变量回归、多变量回归和双元语言模型,每个家族定义了任务、模型、损失函数和评估指标,用于生成和测试数据实例。

ArchitectureIQ is a prototype benchmark dataset for evaluating the modeling intuition of LLMs (and humans). It includes multiple dataset families such as univariate regression, multivariate regression, and bigram language models. Each family defines tasks, models, loss functions and evaluation metrics for generating and testing data instances.

创建时间:
2026-07-05
原始信息汇总

ArchitectureIQ 数据集详情

数据集概述

ArchitectureIQ 是一个用于评估大语言模型(LLM)及人类对模型架构建模直觉的原型基准测试。给定一个数据集实例与若干候选组合(模型 + 优化器 + 损失函数 + 预算),要求选择在指定训练预算后能达到最佳选择指标的候选方案。

数据集版本

当前版本为 v1,包含以下数据集家族:

家族(Family) 任务描述 可用模型 损失函数 评估指标
univariate_regression R → R 符号回归 mlp MSE(+ L1/L2 正则化) test_mse
multivariate_regression R^n → R 符号回归 mlp MSE(+ L1/L2 正则化) test_mse
bigram_lm 基于固定 P(y x) 的下一个词元预测 transformer_lm 交叉熵(+ L1/L2 正则化)

多变量输入维度multivariate_regression 的输入维度 n 默认从配置文件 profiles/v1.yaml 中的 input_dims: [2, 3, 4, 5, 8] 随机选取,可通过 --input-dim 或交互模式固定。

基准生成流程

1. 创建数据集(create-dataset

  • data/datasets/{family}/{dataset_id}/ 下生成合成数据集
  • 支持按家族、随机家族、指定种子及多变量输入维度创建
  • 种子控制合成数据生成(表达式公式、训练/测试点采样)的可复现性

2. 生成候选集(generate-candidates

  • 为指定数据集生成包含真实标注的命名候选集
  • 可选变化轴:模型(model)、优化器(optimizer)、损失函数(loss
  • 支持非交互式(固定轴随机选值)和交互式(手动固定轴值)两种模式

3. 组装问题(generate-question

  • 从一个或多个候选集中组装多项选择题,生成 prompt.txt
  • 问题类型根据候选规格自动推断
  • 支持设定问题数量、选项数量及随机种子

典型工作流程

仅架构变化问题

  • 创建数据集 → 生成仅有模型变化的候选集 → 组装多项选择题

跨预算混合问题

  • 创建数据集 → 生成不同预算或不同变化轴的候选集 → 将多个候选集路径传入 generate-question 组装交叉问题

完全交互式会话:依次使用 -i 交互模式创建数据集、生成候选集、组装问题。

项目结构

profiles/v1.yaml # V1 配置文件(参数池、网格、真实训练设置) AGENTS.md / CLAUDE.md # AI 代理开发指南 prompts/templates/ # 自然语言提示模板 src/architecture_iq/ # 核心流水线(数据集、候选、真实训练、问题) tools/llm_eval/ # 独立的 LLM 评估运行器 tools/ranking_questions/ # 排序任务生成与评分工具 tools/analysis.py # 离线曲线/序参数分析 templates/ # 可复用的 HTML 报告模板 data/ # 运行时生成的数据集、候选、问题 llm_runs/ # 运行时生成的 LLM 评估结果

可复现性

  • 真实训练通过执行磁盘上的 Python 文件实现,不使用并行框架快捷方式
  • 数据集通过 importlib 加载 synthesize.py 中的 synthesize() 函数生成
  • 候选训练使用 model.pyoptimizer.pyloss.py,每次运行前根据 candidate_spec.json 重新生成 .py 文件以保持对齐

问题检查器

提供 Streamlit UI 界面,支持浏览和作答问题。添加自定义设置功能允许用户选择架构、优化器、损失函数、训练预算和种子数,在数据集上训练并显示学习曲线。最多保留两个自定义运行:最新运行和历史最低损失运行。

启动命令:

.venv/bin/python tools/start_quiz.py

可指定具体问题或问题运行路径打开。

LLM 评估

独立的运行器,支持将问题提示发送至 OpenAI 兼容的聊天 API,从 <answer> 标签解析模型答案并与真实标注对比评分。主要特性:

  • 不导入 architecture_iq 核心模块,直接读取 data/ 下的问题文件
  • 评估时扩充提示以允许模型自由推理后提交答案
  • 支持设置 API 基础地址和密钥
  • 可指定评估模型、温度参数、问题数量限制及并行工作数
  • 每次运行在 llm_runs/{timestamp}_{model}/ 下生成配置、准确率摘要及各问题的完整响应记录
  • 支持 --skip-existing 恢复部分完成的评估运行
搜集汇总
数据集介绍
构建方式
ArchitectureIQ数据集的构建遵循一套严谨而灵活的流水线架构,旨在系统性地评估大语言模型在模型选择任务上的直觉能力。首先,通过`create-dataset`命令生成合成数据集实例,这些实例涵盖了单变量回归、多变量回归以及二元语言模型等多种任务族,每个实例均包含训练与测试数据。随后,利用`generate-candidates`命令针对特定数据集实例生成候选集合,每个候选由模型、优化器、损失函数与训练预算的组合构成,并通过实际训练与评估获得其在指定预算下的真实表现指标。最后,`generate-question`命令从候选集合中抽取子集组装成多项选择题,每道题要求从多个候选中选出在给定训练预算下达到最优选择指标的那一个,从而形成对模型选择能力的直接考验。
特点
该数据集的核心特点在于其设计理念的精致与评估维度的丰富性。它将模型直觉的评估从传统的能力基准测试中剥离出来,聚焦于一个具体而微的任务——在有限的训练预算下,从多个候选配置(架构、优化器、损失函数)中识别出最优者。题目类型灵活多变,可以通过控制变量法生成仅变动架构的纯架构题,也能构造跨预算、混合变动的综合题。此外,数据集引入了交互式评测界面,允许用户手动探索候选配置的表现曲线,甚至添加自定义设置进行实时验证,为深入理解模型选择的内在机制提供了强有力的实验平台。
使用方法
使用ArchitectureIQ数据集进行评测时,研究者可通过命令行工具启动交互式测验,或编写脚本进行批量评估。直接运行`start_quiz.py`即可在本地浏览器中开启包含预置题目的问答界面。对于自动化的大规模评测,推荐使用内置的LLM评估运行器,只需配置OpenAI兼容的API密钥,即可通过`run.py`将题目发送至指定语言模型,其回复中的答案标签将被自动解析并与标准答案比对,最终生成详细的准确率摘要与每道题的响应记录。该过程支持多线程并发与断点续评,显著提升了大规模实验的效率与可复现性。
背景与挑战
背景概述
ArchitectureIQ是一个于近期由研究团队构建的原型基准测试,旨在评估大语言模型(LLM)乃至人类在模型设计方面的直觉能力。其核心研究问题在于:给定一个数据集实例以及多个候选方案(包含模型、优化器、损失函数和训练预算),判断哪一种选择能在指定预算下取得最优的评估指标。该数据集聚焦于符号回归与语言建模任务,通过控制模型架构、优化策略、损失函数及训练预算等多个维度,系统性地考察算法选择的推理能力。作为一项新兴基准,ArchitectureIQ为量化模型对训练动态与超参数交互的理解提供了标准化评估框架,有望推动机器学习自动化决策领域的深入探索。
当前挑战
ArchitectureIQ面临的核心挑战在于如何精准刻画并评估模型对复杂配置组合的直觉预测能力。从问题层面看,候选方案在模型、优化器、损失函数与预算上的耦合关系使得最优选择往往并非直观,且不同任务族(如单变量回归与二元语言模型)间共享相同的评估逻辑,增加了泛化难度。在构建过程中,需要确保合成数据的可复现性、候选集采样的随机性受控,并设计严谨的显著性检验以区分运气与真知。此外,基准的交互式探查工具与盲评机制要求妥善处理信息泄露风险,确保评估结果的可靠性与公平性。
常用场景
经典使用场景
在深度学习与自动机器学习交叉领域中,ArchitectureIQ数据集构建了一种新颖的基准测试范式,专门用于评估大语言模型(LLM)乃至人类专家对模型架构的直觉判断能力。该数据集的核心设计在于:给定一个具体的回归或语言建模任务实例,并配套提供若干候选方案(涵盖不同的模型架构、优化器、损失函数及训练预算),要求测试对象预测哪一个方案能在既定预算下取得最优的选择指标。经典使用场景包括单变量回归、多变量回归以及二元语法语言建模任务,研究者可通过固定模型架构或预算规模来设计控制实验,从而量化评估不同智能体对模型超参数与架构选择的理解深度。
衍生相关工作
以ArchitectureIQ数据集为基石,研究者已衍生出多项具有启发性的经典工作。其中,排名问题(ranking questions)的生成与校准分析工具允许研究者构建去标识化的代理绑定任务,通过逆序数评分来量化候选方案排序预测的准确度,为模型直觉的细粒度评估提供了新维度。另一项代表性工作是离线曲线与序参量分析工具,它通过对训练后的候选方案学习曲线进行系统总结,揭示了不同模型配置在有限预算下的收敛规律,形成了可解释的决策规则库。此外,基于校准加排序(calibration-plus-ranking)的评估范式,研究者进一步开发了确定性选择规则的算术评估工具,尝试将LLM的隐式直觉转化为显式、可推导的决策逻辑,从而推动了数据集在可解释性自动化机器学习领域的深层应用。
数据集最近研究
最新研究方向
ArchitectureIQ作为评估大语言模型(LLM)建模直觉的前沿基准,其最新研究方向聚焦于多维度模型架构与超参数组合的智能选择问题。该基准通过设计包含单变量/多变量回归及二元语言模型等多样化任务家族,系统考察模型在给定数据集和候选方案(模型、优化器、损失函数及训练预算)中预测最优配置的能力。近期研究热点包括:利用交互式评估框架量化LLM对架构复杂度和优化动态的直觉理解,探索跨预算混合选择策略(如不同训练步长和可变轴组合下的性能预测),以及开发基于排列逆序分数的排序式问答任务以精细化衡量模型决策质量。这一工作不仅为理解LLM的元学习能力提供了可复现的评估协议,更推动了AI辅助自动化机器学习(AutoML)中直觉推理与算法搜索的融合边界,对于构建具备深层建模洞察力的下一代智能系统具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务