遇见数据集

SCICONVBENCH

收藏
github2026-05-18 更新2026-05-30 收录
官方服务:

资源简介:

该数据集用于评估大型语言模型在计算科学任务制定中多轮澄清对话的能力,涵盖流体力学、偏微分方程、固体力学和材料科学等多个科学领域,包含模糊或矛盾的任务描述,以测试模型通过提问澄清问题并恢复完整、正确任务规范的能力。

This dataset is intended to evaluate the capacity of large language models (LLMs) in multi-turn clarifying dialogues during computational science task formulation. It covers multiple scientific domains including fluid mechanics, partial differential equations, solid mechanics, and materials science, and includes ambiguous or contradictory task descriptions to test the models' ability to clarify problems via questioning and restore complete and accurate task specifications.

创建时间:
2026-05-18
原始信息汇总

数据集概述:SCICONVBENCH

SCICONVBENCH 是一个用于基准测试大型语言模型(LLM)在计算科学任务中多轮澄清能力的评估基准。该基准并非测试 LLM 的任务解决能力,而是评估其提出澄清性问题、消除模糊性或矛盾,并恢复完整、正确任务规范的能力。

数据集内容与结构

数据集覆盖多个科学领域,主要包括流体力学、偏微分方程、固体力学、材料科学等,并包含一个非科学文献领域的对照数据集。

领域目录

  • 科学领域foam/fluids/pde/matSci/matToolUse/solMech/solToolUse/
  • 基线目录:对应领域的 *_baseline/ 目录(用于对比实验)
  • 附加目录clamber/(非科学领域的消歧测试)、judge_ablation/prompt_ablation/user_llm_ablation/(消融实验结果)

核心数据文件

在每个科学领域目录的根级别,包含两个核心 JSON 数据集文件:

  • disambiguation_[domain].json:针对歧义(缺失关键词) 的任务。
  • inconsistency_[domain].json:针对不一致(矛盾) 的任务。

结果与模型文件夹架构

在每个领域目录内,按模型和运行模式(Disambiguation / Inconsistency)组织子文件夹。每个模型/模式文件夹内包含:

  • 摘要文件
    • llm_judge_chat_summary.json:对话指标汇总。
    • llm_judge_summary.json:任务恢复/成功指标汇总。
    • llm_judge_intent_summary.json:忠实度(Faithfulness)指标汇总。
    • disambiguation_coverage_summary.json:特定于部分领域的歧义覆盖指标。
  • 单个案例文件夹:每个案例 ID 对应的子文件夹,包含:
    • complete_prompt.txt:真实任务提示(Ground Truth)。
    • generated_prompt.txt:智能体最终返回的规范。
    • statistics.json:Token 使用量和提问次数。
    • conversation_log.txt:对话记录(可能为空)。

使用与执行流程

1. 环境配置

  • Python 依赖:安装 requirements.txt 中列出的所有包。
  • API 密钥:在 .env 文件中配置 OPENAI_API_KEYGEMINI_API_KEY
  • 模型特定配置:AWS Bedrock 需设置 AWS 凭证环境变量;Claude SDK 和 Codex GPT-5 需安装相应 CLI 并登录;本地 Ollama 需 GPU 资源和 Ollama 服务。

2. 运行智能体

使用 test_runner.py 脚本,并指定模式(inconsistencydisambiguation)、输出目录、领域和模型。具体命令可参考 ALL_*.txt 文件中的预配置命令。 bash python test_runner.py --mode inconsistency --output_dir fluids/CLAUDE_SONNET_4.0_Inconsistency --domain fluids --model bedrock_4_0_sonnet

3. 评估性能

运行 config.py 选择评判模型后,使用多个评估脚本分别评估忠实度、消歧和不一致指标。 bash python llm_judge_intent.py --input_dir fluids/CLAUDE_SONNET_4.0_Disambiguation --json_path fluids/disambiguation_fluids.json python llm_judge_disambiguation.py --input_dir fluids/CLAUDE_SONNET_4.0_Disambiguation --json_path fluids/disambiguation_fluids.json python llm_judge_inconsistency.py --input_dir fluids/CLAUDE_SONNET_4.0_Inconsistency --json_path fluids/inconsistency_fluids.json

4. 生成论文图表与表格

使用 make_paper_artifacts.py 脚本从原始评估 JSON 文件直接生成所有图表和 LaTeX 表格。 bash python make_paper_artifacts.py --root .

数据集访问

数据集包含在 GitHub 仓库中,同时正式托管于 Kaggle 平台:SCICONVBENCH Kaggle Dataset

搜集汇总
数据集介绍
SCICONVBENCH 数据集图片
构建方式
SCICONVBENCH数据集的构建旨在评估大语言模型在多轮对话中澄清任务规范的能力。数据集覆盖流体力学、偏微分方程、固体力学及材料科学等计算科学领域。每个任务被设计为包含歧义(缺失关键词)或矛盾(内部冲突)的形式。构建时,每个任务对应一个基于真实信息的标准答案,并模拟用户角色,严格依据该答案回答模型提出的澄清问题。数据集中每个科学领域目录均包含两个核心JSON文件,分别对应歧义消除与矛盾解决任务,每个案例文件夹中存储了完整提问记录、最终任务规范及各项评估指标。
特点
该数据集的核心特点在于不测试模型的求解能力,而是专门评估其在交互中识别缺失信息或冲突并主动提问以恢复完整任务规范的能力。评价体系既关注最终生成的任务规范是否准确,也考察对话过程的合理性,涵盖意图一致性、澄清覆盖率、召回率与精确度等多元化指标。数据集包含七大科学领域,并设有基线目录作为对比实验,另通过消融测试验证裁判模型、提示词风格及用户模拟模型的变动不会导致显著偏差,确保了基准评估的稳健性。
使用方法
使用者可通过查看对应领域的ALL_*.txt文件获取精确的运行命令。首先利用test_runner.py启动对话代理,需指定模式(歧义消除或矛盾解决)、输出目录、领域及模型类型,执行后代理将自动与模拟用户交互。随后根据模式选择相应的llm_judge脚本进行评估,需在config.py中设定裁判模型。所有运行结果均按模型与模式组织在各领域目录下的子文件夹中,包括对话日志、任务规范文件及统计数据。最后,运行make_paper_artifacts.py可直接从原始JSON中解析生成论文所需的图表与LaTeX表格。
背景与挑战
背景概述
SCICONVBENCH是由多学科研究团队构建的基准数据集,旨在评估大语言模型在计算科学任务表述中的多轮澄清能力。该数据集创建于近期,覆盖流体力学、偏微分方程、固体力学及材料科学等科学领域。其核心研究问题聚焦于:当科学任务存在语义歧义(缺失关键词)或逻辑矛盾(相互冲突的约束)时,LLM能否通过主动提出澄清性问题,完整恢复无歧义、无矛盾的任务规约。该基准的独特之处在于,不测试模型的任务求解能力,而衡量其利用多轮对话交互进行信息补全与矛盾消解的过程性表现,为评估LLM在科学计算领域的应用潜力提供了全新视角。
当前挑战
该数据集面临的挑战首先体现在所解决的领域问题上:计算科学中的任务形式化天然存在歧义性与矛盾性,例如物理参数缺失或边界条件冲突,LLM需具备从模糊描述中精准识别并主动澄清缺失信息的能力。构建过程中,团队需为每个科学领域精心设计包含真实歧义或矛盾的初始任务,并确保逻辑连贯性,这要求领域专家深度介入。此外,多轮对话的评估体系构建颇具难度:需同时衡量最终任务规约的完整性与对话过程的效率(如提问质量和澄清召回率),且需构建模拟用户模型,在严格遵循事实的前提下对模型提问做出回应,保证评估的公平性与可复现性。
常用场景
经典使用场景
在计算科学领域,科研任务的形式化描述往往蕴含着诸多模糊与矛盾,这对大语言模型的理解与交互能力构成了严峻挑战。SCICONVBENCH数据集应运而生,其核心设计理念在于构建一个多轮对话基准测试平台,专门评估大语言模型在面对流体力学、偏微分方程、固体力学及材料科学等复杂科学计算任务时,能否主动识别任务描述中存在的缺省关键词或相互矛盾的表述。不同于传统基准测试侧重于模型的任务求解能力,SCICONVBENCH独辟蹊径,将焦点置于模型的澄清提问能力与任务恢复能力之上,即通过多轮交互逐步消除歧义,最终还原出一份完整且无矛盾的正确任务规格说明书。
解决学术问题
该数据集的诞生填补了当前大语言模型评估体系在科学计算任务形式化领域的关键空白。长期以来,学术界对语言模型的评估多集中于单一轮次的问答或代码生成,鲜有研究系统性地考察模型在科学计算任务初始描述不完善时,通过主动提问进行信息补全与矛盾消解的能力。SCICONVBENCH精准解决了这一学术痛点,为研究模型在不确定条件下的信息获取策略、多轮对话中意图对齐能力以及跨学科科学概念的理解深度提供了标准化的评测框架。其意义在于推动了大语言模型从被动的指令执行者向主动的协作式科学探索伙伴的角色转变,重新定义了衡量模型科学素养与交互智能的标尺。
衍生相关工作
SCICONVBENCH的发布已引发了一系列相关工作的连锁创新。围绕该数据集,研究者们衍生了若干重要方向:首先,基于其多轮对话评估框架,催生了针对大模型在科学任务中主动提问策略优化的研究,探索如何通过强化学习训练模型在最少轮次内澄清最多关键信息。其次,该数据集为科学领域大模型的忠实性评估提供了方法论,衍生出的意图判准器与去重评估模块被广泛应用于其他科学文献理解任务的评测中。此外,其提出的分领域数据集架构(涵盖流体、固体、材料等)启发了跨学科科学任务的统一评估范式,推动了如科学计算中间表示自动生成、物理信息嵌入对话系统等前沿课题的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务