SCICONVBENCH
收藏资源简介:
该数据集用于评估大型语言模型在计算科学任务制定中多轮澄清对话的能力,涵盖流体力学、偏微分方程、固体力学和材料科学等多个科学领域,包含模糊或矛盾的任务描述,以测试模型通过提问澄清问题并恢复完整、正确任务规范的能力。
This dataset is intended to evaluate the capacity of large language models (LLMs) in multi-turn clarifying dialogues during computational science task formulation. It covers multiple scientific domains including fluid mechanics, partial differential equations, solid mechanics, and materials science, and includes ambiguous or contradictory task descriptions to test the models' ability to clarify problems via questioning and restore complete and accurate task specifications.
数据集概述:SCICONVBENCH
SCICONVBENCH 是一个用于基准测试大型语言模型(LLM)在计算科学任务中多轮澄清能力的评估基准。该基准并非测试 LLM 的任务解决能力,而是评估其提出澄清性问题、消除模糊性或矛盾,并恢复完整、正确任务规范的能力。
数据集内容与结构
数据集覆盖多个科学领域,主要包括流体力学、偏微分方程、固体力学、材料科学等,并包含一个非科学文献领域的对照数据集。
领域目录
- 科学领域:
foam/、fluids/、pde/、matSci/、matToolUse/、solMech/、solToolUse/ - 基线目录:对应领域的
*_baseline/目录(用于对比实验) - 附加目录:
clamber/(非科学领域的消歧测试)、judge_ablation/、prompt_ablation/、user_llm_ablation/(消融实验结果)
核心数据文件
在每个科学领域目录的根级别,包含两个核心 JSON 数据集文件:
disambiguation_[domain].json:针对歧义(缺失关键词) 的任务。inconsistency_[domain].json:针对不一致(矛盾) 的任务。
结果与模型文件夹架构
在每个领域目录内,按模型和运行模式(Disambiguation / Inconsistency)组织子文件夹。每个模型/模式文件夹内包含:
- 摘要文件:
llm_judge_chat_summary.json:对话指标汇总。llm_judge_summary.json:任务恢复/成功指标汇总。llm_judge_intent_summary.json:忠实度(Faithfulness)指标汇总。disambiguation_coverage_summary.json:特定于部分领域的歧义覆盖指标。
- 单个案例文件夹:每个案例 ID 对应的子文件夹,包含:
complete_prompt.txt:真实任务提示(Ground Truth)。generated_prompt.txt:智能体最终返回的规范。statistics.json:Token 使用量和提问次数。conversation_log.txt:对话记录(可能为空)。
使用与执行流程
1. 环境配置
- Python 依赖:安装
requirements.txt中列出的所有包。 - API 密钥:在
.env文件中配置OPENAI_API_KEY和GEMINI_API_KEY。 - 模型特定配置:AWS Bedrock 需设置 AWS 凭证环境变量;Claude SDK 和 Codex GPT-5 需安装相应 CLI 并登录;本地 Ollama 需 GPU 资源和 Ollama 服务。
2. 运行智能体
使用 test_runner.py 脚本,并指定模式(inconsistency 或 disambiguation)、输出目录、领域和模型。具体命令可参考 ALL_*.txt 文件中的预配置命令。
bash
python test_runner.py --mode inconsistency --output_dir fluids/CLAUDE_SONNET_4.0_Inconsistency --domain fluids --model bedrock_4_0_sonnet
3. 评估性能
运行 config.py 选择评判模型后,使用多个评估脚本分别评估忠实度、消歧和不一致指标。
bash
python llm_judge_intent.py --input_dir fluids/CLAUDE_SONNET_4.0_Disambiguation --json_path fluids/disambiguation_fluids.json
python llm_judge_disambiguation.py --input_dir fluids/CLAUDE_SONNET_4.0_Disambiguation --json_path fluids/disambiguation_fluids.json
python llm_judge_inconsistency.py --input_dir fluids/CLAUDE_SONNET_4.0_Inconsistency --json_path fluids/inconsistency_fluids.json
4. 生成论文图表与表格
使用 make_paper_artifacts.py 脚本从原始评估 JSON 文件直接生成所有图表和 LaTeX 表格。
bash
python make_paper_artifacts.py --root .
数据集访问
数据集包含在 GitHub 仓库中,同时正式托管于 Kaggle 平台:SCICONVBENCH Kaggle Dataset





