遇见数据集

pde-llm-eval-results-jul28

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

本数据集为pde-llm-eval-results-jul28,是一个用于评估大型语言模型(LLM)在偏微分方程(PDE)自由生成任务上表现的部分结果数据集。数据集包含来自11个不同模型的2816条评估记录,每条记录包含29个字段。数据集的输入数据来源于merged_mod_jul28.csv,评估任务为自由生成PDE相关信息。字段包括:问题标识(title)、真实PDE样本(gt_sample)、数据来源(source)、真实PDE类别(pde_class)、修改条件(mod_type)、真实PDE标签(gt_pde)、真实数值方法(gt_method)、真实物理行为(gt_behavior)、真实物理有效性(gt_valid)、模型原始输出(model_response)、解析后的PDE、方法、行为、有效性字段(parsed_pde/parsed_method/parsed_behavior/parsed_valid)、有效性置信度(valid_conf)、结束原因(finish_reason)、模型名称(model)、数据集名称(dataset)、提示版本(prompt_version)、以及多个匹配和相似度指标(如pde_match、pde_embed_sim、method_any_match、method_recall、behavior_any_match、behavior_recall、valid_match等)。生成参数包括使用的模型列表(如QwQ-32B、Qwen2.5-Coder-32B-Instruct等)、最大token数(per-model)、思考过程被抑制等。该数据集可用于评估和比较不同LLM在PDE理解、生成和数值方法识别等方面的能力。

This dataset is pde-llm-eval-results-jul28, a partial result dataset for evaluating the performance of large language models (LLMs) on the task of free-form generation of partial differential equations (PDEs). It contains 2,816 evaluation records from 11 different models, each with 29 fields. The input data originates from merged_mod_jul28.csv, and the evaluation task is to freely generate PDE-related information. Fields include: question identifier (title), ground truth PDE sample (gt_sample), data source (source), ground truth PDE class (pde_class), modification condition (mod_type), ground truth PDE label (gt_pde), ground truth numerical method (gt_method), ground truth physical behavior (gt_behavior), ground truth physical validity (gt_valid), model raw output (model_response), parsed PDE, method, behavior, and validity fields (parsed_pde/parsed_method/parsed_behavior/parsed_valid), validity confidence (valid_conf), finish reason (finish_reason), model name (model), dataset name (dataset), prompt version (prompt_version), and multiple matching and similarity metrics (e.g., pde_match, pde_embed_sim, method_any_match, method_recall, behavior_any_match, behavior_recall, valid_match, etc.). Generation parameters include the list of used models (e.g., QwQ-32B, Qwen2.5-Coder-32B-Instruct, etc.), maximum tokens per model, and whether thought process is suppressed. This dataset can be used to evaluate and compare the capabilities of different LLMs in PDE understanding, generation, and numerical method identification.

创建时间:
2026-08-20
原始信息汇总

pde-llm-eval-results-jul28 数据集概述

基本信息

  • 许可协议: MIT
  • 标签: pde-llm-eval, free-gen, jul28, partial
  • 数据规模: 2816 行, 29 列

数据集内容

该数据集为自由生成 PDE 评估的部分结果,基于 merged_mod_jul28.csv 输入数据,包含来自 11 个模型的推理输出。

主要字段说明

字段类别 字段名 描述
标识字段 title 数据集行标识符(如 Wave_Comm_Valid_1)
gt_sample 基础问题 ID(如 Wave_1)
source 基础问题来源(人工/合成)
真值字段 pde_class 真值 PDE 类别(wave/heat/burgers/navier-stokes)
mod_type 修改条件(8 种之一)
gt_pde / gt_method / gt_behavior 真值 PDE 标签、数值方法、物理行为
gt_valid 真值物理有效性(True/False)
模型输出字段 model_response 完整原始模型输出(未截断)
parsed_pde / parsed_method / parsed_behavior / parsed_valid 从响应中解析的各字段
finish_reason vLLM 停止原因(length 表示输出被截断)
model 推理所用模型 ID
评估指标字段 pde_match PDE 字段关键词匹配(0/1)
pde_embed_sim PDE 字段余弦嵌入相似度 [0,1]
method_any_match / method_recall 方法匹配标志及召回率
behavior_any_match / behavior_recall 行为匹配标志及召回率
valid_match 有效性预测是否与真值一致(0/1)

生成参数

  • 评估脚本: run_eval.py
  • 实验名称: pde-llm-eval
  • 任务 ID: torch:16075872
  • 集群: torch
  • 工件状态: partial(部分完成)
  • 输出限制: max_tokens 按模型设置,thinking 已抑制
  • 输入数据集: merged_mod_jul28.csv

使用的模型(11 个)

  1. Qwen/QwQ-32B
  2. Qwen/Qwen2.5-Coder-32B-Instruct
  3. Qwen/Qwen2.5-Coder-7B-Instruct
  4. Qwen/Qwen3-32B
  5. Qwen/Qwen3-Coder-30B-A3B-Instruct
  6. deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
  7. google/gemma-3-27b-it
  8. meta-llama/Llama-3.1-8B-Instruct
  9. meta-llama/Llama-3.3-70B-Instruct
  10. microsoft/phi-4
  11. mistralai/Mistral-Nemo-Instruct-2407

使用方式

python from datasets import load_dataset

dataset = load_dataset("bermaneh/pde-llm-eval-results-jul28", split="train") print(f"Loaded {len(dataset)} rows")

搜集汇总
数据集介绍
pde-llm-eval-results-jul28 数据集图片
构建方式
该数据集是偏微分方程(PDE)领域大语言模型评估的产物,旨在系统性地检验模型对PDE问题的自由生成能力。其构建基于merged_mod_jul28.csv这一基础数据集,涵盖了波、热、伯格斯及纳维-斯托克斯等经典PDE类别,并引入了8种修改条件以生成多样化的测试样本。通过调用11个不同的模型(如Qwen、DeepSeek、Llama等)进行推理,每个样本均保留了模型的原始输出及后续解析字段。评估过程采用vLLM引擎,并针对不同模型设定了最大生成长度,同时抑制了模型的思考过程,保证了评估的一致性与纯净性。最终,该数据集共包含2816行、29列数据,每一行均对应一个特定的PDE问题实例及其模型响应,为分析模型在PDE任务上的表现提供了丰富的原始素材。
使用方法
使用该数据集极为便捷,研究人员可通过HuggingFace的datasets库直接加载,如示例代码所示,即可获得完整的训练/测试数据框架。数据集的结构清晰,每一列都对应特定的属性,便于用户根据研究目的进行筛选与操作。例如,可以按模型(model)分组比较不同LLM在PDE任务上的表现,或按pde_class分析模型在不同物理方程上的能力差异。对于需要深入分析的场景,原始未截断的model_response字段提供了完整的模型输出,支持细致的文本挖掘。此外,内置的评估指标列(如recall与match)可直接用于量化分析,无需重新计算。该数据集既可以作为基准,用于评估新模型的PDE理解能力,也可作为训练数据,用于微调更专业的PDE求解或生成模型。
背景与挑战
背景概述
该数据集由Berman等人创建,发布于2025年7月28日,名为'pde-llm-eval-results-jul28',隶属于pde-llm-eval项目,旨在评估大型语言模型(LLMs)在偏微分方程(PDE)自由生成任务上的表现。数据集包含2816条模型输出记录,覆盖11个主流LLM(如Qwen、DeepSeek、Llama等),并针对波动、热传导、Burgers及Navier-Stokes等经典PDE类别,通过8种修改条件进行系统性评测。其核心研究问题在于探究LLM能否准确解析和生成PDE的数学表达、数值方法及物理行为,从而衡量模型在科学计算领域的综合能力。该数据集的发布填补了LLM在PDE理解和生成方面缺乏标准化评估基准的空白,为科学机器学习社区提供了重要参考,推动了LLM在物理信息驱动任务中的可信度研究。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两方面。领域层面,PDE自由生成任务要求模型兼具数学符号理解、物理直觉与多步骤推理能力,而当前LLM常出现输出格式错误、PDE表达式不精确、数值方法或物理行为描述缺失等问题,导致pde_match和method_recall等指标偏低,且对物理有效性的判断(valid_match)不稳定。构建过程中,数据集基于'merged_mod_jul28.csv'筛选部分数据,采用vLLM推理并抑制思考过程,但受限于max_tokens设置,部分模型输出被截断(finish_reason='length'),影响标注完整性。此外,模型输出需经复杂解析流程(parsed_pde、parsed_valid等)才能与真实标签对比,解析歧义可能导致评估偏差。这些挑战凸显了在科学LLM评估中平衡生成自由度与验证可靠性的难度,也为后续改进提供了方向。
常用场景
经典使用场景
该数据集是偏微分方程(PDE)领域大语言模型(LLM)评估的基准资源,聚焦自由生成任务。它汇集了11种不同模型(如QwQ-32B、DeepSeek-R1等)在2816个样本上的原始输出及解析后的结构化字段,涵盖波动方程、热传导方程、伯格斯方程和纳维-斯托克斯方程等经典PDE类别。其核心用途在于系统度量LLM对PDE问题的理解与生成能力,包括方程识别、数值方法选择、物理行为描述及有效性判断等维度,为跨模型对比、提示策略优化及鲁棒性分析提供了标准化数据基础。
解决学术问题
在科学计算与人工智能交叉研究中,该数据集解决了缺乏统一评估框架的痛点。传统PDE求解依赖数值方法,而LLM在符号层面的推理能力尚待验证。此数据集通过引入多维度指标(如关键词匹配、嵌入相似度、召回率),使研究者能量化模型在PDE描述生成中的准确性、完整性和物理一致性,从而回答LLM能否胜任科学方程解析、方法推断及行为预测等学术问题,推动可解释AI与科学发现领域的发展。
实际应用
实际应用中,该数据集可用于自动化科学文献解析、教育辅助工具的开发以及工程仿真前端的智能化升级。例如,基于该数据训练的模型能够自动从文本中提取PDE控制方程,辅助工程师快速建立数学模型;或为科研人员提供数值方法推荐,加速计算流体力学、热分析等领域的建模流程。其结构化的评估结果还可用于筛选适合特定PDE任务的模型,优化生产环境中的推理效率与输出质量。
数据集最近研究
最新研究方向
该数据集聚焦于偏微分方程(PDE)领域的大语言模型(LLM)评估,反映了近期利用LLM进行科学计算与物理建模的前沿探索。研究重点在于评估模型对PDE的识别、数值方法选择及物理行为预测能力,涵盖波、热、伯格斯与纳维-斯托克斯等经典方程。通过引入八种修改条件及人类与合成数据源,该评估揭示了模型对PDE变体的泛化性能与稳健性,推动了LLM在科学发现中的可信应用。其多维度指标(如嵌入相似度与召回率)为量化模型物理理解提供新范式,对加速PDE求解及物理信息机器学习的发展具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务