bermaneh/pde-llm-eval-results-v2
收藏官方服务:
资源简介:
该数据集名为“pde-llm-eval-results-v2”,是一个用于评估大型语言模型(LLM)在偏微分方程(PDE)相关任务上性能的结果集。它包含自由生成(free-gen)的PDE评估数据,涉及10个不同的模型,主要基于v3数据集(128行数据,覆盖8个条件)。其中,9个现有模型的数据行包括v2和v3版本的组合,总计144行;而DeepSeek-R1-Distill-Qwen-32B模型仅使用v3数据集,有128行。整个数据集总共有1424行和21列,列包括标题、PDE类别、模型类型、真实PDE、真实方法、真实行为、有效性标志、模型完整响应、解析出的PDE类型、解析出的数值方法、解析出的物理过程、解析出的有效性答案、完成原因、模型名称,以及多个评估指标(如PDE匹配、嵌入相似度、方法匹配召回率、行为匹配召回率和有效性匹配)。这些指标用于量化模型在生成和解析PDE相关信息时的准确性和一致性。数据集旨在支持对LLM在科学计算和物理模拟领域能力的评估和分析。
Free-gen PDE eval: 10 models, v3 dataset (128 rows, 8 conditions). 9 existing models have 144 rows (v2+v3), DeepSeek-R1-Distill-Qwen-32B has 128 rows (v3 only).
提供机构:
bermaneh


