TeXpert
收藏资源简介:
TeXpert是一个用于评估LLMs生成LaTeX代码能力的多级别基准数据集。它包含440个高质量样本,按难度分为简单、平均和困难三个类别。数据集涵盖了科学文档的多个组件,并针对不同难度级别的任务提供了自然语言提示。TeXpert旨在分析LLMs在生成准确LaTeX代码方面的表现,并识别常见的错误类型。
TeXpert is a multi-level benchmark dataset dedicated to evaluating the capability of Large Language Models (LLMs) in generating LaTeX code. It contains 440 high-quality samples, which are divided into three difficulty tiers: Easy, Medium, and Hard. The dataset covers various components of scientific documents, and provides natural language prompts for tasks at different difficulty levels. TeXpert aims to analyze the performance of LLMs when generating accurate LaTeX code, and identify common error types in their outputs.
TeXpert 数据集概述
摘要
- LaTeX因其在排版方面的精确性和灵活性,成为科学文档准备的金标准。
- 大型语言模型(LLMs)为研究人员提供了通过自然语言指令使用LaTeX生成出版就绪材料的机会,但当前基准完全缺乏对此能力的评估。
- TeXpert是一个基准数据集,包含用于生成LaTeX代码的自然语言提示,专注于科学文档的多个难度级别的组件。
- 评估发现:
- 在标准基准测试中表现优异的LLMs在LaTeX生成方面表现不佳,随着任务复杂度的增加,准确性显著下降。
- 开源模型如DeepSeek v3和DeepSeek Coder在LaTeX任务中与闭源模型表现相当。
- 格式和包错误异常普遍,表明大多数LLMs的训练数据集中缺乏多样化的LaTeX示例。
安装
-
克隆存储库。
-
可选:创建Python虚拟环境。
-
运行:
pip install -r requirements.txt
-
创建一个.env文件,包含所需的LLM API密钥。
使用
-
在main_test.py中设置测试参数:
model = <模型名称> difficulty_class = <Simple/Average/Hard> dataset_path = <数据集路径>
-
运行main_eval.py,结果将以Excel文件形式存储在results文件夹中,文件名为{model}_{difficulty_class}_results.xlsx。
贡献
- 欢迎任何对TeXpert的额外请求和/或贡献。
- 问题跟踪器用于记录待处理的功能和错误列表。
- 请联系作者以进行贡献。

- 1TeXpert: A Multi-Level Benchmark for Evaluating LaTeX Code Generation by LLMsKnowledgeverse AI · 2025年



