NumericBench
收藏资源简介:
NumericBench是一个用于评估大型语言模型数值推理能力的综合基准,它涵盖了从合成数字列表到现实世界领域(如股票趋势和天气模式)的各种数据集,系统地在结构化和嘈杂的环境中测试LLMs(大型语言模型)。
NumericBench is a comprehensive benchmark for evaluating the numerical reasoning capabilities of large language models (LLMs). It covers a diverse set of datasets ranging from synthetic numerical lists to real-world domains such as stock trends and weather patterns, and systematically tests LLMs in both structured and noisy environments.
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
-
数据集名称:NumericBench
-
数据集简介:NumericBench 是一个全面的基准测试,旨在评估大型语言模型(LLM)的数值推理能力,涵盖算术、数字识别、上下文检索、比较、汇总和逻辑推理等任务。
-
数据集构成:包含从合成数字列表到现实世界领域(如股票趋势和天气模式)的多样化数据集,系统地在结构化和噪声环境中测试 LLMs。
-
实验模型:在 GPT-4o 和 DeepSeek-V3 等模型上进行实验。
-
实验结果:展示了模型在数值推理任务上的显著弱点。
-
论文引用:
@misc{li2025exposingnumeracygapsbenchmark, title={Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models}, author={Haoyang Li and Xuejia Chen and Zhanchao XU and Darian Li and Nicole Hu and Fei Teng and Yiming Li and Luyu Qiu and Chen Jason Zhang and Qing Li and Lei Chen}, year={2025}, eprint={2502.11075}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2502.11075}, }




