遇见数据集

MichiganNLP/language-energy-divide

收藏
Hugging Face2026-06-18 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是论文《语言-能源鸿沟:测量多语言LLM推理的能源成本》的配套数据,发布了研究中使用的每种语言的能源测量数据和提示,以便研究人员无需重新运行完整的测量活动即可基于这些数据开展研究。数据集包含两个主要部分:一是能源测量结果(位于results/目录),包括Qwen3-8B在122种语言上的主要结果(如每令牌稳态能源、输出令牌总数、总GPU能源、准确率等),以及其他模型的跨模型研究、跨任务比较和批量大小扫描数据;二是提示数据(位于prompts/目录),包括122种Belebele语言的零样本思维链指令和引导词(经过机器翻译、后翻译质量控制和手动整理),以及机器翻译的GSM8K数学问题和LM-Arena开放聊天提示(带有质量分数)。数据集重点关注多语言LLM推理的能源效率差异,例如发现不同语言之间的每令牌能源差异高达8.3倍,总能源差异高达179倍,且能源消耗最高的语言准确率最低。数据基于ML.ENERGY基准(使用vLLM服务和Zeus库)在NVIDIA L40S和RTX 6000 Pro Blackwell硬件上测量,并提供了一个8语言子集(包括英语、中文、俄语、法语等高资源语言和南普什图语、提格里尼亚语、掸语、藏语等低资源语言)用于跨模型、跨GPU和跨任务实验。

This dataset is the supplementary data for the paper *Language-Energy Gap: Measuring the Energy Cost of Multilingual LLM Inference*. It publishes the energy measurement data and prompts for each language employed in the study, enabling researchers to leverage these data for their own research without rerunning the full measurement campaign. The dataset consists of two core components: 1. Energy measurement results (stored in the `results/` directory): including the main findings of Qwen3-8B across 122 languages, such as steady-state energy consumption per token, total number of output tokens, total GPU energy consumption, accuracy, and other metrics, as well as cross-model research data, cross-task comparison data, and batch size sweep data for additional models. 2. Prompt datasets (stored in the `prompts/` directory): including zero-shot chain-of-thought instructions and guiding prompts for all 122 Belebele languages, which underwent machine translation, post-translation quality control, and manual curation, as well as machine-translated GSM8K mathematics problems and LM-Arena open chat prompts with quality scores. This dataset centers on the disparities in energy efficiency across multilingual LLM inference scenarios. For example, it is observed that per-token energy consumption varies by up to 8.3 times across different languages, while total energy consumption varies by up to 179 times, with languages exhibiting the highest energy consumption also showing the lowest accuracy rates. The data was collected using the ML.ENERGY benchmark (with vLLM serving framework and the Zeus library) on NVIDIA L40S and RTX 6000 Pro Blackwell hardware. An 8-language subset is additionally provided, covering high-resource languages such as English, Chinese, Russian, and French, as well as low-resource languages including Southern Pashto, Tigrinya, Shan, and Tibetan, to support cross-model, cross-GPU, and cross-task experimental studies.

提供机构:
MichiganNLP
搜集汇总
数据集介绍
MichiganNLP/language-energy-divide 数据集图片
构建方式
该数据集源自一篇题为《The Language–Energy Divide: Measuring Energy Costs of Multilingual LLM Inference》的学术论文。研究者基于ML.ENERGY Benchmark框架,在NVIDIA L40S与RTX 6000 Pro Blackwell硬件上,通过vLLM推理引擎与Zeus库对多语言大语言模型推理过程中的能耗进行了系统性测量。数据集涵盖了来自Belebele基准的122种语言、GSM8K数学推理任务以及LM-Arena开放对话任务。为确保低资源语言的覆盖,翻译工作借助NLLB-200模型完成,并辅以回译与质量评分(BERTScore ≥ 0.85, COMET ≥ 0.75),从而构建起一个包含稳态每词元能耗、总能耗及准确率等核心指标的详尽测量数据集。
使用方法
研究者可以通过Hugging Face Datasets库直接加载该数据集。以Python环境为例,使用`pandas`库即可快速读取核心结果文件:`df = pd.read_csv("hf://datasets/MichiganNLP/language-energy-divide/results/belebele_canonical_Qwen3-8B_0shot.csv")`。该DataFrame包含每语言的稳态能耗、输出词元数、总能耗及准确率等关键列,便于进行排序、筛选与统计分析。此外,数据集中还提供了多语言指令提示模板和经过质量控制的翻译数据,可直接用于复现实验或开展对比研究。使用者应当注意,翻译内容为非母语作者创建,测量结果应被视为低资源语言用户面临实际能耗差距的下界估计。
背景与挑战
背景概述
随着多语言大语言模型在全球范围内的广泛应用,其推理过程中的能源消耗差异逐渐成为绿色人工智能领域关注的核心议题。由密歇根大学自然语言处理实验室的研究团队于2026年发布的《语言与能源鸿沟》数据集,系统性地测量了不同语言在LLM推理中的单位令牌能耗与总能耗,揭示了低资源语言在能源效率与模型准确性上的双重劣势。该研究基于Belebele、GSM8K和LM-Arena等基准数据集,覆盖122种语言,采用ML.ENERGY基准测量工具在NVIDIA L40S等硬件上完成实验,为多语言人工智能的可持续发展提供了翔实的数据基础,并对模型部署的公平性与能源优化产生了深远影响。
当前挑战
该数据集解决的领域核心挑战在于,不同语言在LLM推理过程中的能源消耗存在显著不均衡,英语言语单位令牌能耗最低,而低资源语言如普什图语的能耗竟高达前者的179倍,且这些高能耗语言往往伴随较低的任务准确率,形成能源与性能间的负相关鸿沟。在构建过程中,团队面临跨122种语言的高质量人类标注稀缺问题,采用NLLB-200机器翻译生成提示语,并通过回译与质量评分(BERTScore≥0.85, COMET≥0.75)严格筛选,以平衡语言覆盖广度与数据可靠性。此外,在多种模型与硬件平台上的大规模能耗测量实验,要求精密的稳态功率追踪与批处理配置校准,确保测量结果的复现性与可比性。
常用场景
经典使用场景
该数据集的核心价值在于量化评估多语言大语言模型(LLM)推理过程中不同语言的能耗差异。研究人员可基于其提供的跨122种语言的逐令牌能量测量数据,深入分析语言资源丰裕度与计算能耗之间的内在关联。经典使用方式包括:利用Qwen3-8B在Belebele基准上的主实验结果,对比高资源语言(如英语、中文)与低资源语言(如普什图语、提格里尼亚语)在相同推理任务中的能量消耗模式,从而揭示多语言LLM在能源效率上的隐性不均衡。
解决学术问题
该数据集直面多语言LLM研究中的一个关键盲区——语言资源差异如何影响模型推理的能源效率。学术上,它首次系统量化了不同语言间高达8.3倍的逐令牌能量差异与179倍的总能量差异,证实了最耗能的语言往往也是推理精度最低的语言这一残酷事实。这为绿色人工智能(Green AI)研究提供了实证基础,促使学界重新审视多语言模型能力的公平性评估标准,推动将能源效率纳入语言技术可持续发展的核心考量维度。
实际应用
在现实部署场景中,该数据集为多语言LLM服务提供商提供了优化能源策略的量化依据。例如,通过分析批处理大小(batch-size)在不同语言上的能效影响,厂商可为低资源语言任务配置专门的推理硬件或降低并发请求量以平衡能耗。同时,跨模型(Qwen3-8B至Llama-3.1-70B)与跨任务(Belebele、GSM8K、LM-Arena)的能量对比数据,可辅助云服务商制定更具成本效益的多语言API定价策略,避免对低资源语言用户的潜在隐性歧视。
数据集最近研究
最新研究方向
该数据集聚焦于多语言大语言模型推理过程中的语言间能量消耗鸿沟,揭示了不同语言在每token能耗上存在高达8.3倍的差异,而完整请求集的总能量消耗差距更达179倍——以英语17.6千焦与普什图语3147千焦的悬殊对比为极端案例。研究进一步发现,能耗最高的语言往往也是模型推理准确率最低的语言,这一双重不公对低资源语言社区形成了系统性技术壁垒。在绿色AI与多语言公平性成为全球焦点的当下,该数据集通过精细化的每语言能耗测量与公开的提示工程资源,为后续研究提供了可复现的基准,推动学界从模型架构、数据采样到推理优化等多维度探索兼顾能效与语言包容性的解决方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务