: Incorporating Energy Awareness in Large Language Model (LLM) H...)
文章主要内容总结本文针对大型语言模型(LLMs)评估中能源消耗因素被忽视的问题,提出了生成能源竞技场(Generative Energy Arena, GEA)这一评估平台。背景:现有LLM评估方法存在局限——自动化基准测试与人类偏好相关性低,传统人类评估可扩展性差,公开竞技场(如LM Arena)未考虑能源消耗;而LLM的能源消耗(训练和推理阶段)日益成为重要议题。GEA设计:解决了三个核心问题:能源信息获取:通过比较同系列不同规模的模型(如GPT-4.1与GPT-4.1-mini),提供相对能耗信息(不涉及绝对值);能源信息呈现:采用两步评估流程,先让用户仅基于质量选择,再告知能耗信息并询问是否更改选择,避免偏见;影响指标:定义了投票改变率(EcE_cE