蝶动洞察Flutter Insight

全球计算联盟:大语言模型系统级单位token能耗测评报告

分类:人工智能

标签:大语言模型、推理能耗、单位token能耗、GPU算力、MoE架构、FP8量化、vLLM、SGLang、绿色算力、模型选型

摘要:本报告由全球计算联盟组织,清华大学电机工程与应用电子技术系信息能源实验室、清华四川能源互联网研究院信息能源与绿色智算技术研究所、新型电力系统运行与控制全国重点实验室电化学储能高效集成与控制团队联合牵头编制,Linux基金会研究部门与SODA基金会提供开放协作生态支持,首次以单位token能耗(焦耳每token,即J/token)为核心指标,构建面向企业级大模型部署的模型加硬件加场景决策评测体系。报告的问题意识源于算力能耗正在成为大模型产业的天花板:MMLU得分从60提升到90以上、模型参数五年增长5000倍,中国日均token调用量从2024年初的1000亿飙升至2026年3月的140万亿、两年增长逾千倍;2025年全球数据中心用电激增17%,推理已占机器学习计算需求的80%至90%,一个对话式AI的年推理耗电量可能超出训练数十倍,每百万token推理电费可达1.4元,占API定价的7%至28%。报告由此提出,未来竞争不仅是模型能力的竞争,更是能效与可持续的竞争。 报告直指业界的三重困境:选型缺少方法论、只能靠经验;主流榜单(如司南、HuggingFace)只测能力不测硬件;场景负载

来源:zuudee | 日期:2026-08-07 | 格式:pdf | 页数:18

加载中...