人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载概述为什么需要从GPU功耗推算整机功耗在大多数可公开访问的GPU集群上你唯一能稳定拿到的遥测数据就是GPU 级功耗例如 DCGM 的Power Usage采样。但真正关心电费、容量规划和 PUE 核算时你需要的是整机/机架级的 facility 功耗——包括 CPU、内存、网卡、交换机、风扇和 PSU 损耗。InferenceX 开源研究平台中的 power_model 模块正是为此设计的它把你实测的每卡 GPU 电功耗作为唯一核心输入结合各机型的 BOM物料清单建模和冷却策略估算出每卡全口径 facility 功耗AllInPower_per_gpu并输出完整的组件级功耗分解。整个过程只需一条命令无需任何遥测基建。方法论核心三步推算模型power_model 的估算遵循一条清晰的可审计链路定义在 base.pyIT 功耗建模以 GPU 实测功耗为锚点叠加系统中每个组件CPU、DDR5/LPDDR5X 内存、NVMe、PCIe Switch、UBB 基板、NIC、光模块、风扇的建模功耗以及 PSU/DC-DC 变换损耗PUE 折算IT 功耗按冷却模式乘以固定 PUE——风冷air取1.3液冷liquid取1.1见 cooling.py一致性校验最终结果facility_power_w必须同时满足IT×PUE、IToverhead、AllInPower_per_gpu×GPU数三重对账任何一处不平都会直接报错保证结果可审计。模型分为两档见 models/catalog.py模型精度适用场景oss默认逐组件 BOM 建模覆盖 8 类系统真实容量规划、成本核算example简单启发式非 GPU IT 功耗 0.5×GPU 功耗即 1.5 倍 IT 乘子快速估算、教学示例支持的系统与冷却策略系统目录定义在 systems/catalog.py当前支持 8 类系统冷却方式自动跟随系统选择系统参数硬件冷却 / PUEhopper别名h100/h200Hopper HGX 8卡机箱风冷 / 1.3mi300/mi325/mi355AMD MI300/325/355 UBB 机箱风冷 / 1.3b200/b300Blackwell HGX 机箱风冷 / 1.3gb200-nvl72别名gb200GB200 NVL72 整机架液冷 / 1.1gb300-nvl72别名gb300GB300 NVL72 整机架液冷 / 1.1其中 GB200 NVL72 的规模外网络建模见 rack_scale/gb200.py包含计算托盘、NVSwitch 托盘及按比例分摊的 QM9700 交换机HGX 机箱的完整硬件清单2×CPU、32×64GB DDR5、8×NVMe、NIC、光模块等建模在 systems/hgx.py。快速上手从遥测到整机功耗一键安装步骤要求 Python 3.12。进入 power_model/ 目录执行详见 power_model/README.mdpython -m venv .venv source .venv/bin/activate python -m pip install -e .[dev]最简估算命令假设你的基准测试显示每卡 GPU 平均功耗为 400 W这个数可以直接来自 InferenceX e2e 基准结果中的avg_power_w等 GPU 功耗指标遥测采集与验证逻辑见 infx/results/power/python -m power_model --gpu-level-power-per-gpu400 --systemh100输出为 JSON关键字段一目了然AllInPower_per_gpu每卡全口径 facility 瓦数、it_power_w、facility_power_w、pue、facility_to_gpu_power_ratiofacility/GPU 比值。机架级估算查看逐组件功耗 BoM对 GB200 NVL72 这类整机架系统可加--power-breakdown-per-chassis查看嵌套物料清单单件功耗、数量、逐项合计 集群总计并开启--scale-out-enabled计入外部 NIC 与交换机python -m power_model --gpu-level-power-per-gpu594.191 \ --cpu-and-dram-measured-power-per-socket98.066 --power-breakdown-per-chassis \ --systemgb200报告渲染逻辑见 reporting.py会按每个机架归一化输出表格并附上 facility/GPU 比值。场景化估算工作负载画像GPU 之外CPU 和内存的功耗随负载类型变化。用--workload选择画像定义见 base.py工作负载说明fixed-seq-len默认标准定长基准负载CPU/内存取常规档agentic多轮智能体负载agentic-cpu-offloadingCPU 卸载型智能体负载内存压力显著更高多机箱/多机架放大用--systemsN如--systems4直接算 4 个机架的集群总量。GB200/GB300 进阶接入实测 Grace 插槽功耗NVL72 机架上 Grace CPU LPDDR5X 占整机功耗不小比例。若你能从 ACPI 的Grace Power Socket传感器读到每插槽均值可用--cpu-and-dram-measured-power-per-socket直接替换模型估算值——该传感器覆盖 CPU/SysIO 电源轨、LPDDR5X 及稳压器损耗实测 GB300 余量约 42 W。注意绝不能用 DCGM 字段 1130仅 CPU 电源轨每插槽会漏掉约 50 W。详细依据见 power_model/README.md 的 Measured Grace socket 一节。CLI 参数速查表选项含义--gpu-level-power-per-gpu必填每卡 GPU 电功耗W下划线写法亦可--system必填上表 8 类系统之一同时决定冷却方式--modeloss默认或example--workloadfixed-seq-len默认/agentic/agentic-cpu-offloading--scale-out-enabled激活 NIC 与外部交换机功耗默认关闭--systemsoss 模型下所选机箱/机架的数量默认 1--power-breakdown-per-chassis输出单机箱/机架嵌套功耗 BoM 集群合计--cpu-and-dram-measured-power-per-socket仅 GB200/GB300实测 Grace 插槽瓦数完整参数解析见 cli.py。方法论要点如何把遥测喂进模型 一条最佳实践链路取 GPU 功耗锚点从基准测试窗口内取每卡Power Usage的平均值而非峰值作为--gpu-level-power-per-gpu。InferenceX e2e 侧对功耗遥测做了严格的窗口对齐、插值积分与有效性审计见 power/common.py 与 power/audit.py确保喂进模型的数字本身可信匹配系统形态单 8 卡机箱选 HGX 系列NVL72 选gb200-nvl72/gb300-nvl72并开启--scale-out-enabled选择工作负载画像KV 卸载/智能体场景务必用agentic-cpu-offloading否则 CPU/内存功耗会被低估解读输出用facility_to_gpu_power_ratio做跨机型对比典型风冷 H100 机箱该比值约 1.6~1.8液冷 NVL72 更低敏感性分析对同一 GPU 功耗分别跑不同--workload和开关--scale-out-enabled观察 IT 功耗变化幅度即得到模型对该输入的不确定带。延伸阅读完整安装与 CLI 文档power_model/README.md估算契约与数据模型base.py冷却策略cooling.py系统目录models/advanced/systems/catalog.py机架级建模models/advanced/systems/rack_scale/e2e 功耗遥测与审计infx/results/power/⚠️ 注意power_model 当前为 Beta 实验性模块版本号 0.1.0。PUE 采用固定策略值风冷 1.3 / 液冷 1.1非逐机房实测用于正式成本决策时建议将其结果与机房级实测交叉验证。赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐如何用 test_power.sh 测量 BitNet 推理功耗与每 token 能耗J/t如何用 test_power.sh 测量 BitNet 推理功耗与每 token 能耗J/t 如果你已经在本地构建好 bitnet.cppBitNet人工智能大模型推理引擎本地部署模型量化模型优化GPU能耗监控终极指南AITemplate如何优化性能与功耗平衡GPU能耗监控终极指南AITemplate如何优化性能与功耗平衡 在AI模型推理日益普及的今天GPU能耗监控已成为确保 高性能计算 与 功耗平衡 的关键技术推理引擎模型编译算子库FFXIVQuickLauncher终极配置指南3个核心问题解决方案与高级优化技巧FFXIVQuickLauncher终极配置指南3个核心问题解决方案与高级优化技巧 FFXIVQuickLauncher简称XL是《最终幻想14》玩家必备创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?