简介本资源是一份面向企业云平台运维工程师与虚拟化技术学习者的《华为FusionCompute配置笔记》实战型技术文档聚焦FC平台核心配置能力培养解决多场景下存储、网络、时钟同步、权限管理及跨CPU迁移等关键部署难题。文档以PDF格式单文件呈现1个文件2.27MB内容结构清晰覆盖HBA卡WWN号获取、FC-SAN/NAS存储接入、分布式交换机创建、网卡绑定策略主备/基于MAC/轮询/源目的端口四种模式、三种存储类型虚拟化/非虚拟化/裸设备映射选型对比、IMC集群兼容性配置、共享磁盘绑定、模板创建与告警阈值设置等完整运维链路。已有827人学习下载内容源自一线实践步骤详实、截图标注到位特别适合备考HCIA-Cloud或开展私有云交付的中级技术人员快速掌握FusionCompute生产环境配置要点与排错逻辑。1. 这不是“PDF笔记”而是一份能直接上手调通 FC-SAN 存储、绑定网卡、开 IMC 的 FusionCompute 实战配置手册你手上这份《华为 FusionCompute 配置笔记.pdf》不是那种翻两页就扔进收藏夹吃灰的“概念文档”。它是一线工程师在真实生产环境里用华为 V100R003C00 版本当前主流稳定版反复踩坑后把关键路径抠出来的操作快照——从主机 HBA 卡 WWN 号怎么查、FC-SAN 存储怎么扫进系统、分布式交换机上行链路怎么加到裸设备映射RDM给 Oracle RAC 虚拟机、集群 IMC 策略怎么设才不翻车全都有对应界面路径和参数逻辑。它解决的不是“什么是虚拟化”而是“为什么扫描不到 FC 存储”“为什么绑定网卡后业务虚机 ping 不通”“为什么开启 IMC 后虚拟机起不来”这些血泪问题。适合刚接手 FusionCompute 运维的中级工程师、准备华为 HCIA-Cloud 认证实操环节的考生以及需要快速交付私有云底座的集成商实施人员。如果你正被 VRM 页面卡在“存储设备—扫描”按钮灰掉、被 CAN 主机上lspci | grep -i fibre查不到 HBA、或者被裸设备映射后 Red Hat 6.2 虚拟机识别不到/dev/sdb困住这份笔记就是你的后悔药。2. FC-SAN 存储接入全流程从查 WWN 到添加数据存储每一步都带验证命令2.1 查主机 HBA 卡 WWN别只信 WebUILinux 命令才是最终仲裁者FusionCompute WebUI 中“主机 → 配置 → 存储资源”下显示的 WWN只是 UI 层的缓存视图。实际 FC 链路是否物理连通、HBA 是否被内核识别、WWN 是否被 SAN 交换机 Zone 正确放行必须落到 CAN 主机操作系统层面验证。这是后续所有存储操作的前提跳过这步后面全是玄学。在 CAN 主机即运行 CNA 的 Linux 服务器上执行# 查看 HBA 卡是否被识别确认 PCI 设备存在 lspci | grep -i fibre # 查看已加载的 FC 驱动模块华为常用 qla2xxx 或 lpfc lsmod | grep -E (qla|lpfc) # 查看 HBA 卡对应的 hostX 目录通常为 host0, host1 ls /sys/class/fc_host/ # 获取 Port WWN端口级唯一标识用于 SAN 交换机 Zone 配置 cat /sys/class/fc_host/host0/port_name # 获取 Node WWN节点级唯一标识用于多路径聚合 cat /sys/class/fc_host/host0/node_name提示port_name和node_name输出是 16 进制字符串格式如0x21000024ff5b8a1e。实际配置 SAN 交换机 Zone 时需去掉0x前缀并确保大小写与交换机要求一致通常全小写。WebUI 中显示的 WWN 若与cat命令结果不一致说明 UI 未刷新或 HBA 卡未真正上线此时强制刷新 WebUI 或重启vrm-agent服务无效必须先解决底层驱动问题。2.2 扫描 FC 存储设备三步法绕过“扫描无响应”陷阱FusionCompute 扫描 FC 存储失败90% 源于 SAN 侧 Zone 配置错误或 HBA 多路径未启用。不能只点“主机和群集 → 存储设备 → 扫描”必须前置验证。第一步确认多路径服务已启动并识别 LUN# 检查 multipathd 服务状态华为默认启用 device-mapper-multipath systemctl status multipathd # 查看 multipath 是否识别到远端存储输出应有 mpatha, mpathb 等 multipath -ll # 若无输出手动触发重发现需 root 权限 echo 1 /sys/class/fc_host/host0/issue_lip sleep 5 multipath -F multipath -v2第二步在 FusionCompute WebUI 中执行扫描路径主机和群集 → 存储设备 → 扫描注意此处“扫描”本质是向 CAN 主机下发rescan-scsi-bus.sh命令仅刷新 SCSI 总线。若multipath -ll已看到 LUN但 WebUI 扫描仍无结果大概率是 VRM 与 CAN 通信异常需检查vrm-agent日志/var/log/vrm/agent/agent.log中是否有rescan failed报错。第三步验证扫描结果是否可被识别为数据存储候选扫描完成后在 WebUI 中进入主机和群集 → 数据存储 → 添加数据存储目标 LUN 应出现在列表中。若仍不可见登录 CAN 主机执行# 查看系统识别到的所有 SCSI 设备LUN 应显示为 sdX lsscsi # 检查该 LUN 是否被 multipath 映射如 /dev/mapper/mpatha ls -l /dev/disk/by-id/scsi-*只有lsscsi和/dev/disk/by-id/下同时存在该 LUN才代表底层链路完全打通。此时 WebUI 添加数据存储才能成功。2.3 添加 FC-SAN 数据存储虚拟化/非虚拟化/裸设备映射的选型决策树FusionCompute 支持三种数据存储类型选择错误会导致后续虚拟机创建失败或性能崩盘。这不是功能开关而是架构级决策。类型创建速度支持快照支持热迁移适用场景关键限制虚拟化慢需格式化✅✅通用业务虚拟机需高可用性簇大小影响性能小簇1MB利用率高但随机读慢大簇4MB顺序读快但浪费空间非虚拟化快裸盘直挂❌❌高 IOPS 业务如数据库日志盘仅支持厚置备无法做存储层快照裸设备映射RDM极快LUN 直通❌❌Oracle RAC、SQL Server AlwaysOn 等需共享磁盘的集群仅支持 Red Hat Enterprise Linux 5.4/5.5/6.1/6.2 64bitLUN 整块绑定不可分割不能作为系统盘实操建议Oracle RAC 的 OCR/Voting Disk 必须用 RDM数据文件盘可用非虚拟化提升吞吐普通应用虚拟机一律用虚拟化存储。添加时务必勾选“高级设置”中的“格式化”选项首次添加否则残留旧文件系统可能导致挂载失败。3. 网络资源精细化配置网卡绑定模式选型、分布式交换机搭建与 VLAN 精准控制3.1 网卡绑定模式深度对比为什么“基于源目的 MAC”是默认首选FusionCompute 提供四种绑定模式但并非所有模式都适用于所有场景。盲目选择“基于轮询”可能导致业务中断这是高频翻车点。主备模式仅当可靠性是唯一诉求且带宽需求 ≤ 单网卡速率时选用。例如管理网络、VRM 心跳链路。优点是绝对稳定缺点是带宽无提升。基于源和目的 MAC 的负荷分担推荐作为业务网络默认模式。原理是哈希源MAC目的MAC决定流量出口保证同一会话始终走同一物理链路避免乱序。适用于二层同网段业务如虚拟机间互访、VLAN 内业务。基于轮询的负荷分担理论带宽最高但实际风险极大。TCP 流量经不同物理链路传输后到达顺序错乱Linux TCP 栈需大量重排序缓冲导致延迟飙升、丢包率上升。仅在 UDP 流量为主且应用层自处理乱序的场景如视频流推流谨慎使用。基于源目的端口的负荷分担专为三层 VXLAN 网络设计。哈希源IP目的IP源端口目的端口确保同一 TCP 连接流量路径一致。若未部署 VXLAN此模式效果等同于“基于 MAC”但增加 CPU 开销。验证绑定效果绑定完成后在 CAN 主机执行cat /proc/net/bonding/bond0bond0 为绑定接口名查看MII Status: up及Slave Interface下各从接口的Link Failure Count是否为 0。再用ethtool -S bond0 | grep tx_packets查看各从接口发送包数是否均衡误差 15% 视为正常。3.2 创建分布式交换机上行链路绑定的三个致命细节分布式交换机DVS是 FusionCompute 网络统一调度的核心。创建时看似简单但上行链路配置错误会导致整个 DVS 下虚拟机全部失联。步骤与关键点创建 DVS站点 → 右键 → 创建分布式交换机→ 名称建议含版本号如dvs-v100r003避免与旧 DVS 混淆→ 分布式交换机版本必须与 VRM 版本严格匹配V100R003C00 对应 DVS v100R003添加上行链路DVS → 右键 → 添加上行链路→ 上行链路名称必须与物理交换机端口描述一致如sw-eth1/0/1→关键细节一勾选“启用上行链路故障检测”否则链路中断后 DVS 不会自动切换将主机网卡加入上行链路主机 → 配置 → 网络 → 绑定网口 → 选择 DVS 上行链路→关键细节二必须选择“已启用”的物理网卡灰色网卡表示未启用或驱动异常→关键细节三若主机有多块网卡需为每块网卡单独绑定到同一上行链路而非批量选择——FusionCompute 不支持跨网卡的聚合绑定必须物理网卡一一对应避坑验证绑定完成后在 WebUI 中进入主机 → 配置 → 网络查看绑定网口状态是否为“已启用”。登录 CAN 主机执行ovs-vsctl show确认Bridge br-dvs下Port bond0或对应物理口存在且Interface状态为connected。3.3 VLAN 精准控制为什么“VLAN 为 0”是跨虚拟机共享磁盘的唯一解当两台虚拟机需共用一块磁盘如 Oracle RAC 的共享存储网络配置极易出错。常见误区是为虚拟机分配相同 VLAN ID但 FusionCompute 要求更严格。正确路径主机和群集 → 网络 → 端口组 → 新建端口组→ 名称rac-shared-storage→ VLAN ID必须填0代表 Trunk 模式透传所有 VLAN→ 分布式交换机选择前述创建的 DVS为什么必须是 0因为共享磁盘通过 SCSI Reservation 机制实现并发控制该协议依赖二层广播。若端口组 VLAN ID 设为非 0如 100则虚拟机网卡仅接收 VLAN 100 的广播帧SCSI Reservation 请求无法被另一台虚拟机收到导致 RAC 启动失败或实例崩溃。VLAN 0 表示该端口组不打 VLAN Tag所有流量原样透传由物理交换机或存储网络负责 VLAN 隔离。验证方法创建虚拟机时网络选择rac-shared-storage端口组。启动后在虚拟机内执行tcpdump -i eth0 -nn vlan应捕获不到任何 VLAN Tagged 帧执行arping -I eth0 -c 3 192.168.10.100另一台虚拟机 IP应能收到 reply。4. 集群高可用核心配置IMC 策略启用、时钟同步与告警阈值实战设定4.1 开启集群 IMC 策略CPU 兼容性迁移的硬性条件与 BIOS 强制要求IMCIntel Machine Compatibility是 FusionCompute 实现跨代 CPU 主机虚拟机热迁移的基石。但启用它不是点个开关那么简单它是一套硬件-固件-软件的联合约束体系。启用前必须满足的硬性条件集群内所有主机 CPU 基准功能集 ≥ 目标 IMC 级别→ 在 WebUI 中集群 → 配置 → IMC 策略 → 设置选择级别如Westmere、Haswell。→关键动作登录每台主机 BMC进入 BIOS → Advanced → CPU Configuration → 确认Execute Disable Bit即 NX/XD 功能必须 Enabled。华为文档明确要求此选项关闭则 IMC 启用失败。集群内所有运行/休眠虚拟机 CPU 功能集 ≤ 目标 IMC 级别→ 若存在不兼容虚拟机WebUI 会报错“虚拟机 CPU 功能集高于目标基准”。此时必须将虚拟机关机非暂停编辑虚拟机设置 → CPU → 取消勾选“启用 CPU 热添加”该功能会强制启用更高指令集保存后开机再尝试开启 IMC验证迁移可行性开启 IMC 后在 WebUI 中集群 → 右键 → 迁移虚拟机目标主机列表中应显示所有主机灰色禁用项消失。登录 VRM 后台执行cps check imc命令输出IMC status: enabled且compatible hosts: all才算真正生效。4.2 配置时钟同步VRM、CAN、虚拟机三位一体时间对齐方案时间不同步是告警误报、证书失效、数据库事务异常的隐形杀手。FusionCompute 要求 VRM管理节点、CAN计算节点、虚拟机三者时间偏差 ≤ 500ms。标准配置路径系统管理 → 业务配置 → 时钟同步→ 同步方式选择NTP非AD或Local→ NTP 服务器填写企业内网 NTP 服务器地址如10.10.1.100禁止使用公网 NTP如 pool.ntp.org→ 同步周期设为300秒5 分钟兼顾精度与网络负载但 WebUI 配置只是起点必须落地到 OS 层在 VRM 虚拟机内root执行# 检查 chrony 服务状态华为默认用 chrony systemctl status chronyd # 查看同步源及偏移量Offset 应 500ms chronyc tracking # 强制立即同步 chronyc makestep在 CAN 主机内root执行# 确保 chronyd 服务启用 systemctl enable --now chronyd # 检查是否指向 VRM 的 IPVRM 会作为 NTP 客户端CAN 作为其客户端 grep server /etc/chrony.conf # 正常应为server 192.168.100.10 iburst # 192.168.100.10 是 VRM 管理 IP血泪经验曾遇某客户 VRM 时间漂移 2 秒导致 SSL 证书校验失败VRM WebUI 无法登录。根源是 VRM 虚拟机未启用 chronyd仅靠 WebUI 配置。从此我养成了习惯每次配置时钟同步后必 ssh 进 VRM 和任意一台 CAN执行chronyc tracking确认Offset为0.000或±0.001秒级。4.3 设置告警阈值从“CPU 使用率 80%”到精准定位瓶颈的进阶技巧FusionCompute 告警阈值不能照搬模板。CPU 使用率 80%这类粗粒度告警会产生海量噪音真正有价值的告警必须关联业务特征。推荐三类高价值阈值组合内存水位告警内存使用率 90%空闲内存 2GB→ 避免因缓存占用高导致的误报空闲内存才是真实可用资源存储 IO 延迟告警平均 IO 延迟 20msSSD或 50msHDD→ 比IO 使用率更能反映存储瓶颈iostat -x 1中%util高但await低说明是队列堆积而非真实延迟网络丢包告警网卡接收丢包率 0.1%→ethtool -S bond0 | grep rx_中rx_missed_errors或rx_dropped持续增长预示物理链路或驱动问题配置路径系统管理 → 告警 → 告警规则 → 新建规则→ 对象类型选择主机或集群→ 指标选择上述具体指标→ 阈值输入数值务必勾选“持续 3 个周期”避免瞬时抖动误报→ 通知方式邮件 短信需提前配置 SMTP 和短信网关排查技巧当告警触发不要只看 WebUI 图表。立刻登录对应 CAN 主机执行top -H查看哪个线程 CPU 占用高执行iotop -oP查看哪个进程 IO 最重执行iftop -P查看哪个端口流量异常。告警是哨兵根因分析必须回到 OS 层。5. 权限、模板与监控管理员账号安全加固、模板标准化与资源使用可视化5.1 添加管理员账号权限最小化原则下的角色分配实战FusionCompute 权限体系基于 RBAC基于角色的访问控制但默认 admin 账号权限过大生产环境必须拆分。标准角色分配方案系统管理员SystemAdmin仅限 1~2 人负责 VRM 升级、集群创建、IMC 设置等全局操作存储管理员StorageAdmin负责 FC/NAS 存储添加、数据存储管理、LUN 分配网络管理员NetworkAdmin负责 DVS 创建、端口组配置、VLAN 管理虚拟机管理员VMAdmin负责虚拟机创建、克隆、快照、迁移禁止分配“删除集群”权限操作路径系统管理 → 权限管理 → 用户 → 新建用户→ 用户名stor-admin-01→ 角色StorageAdmin→ 对象范围勾选集群A和集群B不勾选“全部对象”安全加固新建用户后立即执行密码策略 → 强制修改密码并设置密码有效期 90 天、历史密码记录 5 次。曾有客户因 admin 密码泄露被恶意删除全部虚拟机——从此我坚持所有账号启用双因素认证需配合华为 eSpace UC 系统。5.2 创建模板从虚拟机到模板的四步脱敏与标准化流程模板是虚拟机快速交付的基础但直接克隆生产虚拟机会泄露敏感信息如 SSH 密钥、数据库密码、网卡 MAC。标准化创建流程准备源虚拟机安装好 OS、必要工具如 qemu-guest-agent、基础软件如 Java、Python脱敏处理# 清除 SSH 主机密钥避免克隆后密钥冲突 rm -f /etc/ssh/ssh_host_* systemctl restart sshd # 清除网卡 MAC 地址FusionCompute 会自动重生成 sed -i /HWADDR/d /etc/sysconfig/network-scripts/ifcfg-eth0 # 清除用户历史命令和临时文件 history -c rm -f /root/.bash_history /tmp/*关机必须关机非暂停否则模板创建失败转换模板虚拟机 → 右键 → 转换为模板名称格式centos7-template-v2.3含版本号模板使用规范每次克隆后首先进入虚拟机执行cloud-init clean --reboot若装有 cloud-init禁止直接编辑模板所有更新必须走“克隆 → 更新 → 转新模板”流程5.3 监控资源使用如何用 WebUI CLI 组合拳定位真实瓶颈FusionCompute WebUI 的“监控”页面提供概览但粒度太粗。真实排障需 WebUI 与 CLI 深度结合。组合监控法WebUI 定位异常对象监控 → 集群 → CPU 使用率发现某主机峰值达 95%CLI 定位进程登录该主机执行top -H -p $(pgrep -f qemu-kvm)找到占用 CPU 最高的 qemu 线程 PID反查虚拟机ps -eo pid,comm,args --sort-%cpu | head -10结合 PID 找到对应虚拟机名称深入虚拟机内部virsh domifstat vm-name vnet0查看该虚拟机网卡流量virsh domblkstat vm-name vda查看磁盘 IO避坑 / 常见问题 / 排查现象 1WebUI 显示某虚拟机 CPU 使用率 100%但top在虚拟机内看到 CPU 空闲→原因虚拟机 CPU 资源被其他虚拟机抢占CPU overcommit或 VRM 采集间隔长导致数据滞后→解决在 WebUI 中虚拟机 → 配置 → CPU → 取消勾选“启用 CPU 热添加”并设置CPU 份额保障基线现象 2监控图表中内存使用率持续 99%但free -h显示可用内存充足→原因Linux 内核将大量内存用于 page cacheused包含 cacheavailable才是真实可用→解决关注available字段而非used若available 1GB才需干预现象 3存储 IO 延迟告警频繁但iostat显示await正常→原因告警阈值设在IO 使用率而IO 使用率高可能只是队列满avgqu-sz高非真实延迟→解决将告警指标改为await阈值设为 SSD 20ms/HDD 50ms现象 4网络监控显示某虚拟机带宽突增但iftop未见异常进程→原因虚拟机内进程使用sendfile()系统调用如 Nginx 静态文件服务流量不经过用户态iftop无法捕获→解决改用nethogs -p按进程统计流量或在虚拟机内tcpdump -i eth0 -w /tmp/traffic.pcap抓包分析6. 进阶技巧裸设备映射RDM在 Oracle RAC 中的落地验证与故障自愈 checklist裸设备映射RDM是 FusionCompute 中最易出错也最关键的配置之一。它绕过虚拟化层直接将物理 LUN 暴露给虚拟机一旦配置失误Oracle RAC 实例将无法启动甚至损坏 OCR/Voting Disk。这不是“配置完就完事”的操作而是一套必须闭环验证的交付流程。6.1 RDM 验证 checklist五步确认法确保 LUN 可用性RDM 配置完成后绝不能仅凭 WebUI “添加成功”就认为万事大吉。必须在虚拟机内逐项验证每一步失败都意味着 RAC 部署必然失败。步骤验证命令预期输出失败原因1. LUN 识别lsscsi输出包含IBM 2145 12.50或HUAWEI XSG1 2.0等存储厂商信息且Type: diskHBA Zone 错误、多路径未启用、LUN 未映射给主机2. 设备权限ls -l /dev/sd* | grep -E (sd[b-z]sd[a-z][a-z])目标设备如/dev/sdb属组为asmadmin权限为brw-rw----3. ASM 磁盘发现oracleasm listdisks输出OCR_VOTE,DATA_DISK等磁盘名oracleasm scandisks未执行或/etc/sysconfig/oracleasm中ORACLEASM_SCANORDERDM_MULTIPATH未设置4. OCR 检查ocrcheckStatus of Oracle Cluster Registry is as follows : ... OCR location: OCR_VOTE ...ASM 磁盘组未mount或crsctl check crs显示 CRS 未启动5. Voting Disk 检查crsctl query css votedisk## STATE File Universal Id File Name Disk group ... 1. ONLINE 0f8a... /dev/sdc [OCR_VOTE]Voting Disk 路径与ocrconfig -showbackup中备份路径不一致需ocrconfig -restore关键细节第 2 步的 udev 规则必须在所有 RAC 节点上一致且oracleasm createdisk命令创建的磁盘名如OCR_VOTE必须全大写、无下划线否则 ASM 无法识别。6.2 RAC 故障自愈 checklist当实例崩溃时5 分钟内定位根因Oracle RAC 实例异常终止日志往往千头万绪。按此 checklist 顺序排查可 5 分钟内锁定问题域。检查 CRS 状态crsctl check crs→ 若输出CRS-4638: Oracle High Availability Services is online则 HA 层正常若CRS-4639: Could not contact CSS则直接跳至第 4 步检查 ASM 磁盘组sqlplus / as sysasm→select name,state,type from v$asm_diskgroup;→ 若STATEDISMOUNTED说明 ASM 无法访问 RDM 设备回溯第 6.1 节第 2、3 步检查 OCR 完整性ocrcheck -detail→ 若Failure: 10或PROT-1错误说明 OCR 损坏需从备份恢复ocrconfig -restore /u01/app/12.1.0/grid/cdata/rac-cluster/backup00.ocr检查 CSSD 日志tail -100 /u01/app/12.1.0/grid/log/rac-node1/cssd/ocssd.log→ 搜索IPC Send timeout或misscount若出现misscount exceeded说明心跳网络中断检查第 3.3 节 VLAN 0 配置及物理链路检查 Voting Disk IOiostat -x 1 /dev/sdcVoting Disk 设备→ 若await 100ms且%util 100%说明存储链路拥塞需联系存储厂商检查阵列负载从那以后我每次交付 RAC 环境都会在客户验收前强制走一遍这个 checklist从lsscsi开始到crsctl check crs结束全程录像存档。不是为了应付审计而是因为 RDM 的脆弱性——它把虚拟化层的容错能力全部交给了底层存储和网络任何一环松动RAC 就是单点故障。希望帮到你。本文还有配套的精品资源点击获取
阅读完成 · 觉得有帮助?