刚把RH134的课过完第一轮趁着记忆还热乎赶紧把核心知识点和实操心得整理出来。RH134这门课全称是Red Hat System Administration II是红帽RHCSA认证路径里承上启下的关键一程。如果RH124讲的是“让一台服务器能开机、能连上、能干活”那RH134讲的就是“让这台服务器稳定、高效、出问题能查能修”。这篇文章适合正在备考RHCSA、或者刚入门Linux想系统补一遍系统管理实操的读者。考试也好、日常运维也罢里面这些命令和思路都是实打实会在生产环境反复用到的。很多人会误以为RH134只是“把命令敲熟”实际学完你会发现不是这样。它更强调场景日志满了怎么办、进程僵住了怎么办、服务起不来怎么办、磁盘不够了又怎么办。每一项都不是孤立知识点而是互相联动的排查链。所以这篇总结我不会按教材目录平铺直叙而是按“管理动作”来拆把一个管理员真正会遇到的场景串起来讲。1. 先说清楚RH134到底在考什么1.1 RH124和RH134的分工基础与进阶的分界线红帽官方的RHCSA考试EX200覆盖的是RH124和RH134两门课的内容所以很多自学者会觉得“考个RHCSA嘛把Linux命令刷熟就行”。但等你看完RH134的官方大纲就会发现RH124更多是让你认识系统、会用基本命令比如用户管理、权限、文件编辑、进程查看、shell基础。RH134则直接进入“管理视角”计划任务、日志归档、系统调优、存储布局、逻辑卷、网络配置、软件仓库甚至连容器的概念都会在课程里出现。这个分界线其实很清晰RH124教你怎么用系统RH134教你怎么管系统。用开车的类比前者是考驾照时学会点火、挂挡、打方向盘后者是真正上路之后的保养、诊断和应急处理。考试里RH134部分的题目通常更“重”——你不仅要会建立逻辑卷还要理解为什么要分两层结构不仅要会让服务开机自启还要能判断服务为什么没起来。1.2 这门课对应的岗位能力不是一个证书那么简单我见过不少自学Linux的人命令背得滚瓜烂熟但一旦进入“服务器出故障”的环境就手足无措。根本原因是缺少RH134这套“管理动作训练”。这门课从头到尾都在逼你形成一套判断闭环先查状态再看日志然后定位原因最后动手修复并验证。比如服务起不来你的第一反应不该是“重启一下试试”而是systemctl status看状态、journalctl看日志、检查配置文件语法、看端口是否占用、再看SELinux是否拦截。这套流程RH134会反复打磨而且考试题就是这么编排的题目描述一个故障现场要求你修复并让服务能够正常访问。可以说RH134学完你才算真正具备了“Linux系统管理员”的基本盘而不是只会敲命令的操作员。2. 第一个重头戏文本处理与进程管理2.1 正则表达式grep、sed、awk不是靠背是靠场景RH134里正则表达式占的篇幅不大但考试喜欢嵌在各种题目里当“隐藏前置条件”。比如让你统计日志里某个服务的错误次数或者从/etc/passwd里筛选出登录shell是/bin/bash的用户。这时候基础正则BRE和扩展正则ERE的区别就要分清楚grep默认用BRE花括号、加号这些要转义grep -E走扩展正则写起来顺手很多。实操中我建议你从一开始就习惯grep -E或者egrep减少转义导致的低级失误。sed和awk不用往深了学但三个能力必须熟练sed的替换动作s/旧/新/g、按行删除/pattern/d和打印指定行-n 10,20pawk的话至少要会用$1、$2取字段会BEGIN/END做汇总会跟if判断做条件筛选。RHCSA不会让你现场写一个复杂awk脚本但它会在题目里说“把某文件第几行第几个字段改成什么”或者“统计某列出现次数”你如果不会这两样光靠vim手动改肯定来不及。2.2 进程管理的正确姿势ps、top、kill与信号RH134对进程管理的要求不止是“ps aux看到PID然后kill -9”。考试和实际工作里更常见的是某个进程CPU占用异常高你要定位到具体进程某个服务僵在那里普通kill没反应你要背着进程树一层层往上找父进程或者你想让某个命令在后台不受终端关闭影响地跑下去涉及nohup、setsid、systemd-run这些手段。top和ps适合看快照但要看清进程关系pstree有时候更直观kill不是只有-9默认的TERM15才是让进程“体面退场”的方式kill -9是最后手段直接砍掉可能留下临时文件、没写盘的缓存甚至损坏数据库状态。nice/renice调优先级在考试里也会出现虽然不常作为独立大题但题目描述“某进程占用了太多CPU希望降低它的优先级”就是典型考法你得会找到PID再用renice调整。2.3 计划任务cron、at和anacron三兄弟都要会计划任务这块RHCSA考试动手点很明确用户cron用crontab -e系统级任务写/etc/crontab或/etc/cron.d一次性任务用at。最容易掉坑的是格式细节crontab -e和编辑/etc/crontab不一样前者不用写用户名后者必须在时间和命令之间指定执行用户。另外分钟字段里“*/5”表示每5分钟但“5”表示第5分钟这两个概念考试里特别爱混淆。更隐蔽的一个知识点是anacron。它解决的是“系统在计划时间没开机”的场景。比如一台练习机晚上关机但任务计划凌晨2点跑普通cron根本不会补跑anacron则会根据时间戳判断是否错过并补执行。RH134大纲里明确提到cron和at但anacron的内容容易被自学的人忽略实际上做实验的时候你就发现如果虚拟机经常挂起普通cron任务会莫名“没执行”这时候就要想起来“机器当时没开”这个前提。3. 服务与日志系统管理的“体检报告”3.1 systemctl使用要点别只会start和stopRH134里systemd单元管理是绝对主场。systemctl start/stop/status这些基础操作自不必说关键要理解Unit的状态不只是“active”或“failed”。比如active (running)、active (exited)、active (waiting)含义完全不同inactive是“没启动”failed是“启动失败”这两者排查路径差别很大。更重要的是systemctl enable和mask的区别。enable是“开机自启”mask是“彻底屏蔽”——mask之后即使有依赖关系想拉起这个服务systemd也会拒绝并提示“Unit is masked”。我在实验里遇到过有人为了“禁用”一个服务直接mask结果另一个服务怎么都启动不了查半天才发现是mask在作怪。生产环境里一般禁用用disable极少用mask。另外一个容易被忽略的命令是systemctl daemon-reload修改了unit文件或新增了service文件之后不执行它systemd可能还在用旧配置这是个非常经典的“改完没生效”原因。3.2 journalctl与rsyslog日志会说话关键是你得听懂RH134对日志管理的考察本质上是在考“故障现场还原能力”。journalctl是查看systemd日志的主入口但很多人只知道journalctl -xe看最后几条报错。真正排查问题时的正确姿势应该是先journalctl -u 指定服务名只看这个单元的日志再配合--since today或者--since 10 minutes ago缩小时间范围最后用-q或-grep过滤关键ERROR字段减少噪音。另一个关键点是日志持久化。默认情况下journal日志存在内存里重启就没了。要让日志落盘需要创建/var/log/journal目录并调整配置否则你排查“上次开机时的报错”就会发现日志是空的。rsyslog这边主要对应传统日志文件/var/log/messages管通用信息、/var/log/secure管认证和安全、/var/log/boot.log管启动过程。考试题里常出现“把某个服务的日志单独输出到指定文件”的写法其实就是写一个rsyslog配置用程序名加日志级别做筛选条件。3.3 时间同步chrony让日志有据可查时间同步在RH134里不是凑篇幅的而是日志分析的前提。你想想如果两台服务器时间差了10分钟跨服务器比对日志时就会出现“A机的报错在B机日志里找不到对应记录”的假象。chrony是当前主流的NTP实现核心命令就三个systemctl enable --now chronyd、chronyc sources查看时间源同步状态、timedatectl确认系统时区。实操题里常见的坑有三个一是没关防火墙导致123/323端口不通同步状态一直是脱机二是配置文件/etc/chrony.conf里的server地址写错或源不可达三是时区不对chrony同步的是UTC时间但系统显示的是本地时间如果/etc/localtime指向错了时区你看到的时间依然不安全。所以判断时间是否准确不能只看date输出要配合timedatectl看Time zone和System clock synchronized字段。4. 存储管理从分区到LVM的一整套动作4.1 磁盘分区、格式化与挂载流程要刻进肌肉记忆RH134的存储部分是我觉得整门课里最有“实操含量”的章节。考试里给你的是一块新加的虚拟磁盘你从lsblk看到设备名开始要依次完成分区fdisk或parted、格式化mkfs.xfs或mkfs.ext4、挂载mount或改/etc/fstab、验证mount -a df -h。这套流程每个动作都有对应的查询命令lsblk看块设备、blkid看文件系统类型和UUID、findmnt看挂载树关系。几个容易翻车的地方我必须强调。第一fdisk里分区类型代码如果选错比如把Linux LVM选成Linux后面想建PV就会失败或需要重来。第二mkfs的时候一定要确认设备名没写错我在练习环境里就干过把整块数据盘误格式化的事生产环境这种失误基本是不可挽回的。第三/etc/fstab的六个字段顺序和含义要烂熟设备、挂载点、类型、选项、dump备份标记、fsck检查顺序。考试不会让你手写fstab但会让你新建挂载并保证重启后依然生效那你要么用UUID写入fstab、要么保证挂载点存在且权限合理。4.2 LVM逻辑卷扩容缩容的闭环操作是掌握的试金石LVM是RH134考试里必然出现的大题也是最容易拿分也最容易踩坑的地方。从物理卷PV、卷组VG到逻辑卷LV三层结构很多人上课时觉得概念懂了一到实验就分不清现在该用pvcreate、vgcreate还是lvcreate。我的记忆口诀是“盘做PVPV进VGVG切LV”。考试最常见的两个场景一是新加一块盘要建一个LV挂载到指定目录用于存放数据二是已有VG空间不足要给LV扩容。扩容这个动作很多人以为lvextend完事实际上最容易被扣分的是后续那一步。XFS文件系统只能扩容不能缩容所以要用xfs_growfs扩展文件系统ext4则用resize2fs。如果你只lvextend不执行文件系统级别的扩展df -h看到的容量不会有任何变化这一点在考试里会直接导致题目结果验证失败。反过来缩容只对ext4安全而且步骤是“先缩文件系统再缩LV”顺序反了数据就毁了。这几条命令的顺序和适用文件系统建议反复练到形成条件反射。4.3 交换分区与自动挂载的小心机交换分区swap在RH134里单独成考点。常见的两种形态是swap分区和swap文件考试里两种都可能出现。mkswap格式化后要用swapon激活开机自动启用要写进fstab。我踩过的坑是fstab里swap设备写错UUID之后开机直接进入救援模式——因为系统找不到可用的swap时会等超时或者挂载失败卡在启动流程里。解决办法是从救援模式或临时启动参数里进入系统修正fstab。这类“开机卡住”的故障RHCSA考试里其实也很爱考算是一道经典的综合排错题。自动挂载autofs这边重点掌握“按需挂载”的机制。它跟fstab的常驻挂载不一样是访问时才挂载、空闲后自动卸载。考试题目通常是在指定目录下配置自动挂载NFS共享核心是编辑auto.master主配置和对应的映射文件里面的通配符“*”、-fstype、超时选项需要理解。说实话这个知识点不常用但考试偶尔会考我建议至少把流程顺一遍先看端口是否通再查NFS服务端共享是否正常最后再怀疑autofs配置问题。5. 软件包管理仓库与rpm、dnf5.1 本地仓库搭建考试机没外网你必须会自给自足RHCSA考试环境是断网的所以“配置本地yum/dnf仓库”几乎每次考试都会出现。搭建本地仓库的步骤其实很简单挂载安装ISO或指定一个软件包目录写一个.repo文件指向baseurl然后dnf clean all、dnf repolist验证。但真正容易丢分的地方在于repo文件的细节baseurl的路径写法是file://开头不是httpgpgcheck要按题目要求设0或1并且对应的gpgkey路径正确enabled字段只有0或1两种状态。从RH134的视角看你要理解dnf底层是在调用rpm做安装dnf负责解决依赖。所以如果dnf安装时报“没有可用软件包”或者“依赖冲突”第一步是看repo是否生效、baseurl路径是否存在。另一个常见操作是dnf history它能回滚事务考试范围没细考但实际生产里用dnf history undo恢复出错的更新非常香建议掌握。5.2 rpm常用操作安装、查询、验证一个都不能少rpm虽然被dnf“掩盖”了大部分日常使用场景但RHCSA考试里仍有独立考点主要是安装rpm -ivh、卸载rpm -e、查询rpm -q、-qa、-qf、验证rpm -V。其中rpm -qf用的频率最高比如“找出/usr/bin/xx属于哪个软件包”这种题就靠它。另外rpm -V检查软件包文件是否被改过考试里结合“文件被破坏需要确认”这种题目会出现。最容易被忽视的是包名和命令名之间的关系。很多题不会直接告诉你包名而是说“这个可执行文件叫什么装哪个包”这时候典型解法就是dnf provides */可执行文件 或 dnf whatprovides。我备考时见过不少人在这类题上卡住其实就是一个反向查询的事。6. 常见问题与考试经验速查6.1 三个典型的排错场景第一个场景是“服务启动失败”。排查顺序我把它们串起来systemctl status 服务名看当前状态和报错、journalctl -u 服务名 -f看实时日志、systemctl cat 服务名看unit配置、检查配置文件语法、再用ss -tlnp看端口是否冲突。每次考试这道题都有人因为日志过滤不够而大海捞针其实用journalctl -u配合--since 5 minutes ago就能把噪音砍掉大半。第二个场景是“重启后挂载点消失”。这个问题90%是因为修改了fstab后没有执行mount -a验证或者fstab用了错误的设备名而非UUID。正确流程是blkid拿到UUID把UUID写入fstab然后mount -a如果有报错当场修避免“写错了但没重启所以没暴露”的假象。第三个场景是“SELinux导致服务无法访问文件”。RH134后半段会讲SELinux但很多人习惯性先把它disable掉。考试环境下不建议你图省事直接setenforce 0因为题目很可能就是让你在enforcing状态下通过修改文件上下文semanage fcontext -a、restorecon或布尔值setsebool -P解决问题。学会看/var/log/messages或journalctl里的AVC拒绝信息比盲目关SELinux重要得多。6.2 备考实操建议与踩坑记录我觉得RH134的备考最好的方式就是“把实验环境当事故现场”。不要按照文档一步一步抄命令而是故意把配置搞错再逼自己通过日志、状态命令和文件内容判断哪里错了。比如故意把fstab的UUID写错然后重启看能不能修回来故意让服务依赖一个不存在的文件再用日志找到原因。这个过程会让你对命令的理解深很多。另外一个心得是考试是按“结果”给分的题目里每个显式要求都要在操作完成后验证一遍。比如“创建用户alice附加组为wheel”那就要id alice确认输出里出现了wheel比如“配置NFS挂载并持久化”那就要mount -a ls -l挂载点确认能看到远端文件。养成“每个题做完必验证”的习惯能救回很多粗心丢的分。最后想分享一个很实在的小技巧RHCSA考试是多台虚拟机场景题目之间其实有依赖关系有些服务会被后面的题目当作前置条件。所以每做完一道题尽量不要把人家原本的配置顺手破坏掉。我就干过为了测试一块新盘把原来该在/boot上的分区表动乱这种事虽然能修但白白浪费了二十分钟。RH134的内容体系到这儿基本把系统管理的半壁江山串起来了。下一篇我会把网络配置、远程访问、SELinux以及容器相关的知识点接着整理这些同样是RH134后半程和RHCE考试绕不开的硬骨头。
阅读完成 · 觉得有帮助?