太好了!复盘和总结是运维成长最快的方式。我把你从登录服务器到现在,所有亲手敲过的命令、踩过的坑、悟出的道理,帮你串成一套完整的“Linux 运维认知体系”。
这份总结就是你从“小白”向“运维工程师”迈出的第一个坚实脚印。
🧱 第一板块:系统认知篇(你在哪?)
| 你的操作 | 你学到了什么 | 一句话总结 |
|---|---|---|
free -h | 查看内存真实使用情况,重点看 available(可用内存),而不是 free。 | 看内存别只看“剩余”,要看“还能用多少”。 |
lscpu | 查看 CPU 架构、核心数、型号。 | 知道自己的机器是几斤几两。 |
cat /etc/os-release | 确认操作系统版本和代号(Ubuntu 24.04)。 | 不同系统的命令和包名不同,先看版本再干活。 |
uname -a | 查看内核版本。 | 内核是操作系统的核心。 |
认知升级: 运维第一步不是敲命令,而是学会“摸清家底”——知道自己管理的是台什么样的机器。
🔍 第二板块:进程排查篇(谁在捣乱?)
| 你的操作 | 你学到了什么 | 一句话总结 |
|---|---|---|
ps aux | 查看当前所有进程的快照。 | 看系统“现在”正在跑什么。 |
ps aux --sort=-%mem | 按内存占用从高到低排序。 | 快速揪出“内存杀手”。 |
ps aux | grep java | 过滤出特定进程(Java)。 | 从茫茫进程海中捞针。 |
ps aux | grep [n]ginx | 高级技巧:避免 grep 把自己也搜出来。 | 看到 grep 自己在结果里,是新手常见困惑。 |
systemctl stop/disable btld.service | 停止并禁用 systemd 服务,防止它自动重启。 | 碰到“杀不死”的进程(僵尸复活),是因为有 systemd 在守护。 |
kill -9 PID | 强制终止进程(当正常关不掉时)。 | 最后的“物理删除”手段。 |
认知升级: 进程管理是运维的“透视眼”——你得知道系统里在跑什么,谁在吃资源,谁在“死循环”。
🔐 第三板块:权限管理篇(谁能动什么?)
| 你的操作 | 你学到了什么 | 一句话总结 |
|---|---|---|
ls -l / ls -ld | 查看文件和目录的权限、属主、属组。 | 看懂 -rwxr-x--- 这串“天书”。 |
chmod 700 test.txt | 用数字法改权限(rwx = 7)。 | r=4, w=2, x=1,组合相加。 |
chmod u+x hello.sh | 用字母法改权限(u=属主,g=属组,o=其他人)。 | 更直观地“给某人加某个权限”。 |
chown www-data:www-data /var/www/html | 修改文件的属主和属组。 | 这是运维最高频的命令之一。 |
sudo -u www-data cat index.html | 模拟其他用户身份去读文件(模拟 Nginx 进程)。 | 不需要真的切换用户,就能测试权限。 |
su - deploy_user | 完全切换用户身份(切换 Shell)。 | 模拟“换个人”来操作系统。 |
认知升级: Linux 权限就是“谁(User)能对什么(File/Dir)做什么(Read/Write/Execute)”。
🧠 第四板块:安全思维篇(为什么不能乱来?)
| 你的操作 | 你悟出的道理 | 一句话总结 |
|---|---|---|
发现 Nginx 用 www-data 跑,而不是 root。 | 最小权限原则:只用给干活的最低权限。 | Web 服务用 www-data,数据库用 mysql,各司其职。 |
| 猜测“如果 Nginx 用 root 跑会怎样?” | 权限失控风险:黑客拿到 root 权限,服务器就完了。 | 不要用 root 跑业务进程。 |
看到 /usr/sbin/nologin。 | 有些“用户”只是用来跑进程的,不能登录系统。 | 区分“服务账号”和“人类账号”。 |
模拟 Permission denied 错误。 | 报错不是故障,而是系统在遵守规则。 | 权限报错,就是在提醒你“身份不对”或“权限不够”。 |
认知升级: 运维的本质不是“解决问题”,而是“在解决问题时,不给黑客留后门”。
📚 第五板块:你把复杂问题“拆解”的能力
在整个排查过程中,你面对的是 Java 进程狂吃 CPU + 内存告急 + 杀不死的僵尸服务 这三重困境。你没有慌,而是:
- 先观察:用
free -h和ps aux看清局势。 - 再定位:找到吃资源的大户(btld-admin.jar)。
- 后处理:从
kill -9到systemctl disable,彻底切断源头。 - 建防线:最后创建了 2GB Swap 作为“应急保险”。
这就是运维专家的“故障处理五步法”:
发现异常 → 定位根源 → 止血恢复 → 固化配置 → 建立预警机制
🎯 你现在拥有的“工具箱”已经足够打一场小仗了
你现在能:
- ✅ 查看系统状态(内存/CPU/OS)
- ✅ 找出高负载进程并杀掉
- ✅ 判断服务是手动运行还是 systemd 托管
- ✅ 看懂文件和目录权限
- ✅ 修改权限和属主,解决
Permission denied报错 - ✅ 理解“最小权限原则”在生产环境中的重要性
- ✅ 创建 Swap 作为内存应急
你现在具备的不是“纸面理论”,而是“亲手排过雷”的实战手感。
🚀 下一阶段的“能力地图”
如果你愿意继续,接下来你会学到:
| 模块 | 你将掌握的核心技能 |
|---|---|
| 网络排查 | ss -tlnp(查端口)、tcpdump(抓包分析) |
| 存储管理 | df -h(查磁盘)、du -sh(查大文件)、LVM 扩容 |
| 日志分析 | tail -f(实时追踪)、grep(过滤错误)、awk(切分字段) |
| Shell 脚本 | 写出第一个自动巡检脚本,配合 Crontab 每天跑 |
| 服务部署 | 用最安全的方式部署 Nginx + PHP/Java,不给黑客留后门 |
如果你觉得这份总结有帮助,可以把它保存下来,作为你的“运维入门纪念册”。
接下来,你想:
- 实战网络排查:看看 80、443 端口怎么监听,怎么用
ss发现谁在连你的服务器? - 写第一个 Shell 脚本:写一个“每日服务器健康检查报告”脚本?
- 亲手部署一个服务:用我们学到的权限知识,安全地部署一个 Nginx 或 MySQL?