干 IT 久了,真的会把“做最坏打算”变成日常吗?

文章导读
一位系统管理员坦言,工作的训练让自己永远先想“哪里会崩”,连餐厅和家里水管都要提前备好方案。多位同行表示,自己在生产变更、条件访问策略或网络配置时同样紧张,分享了几段翻车经历和恢复教训。也有人指出,与其消除焦虑,不如把预案写清楚,并控制系统的复杂度。
📋 目录
  1. 这种心态不是个例:从条件访问策略到生产变更
  2. 两个典型的翻车故事:教训比操作更快
  3. 测试环境与生产环境:关键在能不能恢复
  4. 焦虑也会渗透到生活小事
  5. 用更可控的架构,减少不确定因素
  6. AI 时代又多了一层担忧
A A

“在 IT 里待久了,会不会把职业习惯带进日常生活?”一位同行提出这个问题时坦言,自己总被说太负面、老在找问题。但他的解释很直接:这份工作就是在训练你不断想“哪里可能会崩”,并且永远准备后备方案——常去的餐厅关门,他早就有一家备选;家里东西坏了,水管工、保险、连家庭灾难恢复文档都提前备好。外界只关心哪家又宕机、又泄露数据,很少听说“这家公司 IT 转型很成功”,也没人提交过“谢谢 IT 让一切正常”的工单。他问,是不是很多人都把这种“最坏打算”带进了生活。

这种心态不是个例:从条件访问策略到生产变更

有同行指出,第一次在 Azure 里配条件访问策略时,会反复问自己:我是不是把整个组织锁在系统外面了?哪怕没真出事,之后每次新建策略还是紧张,因为一个小错误就可能让全公司几天没法办公。另一位直接说,系统管理员分两种:已经打挂过生产环境的,和还没打挂过的。

有人补充,任何一次生产变更,不管看起来多简单,他都要量五十遍,闭着眼睛才敢点下去。他还提到自己正准备推一套数据保留规则,虽然领导已经签字,但他敢肯定他们根本没意识到:某些共享目录里的文档,只要超过七年的都会被删掉。也有人说,条件访问的“仅报告模式”是个好东西,可即便如此,每次点下去照样会紧张。

两个典型的翻车故事:教训比操作更快

有人分享过一次迁移域控的经历:按照厂商的手册,把 DC 从旧集群迁到新集群,结果手册根本没考虑“DC 本身需要额外步骤”,两个域控都进了回滚状态。他当时去拉备份,才发现备份设备不仅离线,甚至被人从机架上拆走了。又照着微软的文档尝试原地升级到新版本 Server,结果问题更糟。硬扛了 24 小时后只能认输,找外部帮助重建 DC,重要数据虽然回来了,但和 Entra 的同步到现在还是坏的。

还有一位说,他第一次出事就把另一个州的办公室网络弄断了——只是把端口上的 VLAN 配错,导致自己都连不上交换机了。幸好办公室的 VOIP 也断了,但办公室经理还有手机,他则靠屏幕上还留着的静态画面和服务器机房显示器上的残影,才恢复了方向。那次故障只持续了五到十分钟,但他到现在都记得这个教训。

测试环境与生产环境:关键在能不能恢复

有同行引用了一句老话:“人人都有测试环境,只有少数幸运儿才有生产环境。”讨论中很多人认同,真正该问的问题不是“会不会出岔子”,而是“出了岔子之后能不能恢复,并且让生产重新上线”。一位在迁移后因为同步问题迟迟无法解决的网友,用亲身经历证明:备份和回滚计划不是写给别人看的,是写给自己在凌晨三点用的。

焦虑也会渗透到生活小事

这种心态并不仅限于工作,还体现在给车搭电这类日常事务上。有人形容自己的内心戏:每次搭电都会想——“这个我能做,别人每天都做,我也做了至少十次,顺序肯定记得。”但另一个声音马上就问:“万一你记错了呢?⚡️💀”于是只好承认:你说得对。

另一位讲了一个更真实的教训:他的车因为 covid 期间长期停放,电池亏得很厉害,于是常备一个带低电压和反接保护功能的智能搭电宝。某次打算用车时,他刚接好端子,孩子一打断,等回头时下意识按了 override,结果瞬间“在焊接”,端子都在发红。他赶紧扯掉,万幸搭电宝和车都没事,但这一下让他意识到:连保护装置都可能被人为绕过,系统设计再周全也不能完全替代专注。

用更可控的架构,减少不确定因素

也有同行走另一个极端:家里的实验环境特意用最简单的方式搭——普通 Linux 系统,装 Docker,然后一个服务对应一个文件夹和 docker-compose.yml。他们理解为什么有人喜欢 TrueNAS、Unraid、CasaOS 或 Portainer 这类界面化的东西,但自己还是倾向直接写 Compose 文件。问原因,回答很统一:那些平台一旦出问题反而更难看懂。有人补充说,目前就是 Ubuntu 24.04 加 docker compose 一直跑,只有 Caddy 是直接裸金属部署。还有人在这个基础上写了个简单的 cron 任务:把每个 compose 文件夹里的容器先停下,rsync 到远端盘里,再重新拉起来。不一定适合所有人,但对他们来说,能自己掌控每一层,才是让深夜变更少点紧张的办法。

AI 时代又多了一层担忧

也有同行提到,AI 消解了一部分“手艺感”之后,新的焦虑变成了不停地判断 AI 到底有没有做对。有人甚至在讨论中说,现在这份工作很大一部分时间是在指出 AI 哪里错了,这件事本身已经接近一份全职工作。以前解决好一个故障会有成就感,现在反而要一边怀疑输出、一边擦屁股,心态很难轻松。

如果你也有类似的焦虑,不妨先把“最坏打算”从脑子里挪到文档上:把可能会出问题的点、回滚步骤、联系人、预估恢复时间都写清楚。承认自己会紧张并不丢人——真正危险的,是明明心里害怕,还要在条件访问策略上多勾一个框。