孙思远
随笔

复盘服务器被黑事件,Vibe Coding的安全第一课

2026-07-06

复盘记录一下 5 月 14 日服务器被黑事件——没有 vibe coding 真就完全做不来运维。

10:19
火山短信告警——北京机房那台服务器被人暴力破解、密码撞对了,登进来了。
10:20
止血:
  1. 第一时间冲去各个后台,把所有能连到我钱的密钥全删了——最怕的是 gemini 那把,它当时连个消费上限都设不了,一旦泄露别人拿去刷,账单没有天花板
  2. 打开 claude,剩下的一步步照它说的做
  3. 改防火墙:只放我自己进来,也堵死这台机器往外连(不然它会被人拿去攻击别人)
  4. 关掉广州那两台

微信通知客户停机维护,可能持续到下午

然后就是 claude 全程表演,(说实话我也不知道他在做什么),平时部署、查日志都是 claude 做的,所以运维交个 AI 完全放心
我唯一的工作就是和 claude 确认要做什么、做到哪了、有什么风险要我拍板
我看它取证的结论大概是——
这台机器被装了一整套:改了登录、让我敲命令看到的都是假的、还挂了个程序拿我机器去攻击别人、留了好几个后门。具体我也看不太懂,反正挺专业的。

11:00–11:20
把删掉的密钥重新生成、换上新的。
备份(并行)
顺手给整台机器拍了个快照存证(留着攻击者装的那套东西,也当数据兜底,存一个月就几块钱)。
11:20
把业务数据打包备份出来,校验一遍确认完整。
11:25
系统整个重装,数据留着——被装了后门的机器,重装最干净。
11:35–11:56
装回数据,把服务重新跑起来。
14:28
清理配置,删掉没用的、换掉该换的。
15:00
客户那边验证一切正常。
16:00–17:30
彻底加固:手上 7 台机器全部改成走一张私有内网连,公网入口全关死,登录只认密钥、不再用密码。

总停服大概 6 小时,客户侧使用恢复。

加固之后(时间记不清了)
翻了后台的操作记录,看攻击者这几个小时到底干了什么。结果有点意外——除了把我这台机器当肉鸡、拿去打别人,它别的啥都没干。没动数据,没碰业务,那把我最担心的、没上限的 gemini key 也没来得及用。它从头到尾要的,就是一台能对外攻击的机器。

复盘

一,服务器开着公网、还能用密码登录。

密码不安全我是知道的,但没想到这么不安全。机器人一口气试几百上千次,直接被撞开。

二,Google AI 能力太落后,没有做好企业级基建

gemini 连个消费上限都设不了,只能拿信用卡额度硬卡。

后来改的:

  1. 服务器全改成只认密钥、走内网连,公网入口关死,"猜密码"这回事直接没了。
  2. 事后直接抛弃 gemini,换别家。
  3. 把整个处理过程记成一份手册,下次照着做;顺手也写了套给人开权限的规矩。

复盘就这些。

早期我精力几乎全压业务上,先收钱、先让用户用,安全一直排在"以后再说"。

这次被黑,导火索是前一天那次服务器迁移。那阵子用户涨得快,原来的机器扛不住、一到高峰就崩,得换台更大的;顺手也把服务器从广州搬到北京机房(豆包的算力在那走内网、更便宜),大机器还能多跑几条并行。

这活是半夜赶的,00:37 动手、03:45 收尾,全程 claude 操作,弄完我就去睡了。新机器就这么上线了,还开着公网、还能用密码登录——几个小时后就被撞开。等我早上醒来,第一眼看到的就是那条被黑的短信。

从机器扛不住、扩容、搬机房,到当天被黑、清理重装加固——这一长串折腾下来,最大的体感就是:运维真是个重活,没有 vibe coding 我根本干不了(也干不来)。各家云厂商的后台还都特别难用。

「真的孙思远」微信公众号二维码

微信搜一搜 「真的孙思远」

扫码关注公众号,新文章第一时间推送。