Today AI 每天重复的云操作——到底能不能交给它自己跑完?

文章导读
把每天重复的云操作交给 Today AI 自己跑完,可行性通常不取决于操作难不难,而取决于三件事:步骤是不是固定的、结果能不能从日志或控制台核对、出错之后影响范围是不是收得住。凡是每次都要人临时判断参数、或者只有人眼看着才能确认对错的任务,整体交出去的风险通常大于省下的时间;反过来,每天出现、判断环节少、结果有明确字段可查的操作,可以先交出去跑,再逐步放宽范围。
📋 目录
  1. 把近期重复操作按频率和判断量排序
  2. 给每个候选任务写出一条可核对的完成标准
  3. 找出任务里必须由人提前给的输入
  4. 用一次试运行对比人工结果
  5. 定下哪些先交出去、哪些继续人工做
A A

把每天重复的云操作交给 Today AI 自己跑完,可行性通常不取决于操作难不难,而取决于三件事:步骤是不是固定的、结果能不能从日志或控制台核对、出错之后影响范围是不是收得住。凡是每次都要人临时判断参数、或者只有人眼看着才能确认对错的任务,整体交出去的风险通常大于省下的时间;反过来,每天出现、判断环节少、结果有明确字段可查的操作,可以先交出去跑,再逐步放宽范围。

重复云操作能否整体交给 Today AI 执行,建议按「步骤是否固定、结果能否核对、出错后果是否可控」三点判断。可以先把每天出现、人工判断环节少、结果能落到具体字段或页面状态的操作挑出来,写不清完成标准的直接排除;需要人先给参数或审批的任务,保留人工给输入、AI 执行、结果自动核对的分工。先在预发或单个实例上试运行一次,与人工结果逐字段比对,再决定哪些放行。

把近期重复操作按频率和判断量排序

先不要凭印象挑任务。翻最近两周的操作记录,来源可以是工单、变更单、告警处理记录、堡垒机会话日志或者云平台的操作审计页面,把同一类动作归并成一条,然后填下面这张表。出现次数按天或按周统计,判断环节指「每次都要人临时决定一个值或选一个目标」的步骤数量,影响范围按做错后受影响的实例、服务或下游系统来写。

候选任务出现次数每次人工判断环节做错后的影响范围
日志轮转 / 临时文件清理每天多次1(确认目录和阈值)单机磁盘,可回滚
单服务重启每周数次2(选实例、选时间)该服务短时不可用
扩缩容每周数次2(目标副本数、时间段)成本与容量,需回滚
证书 / 域名续期检查每月一次1(确认到期阈值)到期后访问中断
定时备份触发每天一次1(确认实例清单)数据可恢复性

表里的数值要换成你自己环境里数出来的结果,不要照抄。判断量越大、影响范围越不可逆的任务,排序越靠后。这份清单的作用是给出优先级,不是直接给出放行名单。

给每个候选任务写出一条可核对的完成标准

判断一个任务能不能自动跑,最直接的办法是给它写一条完成标准,而且这条标准必须落到可查的字段、状态值或页面位置上。写不出来的,先排除,不要指望执行完靠感觉验收。

  • 日志清理:目录下匹配文件数为 0,或最旧文件时间在保留期内,磁盘使用率回落到设定阈值以下。
  • 单服务重启:进程状态字段为运行中,健康检查接口返回正常,端口处于监听。
  • 扩缩容:控制台或命令行查询到的副本数等于目标值,实例状态字段为可用。
  • 证书续期:证书有效期字段的新日期晚于旧日期,续期任务状态为成功。
  • 备份触发:备份列表新增一条记录,状态为成功且大小大于 0。

像「页面感觉快了」「应该没问题了」这类描述无法核对,对应任务只能继续人工做。标准写完之后,再回到上一步的排序表,把没有标准的行直接划掉。

找出任务里必须由人提前给的输入

大部分重复云操作不是完全不需要人,而是把人的介入从「每一步」压缩到「执行前给几个输入」。这些输入通常无法从系统里自动取得,因为它们来自业务判断或审批流程:目标环境是生产还是预发、允许变更的时间窗口、对应的变更单或审批编号、要改的具体参数值(副本数、保留天数、阈值)、允许动作的账号和权限范围、以及本次会波及的下游服务名单。

Today AI 每天重复的云操作——到底能不能交给它自己跑完?

给错的后果要在分工里写清楚:环境给错,就是在生产上做了本该在预发做的动作;窗口给错,容易压到业务高峰;参数给错,扩缩容可能过量或不足;权限给多了,AI 可动的范围超出本次任务。建议把这些输入做成一份固定格式的提交单,人工只填这一处,AI 只读这一处,执行日志里原样记录,事后能追到是谁给的什么值。

用一次试运行对比人工结果

正式放行前,先在预发环境、或者单个非核心实例上跑一次,并且优先用工具自带的试运行开关,只输出计划动作、不做实际变更。同一时间点,由人工按同样的顺序做一次,两边产出结果文件,再逐字段比对。关键比对字段建议固定为:目标对象、执行动作、执行顺序、结果状态、以及变更后的可查字段值。下面是一个通用比对骨架,命令和字段名按你实际使用的工具替换。

# 1) 让 Today AI 只输出计划,不执行变更
# dry-run 开关名称以工具实际帮助信息为准
todayai run `--task` rotate-log `--env` staging `--dry-run` `--out` /tmp/ai-plan.json

# 2) 人工按同一顺序执行一次,导出同样结构的记录
# 3) 比对关键字段,顺序与动作都看
jq -S '.steps[] | {target, action, result}' /tmp/ai-plan.json > /tmp/ai.sorted
jq -S '.steps[] | {target, action, result}' /tmp/human-run.json > /tmp/human.sorted
diff -u /tmp/human.sorted /tmp/ai.sorted

出现差异时,按固定顺序排查,不要一上来就改提示词或改脚本:先看两边读到的输入是不是同一份,再看目标对象是否一致,然后看执行顺序,最后才看单步动作的参数。很多差异来自输入不同,而不是 AI 判断错。差异确认不了原因的,这个任务先留在人工侧。

定下哪些先交出去、哪些继续人工做

把前面三步的结果合起来,可以得到一份分档名单,理由围绕频率、可验证性和出错后果展开,而不是围绕「AI 能不能做」这一句话。

  • 可以直接交给 Today AI 自己跑:每天出现、人工判断环节不超过一个、完成标准能落到具体字段、出错后果限于单机或可重试的操作,例如日志轮转、临时文件清理、到期检查类的只读任务。建议保留执行日志和失败告警,定期抽看结果。
  • 半自动,人先给输入:执行本身固定,但参数或窗口需要人定,例如单服务重启、扩缩容、备份触发。人给输入,AI 执行并按完成标准自检,标准不满足就停下叫人,不要自行重试到底。
  • 继续人工做:判断环节多、结果只能靠人确认、或者出错后不可逆的操作,例如数据删除、权限与安全组变更、生产库结构变更、跨环境拓扑调整。这类任务即使频率高,也不建议整体交出去。

放行之后也不是一劳永逸。建议每隔一段时间回看执行日志和失败记录,如果某个任务连续出现输入给错或结果核对不上的情况,就把它退回上一档,先修输入格式和完成标准,再考虑重新放开。