
近期,云智慧 AI SRE 实验室公布了一项测试结果:在香港中文大学与中山大学团队提出的公开 RCA 基准 Cloud-OpsBench 上, Castrel AI 的新一代 RCA Studio 完成 Train-Ticket 系统全量 204 个故障场景测试,综合根因命中率达到 82.8%,较基线63%的准确率提高了 19 个百分点。
这不是一次实验室里的静态模拟。 Cloud-OpsBench 由香港中文大学吕荣聪(Michael R. Lyu)教授团队和中山大学研究者共同提出,覆盖 2 个微服务系统、57 种故障类型、共 754 个 Case,是目前 Agentic Root Cause Analysis 领域规模较大、评估维度较完整的公开学术基准,实验数据均来自真实运行的应用系统数据快照。
这一结果的背后,是 RCA Studio 对根因分析方式的一次重构
在原有假设驱动诊断能力之上引入因果引擎,让 RCA Agent 不再停留于罗列“可能原因”,而是主动调查故障现场、沿因果关系验证根因,向 SRE 团队交付有证据、有边界、可行动的诊断结果——让根因分析从“可能”走向“可验证”。
01 从“可能原因”到“可验证结论”:一场银行故障的完整复盘
某大型银行的一项关键业务,响应时间毫无征兆地从 50 毫秒恶化到 30 秒。短暂恢复十几分钟后,故障再次出现。
应用团队看到链路上的报错,平台团队查到 Pod 在重启,网络团队也发现了异常信号——是流量压垮了服务?是 Pod 重启断了连接?还是网络链路在抖?
每个团队都有自己的证据,却没人能证明故障究竟从哪里开始。时间消耗在重复查询和相互排除上,业务影响却在持续扩大。

这就是 RCA Studio 接手这场调查时的现场:不是没有方向,而是方向太多。
它将如何化解这场困境?
RCA Studio 接入现场已有的告警与可观测数据,从多个假设同时展开调查:检查流量与资源状态,验证 Pod 和服务健康度,对齐应用错误与网络事件的时间窗口。
没有证据支持的方向被逐一排除,调查焦点持续收窄。最终,零散信号指向同一区域——数据中心网络路径。
但 RCA Studio 没有把“高度相关”包装成“已经确认”。当时的数据能够支持网络故障域判断,却缺少物理交换机端口统计、STP 事件和数据包级证据,尚不足以独立确认物理层根因。RCA Studio 给出了当前结论,同时清楚标注了证据边界和下一步需要补查的方向。
现场网络团队随即检查交换机,最终确认广播风暴,并在完成故障隔离后恢复业务。
从大量跨域异常,到网络故障域,再到交换机侧的最终确认,RCA Studio 像一名参与战情室的数字专家,让工程师第一次沿着同一条证据链行动:排除没有证据的方向,聚焦被数据支撑的故障域,标注观测边界,并给出下一步排查的建议。
02 因果调查,让 AI 推理接受证据约束
早期版本的 RCA Studio 采用“提出假设—调用工具—验证假设”的固定循环,为复杂调查建立了结构,但也存在明显问题:
-
关键证据已经出现时,Agent 仍可能继续生成多余假设;
-
不同假设重复查询同一批数据;
-
当故障超出预设模式,调查容易在多个“合理猜测”之间徘徊。
新版本引入的因果引擎,将发现、推断和验证重构为能够动态组合的推理机制。
它把模型推理放进一套工程化约束里:
-
经验可以帮助搜索,但不能冒充证据;
-
假设可以灵活产生,但必须接受验证;
-
AI 可以生成结论,但每一步都被人检查和追溯。

在这套约束下,推理按照一条清晰的链路推进。
第一步,理解多源信号,建立故障上下文。
从告警出发,结合资源状态、配置、日志、指标与服务依赖关系,判断异常之间究竟是因果关系、传播关系,还是时间上的巧合。不做这一步,后续所有假设都是建立在单点异常上的孤立猜测。
第二步,调用历史经验,生成初始假设。
在首次生成假设前,检索历史故障模式,将组织积累的案例转化为调查线索。历史经验的价值是缩小搜索范围,但最终结论必须由现场证据验证,不能由经验直接给出。
第三步,让多个假设共享上下文、协同收敛。
发现、推断与验证不是一条固定流水线。多个假设共享已发现的线索,共性问题合并调查,需要深入的方向交由专门 Agent 继续验证,减少重复查询和无效探索。
第四步,用证据更新故障拓扑。
每一个确认或排除的假设,都绑定真实工具返回的证据。随着调查推进,系统持续更新故障拓扑,把异常对象、依赖关系、传播方向和根因机制连接起来。
第五步,交付能够直接行动的结果。
假设完成收敛后,RCA Studio 输出根因对象、故障机制、证据摘要、影响链路与处置建议,并生成可供工程师复核的根因报告和故障路径。
03 公开基准验证:82.8% 根因命中率,较基线提升 19 个百分点
这一结果,是在公开基准 Cloud-OpsBench 上,通过一套严格的测试方法与评分口径得出的。

本次测试选取 Cloud-OpsBench 中 Train-Ticket 的全量 204 个 Case,覆盖启动失败、运行时故障、服务路由和性能劣化四类典型故障,并采用 JRA(Joint RCA Accuracy)衡量最直观的根因结果:
只有 RCA Studio 明确确认的首要结论,同时命中故障对象与根因机制,该 Case 才计为正确;只定位到异常组件、只给出尚未确认的候选原因,或根因机制判断错误,均不计入命中。

本次测试的基线,为 Cloud-OpsBench 内置的 RCA Agent。RCA Studio 与它使用相同的 Deepseek-V4-Flash 模型,完成相同的 204 个 Case。
在相同条件下,基线命中率为 63%,RCA Studio 的综合根因命中率达到 82.8%,提高 19 个百分点,达到生产使用水平。
其中 169 个准确命中故障对象与根因机制,Startup 类场景实现 100% 命中。这一差距完全来自调查框架本身,而非底层模型。
04 不替换现有系统,接入即可启动
企业引入新的智能运维能力,最担心的往往不是产品有没有价值,而是落地要付出多大代价:
-
是否需要重建监控体系?
-
是否要迁移数据?
-
是否会打断各专业团队已经形成的工作方式?
RCA Studio 不替换企业现有的监控、日志、APM、告警或 ITSM 系统,接入已有数据与工具接口就能开始工作。
它在现有体系之上充当“故障调查大脑”:理解告警、选择调查路径、调用已有工具获取证据、连接跨域线索,并持续输出能够支持团队判断和行动的分析结果。

接入范围也可以根据企业实际条件逐步扩展。已有数据越完整,RCA Studio 能够验证的因果链就越深入;而暂时没有覆盖的数据,则会作为观测边界明确呈现。
企业可以从当前的数据基础出发,先启动场景验证,再逐步扩展能力边界,让已有工具获得一个能够组织数据、验证因果和推动协作的智能大脑。
05 让复杂数字系统,拥有理解自身并持续进化的能力
随着 AI 从辅助工具走向能够承担任务的 Agent,企业运维正在从“人寻找数据、解释异常”走向“AI 组织数据、验证因果、协同执行”的 AI SRE 新模式——
让AI 深入可观测、告警、事件、诊断、处置、复盘和知识运营的完整链路,在企业已有系统之上形成一个能够持续感知、推理和进化的智能运维大脑。

RCA Studio 的此次升级,正是 Castrel AI向这一完整链路迈出的重要一步。它将持续带来三个方面的价值:
-
更高效率:AI 承担海量信息收集、跨域关联与重复调查,把专家时间交还给更关键的判断与决策。
-
更优成本:激活既有数据与工具的价值,减少系统割裂、重复建设以及高度依赖少数专家带来的隐性投入。
-
更强稳定性:把故障发现、根因定位、处置协同与经验沉淀连接起来,让每一次事件都转化为下一次更快响应、更少影响的能力积累。
云智慧 Castrel AI,与企业共同构建这一代 AI SRE,让复杂数字系统理解自身、应对故障、持续进化。
联系方式:400-666-1332