< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下

任务通过率提升24.2%,token成本最高下降45%

允中 发自 凹非寺

量子位 | 公众号QbitAI

“智能并不局限于大脑内部。当我们使用纸笔或地图来梳理复杂问题时,这些外部工具就成为了我们‘延展的心智’。”

著名认知哲学家安迪·克拉克(Andy Clark)在揭示高级推理的本质时指出:

真正的智能,懂得使用外部图纸进行“认知卸载”(Cognitive Offloading)。

而在高度复杂的通信网络运维中,大模型Agent同样亟需跨越这道门槛。

IP承载网是千行万业数字化系统的底座。一次刷卡支付、一次线上挂号,背后都离不开它。

然而,这张网一旦出故障,线索往往深埋在海量的告警或静默的配置中。业务中断时,排障的第一道门槛往往不是怎么修,而是理清“此时此刻,这张网到底长什么样?”

想要回答这个问题,门槛极高。因为真实的现网是“活”的、动态的。每一次故障的网络拓扑空间都截然不同,面对错综复杂的路由,能在脑海中实时重构出“动态网”并揪出根因的,只有极少数资深专家。

既然资深专家可遇不可求,将排障重任交给大模型Agent(智能体),便成了行业破局的共识。业内曾普遍以为,凭借大模型强大的知识理解、逻辑推理与分析决策能力,这会是一场降维打击。

然而,当承载着厚望的Agent真正走进现场后,华为GTS算法团队却发现了一个反直觉的致命痛点:AI的推理能力再强,读得懂海量的文本日志,却偏偏记不住这张网长什么样。团队将此称为「拓扑失忆」。让一个纯文本Agent在脑海里硬扛成百上千个节点的动态变化,注定会陷入记忆坍塌。

如何破局?团队给出了精准解法NetCanvas,通过引入一套「可交互视觉拓扑」机制,它为大模型提供了一张可以画线推演的「外部工作记忆」画布。

这让AI真正学会“认知卸载”,能像专业工程师一样“看着网络排障”。

痛点剖析:AI读得懂日志却修不好网?缺的是一张“活地图”

引入大模型Agent,原本是为了复刻资深专家的排障经验、填补现网的人力缺口。

但一线很快碰到一个反直觉现象,模型明明能解析单条命令、单段回显,一旦进入多设备、多路径、带防火墙与ECMP的真实复杂拓扑,就开始绕弯、重复探查,甚至在同一节点打转。

一个典型的现网惨案是:在一次真实的排障测试中,Agent已经锁定了出问题的防火墙,却在这台设备上换了几十种查法,原地打转了三百多步,仍没找到根因。它知道该查防火墙,却不知道这台防火墙卡在整个图里面的哪个路径的第几跳。

明明推理能力在线,为什么AI还会迷路?答案是:缺了空间记忆。

资深网工排障时,脑子里始终悬着一张「活图」:流量从哪里进入、在哪分流、防火墙卡在第几跳,一切清清楚楚。反观纯文本Agent,面对的却是一维滚动的CLI(命令行),这就意味着每推进一步,都要从碎片的日志里重新脑补网络长什么样。上下文越长,这种空间关系就越容易在长文本里「坍塌」。

针对这一现象,华为GTS AI算法团队将其命名为「拓扑失忆」(Topology Amnesia):排障越深入,局部观测可能越来越多,整体的空间关系却在逐渐丢失。

这恰恰印证了开篇的哲学论断:缺乏「外部工作记忆」的辅助,纯文本模型在复杂的现网中注定会陷入认知超载。

怎么破局?既然人脑都需要依靠图纸来梳理复杂逻辑,AI自然也一样。拓扑图对网工来说是排障时的“外部工作记忆”,查到哪,图更新到哪。

因此,Agent需要的绝不是开局塞给它的一张死板全景图,而是一个能与它产生交互的活地图。

沿着这个逻辑,GTS确立了全新的解法思路:不是把专家经验硬写进Prompt,而是把专家的工作方式写进Agent系统。让模型负责思考决策,让NetCanvas负责记路与画图。

△同一张网,在人和Agent眼里其实是两回事:(a) 人类工程师脑中的空间记忆;(b) 纯文本Agent陷入拓扑坍塌;(c) NetCanvas为Agent配备可交互的“活地图”。

解局之道:引入「可交互视觉拓扑」,三招让Agent边看边推演

基于上述的痛点剖析,团队祭出了真正的解法——NetCanvas。

它绝不是简单地给模型塞一张静态的网络拓扑截图,而是为其量身定制了一套“可交互视觉拓扑”。

通过以下“三招”,NetCanvas彻底颠覆了Agent认知真实网络的方式:

招一:边查边长(动态生长)

真实的排障现场,没有人能在第一时间拿到完美的全局拓扑。

因此,NetCanvas摒弃了“开局给全景”的僵化思路。

Agent每完成一次CLI探查,新发现的设备、链路与路径证据,就会被实时合并到当前的图状态中。

这就好比战争迷雾被逐步驱散,拓扑图就像有生命一样,跟着排障进度一起“动态生长”。

招二:按需取景与推理交互(核心动作)

图长出来了还不够,Agent还必须能像人类专家一样“用图”。

在NetCanvas中,Agent可以随时切换全局与局部视图,或者高亮当前的焦点节点。

更绝的是,它还能通过主动改变连线颜色(如用绿/红虚线标记通断),在图上直接记录自己的推理假设。模型无需再在脑子里死记硬背,真正实现了“边看、边标、边排查”。

招三:按网工习惯画图(认知对齐)

Agent能看见图固然重要,图以什么方式呈现在它眼前同样致命。

研发团队在测试中发现一个惊人的事实:只要把机器生成的拓扑,换成符合人类网络工程师认知习惯的“领域布局”,Agent的排障成功率就能实现碾压式的跃升。画对了图,AI才能走对路。

数据验证:真正“看清”网络,Agent才能精准破局、少走弯路

“活地图”到底有多大威力?团队在公开的通信运维基准CTBench上进行了硬核验证。

这里的任务全部来自真实运维案例,要求Agent进入未知网络、动态执行命令,并从不完整、碎片化的证据中逐步定位故障,难度远超传统的单轮问答。

抛开繁杂的模型参数,NetCanvas带来的核心业务价值,被结结实实地刻在了以下三个维度上:

1. 排障更准:整体效果显著提升,有效突破复杂路径瓶颈。

在整个数据集上,NetCanvas将Agent的综合通过率从30.3%提升至54.5%(若带有物理连线先验可达63.6%)。

尤其在双防火墙、ECMP(等价多路径)等高度依赖空间关系的复杂子任务中,效果更是从约10%跃升至约90%。

当隐含在长日志中的空间关系变成“看得见”的结构,Agent沿着多路径顺藤摸瓜终于有了清晰的抓手。

2. 表现更稳:无一题退化(16胜0负50平)。

逐题比对纯文本方案,NetCanvas没有在任何一道题上出现能力退化。多出来的16道是净增,没有拿别的题来换。

3. 步数更少:综合试错成本最高下降45%。

Agent的平均探查步数从159步直降至113步。由于准确率大幅提高、Agent不再盲目绕路,按“每解对一题”摊算,大模型的Token试错成本反而下降了26%到45%。

画图不是增加大模型的负担,而是实实在在地省下了试错成本。

△CTBench通过率与平均探查步数对比

终极启示:学会「认知卸载」,构建专业Agent的新范式

NetCanvas的实践,揭示了专业Agent走向现网落地的核心命题:模型本身的理解能力固然重要,但外围系统(Harness)如何为它呈现这个真实世界,才真正决定了它最终的战斗力。

这恰好印证了开篇的哲学论断:外围系统,就是Agent延展的心智。

对于IP网络这种由拓扑、路径、协议动态交织的真实复杂系统,把海量日志生硬地压进大模型的Token里,注定会导致认知超载。

Agent除了需要强大的语言理解能力,更需要一套能持续演化的「延展工作记忆」。

真正的专业能力,不仅仅依赖于模型内部庞大的“知识储备”与强大的“推理决策”,更在于懂得借助外围系统来进行“认知卸载”,建立起真正的网络空间全局观。

这也是华为GTS AI始终坚守的技术演进路径:从真实的运维现场出发,将资深工程师长期沉淀的“空间认知与工作方式”工程化,转化为Agent可感知、可交互的系统能力。

未来的网络智能运维,Agent将彻底告别在海量碎片日志中“大脑超载、盲人摸象”的窘境。

有了「可交互视觉拓扑」的驱动,AI终于可以像顶尖专家一样,看着网络、沿着路径,精准排障。

项目地址
caimanjing/netcanvas:https://github.com/caimanjing/netcanvas
CTBench:https://huggingface.co/datasets/netop/CTBench

*本文系量子位获授权刊载,观点仅为原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。