科技云报到原创。
一周前,WAIC 2026 在上海落下帷幕。在各行各业充分享受AI红利、加速挖掘AI价值的同时,如何应对AI带来的安全风险,成为与会各方的关注焦点。

大会期间,AI 安全与治理成为高频议题。《声明》中提到,AI前沿技术的升级迭代给网络安全带来复杂影响,对金融、电力、通信、交通等关键基础设施构成潜在威胁。全球领先的AI企业应以审慎态度推进人工智能研发,为人工智能大模型加装必要护栏,确保前沿模型的安全部署,防范人工智能带来系统性风险。
这段话,击中了AI行业令人不安的现实:AI发展越来越快、大模型越来越强大,各类Agent工具和框架日益普及,但AI带来的安全挑战也越来越复杂严峻。
以往,AI 安全风险更多集中在内容领域,比如虚假信息、违规生成、图片伪造等。但随着Agent时代的到来,AI不仅能“说话”,还长出了“双手”,前所未有地具备了自主规划、决策和执行各种任务的能力。
相应地,AI 的安全挑战也不再只是“可能说错话”,而是“可能做错事”,潜在破坏力有了十倍、百倍的增长。
不断演进的AI,从根本上改变了企业安全环境,也催生了新的安全需求。帮助企业洞察和管控AI风险、构筑安全围墙,已经成为国内外SaaS行业的兵家必争之地。
网易智企是参与这场竞逐的企业之一。作为网易旗下的一站式企业AI应用服务提供商,它已经构筑了一整套全栈AI驱动的产品与解决方案,服务娱乐、社交、游戏、零售、制造、金融等行业的数百万家企业客户。
本届WAIC上,网易智企携全新升级的一站式企业AI应用服务亮相,围绕安全治理、组织协作与业务增长三类企业现场,集中呈现AI落地实践。其中,企业级AI Agent平台“帝王蟹”、AI Agent安全产品“Agent Guard”、AI 私域助理、AI 客服、销售宝等产品,体现了网易智企对于企业 AI 落地的核心判断:AI 不仅要能上岗、能协作、能产生业务价值,也必须在明确的安全边界内稳定运行。

在网易智企看来,随着 AI 从“模型秀场”走向“企业现场”,AI 安全正在经历从内容合规到行为管控的范式转移。当 Agent 具备自主读取文档、调用 API、执行任务的能力时,风险已经从单纯的内容输出问题,延伸到长链任务失控与自主行动风险。
那么,企业该如何应对新的安全格局?单纯依靠大模型自身的安全屏障,或等待模型厂商在底层模型中完成所有安全修复,已经难以覆盖企业现场的复杂需求。网易智企的判断是,只有在模型外部构筑可审计、可更新、可管控的“安全控制面”,企业 AI 安全才能获得更稳定的保障。
正如网易智企副总经理朱浩齐所言:“越强的智能,越需要独立于模型之外的安全约束。”
外部安全控制面,大模型的“脑干”
去年底至今,全球AI公司发布一系列新模型,都把提升安全性能作为重点,比如对抗“越狱”和提示词注入、改进Agent安全、风险分层治理、管控数据隐私等。
但问题在于,把大模型训练得更聪明、更精准,并不能消除所有的安全隐患。
理想的AI安全机制,与人脑颇为相似——人总是能够“下意识”规避风险,比如手碰到火就会立刻缩回,眼前飞来物体就会本能闪躲,这类动作并不需要大脑皮层进行思考,而是由脑干做出快速反应。
AI同样需要类似的“缩手反应”。朱浩齐表示:“在大模型自身能力之外,需要构建一层独立安全控制面,把安全能力嵌入输入、输出、工具调用、权限执行等关键节点,在风险出现时快速判断、快速响应。”

这套机制的基本逻辑是,让大模型作为“大脑皮层”,专注于对话、推理、任务规划、Agent调度等复杂任务;大模型的整体安全,则交给“脑干”安全层负责。
在输入环节,安全控制面可以识别提示词注入、越狱攻击、恶意请求、敏感信息提交等风险;在输出环节,则可以完成实时审核、风险分类、策略处置和审计留痕等动作;在 Agent 执行环节,还可以围绕工具调用、权限范围、任务意图和执行结果建立持续监测。
这道独立于大模型的安全防线,价值并非仅仅“锦上添花”。它能够在模型原生安全能力难以快速覆盖的场景中,构筑起一道高效的通用安全壁垒。正如网易智企在实践中观察到的,企业不能既当“运动员”,又当“裁判员”。当 AI 应用进入真实业务场景,安全判断不仅要有效,也要可审计、可追溯、可被外部验证。
对于企业来说,这一点至关重要。
AI 风险变化非常快,模型漏洞和攻击手段层出不穷;而大模型训练成本高、周期长,依靠重新训练来应对所有新风险并不现实。相比之下,独立安全策略层可以根据新的风险样本、监管要求或业务场景,快速上线针对性规则和处置策略,帮助企业在不更换底层模型的情况下提升防护能力。
同时,外部安全控制面也会推动 AI 安全形成更接近“群体免疫”的防御机制。
在 AI 安全治理中,单个企业即使具备较强的自研能力,也往往只能基于自身遇到的攻击样本和业务风险进行防御。一类攻击在某家企业被识别和拦截,并不意味着其他企业天然具备同样的免疫能力。对于攻击方而言,只要防御经验无法流动,同样的攻击方式就可以在不同企业、不同模型和不同业务场景中反复试探。
而当某类新型越狱提示词、涉未成年人风险表达或暴恐内容变体被识别后,安全团队可以将其抽象为风险标签、检测规则、模型样本或评测集,并在合规前提下沉淀为可复用能力。这样,后续企业面对类似攻击时,就不必完全从零开始建立防御。
在网易智企看来,真正值得期待的方向,是让安全能力逐渐从“各自为战”走向“协同防御”。对于儿童色情、暴恐等人类社会相对容易形成共识的底线风险,安全厂商可以通过开源、标准化能力或低成本服务,尽可能降低全行业的防护门槛;而对于价值判断更复杂、业务差异更大的风险,则可以在客户授权、隐私保护和商业合作机制下进行定制化治理。
这意味着,外部安全控制面的价值不只是为某一个模型“加一道防线”,而是帮助行业沉淀可复用、可验证、可持续演进的安全经验。未来,随着 AI 相关法规、风险标签标准、隐私计算和行业协作机制逐步成熟,不同防御主体之间才可能在不牺牲商业竞争力和数据安全的前提下,共同提升对新型攻击的识别和响应能力。
因此,模型外部的独立安全服务,本质上是在推动 AI 安全从“企业自证安全”走向“第三方验证、行业协同和持续治理”。
大模型“内外兼修”,Agent也有了守卫
基于外部安全控制面的理念,网易智企·易盾在本届WAIC期间展示了面向大模型和智能体的安全能力。其核心,是抓住AI与外部世界交互的关键节点,在每⼀个输⼊、输出和调用环节中进行实时检测和处理。
从产品体系看,大模型安全能力分为“内生安全”和“围栏防护”两大模块。

其中,“内生安全”面向模型训练和对齐阶段,通过多模态训练数据清洗、安全数据标注、合规安全语料库、大模型安全评测等能力,从源头降低模型风险。
朱浩齐表示,大模型基于海量数据训练而成,在学习知识的同时,也可能吸收了大量危险知识、攻击方法、违规内容生成方式和错误价值倾向。
对于企业自建或微调专属模型而言,如果直接使用未经治理的业务数据,训练集中可能包含敏感信息、违规表达或不安全指令。模型在学习这些内容后,可能在实际应用中生成不当回复,甚至造成数据泄露风险。通过训练数据清洗、安全语料构建和模型安全评测,可以在模型形成能力之前识别并降低潜在风险。
“围栏防护”则面向模型应用阶段,在输入、输出和运行过程中建立实时防护机制,确保 AI 应用在可控边界内运行。
在输入侧,安全围栏部署在提示词到达模型之前,重点识别风险输入和恶意意图。它不仅检测敏感关键词和越狱模板,也会结合语义理解能力识别隐藏在角色扮演、假设场景、多轮诱导、图文混合输入中的真实风险意图。对于攻击者通过提示词注入、规则替换、编码隐喻等方式包装的恶意请求,输入侧围栏可以在进入模型前进行拦截。
而在输出侧,安全围栏部署在模型生成内容返回用户之前,重点保障模型回应“有边界、可追溯”。其能力包括流式实时检测、幻觉与事实性检测、多模态融合检测、安全智能代答等。特别是对于政务、金融、教育、客服等严肃场景,输出侧围栏不仅要识别违规内容,也要防止模型生成虚构政策、错误金融建议、不当承诺或敏感信息泄露。
朱浩齐表示,大模型安全围栏不是简单的内容过滤,而是覆盖输入风险防护、输出风险管控和运行过程监测的全链路安全能力。
如果说大模型安全围栏解决的是模型应用全链路防护问题,那么 Agent Guard 则进一步面向智能体时代的新型安全需求。
今年以来,Agent在各种场景的应用越来越广泛;不少企业都鼓励“养虾”,在自家IT系统中广泛应用Agent框架。
随着Agent 进入企业业务系统,AI 开始具备工具调用、系统访问、任务执行和跨系统协作能力,安全风险也从“内容输出”进一步扩展到“行为后果”。企业不能只看 Agent 说了什么,还必须知道它能访问什么、准备调用什么、实际执行了什么,以及一旦出现异常能否被及时阻断。
针对这一变化,网易智企 AI Agent 安全管控平台 Agent Guard 提出“理、控、隔、断”的一站式安全方案:先梳理企业内部 Agent 及其关联工具、服务、接口,形成资产可见;再对 Agent 交互信息、任务意图和调用行为进行语义分析,识别恶意意图和敏感信息;同时通过权限白名单、沙箱隔离等方式限定 Agent 可访问的数据和可执行的动作;一旦发现 Agent 被诱导、越权或行为异常,则及时隔离风险,必要时阻断任务继续执行。
企业应当把 Agent 看作一种“数字员工”,而不是传统软件。传统软件通常按照确定规则执行,而大模型驱动的 Agent 具有更强的自主性和不确定性。它越深入业务系统,越需要在模型之外建立资产可见、意图可审、权限可控、行为可断的安全控制能力。
安全不是AI发展的绊脚石,而是企业把AI真正推向生产环境的必要条件。当大模型“加装”外部安全控制面,Agent被第三方安全工具牢牢管控时,AI安全就突破了“模型自身更安全”的基本范畴,走向“AI进入业务系统后仍然可控”。
这一安全思考范式的转变,将推动企业AI安全治理水平迈上新台阶。
结语
目前,中国AI安全市场正处于起飞前夜。根据市场调研公司IDC的数据,2025年这块市场的规模为44.1亿元,2030年将达到340.3亿元,2025至2030年的复合增长率高达50.5%。
AI安全市场高速增长的过程,也是企业安全新范式逐渐成型、完善的过程。构筑“内外兼修”的安全防护体系,正成为越来越多企业拥抱Agent时代的选择。
在这条通往未来的道路上,网易智企已经走在了前面。
【关于科技云报到】
企业级IT领域Top10新媒体。聚焦云计算、人工智能、大模型、网络安全、大数据、区块链等企业级科技与数字化转型与赋能的领域。原创文章和视频获工信部权威认可,是世界人工智能大会、数博会、国家网安周、可信云大会与全球云计算等大型活动的官方指定传播媒体之一。






