执行摘要
在全球数字化转型与生成式人工智能(AIGC)爆发的双重驱动下,以大模型训练与推理为核心算力引擎的智算中心(Intelligent Computing Center, AIDC)已成为国家与企业的核心数字基础设施。随着大模型参数规模从千亿向万亿迈进,算力集群规模已步入“十万卡时代”,并呈现出向中西部地区纵深发展以及向跨域算网协同拓展的宏大格局。然而,智算中心在追求极致算效与超高网络运力的同时,其底层网络架构的脆弱性正在被无限放大。2025年至2026年期间,全球分布式拒绝服务(DDoS)攻击呈现出规模破纪录(峰值突破2.6 Tbps)、手段智能化(AI驱动攻击平台)、策略精准化(微突发与靶向应用层)的新型演进特征。
本白皮书立足于2026年最新的网络安全威胁态势,深度剖析大模型训练与推理工作负载对网络抖动与丢包的极度敏感性。研究指出,传统基于集中式清洗与静态阈值的DDoS防护体系已无法满足智算中心超低时延与无损网络的要求。通过全面梳理在网计算(In-Network Computing)、数据处理器(DPU/SmartNIC)、P4可编程交换机及内嵌人工智能(AI)检测算法等前沿防御技术,本报告提出构建“边缘分布式清洗、端网协同控制、软硬件异构加速”的新一代智算中心抗DDoS架构。同时,结合华为、中国联通、绿盟科技、奇安信等业界领先企业的最佳实践,为智算中心的建设者、运营者及安全合规管理者提供一套涵盖基础设施、网络边界、核心数据及AI Agent全生命周期的全栈安全防御指南。
第一章 智算时代的基础设施演进与网络脆弱性剖析
智算中心是基于AI芯片和计算框架构建的人工智能基础设施,其核心功能包括海量数据存储、AI模型训练与优化、以及算力服务与共享。为了支撑万亿参数大模型的计算需求,智算网络的底层架构正在经历深刻变革,而这种变革也为其应对网络攻击带来了前所未有的物理局限与挑战。
1.1 大算力时代的网络扩展架构与工作负载特征
人工智能模型的生命周期分为训练(Training)与推理(Inference)两个主要阶段,这两类工作负载对算力中心网络提出了截然不同但同样苛刻的要求。大模型训练需要海量算力、存储和数据资源,其中预训练阶段往往消耗了总算力的90%至99%及绝大部分时间,需要调度数千乃至上万块GPU持续数周至数月完成基础参数学习。微调阶段虽然算力消耗仅占1%至10%,但也需要集群的高效协同。相比之下,推理阶段则表现出低延迟、高并发、持续化的算力需求特征。推理过程中的Prefill(预填充)阶段负责一次性并行处理所有输入Token并构建KV缓存,短时占用峰值算力;而Decode(解码)阶段则采用自回归方式逐Token生成输出,直接决定了整体吞吐率和能效表现。
为了满足这些需求,智算中心的算力资源扩展策略已经从传统的垂直扩展(Scale-up,如通过高速总线提升节点内多GPU协同,提升单位算力)演进至横向扩展(Scale-out,通过超高速、超大规模的组网架构连接数据中心内的成千上万个机架),甚至迈向了跨域扩展(Scale-Across,将分散在多个地理位置的数据中心整合为统一的逻辑AI集群,打造百万卡规模的超级工厂)。在这些扩展架构中,网络不再仅仅是连接设备的数据通道,而是直接决定集群有效算力(MFU,即模型实际利用算力与集群理论算力之比)的核心瓶颈。据统计,在大规模AI集群训练中,网络通信时间占比可高达30%以上,且集群规模越大,通信耗时占比越高。因此,智算中心内部(算内网络)以及跨数据中心(DCI算间互联)必须具备超高带宽、超低时延及零丢包的特性。
1.2 融合以太网RDMA(RoCEv2)与InfiniBand的抉择与隐患
为了实现微秒级甚至纳秒级的通信延迟,智算中心全面抛弃了传统的TCP/IP协议栈。传统TCP协议在跨多云和边缘环境传输时,会一致性地将网络抖动(Jitter)误判为网络拥塞,从而主动节流并重传数据包,这种基于内核态的机制会导致吞吐量雪崩式下降,使得GPU等昂贵计算资源陷入长时间空闲。因此,现代智算中心转而广泛采用内核旁路(Kernel-bypass)的远程直接内存访问(RDMA)技术,允许计算机直接访问远端主机内存,实现零拷贝与超低延迟。
当前智算网络主要存在两大RDMA技术路线。其一是原生支持RDMA的InfiniBand (IB) 网络,该架构采用基于信用的精细化流控机制(Credit-based flow control),能够天然实现无损网络,延迟极低,在应对十万卡级别的超大算力集群时游刃有余,但由于其生态相对封闭且硬件成本高昂,部署门槛极高。其二是基于融合增强型以太网的RoCEv2(RDMA over Converged Ethernet),它依赖UDP/IP协议栈,在以太网上运行RDMA,凭借广泛的兼容性与成本优势成为国内众多智算中心(特别是中小规模和通用云服务商)的首选。
然而,RoCEv2在万卡集群规模下面临着极大的流控挑战与安全脆弱性。为了在以太网上实现“无损”,RoCEv2高度依赖基于优先级的流控制(PFC)和显式拥塞通知(ECN)机制。PFC是一种粗粒度、反应式的流控机制,当网络接收端缓冲区紧张或出现微小突发流量时,接收端会发送暂停帧(Pause Frame)通知上游停止发送。在遭受网络层DDoS攻击(如微突发泛洪)时,恶意流量会瞬间填满交换机队列,触发大面积的PFC暂停信号。更棘手的是,这些暂停信号会沿数据路径逐级向上传导,在多级网络中极易引发连锁反应,形成所谓的“PFC风暴”(PFC Storm),进而导致整个算力网络的瘫痪与吞吐量雪崩式下降。
1.3 脆弱的体同步并行(BSP):DDoS微攻击的灾难性放大效应
AI大模型的分布式训练通常采用体同步并行(Bulk Synchronous Parallel, BSP)模式或其变种。在BSP执行模型中,所有GPU节点必须在每一轮迭代(或微批次)计算结束后,通过集合通信(如All-Reduce)操作同步梯度参数,确认所有节点均完成同步后,整个集群才能进入下一轮计算。
这种机制的致命弱点在于其对网络抖动(Jitter)和延迟放大(Latency Amplification)极其敏感。一旦网络遭受DDoS攻击(哪怕是小流量的短时拥塞攻击),只要导致集群中某一个或几个GPU节点的网络数据包延迟到达,整个集群中成千上万个GPU都必须在同步屏障(Synchronization Barrier)处挂起等待。这种“长尾效应”意味着局部的微小延迟会被全局放大。实验数据表明,在跨域智算中心(如1000公里)的长距RDMA传输中,仅仅万分之一(0.01%)的丢包率,就会导致网络有效吞吐量骤降60%。攻击者完全无需通过Tbps级别的巨型流量压垮数据中心总出口带宽,只需利用精心构造的微突发流量(Micro-bursts)在集合通信的关键时间窗口制造抖动,即可迫使数千张GPU长时间空转,直接摧毁模型训练的效率并造成极其高昂的算力资源浪费。
第二章 大模型时代DDoS攻击威胁的范式转移
在算力即权力的时代,智算中心已成为黑客、竞争对手乃至国家级高级持续性威胁(APT)组织的首要战略打击目标。随着全球地缘政治与网络空间冲突的深度耦合,针对基础设施的攻击逐步升维。2025年至2026年,DDoS攻击的战术策略与技术手段发生了革命性的变化,彻底颠覆了传统的攻防博弈模型。
2.1 规模破局与“地毯式轰炸”(Carpet-Bombing)战术
全球DDoS攻击的规模天花板正在以指数级速度不断被打破。2020年,业界曾因云服务商抵御了峰值达到2.3 Tbps至2.5 Tbps的攻击而震惊;然而,据绿盟科技《DDoS攻击威胁报告(2026版)》显示,2025年5月,单次攻击的最高峰值已达到2.6 Tbps,且峰值带宽超过500 Gbps的高强度攻击事件数量同比激增了115.72%。
更为棘手的是,攻击者不再单纯依赖针对单一IP或单一业务网关的暴力泛洪。新一代物联网(IoT)僵尸网络(如AIsuru、ShadowV2、Kimwolf等)控制着数以万计甚至十万计的受感染节点,这些僵尸网络的敏捷性远超传统出站系统响应速度。它们广泛采用“地毯式轰炸”(Carpet-Bombing)策略,将高达15.7 Tbps至29.5 Tbps的惊人总攻击流量,通过微突发(Micro-bursts)和极度碎片化的攻击向量,精准稀释并分散到目标智算中心的数千个不同IP地址及前缀上。这种化整为零的分散策略使得每一个目标IP接收到的异常流量均完美潜伏在传统集中式清洗中心(Scrubbing Centers)设定的重定向阈值之下,令基于静态带宽监控的防线形同虚设。
2.2 AI驱动的攻击武器化:以认知速度对抗
防守方在利用AI赋能安全,攻击生态同样在加速智能化分化,以Nullsec Philippines等为代表的新兴黑客组织已经开始构建并实战部署完全由AI驱动的DDoS攻击平台(如vire.cc)。传统的DDoS攻击多为流量压制型,依赖人工编写的静态脚本和固定参数;而AI驱动的攻击武器则具备了自我学习和动态优化的能力。
这些AI攻击平台能够利用机器学习算法对目标智算中心的网络架构、业务高峰期及防御基线进行持续侦察。在实战中,平台会根据目标防御系统的反馈自动生成最优的攻击参数组合。例如,数据显示2025年高强度攻击的平均峰值包速率(Mpps)有所下降,但平均峰值带宽却提升了约30 Gbps,这表明AI算法正指导攻击者通过提升单包数据量来实施“高负载放大”攻击,以此最大化对目标系统内存和带宽的消耗。此外,攻击时机的选择也实现了靶向化,攻击者会精确计算大模型任务提交或业务高峰时段,通过与正常流量叠加来掩盖自身,实现从“人力编码策略”向“机器认知对抗”的转变,极大降低了高级别攻击的门槛。
2.3 靶向应用层(L7)与加密流量(SSL/TLS)攻击的泛滥
随着大模型公有云调用量经历爆发式增长(从2024年初的8,000亿Tokens跃升至2025年的71.8万亿Tokens),通过API接口对外界提供推理服务成为了智算中心最主要的商业变现途径。这也使得大模型API成为了攻击者眼中高价值的“新靶点”。
除了消耗网络带宽的基础设施层(L3/L4)攻击外,针对智算中心应用层(L7)的攻击显著增加。例如,在针对DeepSeek-R1等知名大模型的攻击事件中,攻击者精准锁定了API网关(如api.deepseek.com)及对话交互页面,刻意选择用户访问极度活跃的时段,利用高仿真HTTP/HTTPS请求(如CC攻击、Slowloris慢速攻击)耗尽服务器的处理线程与数据库连接池资源。
同时,由于现代智算中心为保障数据传输安全,普遍强制采用SSL/TLS(甚至国密算法)对流量进行端到端加密,攻击者趁机大量发起HTTPS加密泛洪攻击。HTTPS的高安全性反而成为了黑客的天然掩体。传统的安全防护方案在处理此类攻击时,必须先消耗巨大的计算资源对流量进行解密,提取明文特征后才能进行规则匹配与清洗。这种非对称的资源消耗模式使得传统防火墙或解密网关自身极易在遭受攻击的第一时间瘫痪,成为整个网络链条中的性能瓶颈。
| 评估维度 | 传统数据中心DDoS攻击模式 | 智算中心(AIDC)时代DDoS演进特征 |
|---|---|---|
| 攻击流量规模 | 几十 Gbps 至 1 Tbps 级别 | 迈入多Tbps时代,峰值可达2.6 Tbps,极端情况甚至超15 Tbps |
| 典型攻击目标 | 单一Web服务器、特定域名或公网IP | 智算集群基础设施、大模型API接口、全网段IP前缀 |
| 主要流量特征 | 持续性的巨量洪水(如UDP/ICMP Flood) | 地毯式轰炸、微突发(Micro-bursts)、高频低量隐蔽攻击 |
| 战术与决策 | 预设僵尸网络脚本、固定单一的攻击向量 | 依托AI平台(如vire.cc)动态调整参数,精准利用业务脆弱时段 |
| 深远破坏影响 | 网站短暂下线、普通用户访问延迟增加 | 破坏BSP模型同步,触发PFC风暴,导致万卡算力集群长时间停摆空转 |
第三章 智算中心大流量DDoS防护核心技术架构的重构
面对上述攻击规模、隐蔽性及智能化的全面升维,以及智算网络对低时延的苛刻要求,传统的“流量牵引(Tromboning) -> 集中式云端清洗 -> 流量回注”架构已在技术机制和经济成本上双双失效。智算中心正在向“超分布式边缘清洗、在网计算防护、AI内生自适应安全”的全新范式转型。
3.1 从集中式清洗到超分布式边缘防护(Edge Protection)
在过去的十余年中,业界高度依赖地理上分散的集中式清洗中心。当攻击发生时,运营商或安全厂商通过BGP路由将目标网络流量强行牵引至云端的巨大清洗池,剥离恶意报文后再将干净流量送回目标。然而,在当前的超高速智算网络环境中,攻击流量的聚合速度往往在路由重定向完成前就已经导致上行链路完全拥塞。此外,现代僵尸网络不仅攻击边缘,还瞄准访问层、汇聚层和出站路径。
因此,防御架构发生了一次深刻的范式转移:摒弃绕行的重定向模型,将DDoS缓解能力直接下沉到网络的绝对边缘和每一台路由设备中,形成超分布式缓解(Hyper-Distributed Mitigation)架构。在这种新架构下,路由器和边缘网关本身即作为安全执行层,利用硬件线卡(Line card)和访问控制列表(ACL)以无感知的线速(Wire-speed)执行精准过滤。检测与阻断在最接近流量源头的地方瞬间完成,这彻底消除了流量回传(Backhauling)带来的高昂时延损耗,将安全响应时间从传统的几分钟大幅缩短至30秒以内,甚至是微秒/纳秒级别。这不仅保护了业务 SLA(服务等级协议),还有效降低了因流量无效传输造成的超过60%的总拥有成本(TCO)。
| 架构特性 | 传统集中式云端清洗架构 (Legacy Scrubbing) | 现代超分布式在网缓解架构 (In-Network Mitigation) |
|---|---|---|
| 处理位置 | 远离受害网络的外部云清洗中心 | 网络边缘节点、核心路由器、主机侧智能网卡(DPU)内 |
| 流量路径 | 攻击发生后触发BGP牵引(Tromboning迂回绕行) | 流量沿原定物理路径直线传输(Inline 串联处理) |
| 响应时延 | 分钟级(受限于路由收敛和云端处理时间) | 微秒至纳秒级(线速执行,无感阻断) |
| 防御侧重点 | 粗放的体积型大流量攻击削峰 | 精细化应对微突发、地毯式轰炸及应用层隐蔽攻击 |
| 网络影响 | 容易引入较高抖动,不适合敏感的AI同步负载 | 不产生额外通信延迟,天然适配智算无损网络需求 |
3.2 在网计算(In-Network Computing)与软硬件异构卸载
在网计算理念是智算中心抗DDoS革命性的一跃。它打破了计算与网络的传统边界,将原本需要高度依赖通用服务器CPU来处理的网络与安全计算任务,直接卸载(Offload)到网络设备(如交换机、网卡)的专用硬件管线中运行,以换取极高的吞吐量和极低的延迟。
- P4可编程交换机与线速防御: 利用P4等数据面编程语言,网络开发者可以直接在交换机底层定制数据包的处理逻辑。在DDoS防御场景中,P4可编程交换机可以在短短400至500纳秒内提取数据包头部元数据,利用硬件流水线(如HashPipe等统计算法)识别出异常的大象流(Heavy Hitters),并直接在数据平面完成报文丢弃。结合DPDK(数据平面开发套件)技术,在网计算还能实现内核旁路(Kernel-Bypass),彻底规避操作系统中断处理的巨大开销,以全线速处理Tbps级别的恶意报文。
- DPU与SmartNIC(数据处理器/智能网卡): 在智算中心的计算服务器前端,DPU的大规模部署正在重塑安全边界。DPU集成了多核ARM CPU、专用硬件加速引擎以及高速网络接口,能够在网卡侧即时实现状态防火墙、流量深度包检测(DPI)、线速加密/解密以及DDoS初步缓解。这一方面将DDoS防御从数据中心物理边界延伸至每一台主机的虚拟边界之前,有效解决了传统方案难以应对的东西向(内部节点间)横向攻击问题;另一方面,基础设施安全任务的全面卸载,使得宝贵的宿主机CPU和GPU算力得以100%释放,专注于模型推理与训练任务,极大提升了多租户云环境下的资源隔离性与性能稳定性。
3.3 AI赋能的智能流量检测与动态基线自适应
面对大模型业务流量的极端复杂性(正常推理请求与庞大参数同步流量交织共存),传统的基于静态统计与固定阈值“一刀切”的检测思路已完全失效,不仅容易产生海量误报,更会造成小流量针对性攻击的严重漏报。新一代防线全面引入人工智能(AI)构建智能检测与防御引擎。
首先是基于无监督学习的流量基线自适应与IP画像。防护系统不再依赖人工设定的经验数值,而是通过长期无监督地学习海量正常业务流量样本(如使用K-means聚类算法分析),自动为每一个受保护的IP或业务网段建立个性化的“正常行为画像”和动态基线。一旦流量偏离该基线,系统即可瞬间捕获。
其次是加密流量的免解密智能检测。为了在不破坏数据隐私、且不耗费巨大算力进行流量解密的前提下防御HTTPS层攻击,最新的AI安全解决方案引入了行为分析模型(Behavioral Analysis)。系统通过监控数据包长度序列、到达时间间隔、微小突发频率等流量塑形(Traffic Shaping)的底层元数据特征,结合集成学习训练出的强监督模型,能够精准辨识出潜藏在SSL隧道中的DDoS流量与自动化脚本攻击,从而实现高效的零日(Zero-Day)攻击防护。
第四章 业界领先的智算中心DDoS防范最佳实践
在智算网络安全这一尖端博弈领域,国内外头部安全厂商、网络设备商及电信运营商依托深厚的技术积淀,推出了各具特色的高阶解决方案,为智算中心构建了坚实的护城河。
4.1 华为:星河AI智算中心网络安全解决方案
华为凭借其在底层芯片、网络设备与AI算法上的全面布局,连续三年稳居中国区抗DDoS硬件产品市场份额榜首。其面向AI算力集群推出的“星河AI数据中心网络安全解决方案”代表了当前硬核防御的顶尖水平:
- CPU+NP异构智能协同加速: 华为AntiDDoS系统摒弃了单一依靠CPU处理的瓶颈架构,创新性地采用“中央处理器(CPU)+ 网络处理器(NP)”的智能协同机制。NP过滤器专职以极高速度在底层网络层“硬抗”海量泛洪攻击;而CPU则释放出充足算力,专注于执行复杂的会话状态检测与应用层(如HTTPS慢速CC攻击)的精细清洗。这种分层精准处置使得AntiDDoS单机最高防御能力飙升至惊人的 2.4 Tbps,在同等性能下大幅降低了硬件成本。
- 端网联动与极速系统恢复: 在智算网络中,华为提供毫秒级T级DDoS防御,其设备的“闪启2.0”技术将交换机在遭遇故障重启或因极端攻击中断后的恢复时间从业界普遍的120秒大幅压缩至5秒,极大保障了算力训练(MFU)的连续性。同时,结合自研反病毒检测引擎与高性能内存威胁图技术,实现挖矿检测率超99%,并在模型运行前拦截供应链投毒。
4.2 中国联通:算力智联网(AINet)与“闪防”技术
作为国家级骨干网络运营商,中国联通依托“星罗”算力调度平台与G.654E超高速骨干光缆网,构建了横跨东西部的算力智联网(AINet),并在广域网层面的大流量防御上实现了重大突破。
- 可信网络架构与“闪防”: 联通在中讯邮电咨询设计院的支撑下,在广东、北京等地成功落地了基于“设备-网络-管控”三位一体的可信网络创新架构。通过将DDoS攻击检测能力深度下沉至骨干核心路由器,并结合嵌入式AI算法动态学习报文速率与微突发特征,联通的“闪防”技术实现了“2秒发现攻击,5秒完成流量清洗”的极致响应速度。相比传统清洗系统动辄61秒的延迟,该方案将攻击流量透传至智算中心边缘的概率降至极低。
- 云盾 SaaS 化近源清洗: 联通云盾提供按需调度的灵活服务,利用部署于全国32个省级节点的分布式防护体系,整体清洗容量高达3T至6T。当攻击流量产生时,系统在流量进入骨干网的源头处(近源清洗)即刻进行引流拦截并原路径回注,从根本上缓解了用户侧带宽资源拥塞,实现了对用户的零配置、无感知防护。
4.3 绿盟科技(NSFOCUS):基于“产品+运营”的闭环治理
面对DDoS攻击的复杂化,绿盟科技推动解决方案从单纯的“产品能力”向覆盖全生命周期的“安全运营能力”演进,并凭借此荣获了Frost&Sullivan 2026全球抗DDoS解决方案竞争策略领导奖。
- 内嵌AI小模型的敏捷检测: 绿盟在其网络流量分析系统(NTA)和抗拒绝服务系统(ADS)中创新性地内嵌了专用的AI安全小模型。在流量进入防护链路的第一时间,设备即刻在本地完成业务基线学习、特征提取与攻击分类,极大提升了对慢速攻击及新型DDoS变种的检测精度。
- 云地混合协同防御(Hybrid Protection): 针对往往超出智算中心本地带宽负荷的超大规模攻击,绿盟科技提供了“本地硬件防护 + 智能云端清洗”的三位一体解决方案。本地ADS设备负责精准、低延迟地防御日常小流量与复杂应用层攻击;一旦智能流量调度平台(ADBOS)探测到本地带宽即将饱和,系统即通过BGP宣告或自动化API一键将超量流量牵引至具备7T+容量的绿盟全球清洗云,在云端完成大流量削峰,确保本地链路可用性。
4.4 奇安信(QiAnXin):“带洞防护”与AI智能运营
在勒索攻击与漏洞利用交织的当下,奇安信提出了创新的“带洞防护”核心理念。白皮书《Mythos应对白皮书》指出,在AI批量化发动网络攻击的时代,传统的“发现漏洞-打补丁”模式已严重滞后。奇安信主张承认系统漏洞的客观存在,依托其态势感知与安全运营平台(NGSOC)和天眼威胁监测系统,构建“三位一体”的内生安全体系。
此外,奇安信强调利用AI来驱动安全运营,让机器的速度对抗机器的攻击速度(如Mythos的自动化流程)。通过自动化处理海量告警并关联还原攻击路径,奇安信的安全机制旨在拉平攻防之间高达百倍的时间差,为智算中心的持续稳定运行提供保障。
4.5 国际方案的比较(Radware, F5, Check Point)
国际安全巨头在全球视角的云原生防护与零日攻击缓解方面表现出色,其技术侧重点与国内厂商形成互补。
| 厂商 | 核心产品/方案 | 技术亮点与优势 | 数据参考 |
|---|---|---|---|
| Radware | 云DDoS防护服务与混合风险缓解 | 全球部署25个清洗中心,结合获专利的基于行为的机器学习算法,针对Web DDoS、IoT僵尸网络提供自动化的秒级防御与秒级风险缓解SLA。 | 风险缓解容量超 30 Tbps。 |
| Check Point | Quantum DDoS Protector | 融合AI/ML行为算法,提供极低延迟的零日攻击自动防护,支持通过硬件SSL引擎对加密流量进行无损检查缓解。 | 延迟 <60 微秒,处理速度高达 800 Gbps。 |
| F5 | Silverline DDoS Protection + WAF | 强调混合云架构下的多层防御。云端Silverline应对体积型洪水,本地应用层WAF(集成SSL终止)利用CPU处理非对称算力和应用层攻击。 | 覆盖 L3 至 L7 全层级防护架构。 |
第五章 智算中心全栈安全防御体系构建与合规指南
抵御大流量DDoS攻击仅仅是智算中心安全体系构建的一环。面对人工智能内生安全与应用风险交织泛化的复杂挑战,传统单点、静态的补丁式防护体系已难以为继。根据中国信息通信研究院(CAICT)于2024至2026年密集发布的《人工智能安全治理研究报告(2025年)》、《算力网络数据安全研究报告》以及《可信网络实践白皮书》等权威文献,智算中心必须构建一套系统性、可落地、动态化的“一体化”安全治理产业实践框架。
5.1 落实零信任架构(ZTA)与内生网络边界防护
在算网融合的架构下,异构节点数量庞大、资源调度智能自动,智算中心的物理安全边界已被彻底打破,必须向以身份和上下文为核心的零信任架构(Zero Trust Architecture)全面转型。
- 物理与逻辑隔离的计算节点: 基础设施层是防护的根基。为应对算力劫持、供应链投毒等风险,必须确立底层硬件的绝对信任根(Root of Trust)。例如,采用华为擎天(Qingtian)架构的裸金属实例或基于Kunpeng virtCCA/Ascend Shield的机密计算环境,通过专门的控制卡卸载管理功能,实现租户模型业务与云服务商运维人员的完全物理/逻辑隔离,确保持续的运行时透明度与抗篡改能力。
- 微隔离(Micro-segmentation)与边界管控: 智算业务中AI Agent的爆发式增长使得跨应用API调用错综复杂,极易产生越权访问。需在数据中心内部(如利用DPU或可信路由器)实施细粒度的微分段,持续监控并限制未授权的东西向流量横向移动。即使DDoS攻击者或恶意代码攻陷了单一计算节点,微隔离机制也能将其困在原地,有效防止内部广播风暴或横向感染。
5.2 全生命周期的数据保护与模型隐私安全
大模型的训练语料、权重参数(Checkpoints)及推理过程中的中间数据,是企业最为核心的商业机密和隐私资产。
- 存储-计算分离架构的传输安全: 智算中心普遍采用存算分离架构。海量数据在计算节点与高速存储系统(如云原生存储卷PVC)之间频繁流转。必须在传输链路全面启用基于硬件加速的强加密协议(如MACsec物理层加密或IPsec),并结合基于角色的访问控制(RBAC)与细粒度审计,防止数据在传输过程中被旁路监听、篡改或遭遇勒索软件劫持。同时,需针对存储系统的I/O接口配置防DDoS机制,防止攻击者通过巨量无效读写请求导致存储集群瘫痪。
- 防数据投毒与模型内容审计: 根据CAICT的《可信人工智能白皮书》框架,安全体系需覆盖数据准备到模型应用的全流程。对上架智算中心使用的各种开源框架、工具(如Ollama, Clickhouse, Gradio)及模型镜像进行强制的安全合规审计与开源软件指纹漏洞扫描。建立大模型依赖的唯一“模型制品源”,从源头防御供应链投毒。同时,利用内置十万量级的提示词题库验证模型输出,避免恶意注入指令(如越狱验证、对抗攻击)引发计算资源耗尽或输出违规内容。
5.3 迈向自主驱动的智能运维(Agentic AI O&M)
面对智算中心内数以亿计的元器件(涵盖千万量级的GPU/NPU、智能光模块、交换矩阵等)以及极其复杂、高并发的网络流量模型,如果依然依赖传统的人力夜间巡检或手动配置静态安全阈值,将不可避免地产生巨大的响应滞后与安全盲区。未来的智算中心注定要演进为具备“感知-决策-执行-自演进”闭环能力的自主数字实体。
为此,需全面引入智能体运维(Agentic AI O&M)体系。通过在关键基础设施组件中部署高精度智能探针,实时、全域地采集多维网络遥测数据(Telemetry)。在控制平面,基于多智能体(Multi-Agent)的AI原生大脑能够持续监控全局状态,自主预测流量突发趋势,动态优化并下发拥塞控制水线参数。当遭遇突发DDoS攻击或大规模硬件故障时,Agentic AI O&M 系统能够在人类运维人员介入之前,于毫秒级别自动实施风险消减策略(如局部路由黑洞、流量重定向、算网协同负载均衡),极大缩短平均故障恢复时间(MTTR),进而确保整个超大规模算力集群维持极高的可用度(HA)与业务连续性韧性。
结论
大模型技术的狂飙突进,已将全球科技产业的算力竞赛推向了白热化阶段。作为承载这一历史级技术飞跃的物理载体,智算中心(AIDC)的稳定与安全,直接关系到国家数字经济的命脉与企业的核心竞争力。本白皮书的研究与分析表明,在万卡、十万卡互联的高速无损网络架构下,智算中心对网络拥塞与抖动的容忍度几乎为零。这使得大流量、高智能、强针对性的DDoS攻击不再仅仅是导致网页变慢的普通“网络中断事件”,而是可以直接导致海量昂贵算力资源长时间闲置、动辄百万美元训练任务彻底失败的“物理级破坏事件”。
面对日益严峻的威胁挑战,智算网络的防御体系正迎来深度的架构重构与范式升级。传统的被动响应与绕行集中的云端清洗模式,必将被超低时延的在网计算(In-Network Computing)、DPU/智能网卡边缘分布式防护、以及基于AI驱动的自适应内生检测机制所取代。通过软硬件异构协同(如CPU+NP架构)、端网算存深度融合,结合严格执行的零信任架构与CAICT倡导的动态可信合规评估,建设者方能构筑起抵御现代极具破坏力DDoS威胁的钢铁防线。
在迈向“十五五”规划以及更高阶智能时代的征程中,网络安全绝不是阻碍技术发展的枷锁,而是确保“人工智能飞轮”能够高速、平稳运转的核心内驱力。唯有将顶级的网络安全防御与弹性恢复能力深深植根于智算基础设施的底层基因之中,方能真正释放AI算力的澎湃动能,护航数字世界的永续繁荣。

