最新报告:人工智能数据中心十大风险
本文关键看点:
1、传统数据中心和人工智能数据中心所面临的风险大致相似,但人工智能改变了可利用性和影响范围。
人工智能的应用和依赖是科技领域增长最快的单一领域。但人工智能极其耗能,并且需要新型的数据中心。
市场需求正推动人工智能数据中心建设的快速增长。危险在于,那些快速建设这种新型数据中心的人往往并不了解传统数据中心和人工智能数据中心之间的区别——其结果是,新建的 AI 数据中心暴露在一种全新的大规模风险之下。

传统数据中心主要是为已知客户群提供服务的数据处理仓库。而人工智能数据中心更像是为更庞大且未知的客户群提供服务的高性能数据计算工厂。传统数据中心可以由一系列独立的服务器组成,而人工智能数据中心必须作为一个能够进行大规模并行处理的单一引擎运行,以应对更大的计算需求。人工智能数据中心的构建方式与传统数据中心截然不同。
Lava Labs对人工智能数据中心的安全需求进行了调查,并发布了一份报告( 《十大数据中心和人工智能基础设施安全风险》),报告指出,数据中心的建设速度远超安全防护速度。传统数据中心和新型人工智能数据中心面临的风险大体相似;但人工智能改变了这些风险的可利用性和影响范围。
“最初为可信运营商设计的系统现在却要支持来自不同客户的高价值、多租户工作负载,”
Lava Labs 的报告列出了十大 AI 数据中心和基础设施安全风险,并将其命名为“Forge”(因为其目的是“加固模型下方的金属属性”)。
Forge 01:固件和硬件完整性被破坏
Forge 02:网络和互连漏洞
Forge 03:不安全的多租户隔离和资源复用
Forge 04:不安全的带外管理平面
Forge 05:人工智能基础设施供应链妥协
Forge 06:不安全的设施和数据中心管理系统
Forge 07:不安全的数据和数据流动
Forge 08:认证差距和供应商透明度不足
Forge 09:不安全的运营基础设施服务
Forge 10:厂商产品漏洞和补丁发布速度不足
这些风险的排序主要基于其严重程度。风险 01 至 05 在操作系统底层运行,难以检测,且影响范围遍及整个集群。风险 06 至 09 通常更容易检测和应对。风险 10 最容易检测和补救,且最不可能对租户造成灾难性损害。

▲FORGE ID 按严重程度排序,从最高到最低。该矩阵按领域对每项风险进行分组,并显示其可能性、影响和检测难度。
这些风险之所以出现,是因为 AI 改变了传统数据中心的基本信任模型。对于 03、07 和 08 版本,人工智能引入了互不相关的商业租户、高价值工作负载以及在客户之间重新分配的 GPU 节点。
对于 01、06 和 10,来自密集 GPU 集群的新硬件现实需要复杂的固件堆栈,具有极高的热敏感性,并且设施故障的爆炸半径更大。
对于 02 而言,所需的高性能网络架构(例如 InfiniBand、RoCE、RDMA 和 NVLink)通常未加密、监控不力且权限极高。薄弱的网络架构隔离可能导致安全漏洞暴露,从而遭受攻击、滥用或横向移动。
在 04 和 09 版本中,由于严重依赖 BMC 自动化、Redfish/IPMI、固件管道和编排系统,可能会导致操作权限集中。
对于 05 和 10 来说,GPU 处理器的短缺通常意味着新的 AI 数据中心会选择不太合适的处理器,这些处理器的隔离性较弱,这可能会导致供应链更容易受到影响。
Lava Labs 分析与报告的功能有三方面:
揭示 AI 数据中心的独特风险;
按优先级排序最严重的风险,从而形成一套分诊/处置顺序;
为这些风险提供示例攻击场景与实用缓解措施。
Lava Labs 分析所传达的核心结论是:是的,你需要一个新的数据中心来支撑 AI;但不,你不能把现有的数据中心模型当作设计蓝图。
