在云计算中,裸金属实例的核心定义是将没有经过任何虚拟化的物理服务器直接交给用户。
这就带来了一个巨大的技术挑战:由于服务器是纯物理的,如果它的启动盘依然采用分布式网络块存储,而不是服务器自带的本地物理硬盘,物理服务器在通电开机时,是如何通过网络认领并启动这块云盘的?
各大云服务商(AWS、Oracle OCI、阿里云等)为了实现裸金属的“云盘启动”,采用了不同的技术演进路线,主要分为专用硬件芯片直连(ASIC/FPGA) 和 网络协议固化引导(iSCSI/PXE) 两大阵营:
阵营一:硬件芯片级虚拟化(代表:AWS、阿里云)这一阵营的思路是:在物理服务器的 PCIe 插槽上插一块定制的智能网卡(SmartNIC/DPU)。这块卡对物理服务器的 CPU“撒谎”,假装自己是一块本地的 NVMe 固态硬盘。
1. AWS (Amazon Web Services)核心技术:AWS Nitro 系统 (Nitro Cards)。 [1]实现原理:
- AWS 的裸金属服务器主板上插有专用的 Nitro Card for EBS 芯片。当裸金属服务器通电,主板 BIOS/UEFI 开始自检(POST)时,通过 PCIe 总线会扫描到一个标准的、通用的 NVMe 控制器。物理服务器的 CPU 认为这是一块插在主板上的本地高速物理硬盘,于是直接读取它进行引导开机。背后的真相:这个所谓的“NVMe 硬盘”其实是 Nitro 芯片虚拟出来的。Nitro 芯片在硬件层将 CPU 发出的 NVMe 读写指令拦截,转化为网络请求,通过专用的高速私有网络,发送到后端的 Amazon EBS 存储集群中。 [1]
2. 阿里云 (Alibaba Cloud)核心技术:神龙架构 (CIPU / MOC 卡)。实现原理:与 AWS 极为相似。阿里云在物理服务器中部署了自主研发的神龙芯片(CIPU)。当裸金属实例(神龙服务器)启动时,CIPU 芯片在 PCIe 层面虚拟出标准的 NVMe 协议接口,直接与阿里云的分布式存储集群 ESSD(云盘) 建立高带宽连接。服务器开机直接从这个硬件虚拟出来的 NVMe 设备中读取引导程序。
阵营二:网络协议固化与智能引导(代表:Oracle OCI)这一阵营的思路更偏向于传统大型企业数据中心的高级 SAN 网络架构,不完全依赖高成本的专用外设芯片来模拟 NVMe,而是把网络启动协议写进主板。
3. Oracle Cloud (OCI)核心技术:iSCSI 硬件引导与网络隔离。 [1, 2]实现原理:
- OCI 的裸金属服务器在主板网卡(NIC)的固件(UEFI/BIOS)中,固化了 iSCSI Boot 功能。当您在 OCI 控制台点击启动裸金属实例时,控制台会将远程 OCI Boot Volume(引导卷) 的 iSCSI 目标地址(Target IP、IQN 编号)以及认证凭证(CHAP)配置到该服务器的物理网卡固件中。服务器通电后,主板 UEFI 直接通过网络(利用物理网卡的 iSCSI 卸载引擎)向后端的存储集群发起 iSCSI 登录(Login),将远程云盘挂载为系统的根磁盘,并从中读取 OS 内核完成引导。 [1, 2, 3]
阵营三:软件定义的网络预配(代表:GCP 及部分传统裸金属)
4. Google Cloud (GCP)核心技术:网络预配与本地存储映射。实现原理:Google Cloud 的裸金属实例(如基于其智能芯片的机型)也逐步向硬件 offload 靠拢。但对于部分特殊的物理机托管或传统裸金属,GCP 会通过底层的控制平面,在服务器上电时利用 PXE(预启动执行环境)/ 网络流水线 引导。先通过网络下载一个轻量级的镜像环境,然后通过软件定义网络将 Hyperdisk(谷歌高性能云盘) 动态映射为本地块设备进行最终的 OS 加载。
架构一:硬件模拟 NVMe
🟢 S – 优势 (Strengths)极致的操作系统兼容性:对操作系统(OS)100% 透明。无论是 Linux、Windows 还是古老的商用 OS,只要自带 NVMe 驱动(现代 OS 标配),就能直接安、直接转,无需任何特殊定制网卡驱动。零性能损耗与低延迟:硬件芯片(如 AWS Nitro)在硬件层完成了网络协议栈(如 NVMe-oF)的解包和封包,完全不占用裸金属服务器的物理 CPU 算力。与虚拟机的无缝体验:在云控制台看来,裸金属和虚拟机(VM)挂载云盘的代码逻辑完全一样,产品体验高度统一。
🔴 W – 劣势 (Weaknesses)硬件研发成本高昂:必须自行设计、流片并维护专用的 ASIC 或 FPGA 芯片(如 Nitro/CIPU),只有顶级规模的超大规模云商(Hyperscaler)才能玩得起。供应链绑定与锁定:由于深度依赖自研芯片,一旦芯片供应链受阻或出现重大硬件 Bug,很难在短时间内找到替代的服务器主板硬件。
🔵 O – 机遇 (Opportunities)AI/高性能计算 (HPC) 爆发:随着大模型训练对裸金属(GPU 实例)需求的激增,DPU 技术可以顺理成章地扩展到网络加速、内存池化(CXL)等领域,实现一专多能。安全合规的天生边界:硬件芯片充当了物理机与云控制平面之间的“防火墙”。黑客就算攻破了裸金属 OS,也摸不到 Nitro 芯片背后的云基础设施。
🏴 🛠️ T – 威胁 (Threats)开源/标准化技术的普及:随着标准 NVMe-oF(基于 Fabric 的 NVMe)协议和开源 DPU 架构(如 IPDK)的成熟,中小云商可以通过购买通用芯片(如 NVIDIA BlueField、Intel Mount Evans)获得类似能力,从而削弱自研芯片的壁垒。
架构二:主板固件网络引导 (iSCSI Boot)
🟢 S – 优势 (Strengths)开放标准,极易规模化:基于成熟的 iSCSI 和 UEFI 行业标准,不需要设计昂贵的专用芯片。只要购买市场上通用的、支持 iSCSI 卸载(Offload)的商业网卡(如 Broadcom、Mellanox),就能快速组装出百万台级别的裸金属集群。契合传统企业客户习惯:Oracle 的主力客户是金融、能源等大型企业。这些企业对传统的 SAN 网络、iSCSI、光纤通道非常熟悉。OCI 的这种设计,使得企业在线下 IDC 的架构可以原封不动地平移到云端。存储与计算极度解耦:在 OCI 中,VM 和 BM 的启动盘彻底通用。你可以把一个物理机的 Boot Volume 拔下来,直接挂给一台虚拟机开机,反之亦然。
🔴 W – 劣势 (Weaknesses)操作系统兼容性“有门槛”:由于要在启动早期阶段加载网络驱动并维持 iSCSI 链接,如果用户想安装某些非常冷门、裁剪过网络协议栈、或没有正确配置多路径(Multipath)驱动的定制 OS,可能会遭遇开机蓝屏或崩溃。对网络波动的敏感度高:开机阶段完全依赖网卡固件与远程存储通信。如果在此期间机房网络发生极其短暂的抖动,iSCSI 链接断开,物理机可能会直接 hang 住或抛出 I/O 错误。
🔵 O – 机遇 (Opportunities)政企私有云/混合云利器:由于对硬件没有变态的“定制”要求,这种架构非常利于 Oracle 将 OCI 整体打包成“专属区域(Dedicated Region)”卖给政府或大型银行,在客户自己的机房里用标准服务器复制出一个 OCI 环境。
🏴 🛠️ T – 威胁 (Threats)性能瓶颈与时代代差:iSCSI 协议基于相对古老的 SCSI 指令集(单队列、高锁竞争)。在面对如今几十万、上百万 IOPS 的新型 NVMe 分布式存储时,iSCSI 在网络协议层面的软件开销和延迟,明显落后于硬件 offload 后的 NVMe 协议,面临被时代淘汰的风险。