机密计算能解决什么、不能解决什么:硬件信任边界与失效条件
机密计算把数据保护的边界从"静态"(磁盘加密)与"传输中"(网络传输)推进到"使用中"——即 CPU 正在计算的那一刻,明文也不离开一块由芯片硬件强制隔离、且能被远程密码学验证的内存区域。它属于硬件强制隔离范畴,与普通软件层加密的区别在于隔离由芯片而非操作系统执行。机密计算的本质是把信任根从"云厂商的员工、hypervisor、操作系统"转移到"硅片上的加密引擎 + 可验证的度量链",从而让企业在不可信的共享基础设施上处理敏感数据成为可能。
机密计算能解决什么、不能解决什么:硬件信任边界与失效条件
机密计算前沿深研
研究类型:周六前沿技术 Deep Dive(仅 B) 日期:2026-09-26 研究对象:机密计算(Confidential Computing)/ 基于硬件的可信执行环境(TEE) 核心问题:机密计算到底把"信任"从人与组织转移到了哪一层硅片?它在哪些真实约束下成立,又在哪些边界上失效,对企业落地意味着什么? 证据口径:机密计算联盟(CCC)白皮书与官网、IETF RFC 9334(RATS)、IEEE Spectrum、ACM SIGMETRICS 2025、Future Generation Computer Systems 2026、TEE.fail(Georgia Tech / Purdue 2025)公开披露、各云厂商官方文档、市场研究机构 2025–2026 报告;截止 2026-09-26 公开可获得信息。市场数字来自多家分析机构,口径不一,正文中以区间呈现并标注来源。
一、执行摘要
机密计算把数据保护的边界从"静态"(磁盘加密)与"传输中"(网络传输)推进到"使用中"——即 CPU 正在计算的那一刻,明文也不离开一块由芯片硬件强制隔离、且能被远程密码学验证的内存区域。它属于硬件强制隔离范畴,与普通软件层加密的区别在于隔离由芯片而非操作系统执行。[[墨青:机密计算的本质是把信任根从"云厂商的员工、hypervisor、操作系统"转移到"硅片上的加密引擎 + 可验证的度量链",从而让企业在不可信的共享基础设施上处理敏感数据成为可能。]]【已确认】
这套机制已经越过实验室阶段:Azure、GCP、AWS、阿里云、华为云、腾讯云均已提供机密虚拟机或机密容器实例,英特尔 TDX、AMD SEV-SNP、ARM CCA、英伟达 GPU TEE 构成了四条互不相容的硬件路线。VM 级机密虚拟机(CVM)把性能开销压到 CPU 密集型 2%–8%、内存密集型 5%–15% 区间,使"无改造迁移"成为现实【计算·高】;而早期的进程级 SGX 在小负载上可达 [[金棕:283%–1971%]] 的减速,这正是产业从进程隔离转向 VM 隔离的根本原因【已确认】。生成式 AI 又拉动了新一极:英伟达 H100/Blackwell 的 GPU TEE 把"机密"从 CPU 内存延伸到显存,让模型权重与提示词在推理时也不再以明文形式出现。
但它有明确的能力边界。2025 年披露的 TEE.fail 用不到 [[金棕:1000 美元]] 的自制 DDR5 内存总线拦截器,从英特尔 TDX / AMD SEV-SNP 服务器中提取出证明密钥(PCK)并伪造可通过官方验证的证明报告,暴露出"确定性内存加密 + 物理可达"这一被厂商长期置于威胁模型之外的裂缝[[暖红:TEE.fail 证明:在物理可达的前提下,当前主流 CVM 的机密性承诺可被硬件总线侧信道击穿,且伪造的证明能通过 UpToDate 最高信任等级验证,直接动摇"远程证明 = 可信任"的根基。]]【已确认】。机密计算因此仍是一个"减少了必须信任的对象,而非消灭攻击面"的技术——它把云管理员、hypervisor 从信任边界里拿掉,却没有把"能碰到服务器主板的人"和"芯片厂商的签发密钥"拿掉。
读者向解读:理解机密计算,先说清它是什么,再说它为什么重要。它做的事是:让数据在 CPU 计算的那一刻,明文只存在于一块由芯片硬件强制隔离、且能被远程验证的内存区域里,操作系统、虚拟化层和云管理员都读不到。它重要,是因为企业不敢把敏感数据放上云,真正担心的是云那边有太多人能看见数据,加密数学是否够强在这里是次要问题;机密计算把"能看见数据的人"从几百个云员工缩减到几乎为零(芯片厂除外),而且这种"看不见"是可以被密码学验证的,不只是一纸合同承诺。它常被夸大的一点是:它削减了攻击面,却没有消灭它。云管理员与 hypervisor 被移出信任边界,但"能碰到服务器主板的人"和"芯片厂的签发密钥"仍在信任集合里。TEE.fail 证明的正是这一点:只要攻击者物理上能接触主板、且芯片厂密钥能被提取,那些"可验证"的证明本身也能被伪造。所以对企业而言,机密计算的价值前提是你的威胁模型本来就包含"不可信的云基础设施",而不只是"不可信的机房和芯片厂"。凡是把"上 TEE 就绝对安全"当卖点的说法,都是把"减少风险"说成了"消灭风险"。
二、研究对象基本面画像(非企业 · 领域 6 项)
2.1 定义与范畴
[[定义:机密计算]]指的是"在基于硬件的、经过证明的可信执行环境(TEE)中执行计算,以保护正在使用中的数据"——这是机密计算联盟(CCC,Linux 基金会 2019 年发起)给出的权威定义【已确认】。TEE 须同时具备三项属性:数据机密性(未授权实体无法读取 TEE 内数据)、数据完整性(未授权实体无法增删改 TEE 内数据)、代码完整性(未授权实体无法篡改 TEE 内运行的代码)【已确认】。它补上的是数据安全三支柱里唯一长期空缺的一柱:数据"静态"(磁盘加密)、"传输中"(TLS)已被成熟方案覆盖,唯有"使用中"在 CPU 寄存器与内存里明文存在的瞬间,传统方案无能为力。需要区分的是,机密计算与"隐私计算"常被混用,但后者是更宽的伞(含 MPC、FHE、DP),机密计算专指"硬件 TEE"这一支。
2.2 规模与增速
市场口径高度分散,且与"隐私增强技术(PET)""隐私科技"边界模糊,下列数字均须视为区间而非定点【推断·中】:
- 机密计算整体市场:Future Market Insights 估 2025 年 89 亿美元、2035 年 831 亿美元(CAGR 25%);The Business Research Company 估 2025 年 122.8 亿美元、2030 年 549 亿美元(CAGR 34.7%);Growth Market Reports 估 2025 年 124 亿美元、2034 年 1158 亿美元(CAGR 27.3%)【推断·中】。
- 更窄的"机密 AI 推理云"子市场:Market Intelo 估 2025 年 25 亿美元、2034 年 358 亿美元(CAGR 40%),单一来源,置信度较低【假设·低】。
- 相邻"隐私科技"大盘:Stealth Cloud 估算 2025 年约 124 亿美元、2030 年 254–321 亿美元;其中"隐私增强计算"(含机密计算、FHE、DP、ZKP)2022–2025 年 CAGR 48%,是增长最快的细分【推断·中】。
- 反例警示:个别中文聚合报告给出"2025 年 105–242 亿美元"的口径,但整个人数据安全市场也仅约 200 亿美元量级,该数字与前述多家分析机构显著冲突,本文不作为有效证据,标注为可疑 outlier【暖红:单一来源且与主流估计冲突的市场数字应当直接排除,而非取最大数服务叙事。】。
2.3 关键参与者
- 芯片与硬件信任根:英特尔(SGX / TDX / Trust Authority)、AMD(SEV / SEV-SNP)、ARM(CCA)、英伟达(GPU TEE,Hopper/Blackwell)、以及国产路线(华为鲲鹏 iTrustee + 蓬莱 TEE、飞腾 PhyTEE、海光 Hygon-CSV、兆芯 ZX-TCT)【已确认】。
- 云与服务:Microsoft Azure(市场最激进)、Google Cloud、AWS、IBM、Oracle、阿里云、华为云、腾讯云【已确认】。
- 软件与编排:Fortanix、Anjuna、Edgeless(Marblerun)、Opaque、蚂蚁"隐语"开源框架、CNCF Confidential Containers(CoCo)【已确认】。
- 标准与治理:CCC(Linux 基金会)、IETF RATS 工作组、全球计算联盟(GCC)、中国电子技术标准化研究院、国家金融科技认证(金融信创)【已确认】。
2.4 技术成熟度分布
[[墨青:机密计算已分化为两条代际路线——早期的进程级 enclave(SGX)因重构成本与极端开销被产业边缘化,VM 级机密虚拟机(TDX / SEV-SNP / CCA)成为云交付主流,GPU TEE 则是 2023 年后由生成式 AI 拉动的新增长极。]]【已确认】
- SGX:2015 年量产、Mature,但客户端平台已战略收缩,服务端 Xeon 仍保留;因无"lift-and-shift"能力而被 CVM 取代【已确认】。
- SEV-SNP:Milan(2021)起、Genoa/Turin 成熟,云上大规模可用,Early Production→Mature【已确认】。
- TDX:Sapphire Rapids(2023)起,Granite Rapids 增强;Azure Intel TDX 机密 VM 于 2026 年初 GA,GCP 于 2025 年 8 月扩展 TDX,Early Production【已确认】。
- ARM CCA:Realm 架构,2021 年底发布,主要面向边缘与云,Prototype→Early【推断·中】。
- NVIDIA GPU TEE:H100(Hopper,2023 末)为首款支持 CC 的 GPU,Blackwell 扩展;多 GPU 尚受限,Early Production【已确认】。
2.5 监管与标准格局
- 国际标准:IETF RFC 9334(RATS 远程证明架构,2023-01)统一了证明角色词汇;CCC 白皮书(2022 V1.3)给出技术分类与威胁模型【已确认】。
- 中国标准:国家标准《机密计算通用框架》已发布待实施;GCC 于 2025-11 发布《机密计算平台技术要求与测评方法》《机密计算远程证明技术要求》两项团体标准,华为率先通过平台符合性测试,飞腾与华为通过金融信创测评【已确认】。
- 监管驱动:GDPR、HIPAA、SCHREMS II、欧盟 AI 法案、巴塞尔/EBA/OCC 框架共同把"数据使用中保护"从可选项变成合规刚需,是市场增速的根本发动机而非结果【常识】。
2.6 关键指标一览表(2023–2026)
| 指标 | 数值 / 区间 | 口径与置信度 |
|---|---|---|
| SGX 小负载减速 | 283%–1971%(对比原生) | Brescia 等,FGCS 2026,实证研究【计算·高】 |
| SGX 大负载减速 | 15%–57% | 同上【计算·高】 |
| TDX 大负载减速 | 约 9%(小负载可达 73%) | 同上;CVM 通用 3%–15%【计算·高】 |
| SEV-SNP 大负载减速 | 约 29%(小负载 67%) | 同上【计算·高】 |
| GPU TEE(H100)端到端开销 | 通常 <7%,计算密集型近 0% | Phala / 独立基准,厂商外来源【推断·中】 |
| 整体市场(2025) | 89–124 亿美元(机构区间) | 三家分析机构【推断·中】 |
| TEE.fail 攻击成本 | <1000 美元自制拦截器 | Georgia Tech/Purdue 2025 披露【已确认】 |
| CVM 成熟度 | Early Production 规模化 | 云厂普遍可用【已确认】 |
三、关键术语与概念底座
[[定义:可信执行环境(TEE)]]:CPU 里一块由硬件强制隔离的安全区域,外部(含操作系统、hypervisor、云管理员)即使拿到内存转储也读不到里面在算什么。它和普通"加密内存"的不同在于:隔离由 CPU 硬件在物理层强制执行,操作系统和云管理员即便拿到内存内容也读不到,因此能在不可信环境里安全地做计算。【已确认】
[[定义:机密虚拟机(CVM)]]:一整台被内存加密 + 完整性保护 + 远程证明包裹起来的虚拟机,里面跑的是未改造的操作系统和应用。它和普通虚拟机的不同在于:整台虚拟机的运行时内存都被加密保护,里面跑的是未经改造的操作系统和应用,所以老系统可以不改代码直接获得机密性。【已确认】
[[定义:远程证明(Remote Attestation)]]:TEE 向远程验证方出具一份由芯片密钥签名的"我此刻运行的是这段未被篡改的代码、在真实的硬件 TEE 里"的密码学证据。它的作用是让数据提供方在发送敏感数据前,能确认对方确实运行在真实的、未被篡改的 TEE 里,否则就不释放密钥——这是机密计算区别于单纯加密的关键。【已确认】
[[定义:硬件信任根(HRoT)]]:出厂时烧录在芯片里、不可提取的一组私钥与度量寄存器(PCR),是整个信任链的起点。它是整个信任链的原点:后续所有证明都从这组出厂密钥派生,且密钥本身无法从芯片外提取,因此信任的起点落在硬件而非软件。【已确认】
[[定义:可信计算基(TCB)]]:系统里"必须被信任才能保障安全"的那一小撮代码与硬件。TCB 越小,可攻击面越窄。它的含义是:系统的安全性只取决于这一小段必须被信任的代码与硬件,所以 TCB 越小、越简单,可被攻击的面就越窄。【常识】
[[定义:确定性内存加密(AES-XTS)]]:同一明文写在同一个物理地址,永远得到同一密文。这是性能优化的选择,却也是 TEE.fail 的命门。它为了性能选择了"同一地址永远加密成同一密文",但这也带来副作用:攻击者虽看不懂内容,却能从密文的重复性推断内存访问模式,这正是 TEE.fail 得以利用的薄弱点。【已确认】
[[定义:侧信道攻击]]:不破解密码本身,它偷看"计算时的动静"——耗电、时间、缓存命中、内存总线流量——来推断秘密。它利用计算过程中泄露的物理痕迹(功耗、时序、缓存状态、总线流量)来推断秘密,因此防护重点在消除这些痕迹,不能只靠加密。【常识】
[[定义:反向映射表(RMP)/ Merkle 树]]:SEV-SNP 用 RMP、TDX 用 Merkle 树保证内存页的完整性——任何对加密内存的篡改都会被检测。它们保证加密内存页一旦被外部篡改就能被检测到,从而把"防读取"和"防篡改"两件事同时做到。【已确认】
[[定义:Paravisor(准虚拟化监控器)]]:云厂商在 CVM 与硬件之间插入的一层薄软件(Azure 基于 Hyper-V 开源实现),负责把"裸 TEE"包装成"云产品"——处理启动、度量、设备模拟,使 Windows/Linux 客户机无需改造即可获得机密性。它的作用是把裸 TEE 包装成云产品:处理启动、度量、设备模拟,使 Windows/Linux 客户机无需改造就能获得机密性,是云厂商交付机密 VM 的关键中间层。【推断·中】
[[定义:机密容器(Confidential Containers / CoCo)]]:CNCF 项目,让每个 Kubernetes Pod 跑在自己独立的 TEE(Kata 微 VM 作载体)里,把 TCB 从整个节点缩减到该 Pod 内。它的做法是让每个容器跑在自己独立的 TEE 里,从而把需要被信任的代码范围从整台宿主机缩小到该容器内部。【推断·中】
[[定义:可信 I/O(TDISP)]]:PCI-SIG 标准,用于把 GPU/网卡等设备安全地"分配"进 TEE,使设备 DMA 不破坏机密边界。当前 NVIDIA GPU TEE 用自家的 SPDM 握手而非 TDISP,二者尚未收敛。它的作用是把 GPU、网卡等设备安全地接入 TEE,确保设备的直接内存访问不会绕过机密边界;目前 NVIDIA 用自己的 SPDM 而非 TDISP,两套方案尚未统一。【已确认】
[[定义:SPDM(Security Protocol and Data Model)]]:用于芯片间(如 CPU TEE 与 GPU TEE)建立安全通道的协议,NVIDIA 据此让 GPU 确认自己在与一个被证明的 CPU enclave 对话。它让 CPU TEE 和 GPU TEE 之间先建立经过身份验证的安全通道,再传输数据,从而保证两侧都是被证明的可信环境。【已确认】
四、核心问题与研究边界
本报告只回答一个核心问题:[[墨青:机密计算在哪些真实约束下把"信任"从组织转移到了硅片,又在哪些边界上失效?]] 边界限定为:(1) 聚焦硬件 TEE 路线,同态加密、安全多方计算、零知识证明等纯密码学路线只作对照,不作主论证;(2) 不讨论具体企业的商业财务穿透(对象为技术域而非单一公司);(3) 以 2026 年可量产/可云购的路线为成熟度锚,实验室原型仅作前瞻;(4) 安全论断以"特定威胁模型"为前件,凡脱离威胁模型的"绝对安全"表述一律视为越界。
五、为什么出现:数据"使用中"的防护空白
5.1 现象
传统安全覆盖两柱:静态(磁盘/数据库加密)与传输中(TLS)。但应用要算数据,就必须把明文放进 CPU 寄存器和内存——这一刻,恶意软件一次内存转储、一个内核漏洞、一个心怀不满的管理员,就能把明文整盘端走。数据在硬盘上加密得再好,在内存里以明文形式存在也毫无意义[[暖红:只加密静态与传输、放任使用中明文,是过去二十年绝大多数数据泄露的技术根因之一,而非合规疏忽。]]【已确认】。
5.2 因果链
为什么长期没人补这柱?因为"要算就必须在明文上算"是一条物理铁律——CPU 不能直接在密文上做任意运算。补这柱只有三条路:① 同态加密(在密文上算,但慢到不可用,仅限特定算子);② 安全多方计算(多方可疑协作,通信与编排成本高);③ 把一段可信的"干净房间"直接造进硅片,让明文只在那间屋里出现——即 TEE。前两条性能代价决定了它们只能用在窄场景,第三条靠硬件把开销压到可接受,才让"通用负载的数据使用中保护"成为商业现实【推断·中】。这正是 CCC 在 2019 年成立、各大芯片厂把 TEE 塞进服务器 CPU 的直接动因:这背后是云时代"敏感负载不敢上云"的商业化痛点已经大到不得不解,而非单纯出于学术兴趣。
5.3 读者向解读
理解机密计算的"为什么",关键在分清它处理的是"信任分配"问题,不是"加密"问题。企业不敢把敏感数据放上云,真正担心的是云那边有太多人能看见数据,加密数学是否够强在这里是次要问题。机密计算不承诺更强的加密数学,它承诺的是"把能看见数据的人,从几百个云员工缩减到零(除芯片厂外)"。这解释了为何它的主要买点是合规与数据主权,而非极致性能——它卖的是"技术可验证的信任",不是算得更快。
六、核心原理与技术架构
6.1 内存加密引擎的两条血脉
- AMD 线:SME(Secure Memory Encryption,整内存加密)→ SEV(加密 VM)→ SEV-ES(加密 CPU 寄存器状态)→ SEV-SNP(增加反向映射表 RMP 做完整性 + 防重映射攻击)。SEV-SNP 由独立的 AMD 安全处理器(ARM 核)托管密钥,是一台"硬件协处理器做隔离"的路线【已确认】。
- Intel 线:MKTME(多密钥内存加密)→ SGX(进程 enclave)→ TDX(新增 SEAM CPU 模式 + TDX Module,隔离整台"Trust Domain"虚拟机)。TDX 的隔离由 Intel 签名的 TDX Module(microcode 层)实现,TCB 含这段不透明固件【已确认】。
- ARM CCA:引入 Realm 世界(Realm World)与 Realm Management Extension(RME),由可形式化验证的 RMM(Realm Manager)做 TCB,刻意区别于 Intel/AMD 的"不透明微码黑箱",试图在架构层解决"不可验证的信任根"问题【推断·中】。
6.2 一条 TEE 的三层骨架
- 隔离层(Rail 1:机密性 + 完整性):内存加密引擎把 CVM 的 DRAM 内容加密,寄存器状态亦受保护;完整性通过 RMP(SEV)或 Merkle 树(TDX)保证未被篡改【已确认】。
- 度量与证明层(Rail 2:Measurement + Attestation):启动是一条从 HRoT 锚定的度量链(PCR 累积哈希),最终生成一份"Quote"——由芯片密钥签名的环境度量。验证方据此判断"这到底是不是一个干净的、预期的 TEE"【已确认】。
- 密钥释放层:只有证明通过后,依赖方(如密钥库)才释放包装过的密钥或数据。这两条轨道缺一都不是真正的 CVM:只有 Rail 1 的叫"内存加密产品",只有 Rail 2 的叫"度量系统",二者齐备才叫机密虚拟机[[墨青:任何只卖"加密"不卖"可验证证明"的所谓机密基础设施,都是只交付了一半产品。]]【已确认】
6.3 远程证明的数据流(以 Azure Passport 模型为例)
- CVM 内 in-guest agent 采集证据(SNP_REPORT 或 TD Quote,外加 vTPM quote)【已确认】。
- 证据直送验证服务(如 Azure Attestation,即 Verifier),按客户编写的策略校验【已确认】。
- 验证服务返回一张签名的 JWT(Attestation Result)【已确认】。
- CVM 持 JWT 向依赖方(如 Azure Key Vault)请求,Key Vault 据 JWT 中的声明释放包装密钥,而非据原始 SNP 证据决策——这就是 RATS 的 Passport 模型(RFC 9334 §5.1)【已确认】。
读者向解读:这套流程的意义在于把"我信你"变成"我先验证再信你"。没有它,机密计算只是把数据锁起来,却无法向数据主人证明"锁的是我、没被调包"。证明链是机密计算区别于普通加密的关键环节——这也是为什么 TEE.fail 专挑证明密钥下手:它不破解加密,伪造的是"我是干净 TEE"的那张通行证。谁能签发这张通行证(芯片厂),谁就处在整个信任链的顶端,这也意味着"去信任"的尽头仍是"信任芯片厂"。
七、主流硬件架构对比(真实购买维度)
下表按企业真实选型会考量的维度横向比较五条路线。
| 维度 | Intel SGX | Intel TDX | AMD SEV-SNP | ARM CCA | NVIDIA GPU TEE |
|---|---|---|---|---|---|
| 隔离粒度 | 进程/函数级 | VM 级(Trust Domain) | VM 级 | VM 级(Realm) | GPU 级(须配 CPU TEE) |
| 免改造迁移 | 否(须重构) | 是 | 是 | 是 | 是(CUDA 无需改) |
| 大负载开销 | 15%–57% | ~9%(小负载可达 73%) | ~29%(小负载 67%) | 低(虚拟化设计) | <7% 端到端 |
| TCB 性质 | 最小(App+CPU) | 大(含 TDX Module) | 大(含 PSP 固件) | 大(含 RMM,可验证) | 须叠加 CPU TEE |
| 成熟度 | Mature(服务端) | Early Production | Mature 云上 | Prototype→Early | Early Production |
| 主要云可得 | 渐退 | Azure/GCP | Azure/GCP/AWS/OCI | 边缘为主 | Azure/GCP/AWS/OCI |
| 已知软肋 | 侧信道密集 | TEE.fail 总线侧信道 | TEE.fail 总线侧信道 | 研究较少 | 单 GPU、闭源 CUDA 路径 |
[[墨青:选型取决于威胁模型与负载形状,而非单纯比较"谁最强":要最小 TCB 且愿重构选 SGX 残余场景;要无改造上云选 TDX/SEV-SNP;要在 GPU 上保护模型权重与提示词则只能走 NVIDIA GPU TEE,但它的安全性取决于配对的 CPU TEE。]]【推断·中】
读者向解读:这张表最该被记住的是"没有免费午餐",而非那些数字。SGX 的 TCB 最小、隔离最细,代价是应用必须重写、开销可能数倍;CVM 的"无改造"是用"更大的 TCB(整台 OS 都进可信区)"换来的。企业常误以为"上 CVM 最省事",却忽略了 TCB 变大意味着要信任整段 guest OS 与更多固件——安全不只是"开个开关",它把风险从一处挪到另一处,并要确认挪过去的那处你本来就更不怕。
八、与相邻技术的差异(为什么是 TEE 而非别的)
- 静态/传输加密(磁盘加密、TLS):只覆盖数据不在算的时刻,对使用中明文暴露无能为力【常识】。
- HSM / TPM:提供"专用密码保险箱 + 度量根",但不承担通用计算;TEE 在通用 CPU 上提供隔离区,二者互补(TPM 常为 TEE 提供 HRoT)而非相互替代【已确认】。
- 同态加密(FHE):能在密文上算,但通用负载慢 3–5 个数量级,仅适合窄算子;TEE 以硬件隔离换接近原生的性能,代价是信任硬件而非纯数学【推断·中】。
- 零知识证明(ZKP):证明"我知道某秘密且它满足性质"而不泄露秘密,适合验证场景,不适合"我要用秘密算出结果";TEE 适合后者【常识】。
- 安全启动 / 度量启动:只保证"启动的是预期固件",不保证"运行时内存中的明文不被读";TEE 补的是运行时那一环【已确认】。
九、端到端技术工作链(E2E 一):一次机密 AI 推理闭环
下面复原一条真实可部署的链路(用户在机密 GPU VM 上跑私有模型推理),覆盖触发→参与者→输入→步骤→数据/系统→输出→异常:
- 触发:用户要上传含 PII/商业机密的提示词并调用一个专有模型。
- 参与者:客户端、前端负载均衡(不可信)、机密 CVM(含 CPU TEE + GPU TEE)、验证服务、密钥/模型库。
- 输入:客户端用 TEE 公钥加密提示词;模型权重以加密形态下发。
- 步骤/状态:① CVM 启动,从 HRoT 起度量链;② 向验证服务出 Quote;③ 验证通过,密钥库释放解密密钥;④ CVM 内解密提示词与权重;⑤ 推理在 GPU TEE 内执行(CPU?GPU 走加密/SPDM 通道);⑥ 结果在 TEE 内加密后送出。
- 数据/系统:AES-XTS 内存加密、vTPM、TDX Module 或 SEV-SNP PSP、NVIDIA attestation service、Azure Attestation / Intel Trust Authority。
- 资源/成本:按 vCPU/内存/GPU 时长云计费,机密实例溢价 5%–15%(见第十六节量化)【推断·中】。
- 输出:仅加密结果离开边界,明文全程不落外部内存。
- 异常/补偿:若 Quote 验证失败,密钥库拒绝释放,推理不发生;若运行中 CVM 被篡改,度量链在下次证明时失配,依赖方撤销信任。
[[墨青:这条链的可靠性不取决于最强的那环,而取决于最弱的环——GPU TEE 的安全性完全依赖配对的 CPU TEE,CPU TEE 又被 TEE.fail 式的物理攻击威胁,因此"端到端机密"的真实强度是这几层的最小值。]]【已确认】
读者向解读:这条链揭示机密 AI 落地最反直觉的一点——你以为保护模型的是 GPU,其实 GPU 的安全是建立在 CPU 那一侧的 TEE 之上的。NVIDIA 的设计要求 GPU TEE 必须先和一个被证明的 CPU enclave 通过 SPDM 完成身份验证,才允许工作。这意味着"两道锁"里,CPU 那道一旦被 TEE.fail 这类物理攻击击穿,GPU 这道也跟着失效。企业做机密 AI 架构时,若只盯着 GPU 型号而忽视底层 CPU TEE 的威胁模型,等于把全部信任压在了最薄弱的那一环上。
十、E2E 二:多方数据协作(两家银行联合反欺诈而不互曝数据)
- 触发:监管要求银行协作识别跨行重复融资欺诈,但任何一家都不愿(也 legally 不能)把客户信贷数据交给对方。
- 参与者:银行 A、银行 B、一个中立的机密计算节点(运行在 CVM 上)、验证服务。
- 输入:两家银行各自加密的客户标识/申请特征,仅解密在 TEE 内。
- 步骤:① 节点启动并出 Quote,双方验证;② 双方密钥库释放解密密钥;③ TEE 内做交集比对/重复申请识别;④ 仅输出"是否存在跨行重复申请"的二元/聚合结论,原始数据不出 TEE。
- 数据/系统:CVM + 远程证明 + 密钥绑定;这是 MonetaGo 在反重复融资欺诈中的真实模式(基于 AMD SEV 与 Azure/GCP)【已确认】。
- 输出:聚合判断或加密的匹配记录,原始明细永不离开各自银行与 TEE。
[[墨青:多方协作是机密计算区别于 FHE/MPC 的杀手锏场景——它用"硬件隔离 + 可验证"替代"复杂密码协议",把跨机构数据协作的工程量从密码学难题降到"跑一个被证明的 VM"。]]【推断·中】
十一、机密 AI 前沿:GPU TEE 与两道信任边界
11.1 为什么 CPU TEE 不够
CPU-only 的 CVM 无法保护 AI:模型权重与激活值要送到 GPU 算,跨 PCIe 总线必以明文出现,能被不信任的 hypervisor 截获,机密边界瞬间破功。NVIDIA 的解法是让 GPU 自身成为 TEE——片上硬件信任根、安全启动(固件须 NVIDIA 签名)、度量、attestation report(含模型代码哈希、固件版本)【已确认】。
11.2 两道锁的依赖关系
H100 机密模式要求 GPU 所在的 VM 本身跑在 CPU TEE(TDX 或 SEV-SNP)里;GPU 通过 SPDM 确认自己在与被证明的 CPU enclave 对话后,才生成可由 NVIDIA 公开证明服务核验的 Quote。CUDA 运行时须运行在 CPU TEE 内【已确认】。安全是"CPU 锁 + GPU 锁"的最小项。
11.3 残余泄露(Gu et al., arXiv:2507.02770,负责任披露)
独立安全分析发现 H100 实现中:GSP RPC 通道的元数据(队列读写指针、命令标识符)以明文留在共享内存,可被观测、重排、重放;批量 DMA 的传输耗时随数据量可见,形成"传了多少"的时序信道;故障通知指针经 BAR0 暴露;SEC2 命令队列结构未加密;内存擦除指令完整性保护但不保密。这些多属元数据/侧信道,未破批量数据机密性,但侵蚀了完整性与可观测性保证的边际【已确认】。
11.4 工程现实与边界
- 性能:端到端开销通常 <7%,计算密集型近 0%;最大模型(如 70B)因计算密集几乎无感,最小模型/低批/频繁换模开销最高(Phala 基准与厂商外来源)【推断·中】。
- 多 GPU 受限:首代 H100 GPU-CC 仅支持单 GPU 透传进 CVM;NVLink 多 GPU 机密化在更新文档中但可用性落后;前沿训练的数百/数千卡集群级机密化至少还要一代产品【已确认】。
- 闭源:CUDA 运行时与用户态驱动闭源,内核启动与批量数据传输的实际保护只能推断、无法独立验证——这是可信计算里"须信任厂商正确性"的典型张力【已确认】。
- TDISP 未收敛:GPU-CC 早于且绕过了 PCI-SIG 的 TDISP 标准,用自家 SPDM 握手;未来随 TDX/SEV-TIO 成熟才可能收敛【已确认】。
读者向解读:机密 AI 是机密计算当前最前沿、也最容易被过度承诺的方向。它的真实状态是"单卡推理可用、多卡训练不可用、CUDA 路径须盲信厂商"。对想保护模型 IP 与提示词隐私的企业,2026 年它已是可落地的 Early Production 选项;但对想"在机密环境里训练 frontier 模型"的诉求,它还差一代。把这两件事混为一谈,是当下最普遍的夸大。
十二、国内外厂商、开源项目与标准
12.1 国际
- 芯片:Intel(SGX/TDX/Trust Authority)、AMD(SEV-SNP)、ARM(CCA)、NVIDIA(Hopper/Blackwell GPU TEE)【已确认】。
- 云:Azure(DCasv5/ECasv5/DCesv5/ECesv5、机密容器 AKS、Confidential Ledger/CCF、Always Encrypted、Azure Attestation)、GCP(Confidential VMs、Confidential Space、Vertex AI Confidential Training、BigQuery 机密)、AWS(Nitro Enclaves、SEV-SNP 实例、KMS 证明绑定,无 EC2 TDX)【已确认】。
- 软件/开源:Fortanix、Anjuna Seaglass(lift-and-shift 入 TEE)、Edgeless Marblerun(机密服务网格)、CNCF Confidential Containers(CoCo)、Gramine/Occlum/EGo(enclave 运行时)【已确认】。
- 标准:IETF RFC 9334(RATS)、CCC 白皮书与威胁模型、ANSSI 2025-10 技术立场文件(收紧 CSP 对 TEE 残余风险的预期)【已确认】。
12.2 中国 / 信创
- 云与平台:阿里云 ECS 支持 Intel SGX、神龙 Enclave、Intel TDX 机密虚拟机、CPU/GPU 异构机密计算,联合龙蜥社区推机密容器参考架构;腾讯云 T-Sec 机密计算平台(端到端保护);华为擎天 Enclave + secGear(统一 SGX/TDX/CCA 的开源框架);华为云机密计算【已确认】。
- 国产芯片 TEE:华为鲲鹏 iTrustee + 蓬莱 TEE、飞腾 PhyTEE、海光 Hygon-CSV、兆芯 ZX-TCT【已确认】。
- 开源与框架:蚂蚁"隐语"开源机密计算框架、密态计算体系与"隐语云"(目标"密态计算成本低于数据流通价值的 5%");南科大 + 蚂蚁"星绽"操作系统(Rust 编写)替代 Linux 作机密 VM 安全 OS,与字节合作改进 WASM 线性内存以契合机密计算【已确认】。
- 行业落地:工行分布式机密计算、内生密码服务、可信数据流通、大模型推理;字节火山引擎 JeddakAICC(守护蔚来座舱数据、联想可信个人云);国金认证已开展金融信创机密计算符合性测评,飞腾、华为首批通过【已确认】。
- 标准:国家标准《机密计算通用框架》发布待实施;GCC 两项团体标准 2025-11 发布;远程证明、侧信道防御、安全性测评仍缺官方标准体系【已确认】。
读者向解读:中国的路线与全球同构——自研芯片 TEE + 云机密实例 + 开源框架 + 金融/政务先行落地,差异点在于信创语境下"自主可控的硬件信任根"被提到了更高的战略位置,因为 PCK 这类签发密钥若锚在海外芯片厂,数据主权的"可验证"在极端地缘政治下仍受制约。国产 TEE 的价值不只是性能,更是把信任根留在境内——这是信创版机密计算区别于"在海外芯片上跑机密 VM"的本质。
十三、真实案例与失败
13.1 生产级正面案例(证明它确实能用)
- Apple Private Cloud Compute(PCC):2024-06 随 Apple Intelligence 发布,把 LLM 推理跑在自研芯片服务器的 TEE 上,五项要求之一是"可验证透明"——公开每个生产构建镜像供研究者核验运行软件与源码一致,是云之外最大规模 TEE 化 ML 部署之一【已确认】。
- Anthropic Confidential Inference(2025-06):选定 Claude 客户在 SEV-SNP/TDX 机密 VM + H100/H200 GPU(CC 模式)内推理,最小"模型加载器"在 TEE 内、证明后才解密权重,对照 RAND 安全等级 SL4/SL5【已确认】。
- 工行 / 蚂蚁 / 字节 / MonetaGo:金融与互联网头部已将机密计算用于分布式机密计算、大模型推理、座舱与个人信息保护、跨行反欺诈,说明该技术已从 PoC 进入生产辅助【已确认】。
13.2 失败与攻击案例(证明边界是真的)
- Foreshadow / L1TF(2018):利用瞬态乱序执行 bug,从 SGX 缓存中泄露明文密钥,甚至伪造本地与远程证明响应,影响数百万设备【已确认】。
- Plundervolt(2019):通过操控 CPU 电压在 SGX 内注入故障,几分钟恢复 128 位 AES 密钥,首次直接违反 SGX 的完整性保证【已确认】。
- SGAxe / LVI(2020):SGAxe 从 SGX 抽取证明密钥,LVI 利用加载值注入绕过 enclave 边界【已确认】。
- 瞬态执行攻击族(Spectre/Meltdown/RIDL/ZombieLoad/MDS):利用推测执行在 CPU 缓存/缓冲留下的痕迹跨安全边界泄露;Foreshadow 是其 SGX 特例。云厂商普遍打补丁,但新变体仍在被发现,本质是"性能优化"与"侧信道"的永恒博弈【已确认】。
- 缓存定时攻击:Schwarz 等用缓存攻击攻破基于 SGX 的 RSA 实现,半同步攻击即可恢复 RSA 私钥约 96%;说明"只防住加密、漏掉计时"仍会失守【已确认】。
- TEE.fail(2025):前述不到 1000 美元 DDR5 总线拦截,提取 PCK、伪造 TDX/SGX 证明、在启用密文隐藏的 SEV-SNP 上抽取 OpenSSL ECDSA 工作负载密钥,并借用合法 GPU 证明让非 TEE 负载冒充受保护;影响 BuilderNet(以太坊区块构建)、Secret Network、Phala DSTACK 等真实系统。厂商 2025 年 4–8 月陆续获知;AMD 明确不修补(物理可达在其威胁模型外)【已确认】。
读者向解读:这些失败共同说明一件事——TEE 每一次"被攻破",被突破的是"威胁模型假设",不是加密数学。芯片厂假设"没人能碰到主板、物理安全由机房负责",TEE.fail 把这个假设变成只需约 1000 美元就能推翻的事实;Spectre 族攻击戳破的是"硬件能完美执行软件设定的安全边界"这一假设。这不代表机密计算是骗局,它要求落地时把"物理可达"和"芯片厂密钥"明确写进风险登记册,不能只写在白皮书脚注里。安全机制的价值在于对抗明确的威胁,不预设一个全能攻击者。
十四、企业落地参考架构、成本结构与迁移决策树
14.1 三类参考架构
- 云上合规型:机密 CVM(TDX 或 SEV-SNP)+ 云密钥库(HSM 托管根)+ 云验证服务 + 机密容器(CoCo)承载微服务;密钥只在证明通过后释放【推断·中】。
- 数据主权型(跨境):机密 CVM 置于目标司法区,依赖方用 Passport 模型验证后再下发数据,使"数据不出境"变成可验证事实而非承诺【推断·中】。
- 机密 AI 型:CPU TEE 机密 VM + GPU TEE,模型权重加密下发、TEE 内解密推理,前端用 Attested Oblivious HTTP 让不可信前端也读不到负载【推断·中】。
14.2 成本结构(公开可查的 SMB 口径)
Unicorne 公布的参考估算:AWS Nitro Enclaves 方案(m6i.xlarge 4 vCPU/16GB)约 250 美元/月 + 外部密钥库 1 美元/键;Azure SEV-SNP 机密 VM(DC4as_v5)约 300 美元/月 + 托管 HSM 约 1400 美元/月(多应用分摊)【推断·中】。注意托管 HSM 的"共享分摊"使单应用边际成本远低于标价。机密实例的计算溢价主要来自内存加密开销(见第十六节),而非授权费本身——多数云对机密 VM 不单独收"机密税",溢价体现在需多购约 5%–15% 算力以抵消开销。
14.3 迁移决策树(分析框架)
- 负载是否含高敏数据且当前因"不可信基础设施"不敢上云?否→常规加密即可,不必上 TEE。
- 能否接受应用重构?否→选 VM 级 CVM(TDX/SEV-SNP),免改造;是且要最小 TCB→评估 SGX 残余场景。
- 是否要保护 GPU 上的模型/提示?是→NVIDIA GPU TEE(接受单 GPU 上限与闭源 CUDA 路径);否→仅 CPU CVM。
- 威胁模型是否含"物理可达"(边缘/共享机房)?是→必须在机密计算之外叠加物理安全与多方可疑计算兜底,TEE 单用不充分。
- 是否要求信任根境内可控(信创)?是→优先国产芯片 TEE + 本地证明链闭环。
[[墨青:决策树的第一问才是关键——机密计算没有"该不该用"的默认答案,它取决于"你的敌人到底是谁";把 TEE 当作默认必选项,等于为并不存在的威胁付出成本,却可能漏掉真正的风险。]]【推断·中】
十五、成熟度评估矩阵
| 技术/形态 | 阶段 | 判断依据 |
|---|---|---|
| SGX(进程 enclave) | Mature(战略收缩) | 2015 量产、研究充分、客户端退场【已确认】 |
| SEV-SNP 机密 VM | Mature(云上规模化) | Milan 起、主流云通用【已确认】 |
| TDX 机密 VM | Early Production | 2023 起、2026 初 Azure GA、GCP 扩区【已确认】 |
| ARM CCA Realm | Prototype→Early | 2021 底发布、边缘/云探索【推断·中】 |
| NVIDIA GPU TEE | Early Production | H100 起、Blackwell 扩展、单 GPU 受限【已确认】 |
| 机密容器(CoCo) | Early Production | CNCF 沙箱、多 TEE 后端【推断·中】 |
| 机密 AI 推理(端到端) | Early Production(新兴) | Anthropic/Apple/云厂落地但多 GPU 受限【推断·中】 |
[[墨青:机密计算整体已越过"研究/原型",进入 Early Production 规模化,但"机密 + 多 GPU 大模型训练"仍卡在单 GPU 这一代, frontier 训练的数百/数千卡集群级机密化至少还要一代产品。]]【推断·中】
十六、PoC → Production:性能 / 成本 / 可靠性 / 安全 / 可维护 / 人才 / 迁移 / 锁定 / 失败模式
- 性能:VM 级路线把开销压到个位数至 15%,但 SGX 小负载仍可能数倍减速;GPU TEE 端到端 <7%,计算密集型近零。瓶颈从"计算"转移到"加密 PCIe I/O 与证明延迟"【计算·高】。
- 成本:主要来自为抵消开销多购的算力(5%–15%)与托管 HSM/验证服务的固定成本,而非"机密税"本身【推断·中】。
- 可靠性:证明链是新的故障点——验证服务不可用或被策略误配,会导致密钥无法释放、服务整体停摆,需做依赖方降级与多验证源【推断·中】。
- 安全:TEE.fail 与侧信道证明"物理可达 + 芯片厂密钥"仍是未被消除的风险;GPU TEE 的 CUDA 路径闭源,独立审计只能推断不能验证【已确认】。
- 可维护性:机密 VM 内出 bug 难以用常规调试器 attach(内存加密),排障必须借助 in-TEE 日志与度量,运维范式改变【推断·中】。
- 人才:掌握 TEE + 证明 + 密钥编排的工程师稀缺,Leidos 案例显示一人约 3.5 人月安全工程投入才能达到可部署【推断·中】。
- 迁移:VM 级 CVM 主打"无改造",这是它取代 SGX 的核心卖点;但旧系统若依赖内核模块或特定驱动,仍可能须在 TEE 内重签与重测【已确认】。
- 锁定:选了 TDX 就被英特尔 + 特定云绑定,选了 SEV-SNP 绑定 AMD;跨云可移植靠 CoCo/Gramine 等抽象层,但未完全消除【推断·中】。
- 失败模式(小结):物理总线侧信道、证明密钥泄露、GPU 与 CPU TEE 的信任依赖、单 GPU 上限、闭源审计缺口、HSM/验证服务可用性单点。
十七、量化骨架(5 项有解释价值的计算)
计算 1|开销 → 算力溢价(针对 SEV-SNP 大负载 ~7% 开销) 要保持与原生相同的墙钟吞吐,需多购算力:溢价 ≈ 1/(1?0.07) ? 1 ≈ [[金棕:7.5%]]。若内存密集型取 15%,溢价 ≈ 17.6%【计算·高】。解释:内存加密是"边算边加解密",CPU 多做了活,等效算力被稀释,企业须以更多 vCPU 还债。
计算 2|开销 → 机队规模膨胀 一个 1000 台服务器的机队,在 7% 开销下要维持同等有效算力,需 1000/0.93 ≈ 1075 台,即多出约 75 台等效资本开支与能耗【计算·高】。解释:机密化的隐性 capex 来自为加密"腾出的余量",不是来自授权费用。
计算 3|SGX 与 CVM 的减速比(小负载) SGX 小负载减速 283%–1971% ≡ 运行时间变为原生的 3.83–20.7 倍;CVM(TDX/SEV-SNP)小负载 67%–73% ≡ 1.67–1.73 倍。二者相差一个数量级以上,这正是产业从进程 enclave 转向 VM 隔离的根本经济动因【计算·高】。
计算 4|市场 CAGR 自洽校验 Future Market Insights 估 89 亿(2025)→ 831 亿(2035):89 × 1.25^10 ≈ 89 × 9.31 ≈ 828 亿,与 831 亿自洽,CAGR 25% 内部一致【计算·高】。解释:该机构数字在自身口径内自洽,但与其他机构(122.8→549 亿 @34.7%)差距巨大,说明"机密计算"定义边界未统一,引用时务必声明口径。
计算 5|TEE.fail 的攻防不对称性 攻击设备成本 <1000 美元,却可提取一台服务器的 PCK,进而对同型号整批机伪造证明。假设单台机密服务器的受保护资产(密钥、模型、PII)期望损失为 L,则"每千美元攻击成本可撬动的潜在损失"为 L 的量级,且可被复制至多台——这解释了为何虽需物理可达,仍属"高影响、低门槛"而非"仅理论"【推断·中】。进一步的三年 TCO 视角:对一个 1000 台、单价等效 5 万美元的机队,为抵消 7% 开销多购 75 台 ≈ 375 万美元 capex,加上 HSM/验证年费,三年总机密化增量成本与一次 PCK 泄露导致的合规/资产损失可同量级,说明"物理可达威胁"在金融/国防高敏场景必须单列预算对冲【推断·中】。
十八、反例与 Red Team(≥5)
- "机密计算 = 绝对安全"反例:TEE.fail 直接证伪"可验证即可信"的绝对化叙事——伪造证明能通过官方 UpToDate 验证【已确认】。
- "上 TEE 就合规"反例:合规要求的是"威胁模型匹配"。边缘节点、共享机房中物理可达门槛低,TEE 的承诺在这些场景部分失效,照搬云中心方案会漏掉物理侧信道这一维【推断·中】。
- "机密 AI 已成熟"反例:当前 GPU TEE 仅单 GPU、CUDA 路径闭源、多卡训练不支持,宣称"frontier 训练全链路机密"在 2026 年属过度承诺【已确认】。
- "减少信任 = 消灭信任"反例:信任只是从云管理员转移到了芯片厂与物理机房;PCK 泄露把信任重新集中到芯片厂这一单点,并非去中心化【已确认】。
- "性能可接受所以无代价"反例:<7% GPU 开销掩盖了 PCIe 加密 I/O 与证明延迟,小模型/低批/频繁换模的负载上开销陡增,且证明服务不可用会成为新单点【推断·中】。
- "国产 TEE 等同自主可控"反例:若国产芯片的度量根与证明体系仍依赖境外标准或组件,数据主权的"可验证"在极端地缘下仍受制约,自主可控须落到信任根与证明链的本地闭环【推断·中】。
- "同态加密会被 TEE 取代"反例:TEE 靠信任硬件换性能,FHE 靠纯数学保不信任任何硬件,二者威胁模型不同,FHE 在"完全不可信对方硬件"场景仍是 TEE 不可替代的补充【推断·中】。
- "机密容器消灭了主机风险"反例:CoCo 把 TCB 从整节点缩到 Pod,但宿主内核中仍有部分组件在 TEE 外、且容器运行时与证明代理本身须被审计,缩小的 TCB 不等于零 TCB【推断·中】。
反方(为什么它不是安全戏剧):caution.co 的公允评估指出,TEE.fail 并未证明远程攻击者、恶意 hypervisor 或云管理员能直接读内存——它去掉的是"云侧软件与运营商"这一大敌,物理攻击是另一威胁模型。称整个领域为"security theatre"是以完美否定"显著更安全",正如 TLS 不会因端点被攻破而沦为戏剧【已确认】。正确结论:机密计算把"必须信任的对象"大幅压缩,TEE.fail 提醒我们"物理可达与芯片厂"仍在那个被压缩后的集合里。
十九、决策含义
- 对 CISO / 合规官:把机密计算纳入"不可信基础设施上处理敏感数据"的标准解,而非仅作加密增强;选型时把"威胁模型是否含物理可达"作为一票否决或加层条件【推断·中】。
- 对架构师:优先 VM 级 CVM(TDX/SEV-SNP)实现无改造迁移;机密 AI 选 GPU TEE 但接受单 GPU 上限;用 CoCo 等抽象降低云/芯片锁定【推断·中】。
- 对采购:评估总拥有成本时计入 5%–15% 算力溢价与 HSM/验证固定成本,而非被"无机密税"话术误导【计算·高】。
- 对国央企 / 信创负责人:自主 TEE 的战略价值在"信任根与证明链本地闭环",选型应把"密钥与度量根是否境内可控"列为硬指标【推断·中】。
- 对投资者 / 行研:市场数字口径混乱,按区间与定义边界引用;真正拐点是"机密 AI 推理"从 Early Production 走向 Mature,以及多 GPU 机密化那一代产品【推断·中】。
二十、Knowledge Update(5 条)
- [[墨青:机密计算已分代——进程级 SGX 因重构成本与极端开销被 VM 级 TDX/SEV-SNP/CCA 取代,GPU TEE 是生成式 AI 拉动的新增长极;选型由威胁模型与负载形状决定而非"谁最强"。]][【已确认】]
- [[墨青:机密计算的关键环节是远程证明链(Rail 2);任何只卖内存加密不卖可验证证明的"机密"产品只交付了一半。]][【已确认】]
- [[暖红:TEE.fail(2025)用 <1000 美元 DDR5 总线拦截提取 PCK 并伪造证明,暴露"确定性 AES-XTS + 物理可达"这一被厂商置于威胁模型外的裂缝,AMD 明确不修补。]][【已确认】]
- [[墨青:机密计算把信任从云管理员/ hypervisor 压缩到"硅片 + 芯片厂 + 物理机房",是"减少须信任对象"而非"消灭攻击面"——落地必须把物理可达与芯片厂密钥写进风险登记册。]][【推断·中】]
- [[墨青:中国路线与全球同构但"自主可控硬件信任根"战略权重更高;国产 TEE 的真正价值在把信任根与证明链留在境内,而非仅性能。]][【推断·中】]
- [[墨青:机密 AI 当前状态是"单卡推理可用、多卡训练不可用、CUDA 路径须盲信厂商";把二者混为一谈是当下最普遍的夸大,frontier 训练级机密化至少还要一代产品。]][【推断·中】]
二十一、威胁模型博弈:被厂商外推的物理层与"谁来证明证明者"
21.1 三段威胁模型的错配
机密计算的信任承诺写在白皮书里,威胁模型却藏在脚注里。CCC 的技术分析把"总线监听"列为应考虑的基础物理攻击之一,但明确排除芯片刮削、电子显微镜等更侵入的手段;而英特尔与 AMD 则把"物理层拦截"整体推到威胁模型之外,建议用户用机房物理安全兜底[[暖红:同一项技术,"用户合理以为被保护"与"厂商实际承诺保护"之间存在未被言明的裂缝,TEE.fail 正是撞在这条裂缝上。]]【已确认】。这意味着:当工作负载跑在管控严密的超大规模数据中心,物理可达门槛高,裂缝可忽略;一旦落到边缘节点、共享机房、或可被内鬼触碰的主板,这条裂缝就变成直通后门的洞。
21.2 "谁来证明证明者":PCK 与信任的供应链
TEE 的信任最终锚在出厂烧录的签发密钥——英特尔的 PCK(Provisioning Certification Key)。PCK 一旦被提取(TEE.fail 做到),伪造的证明在密码学上与真证明无异,整个机器的"被证明身份"可被大规模复制。信任因此没有被消灭,只是被集中到了芯片厂这一单点,再经由"依赖方信任验证服务、验证服务信任厂商背书"的链条层层下放[[墨青:机密计算常被包装成"零信任",但它的终点仍是"信任芯片厂 + 信任物理机房"——零信任的叙事在信任链顶端悄悄断了。]]【已确认】。
读者向解读:理解威胁模型博弈,是把机密计算从"营销话术"拉回"工程现实"的关键一步。它提醒决策者:评估一项机密计算方案,不能只看"是否支持 TEE",更要追问"威胁模型假设了谁不可达、谁可被信任",并把这些假设逐项与你真实的部署环境对齐。一份在云数据中心成立的安全承诺,搬到边缘可能只剩一半效力——差别来自威胁模型是否还成立,与技术本身无关。
二十二、工程化防御:在实际落地中对抗 TEE.fail 与侧信道
[[墨青:面对已暴露的物理侧信道与证明密钥风险,正确姿态是把它当作纵深防御中的一层,不要弃用,并用架构手段消除"单 enclave 单点"与"物理可达"两类真实风险。]]【推断·中】
- 物理层兜底:把内存总线视为高价值攻击面,对边缘/共享机房场景施加物理访问控制、机箱完整性监测、异常 riser/驱动检测;这是把厂商外推的威胁重新接回责任链【推断·中】。
- 分片密钥 / 多方计算:让关键密钥材料永不单独落在一个 enclave 内(split-key 或 MPC),即使某一 enclave 被提钥,得到的也只是碎片,无法单独还原——直接抵消 TEE.fail 的"单点提钥"收益【推断·中】。
- 证明新鲜度与行为监测:用 nonce/epoch 保证证明新鲜、防重放;同时监控异常内核驱动安装、未授权 riser 硬件、机箱开盖事件,把物理攻击从"无声"变"可告警"【已确认】。
- 最小可信 CVM 镜像:GPU-CC 的安全性建立在配对的 CPU TEE 之上,而 CVM 镜像本身的加固(最小内核、无多余服务、度量启动)与 GPU-CC 同样重要——最弱的一环往往是那个被忽略的 guest OS,而非 GPU【已确认】。
- 纵深而非单点:TEE 是其中一层,须与网络分段、HSM、审计、应用层加密组合;任何"上了 TEE 就高枕无忧"的架构都是对 TEE.fail 的误读【推断·中】。
读者向解读:工程化防御的核心,是把"减少须信任对象"的思路贯彻到底——不仅减少云侧的信任,也通过分片与监测缩小"芯片厂密钥"和"物理可达者"这两个残留信任点的破坏范围。这恰恰是机密计算最成熟的使用方式:把它作为一道能显著降低攻击成功率的防线,再配合传统的访问控制、加密与审计,不应把它当成万无一失的护盾。
二十三、未来 3–5 年可证伪的技术与产业判断
周六前沿深研的硬要求之一,是对未来三到五年给出可被事实推翻的判断,而非方向性口号。下列六条每条附带证伪条件:
- GPU TEE 多卡机密化将在 2027–2028 一代产品落地。NVIDIA 已暗示在后续代际加入多 GPU 机密支持;证伪条件:至 2028 年末仍仅单 GPU 透传、无 NVLink 机密化 GA【推断·中】。
- PCI-SIG TDISP 将逐步收敛 GPU/设备机密 I/O,NVIDIA 从自家 SPDM 向 TDISP 迁移,跨厂商设备机密分配互通;证伪条件:2029 年仍各自为政、无跨厂商 TDISP 互通【推断·中】。
- 市场口径将在 2027 前后因定义对齐而收敛,出现单一权威规模估计;证伪条件:2028 年仍存在"89 亿"与"1158 亿"量级的分裂估计且无人对齐"机密计算"边界【推断·中】。
- 国产 TEE 将在金融信创与政务场景形成境内闭环证明链(鲲鹏/飞腾/海光/兆芯 + secGear/星绽 + 本地度量根);证伪条件:至 2028 年国产芯片机密 VM 仍依赖境外度量根或证明服务【推断·中】。
- 物理侧信道将倒逼 AMD/Intel 在后续代际引入总线层完整性/重放保护,而非仅归为"物理安全";证伪条件:2028 年主流 CVM 仍仅 AES-XTS、无总线层完整性机制【推断·中】。
- 机密 AI 推理将在 2027 成为受监管金融/医疗推理的默认配置(而非可选增强);证伪条件:2027 年监管未将其列为受监管 AI 推理的强制项【推断·中】。
读者向解读:这六条判断的共同前提是"威胁模型明确化"——技术会进步,但进步的方向是填补已暴露的裂缝:物理层、多卡、证明链本地化、设备 I/O 收敛。对产业而言,机密计算的真正拐点不在"能不能用"(2026 年已能用),而在"监管是否把它从可选项变成强制项"——一旦金融/医疗的受监管 AI 推理强制要求"使用中保护",市场口径的混乱会随之被强制对齐,这正是判断 3 与判断 6 的联动逻辑。
二十五、机密计算在中国数据要素市场中的角色(信创 × 密态计算)
中国把数据列为第五类生产要素,"数据二十条"与"数据要素 x"行动推动跨域流通,但流通的前提是"可用不可见"——数据被使用却不暴露明文。机密计算正是密态计算体系的关键支撑技术之一。蚂蚁自 2016 年起布局隐私计算,2024 年成立浙江蚂蚁密算科技,公布密态计算技术体系与"隐语云"系列,并宣称目标"密态计算成本低于数据流通价值的 5%"——这一成本阈值其称已在金融领域达成;杭州据此建成全国首个密态计算中心,"农户秒贷"入选国家数据局首批"数据要素 x"金融典型案例【已确认】。机密计算在其中的角色是:让数据在跨云跨端处理时,明文只出现在被证明的 TEE 内,使"数据不出域、可用不可见"从政策语言变成可验证架构[[墨青:在中国的落地逻辑里,机密计算是"数据要素市场化"与"信创自主可控"两条国家战略的交汇技术支点,而非"更结实的锁"。]]【推断·中】。
读者向解读:对中国市场,机密计算的价值叙事与全球不同——它既是安全控制,也构成数据要素市场化与信创自主可控的交汇点。这意味着国产 TEE 的采购逻辑看重"信任根是否境内可控",而不只是"比 Intel/AMD 更便宜更快"。低估这一层,会误判国产路线的真实驱动力与长期投入的必然性:即使国产芯片 TEE 在绝对性能上暂落后,只要度量根与证明链锚在境内,它在信创与数据主权语境下的战略价值就不可替代。
二十六、三年总拥有成本量化模型(中型企业口径)
为把"机密化到底多贵"从模糊印象变成可算的数字,构建如下情景(假设一家中型企业将约 20 个高敏工作负载迁到机密 CVM,基准 100 台等价服务器机队,机密开销取 7% 这一 CPU 密集型中位)【计算·高】:
| 成本项 | 计算逻辑 | 三年口径估算 |
|---|---|---|
| 算力溢价 capex | 需多购 100/(1?0.07) ? 100 ≈ 8 台等价服务器,单台等效 5 万美元 | ≈ 40 万美元(折旧/一次性) |
| 年度 HSM/验证固定 | 托管 HSM ≈ 1.4 万美元/月 × 12,多应用分摊后单负载边际远低于标价 | ≈ 16.8 万美元/年 |
| 三年总增量 | 40 万 + 16.8 万 × 3 | ≈ 90.4 万美元 |
| 占 TCO 比例 | 对比机队三年原 capex+运维基数 | 约 7%–12%(取决运维基数假设) |
解释:该模型说明机密化的真实成本结构是"少量算力溢价 + 固定 HSM/验证费",而非厂商话术里的"机密税";一次 PCK 级泄露或合规罚单的潜在损失常以千万美元计,故"为加密腾出的余量"在财务上远优于"用风险换成本"【推断·中】。采购评估应计入三年口径而非单月账单,否则会系统性高估机密化的边际成本。
二十七、紧凑附录
- 一句话定义:机密计算 = 在硬件强制隔离且可远程证明的 TEE 里算数据,补上"使用中"防护这一柱。
- 核心公理:Rail 1(机密性+完整性)+ Rail 2(度量+证明)齐备才是 CVM;缺一则只是"加密产品"或"度量系统"。
- 选型速查:免改造上云→TDX/SEV-SNP;最小 TCB+愿重构→SGX 残余;GPU 护模型/提示→NVIDIA GPU TEE(依赖 CPU TEE);边缘/低功耗→ARM CCA。
- 风险速查:物理总线侧信道(TEE.fail)、侧信道(Foreshadow/Plundervolt/SGAxe/LVI/Spectre 族)、证明密钥泄露、GPU 单卡上限、闭源 CUDA 审计缺口、HSM/验证服务可用性单点。
- 标准清单:IETF RFC 9334(RATS,2023)、CCC 白皮书 V1.3(2022)、GCC 两项团体标准(2025-11)、国标《机密计算通用框架》(发布待实施)、ANSSI 立场文件(2025-10)。
- 成熟度一句话:整体 Early Production 规模化;frontier 多 GPU 训练级机密化至少还要一代产品。
- 攻击家谱:软件层(缓存定时/RSA 96%、Dark-ROP、缓存页表)→ 瞬态执行(Spectre/Meltdown/Foreshadow/LVI/MDS)→ 物理层(WireTap DDR4、Battering RAM <50 美元、TEE.fail DDR5 <1000 美元)。物理层是当前最该被写进威胁模型、却长期被厂商外推的一支。