推理侧走向多极化,算力层权力重构
本期 AI Infra Weekly 梳理 GPT-5.3 Codex、Claude Opus 4.6、Token 定价分化、Meta 转向 AMD 算力订单与 AI 合规扩张,讨论多模型路由、成本治理和智能体身份审计对企业部署的影响。 观测周期:2026年2月11日至2月25日 来源视角:AgentsFlare 全球传感网络
1. 系统态势与核心诊断
根据 AgentsFlare 全球传感网络在 2026年2月11日至2月25日期间捕捉到的流量水平与信号波动,本周全球 AI 基础设施环境同时呈现出两个特征:
1. 推理侧的多极化动荡;
2. 算力层的权力重组。
可观测性信号显示,随着 OpenAI GPT-5.3 Codex 与 Anthropic Claude Opus 4.6 近乎同时发布,企业级智能体已经到达一个临界时刻:从提示词工程转向长周期自主执行。系统检测到,过去 14 天内,全球主要数据中心的推理流量增长了 32%,主要由模型在长周期任务稳定性上的突破所驱动。
与此同时,物理层也出现了显著扰动。在 Meta 与 NVIDIA 达成大规模 Grace CPU 部署协议仅一周后,Meta 转向 AMD,并签署了一笔 1000 亿美元的算力订单。这表明,超大规模数据中心正在试图通过多供应商对冲策略,打破单一供应极的主导地位。这一变化已经引发二级市场对 AI 芯片供应链韧性的重新评估。
在治理维度上,系统检测到合规边界正在快速扩张。新德里《AI 影响力领导人宣言》的签署,为全球 AI 协作确立了七大支柱。这意味着,企业在跨境调用模型时,必须考虑的不再只是延迟与成本,还包括日益复杂的“主权 AI”监管框架。
总体来看,系统正处于“高频迭代 + 治理追赶”的运行状态。建议企业重新评估高并发场景下的路由权重,并主动建设私有化部署能力与智能体身份治理能力。
2. 核心信号深度解析
2.1 信号一:推理“军备竞赛”与模型能力范式转移
本周,OpenAI 与 Anthropic 的竞争再次升级。核心战场不再主要是参数规模,而是对智能体属性的实质性捕捉。
OpenAI 的 GPT-5.3 Codex 被描述为首个在开发过程中“自我构建”的模型:团队使用早期版本来调试训练、管理部署,并诊断评测结果。这种递归式开发显著压缩了发布周期,并带来了 25% 的速度提升。
与此同时,Anthropic 的 Claude Opus 4.6 具备 100 万 token 的超长上下文窗口,并强化了子任务拆解能力,直接瞄准制造业与复杂科学研究中的长周期任务市场。
这场竞争正在 token 经济层面制造剧烈波动。2026年2月主要闭源模型的最新 API 定价结构呈现出极端分化:
· GPT-5.2 Pro:输入每 100 万 token 21 美元,输出每 100 万 token 168 美元。
· GPT-5.3 Codex:输入每 100 万 token 1.75 美元,输出每 100 万 token 14 美元。
· Claude Opus 4.6:输入每 100 万 token 15 美元,输出每 100 万 token 75 美元。
· Claude Sonnet 4.5:输入每 100 万 token 3 美元,输出每 100 万 token 15 美元。
· Google Gemini 3.1 Pro:输入每 100 万 token 1.25 美元,输出每 100 万 token 10 美元。
· DeepSeek V3.2:输入每 100 万 token 0.28 美元,输出每 100 万 token 0.42 美元。
不同供应商的上下文窗口从 128K 到 2M 不等。
影响诊断:
这种极端的价格分化,正在迫使企业架构从“单一模型依赖”转向语义路由架构。高价值的复杂推理任务正在向 GPT-5.2 Pro 或 Opus 4.6 集中,而高吞吐量的日常自动化流程则正在快速迁移到 DeepSeek 或 GPT-5 Nano。对于技术决策者而言,这种波动验证了模型层解耦的战略重要性。在控制平面中,应通过多模型网关策略对冲这一风险,避免单一供应商的 SLA 波动,例如本周观测到的 Anthropic API 间歇性 500 错误,影响核心业务运行。
2.2 信号二:算力层的战略转向与供应商多元化
2026年初,NVIDIA 继续展示其主导地位。第四季度财报显示,其数据中心收入达到 512 亿美元,同比增长 66%。然而,Meta Platforms 的行为反映出超大规模客户对单一供应商依赖的深层焦虑。
2月17日,Meta 宣布将部署数百万块 NVIDIA Blackwell 与 Rubin GPU,目标是建设全球领先的 AI 工厂。然而,仅一周后的 2月24日,Meta 又宣布与 AMD 达成一项 1000 亿美元协议,采购 6GW 的 AMD GPU 算力容量和下一代 CPU。
影响诊断:
这种“闪电式”的战略转向反映出,算力市场正在进入一个同时重视现货供给与长期产能的阶段。由于 NVIDIA Blackwell 的交付周期仍为 6 至 12 个月,而台积电 CoWoS 先进封装产能仍然受限,Meta 必须通过 AMD 股权期权等机制锁定算力确定性。对于企业而言,算力成本波动如今已成为基础性约束。监测“token 黑洞”的收缩与扩张,即由无效推理循环造成的算力浪费,将成为 2026 年成本治理的核心。
2.3 信号三:治理红线的明确化与全球合规共振
2026年2月20日,欧盟正式支持印度 AI 峰会达成的《领导人宣言》,标志着全球 AI 治理正从“原则性共识”转向机制化协作。新德里宣言的“七大支柱”不仅覆盖 AI 资源的民主化,也明确强调韧性 AI 基础设施与可信公共 AI 资源。
与此同时,欧盟《AI 法案》的执行时间表已经进入关键阶段。透明度规则将于 2026年8月全面生效,要求所有合成媒体都必须带有清晰标识和数字水印。
影响诊断:
每一项监管规则的落地,都是对“无治理调用”的进一步收紧。系统观测到,由员工私自使用未授权 AI 工具造成的组织损失,平均已达到 1950 万美元。合规边界正在从简单的“数据不出境”扩展到“模型行为必须可审计”。企业需要建立类似智能体验证检查点的机制,确保自主智能体的行为符合法律与伦理规范。
分层动态扫描
📡 供给层:模型与云厂商
· Google Gemini 3.1 Pro 升级:上下文窗口扩展至 200 万 token,并强化了 Google Workspace 内部的原生推理能力。
观察:云厂商正在利用生态锁定,对抗纯 API 厂商的性能优势。
· OpenAI Codex-Spark 预览版发布:引入基于 Cerebras 硬件构建的超低延迟模型,面向实时代码编辑场景,生成速度达到每秒 1000 token。
观察:推理硬件异构化正在成为突破延迟瓶颈的新常态。
· DeepSeek 维持“价格杀手”地位:DeepSeek V3.2 在保持行业领先性能的同时,将输入价格维持在每 100 万 token 约 0.28 美元。
观察:低成本模型正在侵蚀闭源旗舰模型在非核心业务场景中的护城河。
🛠️ 栈层:开源与工程
· vLLM 0.9.0 引入 P/D 分离架构:对 prefill 与 decode 阶段进行完全解耦,从而支持更高效的缓存复用。
观察:这一架构突破使私有化部署在部分场景下的 ROI 首次有机会超过闭源 API。
· LangGraph 多智能体框架走向成熟:开发者正在普遍从 LangChain 的线性链条,转向基于状态机的多智能体协作架构。
观察:智能体架构复杂度上升,要求更加细粒度的监控工具,例如 AgentOps。
· MCP 协议采用率提升:MCP 正在成为连接 AI 模型与本地工具的事实标准,简化智能体获取系统权限的过程。
观察:协议统一加速了“AI 操作系统”雏形的出现。
💰 物理层:算力与成本
· GPU 功耗接近物理极限:下一代 NVIDIA Rubin GPU 的单芯片 TDP 预计在 2300W 至 3700W 之间。
观察:算力密度的激增正在重塑数据中心设计;液冷正在从可选项转变为“出厂默认配置”。
· 算力交付周期波动:尽管产能正在扩张,但由于封装复杂度较高,Blackwell 面向大客户的交付周期仍在 30 周以上波动。
观察:这种不确定性正在推动企业将边缘计算与分布式推理作为补偿性策略。
· “token 黑洞”治理:部分复杂智能体任务由于推理逻辑缺陷生成无效 token,从而击穿预算。
观察:企业需要针对语义任务设置“断路器”。
⚖️ 控制层:治理与合规
· 欧盟《AI 法案》高风险清单确认:执法、信用评分等领域中的 AI 应用被正式归类为高风险应用,必须接受严格的人类监督。
观察:高风险 AI 项目的合规成本将超过总预算的 15%。
· 智能体身份标准正在形成:NIST 与 Google 正在共同推进将 AI 智能体视为独立“数字行为主体”的概念,并为其配置专门的托管身份。
观察:零信任架构必须延伸到智能体层。
· “影子 AI”安全事件:88% 的受访企业报告发生过与智能体相关的安全事件,主要集中在未经授权的数据访问。
观察:权限扩散正在成为智能体迁移到生产环境时最大的痛点。
🏢 市场层:部署与采用
· 制造业 ROI 开始可见:全球头部制造企业通过预测性维护智能体,将设备停机时间平均减少了 25%。
观察:AI 正在从“效率提升”转向“核心业务控制”。
· 生产迁移率上升:预计到 2026 年底,40% 的企业应用将包含面向特定任务的 AI 智能体。
观察:需要关注从演示迁移到生产时的“体感摩擦”,尤其是长周期任务中的延迟与幻觉风险。
· 印度 AI 生态加速:借助 AI 影响力峰会,印度正在展示利用 AI 改善公共服务的巨大潜力,例如农业与农村治理。
观察:全球南方正在成为 AI 基础设施的新增长极。
🗣️ 信号层:情绪与叙事
· 开发者回归“轻量化”:在 Reddit 与 GitHub 上,关于大型框架过度封装的抱怨正在增加;开发者越来越偏好轻量化、模型原生支持的调用工具。
观察:捕捉尚未被正式报告记录的一线工程痛点,例如对 RAG 管线复杂性的反感。
· ROI 质疑升温:尽管大型科技公司的资本开支激增至 6500 亿美元,投资者对商业化速度的耐心正在缩短。
观察:这种情绪波动可能会推动企业 AI 预算在下半年进入“谨慎增长”状态。
本周治理启示:从“权限防御”到“语义防御”
背景:
本周观测到的最深层信号是,AI 智能体的广泛采用正在从根本上侵蚀传统身份与访问管理(IAM)。传统 IAM 假定行为主体是具有稳定行为模式的人,或是具备预定义逻辑的软件。智能体则具有自主推理能力,这意味着在执行任务时,它们可能会基于模型推理,独立决定访问那些并未被明确授权的边缘资产。
启示:
组织 AI 治理必须引入智能体身份治理框架。每个智能体不应再被仅仅视为一个 API key,而应被视为具有独立、可验证数字身份的非人类身份实体。权限必须是即时授予、任务绑定且可撤销的。只有当智能体行为与其预设目标层级保持一致时,访问权限才应被激活。从“我能访问什么”转向“为了完成任务我需要访问什么”,是企业避免在 2026 年陷入“权限黑洞”的唯一路径。
5. 前沿研究:智能体身份管理的架构模型
研究背景:
随着 OpenAI GPT-5.3 Codex 等具备长周期执行能力的模型出现,智能体开始在银行、工厂、公共行政等复杂系统内部扮演“数字员工”的角色。然而,在当前治理制度中,智能体身份处于灰色地带:它既不是人类,也不能完全等同于传统后台进程。本项研究考察的是,在 2026 年监管环境下,如何构建一种可审计、可验证的智能体身份管理架构。
核心发现:身份错配驱动的三类风险
研究显示,82% 的高管对现有政策有信心,但 88% 的一线团队已经观察到与智能体相关的安全事件。这种“信心悖论”源于对智能体身份属性的误读。
· 风险类别:智能体劫持
描述:攻击者伪造智能体身份,并利用取得的权限进行横向移动。
典型场景:攻击者通过提示词注入获取财务智能体的凭证。
· 风险类别:权限扩散
描述:智能体在推理链中自主调用权限,超出初始任务范围。
典型场景:营销智能体为了“优化结果”,私自读取敏感的用户隐私数据。
· 风险类别:身份混淆
描述:多个智能体共享同一个 API key,破坏责任链条,使取证审计无法进行。
典型场景:审计人员无法判断究竟是哪一个智能体触发了非法交易。
架构建议:基于去中心化身份与零知识证明的治理模型
为满足欧盟《AI 法案》与《新德里宣言》下的合规要求,建议企业采用以下智能体身份管理架构:
· 去中心化标识符(DIDs):为每个智能体生成唯一的密码学身份,并将其与底层模型哈希、创建者身份和任务目标指纹绑定。
· 即时授权:废除持久化 token,改用基于任务状态的短期凭证,确保智能体只在主动执行窗口内持有权限。
· 零知识证明授权验证:当智能体必须协作时,使用零知识证明验证权限合法性,而无需暴露敏感的底层上下文,从而满足隐私主权要求。
· 语义链审计:不仅记录“做了什么”,也记录“为什么这么做”,将智能体推理链保存为合规审计的核心证据。
结论:
智能体身份管理是企业进入智能体时代的“入场券”。它不仅是一组安全工具,更是 2026 年企业 AI 治理的基础。在没有独立身份治理的情况下部署智能体,等同于邀请一个“带着钥匙的陌生人”进入服务器机房。技术决策者应优先在财务、研发等核心部门开展试点,建立“了解你的智能体”(Know Your Agent)体系。