Skip to content
AI 基础设施周报2026 · 07 · 03

Fable 5 停服 19 天后恢复、Sonnet 5 促销价 $2/$10、OpenAI 首颗自研推理芯片亮相——政府指令首次成为模型可用性变量

Fable 5 停服 19 天后恢复,Sonnet 5 以 $2/$10 促销价上线,OpenAI Jalapeño 芯片亮相,模型可用性、真实调用成本和推理供应链同时成为企业 AI 的关键变量。

本周的主线由 Anthropic 一家贡献了两件事:6 月 30 日美国商务部解除对 Claude Fable 5 与 Mythos 5 的出口管制,一场持续 19 天的全球停服就此结束,7 月 1 日模型恢复上线;同一天 Anthropic 发布 Sonnet 5,以 $2/$10 的促销价把接近旗舰的智能体能力推到中端价位。再往前几天,OpenAI 与 Broadcom 发布了首颗自研推理芯片 Jalapeño,高通确认以约 39 亿美元收购推理软件公司 Modular。把这几件事放在一起看,企业 AI 供应链的两个变量在本周同时显形:政府指令已被证明可以让一个前沿模型一夜之间全球下线,而模型层的名义降价在新计费口径下未必等于实际成本下降。

AgentsFlare 是企业的 AI 控制平面——在模型、云与智能体不断分裂的环境里,替企业守住调用路由、成本归因与访问审计这条主动权。AI Infra Weekly 是 AgentsFlare 为企业用户推出的战略专栏,追踪全球 AI 基础设施层的关键变动。控制平面天然不押注任何单一模型或云,因此我们能不带立场地判断模型、算力与监管的结构性变动——在格局固化之前,先一步看清方向。

主要事件

一纸指令停服 19 天:Fable 5 出口管制的始末与恢复

6 月 12 日,美国政府对 Anthropic 最新的 Claude Fable 5 与 Mythos 5 实施出口管制,要求限制所有外国国籍人士的访问。由于指令即时生效且 Anthropic 没有实时核验用户国籍的手段,公司选择对所有用户暂停这两个模型。起因是 Amazon 研究人员发现了一种绕过 Fable 5 安全防护的提示技巧,能让模型识别出若干软件漏洞,并在一个案例中生成了漏洞利用的演示代码。Anthropic 事后测试称,多款能力更弱的模型(包括 Opus 4.8、GPT-5.5、Kimi K2.7)能识别出同样的漏洞,且所有受测模型都能生成那个漏洞演示,即该越狱并未释放出 Mythos 级的独有能力。6 月 26 日政府批准部分美国机构恢复 Mythos 5 访问,6 月 30 日商务部解除管制,7 月 1 日 Fable 5 面向全球恢复,Pro、Max、Team 及部分企业计划在 7 月 7 日前可用至每周用量上限的 50%。渠道恢复存在时间差:第一方平台当日恢复,AWS、Google Cloud、Microsoft Foundry 上的访问按官方说法"尽快"跟进,云分销渠道的恢复慢于原厂直连。

技术处置上,Anthropic 与政府合作训练了针对该越狱技巧的新安全分类器,拦截率超过 99%,被拦截的请求会转由 Opus 4.8 处理,代价是日常编码调试类请求的误拦率上升。Anthropic 同时联合 Amazon、Microsoft、Google 等 Glasswing 伙伴起草越狱严重度的行业评分框架,并承诺向政府提供前沿模型的预发布评测通道。这些安排放在 6 月 2 日白宫行政令的背景下看,意味着美系前沿模型的发布与运行正在制度化地纳入政府流程。

对企业的直接教训是可用性风险清单里多了一项:监管指令可以在数小时内切断一个模型的全球访问,且没有预告、没有过渡期,恢复时间取决于政企协商而非厂商 SLA。这 19 天里,把关键业务绑定在单一模型上的团队只能等待,而在 AgentsFlare 上预设了跨厂商回退链的客户,流量按策略自动切换到 Opus 4.8、GPT-5.5 或国产开源模型,审计链完整记录了切换全程,事后合规复盘不需要额外补证。模型层的地缘与监管变量正在变多,回退能力从架构洁癖变成了实际用得上的保险。

Sonnet 5 发布:名义降价三分之一,换算后大致持平

6 月 30 日 Anthropic 发布 Claude Sonnet 5,定位是迄今最强的智能体向 Sonnet:官方基准显示其推理、工具调用、编码成绩接近 Opus 4.8,上下文窗口默认即为 100 万 token。定价采用促销结构:8 月 31 日前 $2/百万输入 token、$10/百万输出 token,9 月 1 日起回到 $3/$15 的标准价,与前代 Sonnet 4.6 持平;作为参照,Opus 4.8 为 $5/$25。

价格表之外有一个容易被忽略的口径变化:Sonnet 5 更换了 tokenizer,同样的输入会折算成 1.0–1.35 倍的 token,具体倍数取决于内容类型。Anthropic 在发布说明中自己承认,促销价就是按过渡期大致成本中性来定的。换句话说,促销期内从 Sonnet 4.6 迁移过来,账单大体不变;9 月 1 日恢复标准价后,同样的负载最多会比 4.6 时期贵 35%。企业在做预算测算时不能拿历史 token 用量直接乘新单价,需要用自己的真实负载实测换算率,并在成本归因里把模型切换前后的 token 口径分开统计,AgentsFlare 的按模型、按团队成本记录可以直接支撑这类前后对比。

对选型的实际影响在于档位结构:Sonnet 5 促销价只有 Opus 4.8 的 40%,而多数智能体任务上两者表现的差距已经不大,加上可调的 effort 档位,同一个模型内部就存在数倍的成本区间。代理类负载把默认模型从旗舰档下调到 Sonnet 5、只在困难任务上调用 Opus,是本季度最直接的降本动作。

OpenAI 首颗自研芯片 Jalapeño:九个月设计周期,年底部署

6 月 24 日 OpenAI 与 Broadcom 共同发布 Jalapeño,OpenAI 的第一颗自研芯片,定位是纯粹的大模型推理 ASIC(为单一用途定制的专用芯片),不做训练、不做通用计算。芯片接近光刻单次曝光的面积上限,从立项到完成设计只用了九个月,OpenAI 称设计过程大量借助了自家模型。整机由 Celestica 负责板卡与机架,网络采用 Broadcom 的 Tomahawk 交换芯片,计划 2026 年底开始部署,官方口径是性能功耗比显著优于当前最先进水平,且设计上兼容各家大模型而非只服务 GPT。

这颗芯片短期不改变市场供给,它不对外销售,产能优先满足 OpenAI 自用。中期的传导路径在成本端:OpenAI 的推理成本结构里若有相当部分从采购英伟达整机变成自研 ASIC 摊销,其 API 定价的回旋余地会变大,这对正处在 IPO 前定价博弈期的 OpenAI 是实打实的筹码。对英伟达而言,这是继 Google TPU、Amazon Trainium 之后又一个头部客户把推理负载往自研硅上迁移的信号,训练市场的垄断暂时无虞,推理市场的议价权在缓慢流失。

高通弃 Tenstorrent 购 Modular:39 亿美元买的是软件层

上期简报曾关注高通以 80–100 亿美元洽购 Tenstorrent 的谈判,本周有了反转:6 月 30 日 Tenstorrent CEO Jim Keller 在东京公开否认正在与高通谈收购,称公司专注自身业务。而在此前的 6 月 24 日,高通已确认以约 39 亿美元全股票收购 Modular,交易预计 2026 年下半年完成。Modular 由前 Apple、Google 工程师 Chris Lattner 创立,产品是跨硬件的推理软件栈,同一套模型代码可以在不同厂商的加速器上运行而无需为每种硬件重写,被普遍视为 CUDA 之外最成型的可移植层。

两件事放在一起,高通进军数据中心的路径变得清楚:芯片自己做,缺的软件生态直接买。这笔交易对企业的参考价值在于它确认的方向:推理硬件正在多样化(英伟达、AMD、自研 ASIC、国产芯片),谁能提供跨硬件的统一软件层,谁就拿住了这轮碎片化的入口。Modular 以独立公司身份存在时是中立层,被高通收编后中立性存疑,这个位置的空缺反而更明显了。

LiteLLM 网关漏洞链已被野外利用

6 月 8 日 CISA 将 LiteLLM 的命令注入漏洞 CVE-2026-42271(CVSS 8.7)列入已知被利用漏洞目录,确认存在野外攻击。漏洞位于 MCP 服务器的测试端点,持有任意代理 API key 的用户可在网关主机上执行任意命令;与 Starlette 框架的 Host 头校验绕过漏洞(CVE-2026-48710)串联后,攻击者无需任何凭证即可远程执行代码,组合链 CVSS 评分 10.0。攻陷一台 LiteLLM 网关意味着拿到其中存储的所有模型厂商 API key,并可向下游系统横向移动。修复版本为 LiteLLM 1.83.7 与 Starlette 1.0.1,缓解措施包括在反向代理层封锁两个测试端点、轮换网关存储的全部凭证。自托管 AI 网关集中保管着企业最敏感的模型凭证,已经成为攻击者眼中的高价值目标,这类组件的补丁时效需要纳入安全运营的常规清单。

算力上游:租金与内存的反向行情

GPU 租赁端在降价。行业租赁价格数据显示,英伟达 B200 的时租在三周内从约 $6.11 降到 $4.22,降幅约 30%,驱动因素包括台积电 4NP 工艺良率改善摊薄了整机成本、HBM3e 供应缓解,以及 RunPod、Lambda、Nebius 等新兴云持有现货后的竞争。租赁降价意味着推理算力的可得性在改善,中小规模部署的成本压力短期缓解。

内存端却是相反方向。TrendForce 6 月 30 日更新的 DRAM 合约价继续上涨,市场预期常规内存产出负增长;该机构 6 月初的分析预计 HBM(把多层内存芯片垂直堆叠、紧贴 GPU 封装的高带宽内存)2027 年合约价将成倍上涨,买卖双方的谈判已转向 2027 年 HBM4 供应协议。美光此前已披露 2026 年全年 HBM 产能基本售罄。市场信号层面,资金正在从 GPU 环节向内存环节轮动。两端反向的含义:租赁市场降价来自供给端竞争和整机成本的一次性改善,上游内存的结构性短缺没有缓解,服务器整机成本里内存占比继续上升,明年新增算力的成本曲线仍然受制于 HBM 而非 GPU 本体。

配套的容量信号是 Blackstone 总裁 Jonathan Gray 本周接受日经专访时确认,计划未来三到五年在日本投入 300 亿美元建设 AI 数据中心,已建成超过 500MW,正在洽谈 1GW 级项目。亚太区的推理容量供给在加速,对有日本及周边区域部署与数据驻留需求的企业,可选项在变多。

综合判断:监管开关、价格幻觉与七月发布窗口

第一,政府行为正式成为模型可用性变量。Fable 5 的 19 天停服是首个全球性案例:触发是一份越狱报告,执行是即时全面下线,恢复取决于政企协商。越狱评分框架、预发布政府评测、行政令确立的漏洞信息共享机制,这些安排会让未来前沿模型的发布更有秩序,但也意味着美系厂商的模型准入从纯商业行为变成带政府流程的事务,停服与恢复的时间表不再完全由厂商控制。企业做供应商评估时,除了价格、性能、SLA,模型所处的监管管辖区从此是一个实际参数。

第二,模型层价目表的信息量在下降。Sonnet 5 的促销价、tokenizer 换算、effort 档位三件事叠加后,同一个模型的实际单位成本可以相差数倍,跨模型比价更是必须先统一口径。名义单价的下行趋势是真实的,但企业拿到的实际成本取决于负载结构和配置细节,用价目表做预算的误差会越来越大,按真实流量实测是唯一可靠的比价方法。

第三,七月发布窗口拥挤。Gemini 3.5 Pro 错过 6 月 30 日的目标时点后,Google 改口 7 月上线;多家媒体报道 GPT-5.6 的大范围推送预计在 7 月中下旬。叠加 Fable 5 恢复和 Sonnet 5 的促销期,第三季度开局的一个月内,模型层的选项、价格与能力排序大概率再洗一轮,本季度签长期合同锁定单一模型的时点风险偏高。

参考资料

Anthropic — Redeploying Fable 5(含停服时间线、越狱报告、行业框架): https://www.anthropic.com/news/redeploying-fable-5 — 2026-06-30

CNBC — Anthropic says Trump admin has lifted export controls: https://www.cnbc.com/2026/06/30/anthropic-says-trump-admin-has-lifted-export-controls-on-claude-fable-5-and-mythos-5.html — 2026-06-30

Anthropic — Introducing Claude Sonnet 5(定价、tokenizer、基准): https://www.anthropic.com/news/claude-sonnet-5 — 2026-06-30

Claude Platform Docs — What's new in Claude Sonnet 5(1M 上下文): https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5 — 2026-06-30

OpenAI — OpenAI and Broadcom unveil LLM-optimized inference chip: https://openai.com/index/openai-broadcom-jalapeno-inference-chip/ — 2026-06-24

Tom's Hardware — Jalapeño reticle-sized ASIC, nine-month cycle: https://www.tomshardware.com/tech-industry/artificial-intelligence/broadcom-and-openai-unveil-custom-built-jalapeno-inference-processor-openais-first-chip-is-a-massive-reticle-sized-asic-built-in-an-ultra-fast-nine-month-development-cycle — 2026-06-24

Qualcomm — Qualcomm to Acquire Modular: https://www.qualcomm.com/news/releases/2026/06/qualcomm-to-acquire-modular — 2026-06-24

Bloomberg — Qualcomm Confirms Buying Modular(约 $3.9B 全股票): https://www.bloomberg.com/news/articles/2026-06-24/qualcomm-confirms-buying-modular-to-help-ai-market-push — 2026-06-24

GuruFocus — Tenstorrent CEO Denies Qualcomm Acquisition Talks: https://www.gurufocus.com/news/8938157/tenstorrent-ceo-denies-qualcomm-acquisition-talks-amid-focus-on-ai-development — 2026-06-30

The Hacker News — LiteLLM Flaw CVE-2026-42271 Exploited in the Wild: https://thehackernews.com/2026/06/litellm-flaw-cve-2026-42271-exploited.html — 2026-06-09

Horizon3.ai — CVE-2026-42271 chained with CVE-2026-48710: https://horizon3.ai/attack-research/vulnerabilities/cve-2026-42271-chained-with-cve-2026-48710/ — 2026-06

Thunder Compute — AI GPU Rental Market Trends (July 2026): https://www.thundercompute.com/blog/ai-gpu-rental-market-trends — 2026-07

TrendForce — DRAM Price Trends(6/30 合约价更新): https://www.trendforce.com/price/dram/dram_spot — 2026-06-30

TrendForce — HBM Contract Prices Expected to Surge Multiples Higher in 2027: https://www.trendforce.com/presscenter/news/20260602-13074.html — 2026-06-02

Nikkei Asia — Blackstone to invest $30bn in Japan AI data centers: https://asia.nikkei.com/editor-s-picks/interview/blackstone-to-invest-30bn-in-japan-ai-data-centers-president — 2026-07

TechTimes — Gemini 3.5 Pro Cleared for July Launch, GPT-5.6 Stays Locked: https://www.techtimes.com/articles/319318/20260629/gemini-35-pro-cleared-july-launch-fable-5-nears-return-gpt-56-stays-locked.htm — 2026-06-29