AI 基础设施周报

DeepSeek 输出价涨至峰时 27 元并首次按时段计费,Grok 4.6 以 2/6 美元追平 GPT-5.6 Sol,英伟达联合六家资管将算力做成 5000 亿美元可融资资产

Author

AgentsFlare Research

Date Published

8 月 13 日深夜,DeepSeek 将 V4-Pro 正式版推上 App、网页端与 API,同时公布调价方案:8 月 17 日 0 点起按北京时间分峰谷两段计费,每百万输出 token 高峰时段 27 元、空闲时段 13.5 元,调价前为全天 6 元。前一日,xAI 发布 Grok 4.6,价格与上一版持平,每百万 token 输入 2 美元、输出 6 美元,Artificial Analysis 独立评测给出智能指数 61 分,与 GPT-5.6 Sol 并列。全球最便宜的前沿模型开始抬价,并把调用时段写进价目表,而同一价位买到的能力已逼近榜首。资金侧,英伟达 8 月 10 日与阿波罗、贝莱德、黑石、Brookfield、高盛、KKR 六家机构签署谅解备忘录,筹建算力融资平台,目标动员超过 5000 亿美元第三方资本,将 GPU 算力做成可承销的资产类别。8 月 13 日,Anthropic 首席财务官启动上市前的投资者沟通,投资方按 2 万亿美元估值、10 月挂牌的预期在准备。安全侧,OpenAI 8 月 10 日将 Daybreak 拆为防御与红队两级授权并发布 GPT-5.6-Cyber;Z.ai 8 月 14 日发布 GLM-5.3 时则把开源权重与 API 访问推迟至安全评审之后。

执行摘要

本篇核心判断:

  • DeepSeek 公布 API 峰谷定价,8 月 17 日 0 点生效:高峰时段为北京时间 9:00–12:00 与 14:00–18:00,其余为空闲时段,空闲价为高峰价的一半。deepseek-v4-pro 高峰时段每百万 token 缓存命中 0.30 元、缓存未命中 9 元、输出 27 元,空闲时段对应 0.15 元、4.5 元、13.5 元;调价前为 0.025 元、3 元、6 元(8/13 公告)
  • DeepSeek-V4-Pro 正式版同步上线,版本号 DeepSeek-V4-Pro-0813:参数与 preview 版一致,1.6 万亿总参数、490 亿激活,100 万上下文,最大输出 38.4 万 token;官方给出的 Agent 类基准较 preview 大幅提升,Terminal Bench 2.1 由 72.1 升至 87.9,DeepSWE 由 12.8 升至 62.7,Cybergym 由 52.7 升至 83.3;原生支持 OpenAI Responses API 与 Anthropic 格式端点,V4-Pro 并发上限 500(8/13)
  • xAI 发布 Grok 4.6:沿用 Grok 4.5 的 1.5 万亿参数基座,以后训练而非扩容取得提升,定价与上一版持平,20 万 token 以内每百万输入 2 美元、输出 6 美元,超过 20 万后整单按 4 美元、12 美元计。Artificial Analysis 智能指数 61,与 GPT-5.6 Sol 并列,之上为 Claude Opus 5 的 63 与 Claude Fable 5 的 62(8/12)
  • 英伟达与阿波罗、贝莱德、黑石、Brookfield、高盛、KKR 签署谅解备忘录,筹建独立算力融资平台,目标动员超过 5000 亿美元第三方资本,为前沿实验室、企业与 AI 云的数据中心建设融资;公告明确各方仍需签署最终协议(8/10)
  • Anthropic 首席财务官 Krishna Rao 开始与潜在投资者进行上市前早期沟通,投资方按 2 万亿美元估值、10 月挂牌的预期准备,若成真将超过 SpaceX 成为史上最大 IPO;公司内部尚未确定估值目标,2 万亿为投资方预期而非官方指引(8/13)
  • OpenAI 将 Daybreak 拆为面向通用防御的 Blue 与面向漏洞研究的 Red 两级授权,发布 GPT-5.6-Cyber:官方称该模型对漏洞利用链、鉴权绕过、权限提升类高级安全请求的完成率为 95.0%,通用模型 GPT-5.6 Sol 为 1.5%,上一代 GPT-5.5-Cyber 为 57.3%;9 月 1 日起个人 Daybreak 账户强制启用硬件安全密钥(8/10)
  • Z.ai 发布 GLM-5.3,基于 7430 亿参数基座后训练,主打编程与网络防御;与 GLM-5.2 不同,本次开源权重与 API 访问推迟到安全评审完成之后,目前仅通过 GLM Coding Plan 与 ZCode 提供,多模态能力未包含在本次发布中(8/14)
  • IBM 与 Together AI 签署约 2.4 亿美元多年期协议,在 IBM Cloud 上部署约 2000 颗 NVIDIA HGX B300 的推理集群,2027 年一季度美国上线,面向 DeepSeek、MiniMax、Kimi 等开源模型提供推理服务(8/11)
  • 算力上游:台积电 7 月合并营收约新台币 4676 亿元,同比增长 44.7%,2026 年资本开支上修至 600 亿至 640 亿美元;三星 HBM4 良率由量产初期不足 60% 升至约 80%,SK 海力士约 2500 名员工 8 月 13 日成立统一工会,薪酬谈判第五轮未果;CoreWeave 二季度营收 25.8 亿美元、积压订单 1040 亿美元,Nebius AI 云收入 5.75 亿美元,同比增长 514%(台积电营收 8/10、HBM4 与劳资 8/10 与 8/13、两家云财报 8/12)
  • 特殊洞察:波兰与硅谷两地的 Pathway 公布 1.5 亿参数模型 BDH-CQ 的 ARC-AGI-1 成绩,pass@2 为 29.5%,单任务推理成本 0.0007 美元,同时以 5 亿美元估值完成追加种子轮,累计种子轮 3000 万美元(8/11、8/13)


AgentsFlare 是企业 AI 控制平面,帮助企业在多模型、多云环境下统一管理模型与智能体的调用路由、成本归因与访问审计。AI Infra Weekly 是 AgentsFlare 推出的追踪全球 AI 基础设施层信息变动的专栏,从独立视角追踪模型、算力、监管的关键变动,帮企业在格局固化之前看清方向。

主要事件

DeepSeek 将北京时间写进价目表,峰时输出价涨至调价前的 4.5 倍

8 月 13 日深夜,DeepSeek 近乎无预告地将 V4-Pro 正式版推上 App、网页端与 API,版本号 DeepSeek-V4-Pro-0813。模型结构与 preview 版一致,为 1.6 万亿总参数、490 亿激活的 MoE,100 万 token 上下文,最大输出 38.4 万 token。提升全部来自针对性后训练,集中于长链路代码修改、环境操作与工具调用几类任务:Terminal Bench 2.1 由 72.1 升至 87.9,DeepSWE 由 12.8 升至 62.7,Cybergym 由 52.7 升至 83.3,DSBench-Hard 翻倍至 67.2。接口侧原生支持 OpenAI Responses API 与 Anthropic 格式端点,并针对 Codex 做了适配,V4-Pro 并发上限 500,V4-Flash 为 2500。

同日公布的调价方案更需要企业逐笔算账。8 月 17 日 0 点起,DeepSeek API 按北京时间分两段计费,高峰时段为 9:00 至 12:00 与 14:00 至 18:00,其余时间为空闲时段,空闲价恰为高峰价的一半。落到 deepseek-v4-pro,高峰时段每百万 token 缓存命中 0.30 元、缓存未命中 9 元、输出 27 元,空闲时段依次为 0.15 元、4.5 元、13.5 元。调价前的价目是 0.025 元、3 元、6 元。即便按空闲价计,输出也涨至 2.25 倍,缓存命中涨至 6 倍;按高峰价计,输出为 4.5 倍,缓存命中为 12 倍。deepseek-v4-flash 同步调整,空闲时段 0.05 元、1.5 元、4.5 元,高峰时段翻倍。这家以最低价支撑国产开源叙事的厂商,首次将调用发生在几点钟纳入计费维度。

按当前汇率折算,V4-Pro 高峰输出价约合每百万 token 3.8 美元,空闲时段约 1.9 美元,仍低于同类模型近期报价,但价格优势的量级明显收窄。横向对照,8 月 3 日上线的阿里 Qwen3.8-Max 报 2 美元输入、6 美元输出;8 月 12 日的 Grok 4.6 以完全相同的 2/6 美元,报到 Artificial Analysis 智能指数 61 分,与 GPT-5.6 Sol 并列,仅次于 Claude Opus 5 的 63 与 Fable 5 的 62。Grok 4.6 沿用 Grok 4.5 的 1.5 万亿参数基座,性能提升来自后训练而非扩容,价格因此未动,仅在提示词超过 20 万 token 时整单跳至 4/12 美元一档。2 美元这一档买到的能力较三个月前明显提高,而最便宜的一端正在抬价。

这类改动对企业账单的影响,在单价对比表上看不出来。同一工作流在上午九点至十二点运行与在夜间运行,成本相差一倍;提示词缓存的经济性同样改变,缓存命中价涨幅最大,此前以长系统提示词加缓存压低成本的做法须重新核算。要吃到这层差价,需先具备三项条件:掌握各团队调用量落在哪个时段,能将不赶时间的批量任务移至空闲窗口,能在同档位的多家模型之间按任务切换。将请求按任务类型、成本预算与时段分流至不同模型,为每个团队和项目设定配额,并按 endpoint、用户、团队、模型逐笔沉淀实际成本,是这三项条件的共同基础。在 AgentsFlare 上运行 AI 流量的企业,价目表结构变动一次,调整一次路由策略即可,各业务线代码不动。

攻防能力开始按许可证发放:OpenAI 分设两级授权,Z.ai 推迟 GLM-5.3 开源

8 月 10 日,OpenAI 发布《Expanding Daybreak as the Cyber Defense Window Narrows》,将面向安全场景的 Daybreak 计划拆为两级:Blue 面向通用防御场景,可访问 GPT-5.6 Sol 等模型,并解除一部分安全审查限制;Red 面向漏洞研究与渗透测试,配套发布 GPT-5.6-Cyber。官方给出的对比数字是,对涉及漏洞利用链、鉴权绕过、权限提升的高级安全请求,GPT-5.6-Cyber 完成率为 95.0%,通用的 GPT-5.6 Sol 仅 1.5%,上一代 GPT-5.5-Cyber 为 57.3%。OpenAI 将该模型在自家 Preparedness Framework 下的网络能力评为高,未达关键阈值,访问须经身份核验与监控,9 月 1 日起个人 Daybreak 账户强制使用硬件安全密钥。官方列出的战绩有两项:发现 Chrome V8 引擎两个可串联利用的漏洞(CVE-2026-15903),以及 400 余个内核提权相关漏洞。

四天后的 8 月 14 日,Z.ai 发布 GLM-5.3,标语为编程与网络防御,基座 7430 亿参数,官方称在 AutomationBench、GDPval-AA v2、CyberGym 等基准上均有改进。改变的是发布方式。GLM-5.2 为权重与 API 同步开放,此次开源权重与 API 访问均推迟至安全评审完成之后,当下仅能通过 GLM Coding Plan 与 ZCode 使用,多模态能力亦不在本次发布范围内。一家以开源节奏为主要竞争手段的厂商,主动为自己加了一道发布前的闸门。

模型的攻防能力正由随模型一并交付的通用能力,转为单独授权、单独审计、单独收紧访问的产品。对企业安全团队的直接影响有两层。一层是采购口径,内部红队与漏洞研究若要用上这类能力,须走身份核验、硬件密钥、使用监控这一套准入流程,采购合同中需谈的条款与普通 API 不同。另一层是威胁模型,一家厂商公开承认自家模型对高级攻击请求的完成率为 95%,同等能力在防御侧与攻击侧的差距便取决于谁先拿到授权。GLM-5.3 的开源承诺何时兑现,目前只有评审后开放一句,未给日期。在这类日程未定的窗口期,若将某个开源权重当作既定的自托管方案排进路线图,需备一条随时切回商用 API 的退路。

英伟达将 GPU 做成可承销的资产类别

8 月 10 日,英伟达宣布与阿波罗、贝莱德、黑石、Brookfield、高盛、KKR 六家机构签署谅解备忘录,筹建独立的算力融资平台,目标动员超过 5000 亿美元第三方资本,用于前沿实验室、企业与 AI 云的数据中心建设。公告将英伟达算力描述为一种可投资资产,理由是单位 token 成本最低,可跨模型与负载复用,可在客户和运营方之间转让,并因 CUDA 的持续更新而延长使用寿命。黄仁勋的表述是,在 AI 中算力即收入。需要注明的是,六份文件目前均为谅解备忘录,最终协议尚未签署。

这套安排为算力建立了一条独立于芯片买卖的融资渠道。过去数据中心的资金来自云厂商的资本开支、主权基金或项目融资,采购方的资产负债表决定了建设规模;若 GPU 可像收费公路与数据中心地产那样被承销,出资方看的便是使用率与长期租约现金流,建设速度不再受单一买家的现金流约束。对企业采购的含义有两面。中期看,算力供给增加,租赁渠道变多,推理单价的下行压力会更持续。另一面是,算力资产背后开始站着长期资金与固定收益类的回报要求,租约条款、承诺用量与违约条件会越写越接近基础设施合同,短租的灵活性未必一直这样便宜。

同一周另有一笔结构不同的交易。8 月 11 日,IBM 与 Together AI 签署约 2.4 亿美元的多年期协议,由 IBM 在自家云上部署约 2000 颗 NVIDIA HGX B300 组成的推理集群,2027 年一季度在美国上线,Together AI 以这批算力为 DeepSeek、MiniMax、Kimi 等开源模型提供推理服务。一家老牌云厂商拿出机房与资本开支,换一个开源模型推理服务商入驻,双方押注的是同一件事:出于安全与可控性的考虑,会有相当一部分企业负载愿意运行在开源权重模型上,而非闭源 API 上。这批算力 2027 年才上线,届时的对照价格与模型格局尚不可知。

Anthropic 启动上市前沟通,投资方按 2 万亿美元估值准备

8 月 13 日,Anthropic 首席财务官 Krishna Rao 开始与潜在投资者进行早期沟通,形式上属于上市前的投资者教育,尚未进入正式路演。多家媒体报道称,投资方正按 2 万亿美元估值、10 月在纳斯达克挂牌的预期做准备,这一价格将超过 SpaceX 的 1.77 万亿美元,成为史上最大 IPO。需要注明的是,报道同时提到公司高管在私下沟通中亦未确定估值目标,2 万亿为投资方预期,并非官方指引。参照三个月前的 H 轮 9650 亿美元,2 万亿意味着翻一倍。支撑这一预期的是收入斜率,报道称年化收入预计在年底前落至 1000 亿至 1200 亿美元区间,而 5 月披露的数字为 470 亿美元。公司已于 6 月 1 日向 SEC 保密递交注册申请,承销商为摩根士丹利、高盛、摩根大通。同期有报道称,OpenAI 已将上市推迟至 2027 年。

对企业采购方,这件事的相关性落在上市之后的定价行为。一家未上市公司可以长期以低于成本的价格换取企业渗透率,而季度披露一旦开始,毛利率便成为被公开追问的指标。过去一年模型层价格战的一部分弹药来自私募市场的耐心资本,这个前提在上市后会变。签订多年期承诺用量合同时,需盯住价格保护条款的期限,以及厂商单方面调整模型版本与退役时间表的权利。8 月 10 日 OpenAI 从 API 移除 gpt-5.2-chat-latest 与 gpt-5.3-chat-latest 两个快照,是提前三个月预告的常规退役,同样说明模型标识符的生命周期由厂商定义。

另有一条尚未证实的消息。Fortune 与以色列媒体 Calcalist 于 8 月 13 日报道,Anthropic 正就以约 60 亿美元收购以色列推理优化公司 Decart AI 展开谈判,若成交将是其最大一笔收购。Decart 的核心产品是名为 DOS 的推理优化栈,据称可在同一硬件上将推理速度提高最多 8 倍。双方均未证实,报道亦写明谈判可能告吹,8 倍这一数字来自公司口径,无第三方复现。若最终成交,意味着模型厂开始将推理效率收编为自有资产,此前这一层的进展主要来自芯片厂与推理框架社区。

算力上游信号:封装产能与 HBM 良率同时松动,劳资纠纷成为新变量

过去一周上游的三条线索均指向供给侧。制造端,台积电 8 月 10 日公布 7 月合并营收约新台币 4676 亿元,环比增长 5.6%,同比增长 44.7%,1 至 7 月累计同比增长 37%,并将 2026 年资本开支上限上修至 600 亿至 640 亿美元,二季度高性能计算业务占营收 66%。同日有报道称,台积电拟收购友达位于台中的两座面板厂,交易额估超新台币 300 亿元,用于面板级封装(将芯片封装由圆形晶圆改到方形面板上进行,同样面积可多放芯片,成本更低);龙潭三期约 104 公顷用地的扩建计划亦重启,规划两座 1.4 纳米晶圆厂与一座面板级封装厂。当前 AI 硬件的交付瓶颈主要在先进封装而非晶圆产能,新增封装产能的落地进度直接决定 Blackwell 与 Rubin 系列整机的交期,也决定整机溢价能否收窄。

内存端出现了与前几个月方向相反的信号。据 TrendForce 综合韩媒报道,三星 HBM4 良率已由今年 2 月量产初期的不足 60% 升至约 80%,三季度 HBM4 营收计划环比增长逾两倍,下半年 HBM4 将占其 HBM 销售的六成以上,年底 HBM 市占目标约 38%。HBM 长期由 SK 海力士一家独大,第二供应商良率追上来,英伟达 Rubin 平台的 HBM 采购便有了议价空间,此前连续几个季度的内存涨价压力有望在明年缓解。变量出在人力侧。SK 海力士 2026 年薪酬集体协商第五轮谈判于 8 月 4 日未果,争议集中于以公司股票支付部分绩效奖金,8 月 13 日约 2500 名员工跨岗位成立统一工会。若劳资纠纷升级,最先受影响的将是下一代 HBM 的产能爬坡时间表。同一家公司 8 月 11 日还重启了停摆近四年的大连第二座 NAND 工厂,新增月产能约 5 万片晶圆,与原有产能合计 15 万片,2027 年上半年量产,指向企业级 SSD 需求回暖。

租赁端,CoreWeave 与 Nebius 于 8 月 12 日同日发布二季度财报。CoreWeave 营收 25.8 亿美元,同比增长 112%,积压订单 1040 亿美元,同比增长 246%;Nebius AI 云收入 5.75 亿美元,同比增长 514%,当季新签合同金额环比翻两番。市场信号指出,这批新云厂商的 GPU 租赁报价较三大公有云低至多 66%。积压订单为已签约未确认的收入,1040 亿美元这一量级表明,企业与实验室正在锁定未来两三年的算力,而不只是按月租用。三大云与新云之间的这段价差,是当下推理成本弹性最现成的来源,前提仍是负载能在不同供给方之间迁移。

特殊洞察:Pathway 以 1.5 亿参数模型把单任务推理成本压到 0.0007 美元

Pathway 成立于 2023 年,创始团队为 Zuzanna Stamirowska、Jan Chorowski 与 Adrian Kosowski,起家产品是开源的流式数据处理与 RAG 引擎,客户包括北约、法国邮政与达飞海运,2024 年底起转向基础模型架构研究。8 月 11 日,公司公布 1.5 亿参数模型 BDH-CQ 在 ARC-AGI-1 公开评测集上的结果:pass@2 为 29.5%,单任务推理成本 0.0007 美元,约为 GPT-5.6 Luna(Low 档)的十一分之一,该对比已计入 OpenAI 7 月 30 日的降价。8 月 13 日,公司宣布以 5 亿美元估值完成追加种子轮,累计种子轮融资 3000 万美元,投资方包括 TQ Ventures、Red Bridge Ventures 与 Wilson Sonsini 投资部门,天使投资人中有 Databricks 首席 AI 科学家 Jonathan Frankle。

技术路线上,BDH-CQ 不生成中间文本推理链,而在一个循环的潜在状态中反复修正答案,成本优势主要来自于此。数字需要读准:同一评测中 GPT-5.6 Luna(Low)得 34.2 分,高于 BDH-CQ 的 29.5 分,这份成绩的含义是准确率略低、成本低一个数量级,小模型在能力上并未反超大模型。疑点同样清楚。ARC-AGI-1 是公开评测集而非隐藏测试集,存在针对性优化的空间,目前没有 Artificial Analysis 一类第三方的独立复现;1.5 亿参数上成立的成本曲线能否在十亿至千亿参数区间保持,公司称符合类 Transformer 的规模定律,亦无外部验证。转向新方向后,公司尚未披露付费客户。

把它记入观察名单,看的是它所处的位置。模型层的价格竞争已压到 2 美元这一档,下一段降本要么来自硬件与封装,要么来自架构层面每 token 计算量的下降。前者正在发生,进度以季度计;后者一旦获得独立验证,影响的是所有需要大批量、低延迟推理的场景。Pathway 目前给出的是一份方法论公开、结果未经复现的自测成绩,接下来要看第三方评测机构是否接手,以及这套架构在参数量放大后是否还站得住。

综合判断

模型层的定价维度正在增加。DeepSeek 加入了调用时段,Grok 4.6 与 Gemini 沿用超过一定上下文长度整单跳档,Anthropic 与 OpenAI 以促销期和快照退役界定有效价格的窗口,OpenAI 又将攻防能力做成单独授权的档位。一年前比较模型成本只需看输入价与输出价两个数字,如今同一模型在同一天中的实际单价,取决于几点钟调用、上下文多长、缓存命中率多少、是否处于促销期,以及企业拿到的是哪一级授权。价目表的对比工作因此由选型阶段的一次性动作,转为按实际调用分布持续核算。

资金侧的两件事共同表明,算力与模型公司正从风险资本的资产负债表,转移到公开市场与长期基金的资产负债表上。英伟达联合六家资管将 GPU 承销为资产类别,Anthropic 按 2 万亿美元估值筹备 10 月上市,后果是供给会更充裕,定价则更受回报要求约束。上游过去一周的信号支持前半句:三星 HBM4 良率追至 80%,台积电扩建面板级封装产能,新云厂商积压订单破千亿,并以低至 66% 的价差承接负载。企业能确定的是,未来两三年可租到的算力更多、渠道更杂;不能确定的是哪一家的报价会一直便宜。在这种结构下,将准入规则、路由策略、成本归因与审计链留在自己控制的一层上,厂商侧的形态与价目表再怎么变,影响的都只是配置工作量。