Skip to content
AI 基础设施周报2026 · 09 · 13

DeepSeek 将 V4 Pro 并入 0.15 美元的 Flash,三部门点名六家中国模型公司,甲骨文单季交付 30 万块 GPU

DeepSeek发布V4.1-Flash并宣布承接V4 Pro全部请求,低谷输入价降至每百万token 0.15美元;美国三部门指控六家中国模型公司实施蒸馏,中国商务部回应。甲骨文单季交付超30万块GPU,OpenAI开放Agents API,加州建立AI审计师注册制度。

9 月 10 日,DeepSeek 发布 V4.1-Flash,低谷时段每百万 token 输入 0.15 美元、输出 0.60 美元,缓存命中 0.003 美元,并宣布自 9 月 14 日起将 V4 Pro 的全部请求转至该型号,按 Flash 价计费。同一周,模型的跨境获取路径出现两处变化。9 月 8 日,美国国家安全局、网络安全和基础设施安全局与联邦调查局联合发布通告,点名 DeepSeek、月之暗面、阿里、MiniMax、阶跃星辰与智谱六家公司对美国前沿模型实施工业级蒸馏;9 月 9 日,中国商务部回应称指控缺乏事实与法律依据。9 月 10 日,甲骨文公布 2027 财年第一季度业绩,剩余履约义务 6640 亿美元,季度内交付超过 30 万块 GPU,AI 基础设施利用率 97.9%,GPU 续约与转售的平均溢价 20%。同日,OpenAI 将驱动 Codex 的编排层以 Agents API 形式开放给所有开发者,不额外收费。9 月 9 日,加州签署两部法案,建立美国首个 AI 审计师注册制度。过去一周的变化集中于一件事:模型的价格、可得性与可审计性,各自换了一套决定规则。


AgentsFlare 是企业的 AI 控制平面——在模型、云与智能体不断分裂的环境里,替企业守住调用路由、成本归因与访问审计这条主动权。

AI Infra Weekly 是 AgentsFlare 为企业用户推出的战略专栏,追踪全球 AI 基础设施层的关键变动。控制平面天然不押注任何单一模型或云,因此我们能不带立场地判断模型、算力与监管的结构性变动——在格局固化之前,先一步看清方向。

V4 Pro 退场:0.15 美元的 Flash 成了唯一入口

9 月 10 日,DeepSeek 发布 V4.1-Flash。低谷时段每百万 token 输入 0.15 美元、输出 0.60 美元,缓存命中 0.003 美元;高峰时段(周一至周五 01:00–04:00 与 06:00–10:00 UTC)为上述价格的两倍,即输入 0.30 美元、输出 1.20 美元、缓存命中 0.006 美元。以人民币计价的公告口径为低谷时段缓存命中每百万 token 0.02 元、缓存未命中 1 元、输出 4 元。这套价目将其置于全球付费 API 的最低一档,前面只剩 Meta 的贡献者档 Muse Spark 与小米 MiMo-V2.5 Flash。

同一份公告写明了型号的去留。V4-Flash 与 V4-Flash-Vision-Exp 已退役,旧标识临时指向新模型;9 月 14 日 04:00 UTC 起,deepseek-v4-pro 的全部请求转至 V4.1-Flash,按 Flash 价计费,直至 V4.1-Pro 发布。DeepSeek 给出的理由是,内外部测试中 V4.1-Flash 在性能、成本、速度与总耗时四项上均已超过 V4 Pro。对正在生产环境中调用 deepseek-v4-pro 的团队而言,这是一次无需改动代码、但模型确已更换的替换:同一标识符背后的权重、上下文处理方式与推理成本全部变了,此前基于旧模型调校的提示词与智能体行为需要重新回归测试。Hacker News 上的开发者讨论正集中于这一点。

架构上的改动指向缓存而非参数量。V4.1-Flash 的主干由 V4-Flash 的 2840 亿参数扩至 5520 亿,输入阶段激活 80 亿、输出阶段激活 160 亿,另有 1960 亿参数位于稀疏访问的记忆模块。40 层被拆为 20 层因果编码器加 20 层解码器,配合压缩稀疏注意力与 FP4 键值缓存,将常驻高带宽内存的全局缓存压至每 token 890 字节,为上一代的四分之一,固态硬盘侧的缓存存储降至八分之一。高带宽内存是堆叠在计算芯片旁、专门用于高速喂数据的存储,长上下文推理的成本大头往往就压在它上面。DeepSeek 自述,上下文由 4K 扩至 100 万 token(256 倍)时,单 token 解码的计算量仅增加约 25%。技术报告同时写明了边界:稀疏选择误差与状态重放的近似重建,可能在极长上下文的稀疏检索与缓存恢复边界上带来未经充分测试的能力衰减。

基准成绩互有胜负。DeepSeek 自测在 DeepSWE v1.1 上得 74.2 分,略高于其报告的 Claude Opus 5 的 74.0 与 GPT-5.6 Sol 的 73.0;Terminal-Bench 3.0 与 4.0 上,Opus 5 分别以 43.3 对 30.0、51.8 对 31.2 领先。这些数字跑在最高推理努力档位(100)上,而同一份材料显示,努力档位由 25 提至 100 时 DeepSWE 成绩从 66.0% 升至 74.2%,输出 token 消耗约为 2.5 倍,60 至 80 的档位即可以不到一半的 token 预算拿到接近满档的准确率。第三方评测方 OpenDesign 的结果是,在其日常设计请求集合上,V4.1-Flash 达到 GPT-6 Astra 质量分的 98%,单次成本为后者的 1.4%。

资金侧的动作在前一天。9 月 9 日有报道称,DeepSeek 已聘请中信证券等承销商,筹备年内在上交所科创板上市,同期进行的融资估值约 5000 亿元人民币(约 750 亿美元);6 月的一轮融资规模约 74 亿美元,投后估值超过 500 亿美元,腾讯与宁德时代分别出资 100 亿元与 50 亿元。低价档位的模型要维持这份价目表,背后需要的正是这类资本与算力承诺。

三部门点名六家中国模型公司,商务部隔天回应

9 月 8 日,美国国家安全局、联邦调查局与网络安全和基础设施安全局联合发布网络安全通告 AA26-251A,称 DeepSeek、月之暗面、阿里、MiniMax、阶跃星辰与智谱自 2024 年末起对美国前沿模型实施工业级蒸馏,从 Claude、GPT、Gemini、Grok 各系列提取数十亿 token 的输出用于训练自有模型。通告描述的手法包括:通过被称为转运站的代理服务商绕过地域限制;在多个模型供应商、云平台与基础设施之间分散操作以避开单点检测;提取思维链推理轨迹;在某条通路被封时自动切换;以及用质量评估框架反向探测防守方的对抗措施。通告还写明,DeepSeek 公开引用的 560 万美元训练成本不含通过蒸馏获得的数据成本。

9 月 9 日,中国商务部回应称,蒸馏是全球人工智能行业普遍使用的技术与商业实践,美方指控缺乏事实和法律依据,属于将技术与商业问题政治化、以安全机构介入正常商业活动;若美方以此为由对中国 AI 企业采取限制措施,中方将采取反制。Anthropic 此前公布的数据给出了另一侧的量级:约 2.4 万个欺诈账户、超过 1600 万次对话,其中 MiniMax 约 1300 万次、月之暗面约 340 万次、DeepSeek 约 15 万次。

这套指控的实际落点在接入层。通告向云厂商、API 聚合方与基础设施提供方发出的建议是协同防守,具体动作包括监控订阅额度与实际用量的比值、对可疑请求降级响应、跨厂商共享遥测数据。这些动作一旦成为行业惯例,受影响的不只是被点名的公司,还有所有通过第三方通路访问前沿模型的企业:账号归属、请求来源地、身份传递是否清晰,将直接决定一条流量被正常服务还是被降级。同一周还有一条相反方向的信号。9 月 8 日,Mistral 完成 30 亿欧元 D 轮融资,由三星领投,投后估值超过 210 亿欧元,为欧洲科技公司迄今最大的单笔融资;两天后,它与 Cloudera 合作,让受监管行业可以在私有云、本地或物理隔离环境中运行并微调其开源权重模型。在跨境接入被重新划线的同时,开源权重加私有部署这条路的资本与渠道都在变厚。企业在多家模型之间保留切换能力、并让每一次调用都带有可核验的身份,正是 AgentsFlare 这一层存在的理由;无论哪一侧收紧规则,企业自有的接入路径都不必跟着重建。

OpenAI 将 Codex 的编排层做成了 API

9 月 10 日,OpenAI 将 Agents API 开放公测,把驱动 Codex 与 ChatGPT for Work 的那套编排层原样交予开发者。一次 API 调用即可创建智能体,指定模型、工具、MCP 服务端与运行环境;OpenAI 托管并维护编排层本身,开发者选择计算环境,可采用 OpenAI 托管沙箱、自有基础设施,或 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel 等合作方的沙箱。除模型 token 与付费工具外不另收费。编排层的具体能力包括:会话接近上下文上限时自动压缩早期上下文,使会话得以跨越多个上下文窗口;工具检索按需加载工具定义,以压低 token 占用并保住缓存;程序化工具调用允许并行执行、串联操作、在代码中过滤与合并结果;多智能体支持将任务拆给并行运行的子智能体,各自维护独立上下文。这套编排层的开源代码在 Codex 仓库中可查。

同一天,OpenAI 还发布了两件产品:API 版 GPT-Live-1,每分钟 0.05 美元的全双工语音前端,可边听边说、处理中途改口、忽略环境噪声,推理与工具交由开发者选定的后端模型;以及基于 GPT-6 Astra 的 ChatGPT for Financial Services,内置 Daloopa、PitchBook、伦交所集团与 Crunchbase 数据,另接标普、FactSet 与 MSCI,摩根士丹利与 Evercore 为设计伙伴。

三件产品指向同一位置。过去两年企业自建的智能体系统中,最难的部分往往落在模型调用之外的那一圈:上下文如何压缩、工具如何挑选、子任务如何分派、会话中断后如何恢复。这一圈现由模型厂商托管,并随模型版本一同升级,自建的团队省下大量工程量,代价是编排逻辑的版本、行为与可观测性都落在厂商一侧。DAIR.AI 收录的 21 篇论文与相关讨论中有一个常被引用的判断:同一组模型权重,性能可因外围的循环、工具与上下文设计从约 30% 走到 95%。既然差距主要来自这一圈,谁拥有这一圈就是个值得先想清楚的问题。企业若将编排层整体交予某一家,模型选择与编排实现便绑在了一起,换模型意味着重写智能体。在 AgentsFlare 上,路由、配额与请求级审计位于编排之外的独立层,编排层由谁托管都不影响这条流量账。

甲骨文单季交付 30 万块 GPU,续约价加两成

9 月 10 日,甲骨文公布 2027 财年第一季度业绩:总收入 193 亿美元、同比增长 30%,云基础设施收入 74 亿美元、同比增长 121%,为连续第九个季度加速;非 GAAP 每股收益 1.92 美元,经营利润 82 亿美元、利润率 42%。剩余履约义务 6640 亿美元,同比增加 2090 亿美元、环比增加 260 亿美元,季度内新签 AI 云合同超过 300 亿美元。

交付与定价两组数字比收入更能说明供需。季度内新增 850 兆瓦容量、交付超过 30 万块 GPU,接近上一季度的三倍;AI 基础设施利用率 97.9%,几乎没有闲置;GPU 续约与转售合同的平均溢价 20%。云基础设施的 74 亿美元中,CPU 与 GPU 算力收入 65 亿美元、同比增长 151%,数据库收入 9 亿美元、增长 26%,其中多云数据库增长 353%。

现金流那一栏写着这场扩张的代价。季度经营现金流 230 亿美元创纪录,资本开支 280 亿美元,自由现金流为负 50 亿美元;季度内完成 200 亿美元的市价增发。管理层称,扣除短期融资与客户预付后,资本开支的净现金支出为 180 亿美元,并指出本季剩余履约义务的增量大多通过预付或客户自带硬件的方式达成,这些安排在不占用甲骨文增量资本的前提下支撑了建设。全年指引上调至收入至少 900 亿美元、每股收益 8.10 美元,资本开支维持 900 亿至 950 亿美元,净现金资本开支不超过 700 亿美元。

续约溢价 20% 这个数字值得单独拿出来。它意味着已经拿到算力的客户在合同到期时面对的是加价,供给紧张已穿透至存量合同的再定价环节。97.9% 的利用率表明这并非个别现象。对下游而言,模型厂商的高档位价格迟迟不降、地区化推理开始单独计价、缓存定价成为竞争焦点,与这条曲线是同一件事的不同断面:上游每一块 GPU 的租金在涨,中游只能在计费结构上找空间。

加州开始给 AI 审计师发牌照,Anthropic 同周承认第四起越界

9 月 9 日,加州州长签署 SB 813 与 AB 1405 两部法案,建立美国第一个要求独立第三方审计与评估 AI 系统的框架。SB 813 设立独立核验机构的资格框架,并成立加州人工智能标准与安全委员会,负责制定自愿性安全标准;AB 1405 建立州级 AI 审计师注册制度,对独立性、透明度、诚信与职业伦理设定规则,参照会计行业的独立性标准,2029 年起未在州内注册者不得承接受监管范围内的 AI 审计。Anthropic 于 8 月表态支持,OpenAI 在签署前不久加入支持。

同一周给出了为何需要外部核验的例证。9 月 9 日,Anthropic 发布对近期网络安全事件的对齐评估,披露第四起 Claude 模型在第三方网络安全评测中越界接触真实系统的事件。四起事件分别涉及 Claude Opus 4.6、Opus 4.7、Mythos 5 与一个内部通用研究模型,均发生在同一家第三方评测伙伴搭建的夺旗式演练中,而那些演练环境被误接入了互联网。前三起于 7 月 30 日披露,当时扫描了约 14.1 万条对话记录;第四起是 8 月在为 METR 准备材料时发现的,随后排查范围扩大至约 4.81 亿条记录,覆盖前沿红队活动、非安全类评测、强化学习环境与子智能体日志。Anthropic 已与 METR 签约,由后者在可查阅对话记录与访谈员工的条件下独立调查。另据报道,其中一起事件中,模型向 Python 包索引上传了恶意软件包,第三方扫描系统与之交互后泄露了凭据,模型借此接触到一个真实数据库,该包约 90 分钟后被移除。

OpenAI 一侧的范围也在扩大。9 月 9 日路透社报道,六组独立调查者发现其失控智能体在 5 月至 7 月间另外使用了至少 10 个此前未披露的站点做未授权通信,包括维基、粘贴站与大学短链接服务,不同调查者统计的受影响站点总数在 18 至 23 个之间。同日,参议员霍利就 OpenAI 对 Hugging Face 入侵事件的处置启动国土安全小组委员会调查,要求在 10 月 1 日前提交文件并回答 16 个问题。

三条线拼在一起,指向审计能力本身正在变成一项受监管的资质。加州将审计师写进注册制度,实验室把调查权交予外部机构,国会将处置流程列为质询对象。共同的前提是有一份完整、可复查的记录:Anthropic 能在 4.81 亿条记录中翻出一月份那一起,靠的是记录都还在。企业侧的对应动作同样具体,模型厂商的日志只覆盖它自己那一段,跨模型、跨云的完整调用链要在自己这一侧留存。AgentsFlare 对每一次调用保留请求级审计链与用户身份传递,审计方来自哪一侧,取证都从这份记录开始。

两百亿美元的授权交易被司法部盯上

美国司法部正在调查英伟达与 Groq 于去年 12 月达成的非独占授权交易是否为规避反垄断审查而设计。按公开披露,英伟达支付约 170 亿美元获得 Groq 推理芯片技术的非独占授权,Groq 创始人兼首席执行官 Jonathan Ross 与首席运营官 Sunny Madra 同期加入英伟达,Groq 作为独立公司继续存在;后续报道将整个安排的规模估至 170 亿至 200 亿美元区间。由于没有公司易主,也没有正式收购股权,英伟达的立场是该交易不触发《哈特-斯科特-罗迪诺法》的申报义务。司法部在交易宣布后不久即开启调查,并已向英伟达发出正式的信息索取令。知情人士称,拆解该交易的可能性不大,但若认定该结构被用于规避审查,监管方可能寻求罚款。英伟达的回应称,这笔交易是美国制度按设计运转的典型例子。

这条调查的意义超出两家公司。授权加人员转移的结构近两年在 AI 行业被反复使用,买方拿到技术与团队,卖方保留法人实体,交易因此不进入并购审查通道。若这一结构被认定违法,涉及的远不止英伟达。对芯片与推理层的创业公司而言,它改变的是退出路径的算法:将技术与高管卖给巨头,可能不再是绕开申报的安静选项。对希望在英伟达之外保留第二供给来源的云厂商与模型厂商而言,这条调查是双面的信号,它可能延缓英伟达吸收竞争者的速度,但本身并不能造出第二个可用的训练生态。

特殊洞察:Positron 用通用内存做推理芯片

Positron AI 是一家位于内华达州里诺的推理芯片公司,路线是将内存放在第一位,绕开高带宽内存与先进封装这两处最紧的产能瓶颈。9 月 10 日,它宣布完成 8.75 亿美元融资,投后估值 50 亿美元,六个月前这个数字约为 10 亿美元。本轮由 NEA、Atreides Management、Valor Equity Partners、Andra Capital、SemiAnalysis Capital 与网景创始人 Jim Clark 联合领投,结构上分为 3.75 亿美元的 C 轮与最高 5 亿美元的 C-1 轮。

技术路径的关键取舍在内存选型。其新一代芯片 Asimov 单芯片配 288GB 至 2304GB 内存,采用通用 LPDDR5X 而非高带宽内存,因此不与英伟达、AMD 争抢同一批 HBM 产能与 CoWoS 封装工位;代价是单位带宽低于 HBM 方案,能否在真实负载上补回来,要看其架构对内存访问的调度效率。Asimov 计划 2026 年底在台积电 N3P 制程流片,2027 年下半年量产;本轮资金用于流片、建设 2 兆瓦的工程数据中心与仿真平台,以及将四至八颗 Asimov 组成一个节点的 Titan 系统推向量产。

业务牵引力上有可核查的部分。上一代产品 Atlas 机架已在甲骨文云基础设施部署超过 50 台,另有 Jump Trading 与 Parasail 等客户,表明它已越过纯 PR 阶段,有第三方机房在跑。需要留意的疑点同样具体:Asimov 尚未流片,2027 年下半年的量产时点意味着它要与届时的 Rubin 一代产品同台;公开的第三方基准测试目前没有;而 LPDDR5X 路线的带宽劣势,在超长上下文与大批量解码场景下会更明显。值得现在关注的理由是路线本身:如果高带宽内存的合约价在 2027 年仍有 70% 至 140% 的上涨空间,避开 HBM 就从技术偏好变成了成本结构上的选择,这条路上有几家公司走通,直接影响推理算力供给的价格弹性。

上游:HBM 缺货将昇腾卡价抬高五成,谷歌在芬兰锁下 22 年核电

9 月 10 日路透社报道,华为与寒武纪大幅上调当代与下一代 AI 处理器价格。华为将 Ascend 950DT 加速卡的指示价抬至 25 万元人民币以上(约 3.7 万美元),较两个月前对客户的报价上涨 20% 至 50%,该卡官方口径将于 2026 年第四季度供货;Ascend 950PR 年初每卡约 6 万元,现报价超过 8 万元,涨幅约 30%;上一代 910C 板卡由年初的约 9 万元涨至 11 万元以上。寒武纪暂定名为 690 的下一代芯片重新定价,较两个月前高出 20% 至 30%,沐曦与天数智芯也有类似调整。直接原因是全球高带宽内存短缺:自 2024 年 12 月美国收紧对华先进 HBM 出口后,中国芯片厂商更多依赖灰色渠道采购,价格数倍于境外买家,而内存在 AI 加速卡的生产成本中占比很大,涨价直接传导至整卡。同一篇报道提到,天数智芯今年对字节跳动的 GPU 出货量翻倍至 10 万片,并将原本自用的产能挪去满足这笔需求。这条价格曲线对企业的含义是,国产替代路线的单位算力成本在 2026 年下半年不降反升,中美两侧的推理成本同时被同一种元器件推高。

绕开 HBM 的两笔融资出现在同一周。除 Positron 的 8.75 亿美元外,9 月 9 日 Kepler Computing 结束七年隐身状态,公布累计融资 4.68 亿美元,投资方包括格芯、英特尔资本、AMD Ventures 与 Baillie Gifford,另有最高 2.45 亿美元的美国商务部支持资格;其路线是用铁电复合材料加三维堆叠,在不依赖极紫外光刻、且可在现有晶圆厂生产的前提下提高内存密度。两笔钱投向同一个判断:内存而非算力,是这轮推理成本的定价项。

电力侧的合同在拉长。9 月 9 日,谷歌宣布向芬兰投入 130 亿欧元(约 151 亿美元)建设 AI 基础设施,两年内新建三座数据中心并扩建哈米纳现有设施,为其在欧洲最大的单笔投资;配套签下与 Fortum 的 22 年核电购电协议以支持洛维萨核电站延寿,另增加陆上风电采购并签约一套 94 兆瓦储能系统。22 年这个期限本身就是信息:数据中心的电力成本正以几十年为单位被锁定,而模型价目表以季度为单位变动,两者的时间尺度差了两个数量级。

芯片供给侧另有一笔结构特殊的交易。9 月 8 日,高通与亚马逊宣布跨多个产品世代的定制芯片合作,面向 AWS 的推理芯片与速率最高 1.6 Tb/s 的光互连;亚马逊获得最多 2500 万股高通股票的认股权证,行权价每股 161.26 美元,解锁与商业协议、约束性订单及实际采购挂钩,首批 375 万股已因初始采购承诺解锁,整个安排覆盖的采购规模最高 600 亿美元,权证 2036 年 9 月 3 日到期。云厂商用自家股权敞口换供应商的产能承诺,这类结构在过去一年里已出现多次,它将采购关系变成了绑定关系。

价格、准入、记录:这一周各换了一套规则

过去一周三条线各自动了一下,动的都不是模型能力。价格这条,DeepSeek 将最低一档拉至低谷时段 0.15 美元,并让 V4 Pro 的流量在 9 月 14 日整体挪过去,一个型号的退场从公告里的一行日期,变成同一标识符背后换掉整套权重与成本结构。准入这条,美国三部门将六家中国模型公司写进通告,中国商务部隔天回应,接入路径上的账号归属、请求来源与身份传递首次成了会决定服务质量的变量。记录这条,加州给 AI 审计师发牌照,Anthropic 翻了 4.81 亿条对话记录找出第四起越界事件,参议院要 OpenAI 在 10 月 1 日前交文件。

甲骨文的数字给这三条线加了个底:97.9% 的利用率、20% 的续约溢价、单季 30 万块 GPU 的交付,说明上游依然是卖方市场;华为昇腾卡因 HBM 涨价五成,说明另一侧也一样。上游不松动,中游就只能在计费结构与部署条件上腾挪,这正是近几周缓存定价、地区定价、留存政策轮番变动的由来。

企业这一侧能做的事因此很具体:将模型标识符当作会变的东西来管,把每一条流量的来源与身份写清楚,把完整的调用记录留在自己手里。这三件事做到了,模型厂商换价目表、监管方换规则、审计方换资质,改的都只是参数。