AI 基础设施周报

Anthropic 将每条 prompt 交给企业服务器裁决,Qwen3.8-Max 输出价压至 6 美元,MiniMax H3 开源权重却把 2K 留在 API——模型厂开始把控制权切成两半卖

Author

AgentsFlare Research

Date Published

本周三项动作指向同一处:模型厂开始重新划线,划的是企业能管到哪一层。8 月 5 日,Anthropic 为 Claude Enterprise 上线推理钩子。每条员工 prompt 进入模型之前,先发送至企业自有的安全服务器,换回放行或拒绝的判决;判决只有这两种,服务器既不能改写,也不能脱敏。8 月 3 日,阿里 Qwen3.8-Max 上线,每百万 token 输入 2 美元、输出 6 美元,输出价仅为同价位 GPT-5.6 Terra 和 Gemini 3.1 Pro 的一半。Artificial Analysis 智能指数 58 分,在 185 个模型中排第 9。但阿里既未发布技术报告,也未公开参数;二手报道所称的 2.4 万亿参数和“下周开源权重”,均无官方出处。多模态领域本周更热闹:MiniMax 于 8 月 2 日把 33B 全模态视频模型 H3 的权重放上 Hugging Face;字节跳动 7 月 31 日发布 Seedance 2.5,将单镜头延长至 30 秒。前者许可协议将欧盟、英国、韩国、美国排除在适用地域之外,开源的也只有 768p 部分,2K 仍需调用 API;后者截至本周仍未公布面向开发者的官方计价。工具侧,微软 8 月 3 日将安全智能体放入 Defender 公测,官方口径明确按质量、可靠性、延迟和成本动态选择模型;Cloudflare 则用一整周时间,把智能体的运行时、网络、支付、浏览器成套端了出来。

执行摘要

本篇核心判断:

  • Anthropic 推理钩子公测上线:每条 prompt 经签名 HTTPS POST 发往企业自有 DLP/安全服务器,默认 5 秒超时内返回放行或拒绝,之后 Claude 才开始生成;覆盖 Claude 聊天、Claude Code 与 Claude Cowork,客户端无需安装任何组件。已列出 Netskope、Palo Alto Networks、Zscaler、Proofpoint 为可对接目标,判决为二元,不支持改写或脱敏(8/5)
  • 阿里 Qwen3.8-Max 上线:每百万 token 输入 2 美元、输出 6 美元,缓存命中 0.25 美元;100 万上下文,支持文本、图像、视频输入。Artificial Analysis 智能指数 58,排名 #9/185,输出速度 67.6 token/秒;官方未发布技术报告,未披露参数(8/3)
  • MiniMax 开放 H3 权重:33B 稠密单流全模态模型,输出 4–15 秒、24 FPS、32kHz 原生立体声、支持 11 种对话语言;开源仅为 768p 的 H3-Base,上下文理解模块与 2K 再生成模块留在 API。社区许可适用地域排除欧盟、英国、韩国、美国,年营收超 2000 万美元须另行书面授权,禁止使用输出训练其他模型(权重 8/2 上线,8/3 官宣)
  • 字节 Seedance 2.5 正式发布:单镜头从 15 秒翻倍至 30 秒,单次参考素材上限从约 15 份提至 50 份(30 图 + 10 视频 + 10 音频),新增时间戳级编辑、绿幕重打光、运镜再编辑、泥模参考;首发即梦与豆包,开发者 API 官方仅称“即将通过 BytePlus ModelArk 开放”,计价至今空白(7/31)
  • 微软 Project Perception 进入 Defender 公测:RED/BLUE/GREEN 三类安全智能体分别负责发现攻击路径、研判信号、执行加固,搭载自研 MAI-Cyber-1-Flash;官方明确系统按质量、可靠性、延迟、成本动态选择模型,所有基准数字均为微软自述(8/3)
  • Cloudflare Agents Week 连发一周:@cloudflare/computer 为每个智能体提供一台虚拟机,Cloudflare Wallets 采用 x402 协议让智能体自主付费购买 API 与内容,Mesh 将智能体与多云基础设施收进同一张私有网络,Email Service 公测,Kitesurf 无状态浏览器(8/2–8/6)
  • 算力上游:TrendForce 7 月 31 日更新合约价,三季度传统 DRAM 环比再涨 13–18%,DDR4 现货每 Gb 2.10 美元已高过 HBM3e 的 1.70 美元(Counterpoint);B200 按需租金 8 月初约每小时 5.5–5.8 美元;NRG 8 月 4 日披露,已与一家未具名的全球云与 AI 超大规模客户就德州 1.2GW 燃气电厂敲定主要商业条款
  • 特殊洞察:伦敦光子推理芯片公司 OLIX 完成 3.12 亿美元 B 轮,估值 33 亿美元,为欧洲迄今最大半导体融资,Arm、Hudson River Trading 与 Reed Hastings 参投(8/3)


AgentsFlare 是企业 AI 控制平面,帮助企业在多模型、多云环境下统一管理模型与智能体的调用路由、成本归因与访问审计。AI Infra Weekly 是 AgentsFlare 推出的追踪全球 AI 基础设施层信息变动的专栏,从独立视角追踪模型、算力、监管的关键变动,帮企业在格局固化之前看清方向。

主要事件

Anthropic 让企业服务器决定 prompt 能否进入模型

8 月 5 日,Anthropic 为 Claude Enterprise 开放推理钩子公测。机制不复杂:员工 prompt 离开客户端后、模型推理前,Anthropic 通过一次签名的 HTTPS POST 将整段会话记录发往企业自有的 DLP 或安全服务器;服务器在默认 5 秒超时窗口内返回放行或拒绝,Claude 只有收到判决后才开始生成。一个组织级配置即可覆盖 Claude 聊天、Claude Code 与 Claude Cowork 三个界面,用户设备上无需安装任何东西。协议基于公开 schema 的 webhook,官方点名 Netskope、Palo Alto Networks、Zscaler、Proofpoint 四家可直接对接,也允许企业指向自建服务器。

限制明确写在协议中:判决只有放行和拒绝两种,服务器不能改写、不能脱敏,也不能将敏感字段替换后放行。一条包含客户身份证号的提问,唯一结局就是整条被拦截,员工得不到任何结果,安全团队要么放宽规则,要么承受可用性损失。变化在于检查点的位置——过去企业管控 AI 流量内容,要么在网络出口部署代理,要么在终端安装客户端,两条路都需要维护一套与 AI 无关的基础设施;现在这个检查点移到了模型厂自己的服务器上,由模型厂主动回调企业。这是模型厂首次将推理链路中的一个环节交给客户来裁决。

对企业采购的影响需从两层来理解。积极的一面是,这条钩子把过去只能依赖合同和信任的敏感数据准入,变成了可执行的技术控制;另一面,它只对 Claude 这一家界面生效。如果同一家企业同时使用 GPT-5.6 做批量分类、Qwen 做多模态预处理,以及用开放权重模型自托管,就必须为每家厂商各配一次策略、各接一次协议、各维护一套审计口径,而各家的判决语义、超时行为和是否支持脱敏都不同。将这层策略执行放在企业自己的控制平面上,让同一条脱敏与准入规则对所有模型生效,把请求级审计链与按用户、按 endpoint 的调用记录统一沉淀在一处,才是多模型环境中真正收得住的做法。在 AgentsFlare 上运行 AI 流量的企业,模型可换、多家并用,这层规则和审计不随任何一家厂商的产品形态漂移。

Qwen3.8-Max 把 2 美元价位输出价砍掉一半

8 月 3 日,阿里发布 Qwen3.8-Max,每百万 token 输入 2 美元、输出 6 美元,缓存命中 0.25 美元;100 万 token 上下文全程不分档,5000 token 和 90 万 token 同价,支持文本、图像与视频输入。Artificial Analysis 独立评测将其放在智能指数 58 分,185 个模型中排第 9,输出速度 67.6 token/秒,跑完整套指数花费 1741 美元。同一评测也指出它相当啰嗦:跑分时生成了 1.5 亿输出 token,而中位数是 7000 万。

放在同价位来看,差异集中在输出侧。GPT-5.6 Terra 在 7 月 30 日降价后为 2/12 美元,Gemini 3.1 Pro 同为 2/12 美元,Qwen3.8-Max 输入价与两者持平,输出价仅一半。长上下文算法亦不同:Gemini 3.1 Pro 在输入超过 20 万 token 后跳至 4/18 美元一档,Qwen3.8-Max 则在 100 万窗口内全程不分档。对话类产品和批量抽取等输出量小的场景感受不到差别,推理型工作负载的账单却主要由输出 token 决定——何况该模型本身偏啰嗦,实际每次任务的输出量会比价目表看上去更接近同行。一处保留必须写明:阿里未为此版发布技术报告,也未公开参数规模,Artificial Analysis 直接记录为闭源、参数未披露;二手报道流传的 2.4 万亿总参数、950 亿激活参数和“下周开源权重”,均找不到官方出处,选型时不应据此排期。

价格带上压出的空档有实际用途。同一工作流中,不同环节的最优模型现在明确分布在两个数量级上:批量多模态预处理、分类、抽取用分币到角币级模型即可覆盖;长上下文中等推理落在 2 美元这一档;只有真正吃能力的环节才值得调用两位数单价的旗舰。让请求按任务类型与成本预算分流至不同模型,再对每个团队和项目消耗设定配额,是把这条价差变成账单差的前提。否则,一个默认路由至旗舰的工作流,会把本周省下的一半输出价全部还回去。

视频模型集中上新,企业真正拿到手的却只有很细的一截

本周多模态侧动作密集,但每一条开放都带着限定条件。8 月 2 日,MiniMax 将新一代全模态视频模型 H3 的权重放上 Hugging Face,次日正式官宣。H3 是 33B 参数的稠密单流 Transformer,不走 MoE,可接受文字、图像、视频、音频任意组合输入,输出带原生 32kHz 立体声的视频,4 至 15 秒、24 FPS,稳定支持 11 种对话语言。其技术选择是让同一个 Transformer 同时预测视频和音频的潜在表示,从架构上绕开了先出画面再配音路线中口型与环境声对不齐的老问题。开源当天,社区便补齐了 NVFP4、FP8、INT4、GGUF 全套量化版本,diffusers 管线、ComfyUI 模板、SGLang 与 vLLM 部署指南同步就位。

但拿到手的只是系统的中段。完整 H3 系统包含三个模块:将复杂多模态输入提炼成结构化中间表示的 H3-Context-IR、生成 768p 音视频的 H3-Base,以及把 768p 结果连同原始上下文回炉重生成 2K 的 H3-Regenerate-2K。开源的只有 H3-Base,前后两个模块都留在 API 里——自托管只能跑 768p,官方宣传的 2K 必须走回官方接口。许可条款对企业侧约束更硬:H3 社区许可的适用地域直接排除欧盟、英国、韩国和美国,这些地区的用户需单独联系 MiniMax 申请授权;年营收超过 2000 万美元商用须另行书面授权;不得用 H3 输出训练其他模型;商用产品界面必须显著标注“MiniMax H3”。对跨国企业而言,这几条合起来意味着它不是能按开源惯性直接投产的模型,法务评估应排在技术验证前面。官方技术报告与基准数据至今未随权重发布,质量上限仍待独立评测验证。

价格是它最锋利的部分。MiniMax 官方称,2K 分辨率下每秒价格不到主流模型的三分之一,768p 下不到主流 720p 价格的一半;报道给出的对标约为 Seedance 2.0 的三分之一。Seedance 这边,字节 7 月 31 日正式发布 2.5:单镜头时长从 15 秒翻倍至 30 秒,单次参考素材上限从约 15 份提到 50 份(30 张图、10 段视频、10 段音频),另增四类能力——时间戳级编辑、绿幕换背景后按新环境光重新打光、运镜再编辑,以及用无材质白模搭出空间结构再生成画面的泥模参考。首发渠道是即梦 Web 端和豆包 Pro 两个中国消费级应用,订阅套餐和额度不变,2.0 也不下架。面向开发者的 API,官方博客只写了“即将通过 BytePlus ModelArk 开放”,没有日期;计价方式到本周仍是空白,第三方给出的按秒估算彼此相差数倍,主流聚合平台上也查不到对应模型 ID。第三方评测同样滞后:Artificial Analysis 的文生视频 Elo 榜上,Seedance 2.0 以 1225 分排第三,本周上线的 MiniMax H3 以 1242 分反超,而 Seedance 2.5 至今查不到独立条目——厂商自述的升级幅度是真实信号,只是尚无第三方交叉验证。

三条并排来看,视频生成正重复文本模型两年前的路:能力在快速逼近可商用,但开放权重附带的地域与营收条款、正式发布中缺席的开发者计价,加上独立评测滞后,将选型不确定性推到了合同与账单这一侧,效果反倒是最好验证的部分。企业在此阶段能做的最实际的事,是把视频生成调用抽象在自己的接入层中,模型 ID、时长上限、参考素材数量、输出分辨率都当参数处理,别写成常量。本周这批模型规格和计价都还在变动,待到定价明确再切换,成本应该只是改一行配置的事。

微软与 Cloudflare 同周搭出智能体底座,一个自做多模型路由,一个把运行时全包

8 月 3 日,微软将 Project Perception 放入 Microsoft Defender 公测,面向一批已在测试其漏洞分析框架的企业客户。架构由三类智能体分工:RED 持续寻找可利用的攻击路径,BLUE 研判信号并结合上下文推理出真正有意义的风险,GREEN 执行修复与加固。配套的是 MAI-Cyber-1-Flash,微软首个专为网络安全场景自研的模型。官方在系统设计描述中直接写明:Project Perception 是多模型的,系统按质量、可靠性、延迟和成本动态选择能力。一家自己造模型、自己卖云的超大规模厂商,在自家最重要的安全产品中搭了一层按四个维度动态选模型的机制,没有把调用固定到自家模型上——这层路由逻辑正从少数前沿团队的实践,变成产品的默认架构。需要注明的是,这仍是公测而非正式可用,官方给出的所有基准数字均为微软自述,尚未独立验证。

同一周,Cloudflare 在 8 月 2 日至 6 日的 Agents Week 中,将智能体缺失的基础设施成套推出。开局是 @cloudflare/computer,一个早期预览版开源库,为每个智能体配一台自己的虚拟计算机,配备跨语言 RPC 与入站 TCP 支持。随后是 Cloudflare Wallets,用 x402 协议解决一个此前无人正面处理的问题——智能体开不了银行账户,也无法走浏览器上那套第三方账号登录;钱包赋予它原生付费能力与可验证身份,让它在明确的安全护栏内自主购买 API 和内容。再往后是 Mesh,把智能体、人和多云基础设施收进同一张私有网络;Email Service 进入公测,让智能体原生收发和处理邮件;Kitesurf 是跑在 Workers 上的无状态浏览器。

两条放在一起,一个此前分散的判断落到了实处:企业接下来要治理的不仅是模型调用,还有一个会自己付钱、自己收发邮件、自己开浏览器、自己在私有网里活动的执行体。微软那条表明多模型动态选择已是产品级默认;Cloudflare 这条说明智能体的运行时正由一家厂商成套供给,方便的代价是整套身份、网络与支付都长在单一基础设施上。企业真正需要留在自己手中的,是跨这些运行时的身份传递、工具访问控制与请求级审计——哪个智能体、代表哪个用户、调用了哪个模型和哪个工具、花了多少钱,这条链路一旦散进各家运行时,就再也拼不回来。

算力上游信号:内存涨价压力开始挑客户,电力合同越签越像重资产

本周上游有两条方向不同的价格线值得记录。内存继续上行:TrendForce 于 7 月 31 日更新合约价,三季度传统 DRAM(服务器内存,AI 服务器每张加速卡都需外挂大量 DRAM)合约价环比再涨 13–18%,不过涨幅较前两个季度收窄,原因是消费类需求转弱与基数变高。结构性错位更为明显:Counterpoint 数据显示,DDR4 现货价已达每 Gb 2.10 美元,高过 HBM3e(高带宽内存,将多层内存芯片垂直堆叠并紧贴处理器封装,是 AI 芯片的性能瓶颈之一)的 1.70 美元——上一代通用内存卖得比当代最先进的 AI 专用内存还贵。原因在供给侧分配,而非需求侧:原厂将产能优先拨给 HBM 和高端 NAND 等单价更高的产品,通用内存供给因此被挤出;而 HBM 采用年度定价机制,季度市场价上涨未能及时反映进合约价。传导至企业侧的含义很直接:这轮涨价压力主要落在没有多年长约保护的客户,以及长约客户配额之外的增量采购上,自建推理集群的内存成本会比同规格租赁方案更早感受到压力。

GPU 租金相对平稳。8 月初 B200 按需租金约每小时 5.5–5.8 美元,多家云的报价落在 6 至 10 美元区间,最低预留档至 3.35 美元;H100 中位数在每小时 2.29 至 3.12 美元,最便宜的按需渠道为 1.40 美元。两者共同说明一点:推理成本弹性目前主要来自租赁渠道的选择,硬件迭代带来的降幅要慢得多;而吃到这层弹性的前提,是负载能在不同供给方之间迁移。

电力侧本周有一笔合同结构值得留意。8 月 4 日,NRG 在二季度财报中披露,已就一座位于德州、1.2GW 的联合循环天然气电厂,与一家未具名的“全球云与 AI 超大规模厂商”敲定主要商业条款;同期 Brookfield 与 NextEra 计划将美国能源部位于肯塔基的旧铀浓缩厂址改造成 1.2GW 的 AI 数据中心园区,自带发电。这类交易的共同点,是把电厂与数据中心写进同一份合同,发电容量成为项目资产的一部分,而非从公共电网采购的服务。对企业的现实含义是,区域算力可得性越来越取决于当地的发电与并网进度,云厂商在某个区域挂出的实例列表只反映当下——签订三到五年区域算力长约时,这层进度应进入尽调清单。

特殊洞察:OLIX 拿 3.12 亿美元赌一件事——推理芯片不该靠铜线传数据

8 月 3 日,伦敦光子芯片公司 OLIX 完成 3.12 亿美元 B 轮,估值 33 亿美元,为欧洲迄今最大一笔半导体融资。领投方为成长基金 Fundomo,参投方包括 Arm、Hudson River Trading 以及 Netflix 联合创始人 Reed Hastings 等天使投资人,现有股东全部加投;同时将 Nick McKeown 请进董事会——软件定义网络、OpenFlow 与 P4 的共同发明人、斯坦福荣休教授。公司 2024 年 3 月在伦敦成立,创始人 James Dacombe 当时 24 岁,今年 1 月才由 Flux 更名为 OLIX,2 月刚拿过 2.2 亿美元 A 轮。

它做的是光学张量处理单元,核心论点是:大规模 AI 计算系统中的能耗与速度瓶颈,相当一部分来自铜线传输数据,改用片上光互连可绕开这层约束。产品路线图的核心是 DX-1,一款针对解码阶段的加速器——也就是模型逐个吐出 token 的那一段。这一段吃的是访存带宽而非算力,恰好落在光互连主张能改善的地方,选点上自洽。

疑点同样清楚:DX-1 计划 2026 年流片,首批交付要到 2027 年下半年,意味着这家公司目前没有一颗量产芯片在客户手中运行推理,33 亿美元估值定在一份路线图和一支团队上。光计算这条技术路线论证了二十年,反复卡在制造良率和现有软件栈的适配上,而这两项恰恰要到流片之后才能验证。Arm 和 Nick McKeown 的入场,表明技术论证在专业侧过了关;但从流片到能被企业视为英伟达之外的第三个选项,中间还隔着完整的软件栈与生态适配。把它记入观察名单,看的是它占据的位置:如果专用架构真能显著改善解码阶段,推理成本结构将重新分层,而这一层目前竞争者极少。

综合判断

本周几项动作放在一起看,模型厂与企业之间控制权的边界第一次划得如此清楚,且分别划在三个不同位置。Anthropic 将准入判决交予企业,条件只能是说“是”或“否”;MiniMax 交出权重,但排除四个主要法域,并把上下文理解与 2K 生成留在自己手中;字节发布能力,开发者计价至今不给。三家的动作形态不同,逻辑却是同一个:厂商正将控制权与模型能力拆开定价,交出去的那部分是最容易复制的中间层,留下的那部分才是议价点。企业获得的自主权比一年前更多,但每一份自主权都绑在特定厂商的界面、法域和产品形态上,换一家就要重来一遍。

微软那条从另一角度印证了同一判断。一家同时造模型、卖云、做安全产品的公司,在自己最重要的安全产品中按质量、可靠性、延迟、成本四个维度动态选择模型,说明多模型路由已走过成本敏感型团队省钱手段的阶段,成为产品级默认架构。而 Cloudflare 用一周将智能体运行时成套端出后,要治理的对象也随之扩大:一个会自主付费、自主收发邮件、自主开浏览器的执行体,其身份、权限和账单若散进各家运行时,就没有任何一处能拼出完整的因果链。上游两条价格线位置未变——内存涨价挑着没有长约的客户下手,租赁渠道仍是推理成本弹性的主要来源。企业能做的收敛动作方向明确:把准入规则、路由策略、成本归因和审计链留在自己控制的一层上;厂商侧形态再变,影响的也只是适配工作量。