模型更新

grok-4.6 用 $2 输入价追平 GPT-5.6 Sol,MiniMax-H3 把 2K 视频打到 $0.13/秒:AF 8 月上半月模型更新

Author

Agentsflare Admin

Date Published

AF 本期新增 4 个模型。8 月 6 日上线 Google 的 gemini-3.5-flash-lite,1M 上下文、输出 350 token/s,Terminal-Bench 2.1 从上代 Flash-Lite 的 31% 提到 54%。8 月 7 日上线 MiniMax 原生视频模型 MiniMax-H3,一次出 15 秒 2K 视频并带原生立体声,2K 每秒 $0.13。8 月 13 日上线阿里通义 text-embedding-v4 向量模型,/v1/embeddings 接口同步开放,$0.07/1M 输入 token。同日上线 xAI 的 grok-4.6,500K 上下文,Artificial Analysis 智能指数 61 分与 GPT-5.6 Sol 打平,输入价 $2.00。

退役方面,claude-opus-4-1-20250805 于 8 月 5 日到期,grok-4-1-fast-reasoning 与 grok-4-1-fast-non-reasoning 两个 slug 已按 xAI 官方安排在 5 月 15 日退役。另有 10 个模型公布了 8 月底到 2027 年 6 月之间的退役日期,最近的一个是 8 月 31 日,迁移建议见后文。

执行摘要

本篇核心判断:

  • AgentsFlare 8 月上半月新增 4 个模型:包括 xAI 的 Grok 4.6、Google 的 Gemini 3.5 Flash-Lite、MiniMax-H3 视频模型,以及阿里通义 text-embedding-v4,并同步开放 /v1/embeddings 接口。
  • Grok 4.6 以较低价格进入前沿能力档:在 200K token 以内定价为每百万输入 $2、输出 $6,Artificial Analysis 智能指数为 61,与 GPT-5.6 Sol 持平,适合长程 Agent、研究分析和多步代码任务。
  • MiniMax-H3 与 Gemini 3.5 Flash-Lite 分别覆盖视频和高吞吐任务:H3 支持最长 15 秒、2K、原生立体声视频生成,2K 价格为 $0.13/秒;Gemini 3.5 Flash-Lite 提供 1M 上下文和约 350 token/s 输出速度,适合大规模批处理和 Agent 子任务。
  • 本期同时涉及向量检索与模型迁移:text-embedding-v4 以 $0.07/1M 输入支持 100 多种语言和可调向量维度,适合 RAG 与语义检索;部分 Claude、Grok 等旧模型已退役或公布退役时间,现有用户需要提前安排替换与迁移。


按日上新清单

8 月 6 日:gemini-3.5-flash-lite(Google Gemini 3.5 系列轻量模型,模型 id gemini-3.5-flash-lite)

8 月 7 日:MiniMax-H3(MiniMax 原生视频生成模型,模型 id MiniMax-H3,含 H3-Context-IR 提示增强)

8 月 13 日:text-embedding-v4(阿里通义文本向量模型,模型 id text-embedding-v4),/v1/embeddings 接口开放

8 月 13 日:grok-4.6(xAI Grok 系列旗舰,模型 id grok-4.6)

grok-4.6:$2.00 的输入价,智能指数与 GPT-5.6 Sol 打平

xAI 在 8 月 12 日发布 grok-4.6,AF 于 8 月 13 日上线,兼容现有的 OpenAI Chat Completions 接口,上下文与最大输出均为 500K token。计费按上下文长度分档:单次请求提示词在 200K token 以内,输入 $2.00/1M、输出 $6.00/1M、缓存读取 $0.50/1M;一旦提示词超过 200K,整个请求按输入 $4.00/1M、输出 $12.00/1M、缓存读取 $1.00/1M 结算。这里有个容易踩的坑:超档按整单换算,210K token 的请求会全额按高档计费,超出的那 10K 并不单独算。做长上下文任务时把提示词压在 200K 以内,单位成本差一倍。

和自家上一代 grok-4.5 相比,这一代最实在的地方是价格没动。两代同为 $2.00/$6.00、同为 500K 上下文,xAI 在原有基础上加跑了一轮补充训练,重做了 SFT 轨迹,并在编码、Web 开发、CAD 与 kernel 优化四类任务上做了 agent 强化学习,官方口径是模型在长任务里出现了更多自检与验证行为。往前一档的 grok-4.3($1.25/$2.50、1M 上下文、30K 最大输出)仍在售,两者分工清楚:单纯要长上下文喂料、输出不长的批量任务用 4.3 更划算,需要模型自己跑多步、边做边验的任务上 4.6。

放到市场上,grok-4.6 的位置很明确。Artificial Analysis 智能指数它拿到 61 分,与 GPT-5.6 Sol 持平,落后 Fable 5 一分;GDPval-AA v2 得 1753,CursorBench v3.2 得 69.9%,DeepSWE v1.1 得 65.9%。分项上是有输有赢:GDPval-AA、AA-Briefcase、Harvey LAB 三项领先 GPT-5.6 Sol,DeepSWE 与 Terminal-Bench 两项落后。真正拉开差距的是价格。同为 61 分档位,GPT-5.6 Sol 是 $5.00/$30.00,claude-opus-5 是 $5.00/$25.00,grok-4.6 的 $2.00/$6.00 在输入端只有它们的五分之二,输出端只有五分之一到四分之一。

安全侧的情况一并说清楚。xAI 在 8 月 12 日随模型发布了 grok-4.6 的 model card,其中的对抗性评测覆盖了拒答护栏在压力下是否失守,拒答由安全微调加后训练组成的分层机制执行。同时也有批评声音指出,能力基准公布得很详细,安全结论往往压缩成一两句话,而独立第三方测试要滞后一段时间才出结果。上一代 grok-4.5 在 7 月 8 日发布数小时后,就有越狱研究者公布了绕过截图。这类结论的口径需要区分:越狱测试针对的是裸模型的拒答边界,与生产环境里外挂内容审核、工具白名单、输出过滤之后的实际风险不是一回事。把 grok-4.6 放进对外产品前,建议按自己的业务红线单独做一轮红队,不要直接引用厂商或第三方的单一分数下结论。

适合放的位置是长程 agent 与研究型任务:合同批量审阅、竞品资料的跨源整合、多步代码改造这类需要模型自己规划再执行的链路,500K 上下文加上这个价位,跑一整个工作流的成本比同档竞品低一大截。

gemini-3.5-flash-lite:每秒 350 token,把上代 Terminal-Bench 成绩从 31% 提到 54%

Google 在 7 月 21 日发布 gemini-3.5-flash-lite,AF 于 8 月 6 日上线,模型 id gemini-3.5-flash-lite,1M 上下文、66K 最大输出,兼容现有 Gemini 接口。定价 $0.30/1M 输入、$2.50/1M 输出、$0.03/1M 缓存读取。

这一代的定位是高吞吐与低延迟,输出速度做到 350 token/s,是 3.5 系列里最快的一档。相比自家上一代 gemini-3.1-flash-lite,提升幅度不小:Terminal-Bench 2.1 从 31% 提到 54%,长上下文检索 GDM-MRCR v2 从 60.1% 提到 72.2%,真实任务执行 GDPval-AA v2 从 642 提到 1140。它在几项 agent 与编码评测上甚至越过了体量更大的 gemini-3 flash,SWE-Bench Pro 54.2% 对 49.6%,OSWorld-Verified 74.0% 对 65.1%。另一个实用变化是 computer use 成了内置工具,做界面操作类 agent 不用再自己拼一套工具层。代价是价格比上代略涨,输入从 $0.25 到 $0.30,输出从 $1.50 到 $2.50。

跨厂商对照,同价位区间挤了不少选手:gpt-5-mini $0.25/$2.00、400K 上下文,价格几乎一样;claude-haiku-4-5 $1.00/$5.00、200K 上下文,价格高一档;MiniMax-M2.7 $0.30/$1.20、205K 上下文,输出端便宜一半。gemini-3.5-flash-lite 的差异点在 1M 上下文和 350 token/s 的吞吐,做长文档批处理和高并发 agent 分支时优势明显;纯短对话跑量的话,输出更便宜的选项更合算。往上一档的 gemini-3.5-flash 是 $1.50/$9.00,智能指数 50 对 37,质量差距真实存在,值不值这五倍价差要看任务类型。

它适合承接的是主 agent 底下的批量子任务:电商商品库的属性抽取、票据翻译与摘要、大规模网页解析这类一次几十万条的活儿,让贵模型做规划、这个模型做执行层,整体成本能压下来一个数量级。

MiniMax-H3:15 秒 2K 视频带原生立体声,2K 每秒 $0.13

MiniMax 在 7 月 31 日发布 H3,AF 于 8 月 7 日上线,模型 id MiniMax-H3。这是一个把文本、图像、视频、音频读进同一个上下文的全模态生成模型,支持文生视频、图生视频(首帧/尾帧)、参考图生视频,输出 768P 或 2K,单段 4 到 15 秒,自带原生立体声。配套的 H3-Context-IR 做提示词增强,把粗略描述改写成模型更吃得准的镜头语言。

调用走四个接口:https://api.agentsflare.com/minimax/v2/video_generation 建任务,/minimax/v2/h3_context_ir 做提示增强,/minimax/v2/video_regeneration 把 768P 结果重生成到 2K,/minimax/v2/query/video_generation/{id} 查询状态。

计费分三块。提示增强按 token 算,$0.9/1M 输入、$3.6/1M 输出。视频按秒算,2K 生成 $0.13/秒、768P 生成 $0.08/秒、2K 重生成 $0.05/秒。生成图按张算,2K 与 768P 通道 $0.04/张,2K 重生成 $0.025/张。先用 768P 跑十几版试镜、选中的再重生成到 2K,这条路径的单位成本是 $0.08 加 $0.05,比直接按 2K 反复出片便宜三成以上。

纵向看,H3 相对 MiniMax 自家的 hailuo 2.3 一代,主要变化是从单一视频生成变成全模态输入、加了原生立体声、分辨率提到 2K,并且把重生成拆成独立的低价通道。横向看,Artificial Analysis 在 8 月 3 日的榜单上给 H3 视频编辑第一、文生视频与图生视频进前三,这是第一个在该榜拿下第一的开放权重模型。价格对照更直观:Sora 2 的 720P 是 $0.30/秒,Veo 3.1 标准档约 $0.75/秒,Kling 3.0 标准档约 $0.084/秒且含音频,H3 的 2K $0.13/秒放在这条线里属于高分辨率档位里最便宜的一档。

开放权重这块有个细节值得留意。MiniMax 公布的是 33B 的 H3-Base,2K 重生成与提示处理模块没有一并放出,自己在本地跑上限是 768P,榜单上拿第一的那套配置与公开权重并非同一套。要 2K 出片,走接口调用。

它适合的是广告、电商与游戏素材的批量试片:一条商品脚本先出十几个分镜方向,选中的再上 2K,配音不用另外拼一层 TTS。

text-embedding-v4:/v1/embeddings 接口开放,$0.07/1M 输入

8 月 13 日 AF 开放 /v1/embeddings 接口,首个上线的向量模型是阿里通义的 text-embedding-v4,模型 id text-embedding-v4,定价 $0.07/1M 输入 token。接口兼容 OpenAI 格式,地址是 https://api.agentsflare.com/v1/embeddings,支持 dimensions 与 encoding_format 参数。

这是通义实验室基于 Qwen3 训练的多语言统一向量模型,覆盖 100 多种语言,向量维度可在 64 到 2048 之间自选,1024 维是检索质量与存储成本的常用平衡点。单条文本上限 8192 token,一次请求最多传 10 条。除了常规稠密向量,它还支持任务指令(instruct)与稀疏向量:前者用一句英文指令告诉模型这批向量将用于什么检索场景,后者便于和关键词检索做混合召回。

相比自家 v3,官方口径是在 MTEB 多语言、中英、Code 检索等评测上效果提升 15% 到 40%,维度从固定值变成可自选是工程上最省钱的一处改动:同一份语料按 512 维建库,向量存储与相似度计算的开销比 1024 维直接减半。

跨厂商对照,$0.07/1M 这个价位在主流向量模型里处于低位:OpenAI text-embedding-3-large 是 $0.13/1M(3072 维),Google Gemini Embedding 是 $0.15/1M(3072 维、单条上限 2048 token),Voyage 的大模型档约 $0.18/1M。更便宜的选项是 OpenAI text-embedding-3-small 的 $0.02/1M,但它只做英文场景更稳,中英混排与多语言语料上 text-embedding-v4 的召回质量优势更明显。单条 8192 token 的输入上限也比 Gemini Embedding 的 2048 宽出四倍,长文档切块时少一层切分逻辑。

它承接的是 RAG 与语义检索的底座:企业知识库、工单历史检索、商品与简历的语义匹配、聚类与分类打标。按 $0.07/1M 算,一份 10 亿 token 的语料全量建库的向量化成本是 70 美元量级。

已退役模型与替换建议

以下 3 个模型已到期,调用会直接失败:

claude-opus-4-1 的迁移是一笔划算买卖。上一代 opus-4-1 是 $15.00/1M 输入、$75.00/1M 输出、200K 上下文、32K 最大输出;claude-opus-5 与 claude-opus-4-8 同为 $5.00/1M 输入、$25.00/1M 输出、1M 上下文、128K 最大输出。输入输出价降到三分之一,上下文扩到 5 倍。需要注意的是 opus-4.7 及以后的版本对采样参数收紧了,temperature、top_p、top_k 设成非默认值会直接返回 400,迁移时把这几个参数从请求里删掉,靠提示词控制风格。

两个 grok-4-1-fast slug 的情况要单独说。按 xAI 的退役公告,打到这两个 slug 的请求会自动重定向到 grok-4.3,也就是说代码不改也不会报错,但计费按 grok-4.3 的 $1.25/$2.50 走,而不是原来的 $0.20/$0.50,输入端涨了 6 倍多。请尽快把 model 字段显式改成 grok-4.3,推理类负载把 reasoning effort 设成 low,非推理类设成 none。如果原本用这两个 slug 就是图便宜,可以直接换一条线:gemini-3.5-flash-lite $0.30/$2.50、gpt-5-nano $0.05/$0.40、deepseek-v4-flash $0.14/$0.28、gemini-2.5-flash-lite $0.10/$0.40,都比 grok-4.3 便宜,先在测试项目里对齐输出质量再切生产流量。

即将退役:10 个模型的时间表

8 月 14 日根据 Microsoft Azure AI Foundry 与 Google Cloud 官方的生命周期文档,更新了以下模型的退役日期。最近的一个在 8 月 31 日,建议现在就排迁移窗口:

这批里迁移收益最高的是 gemini-2.5-flash:新旧同为 $0.30/$2.50,换到 gemini-3.5-flash-lite 等于白拿一整代能力提升。o1 系列与 o3-mini、o4-mini 这几个推理模型的替换普遍是降价的,gpt-5 系列在同类任务上的表现与价格都更好。sora-2 是唯一需要重做工程的一项,视频接口的参数与产物格式各家不同,建议留出两到三周的适配时间。

价格与计费对比

本期 grok-4.6、gemini-3.5-flash-lite、text-embedding-v4 按 token 计费,MiniMax-H3 的视频部分按秒与按张计费、提示增强部分按 token 计费。关键模型对比如下:

MiniMax-H3 的视频与图像部分单列:

同期视频模型的参考价:Sora 2 的 720P 约 $0.30/秒,Veo 3.1 标准档约 $0.75/秒,Kling 3.0 标准档约 $0.084/秒。

企业选型建议

长程 agent 与研究型任务:grok-4.6 在 $2.00/$6.00 这个价位提供了 61 分智能指数,合同审阅、跨源资料整合、多步代码改造这类模型自己规划再执行的链路,成本比同档的 GPT-5.6 Sol、claude-opus-5 低一半以上。把提示词控制在 200K 以内,避免整单跳档。

高吞吐执行层:gemini-3.5-flash-lite 的 $0.30/1M 输入配 350 token/s,适合放在主 agent 底下做批量子任务;对输出成本更敏感、上下文需求在 200K 量级的场景,MiniMax-M2.7($0.30/$1.20)的输出端更便宜。

视频素材生产:MiniMax-H3 走 768P 试镜、2K 定稿的两段式流程,原生立体声省掉一层配音工程。需要严格版权与合规审查的品牌片,仍建议保留一路 veo-3.1 或 kling-v3 做备选。

检索与知识库:text-embedding-v4 建库,$0.07/1M 的成本让全量重建索引成为可以定期跑的常规操作;维度按语料规模选,百万级文档用 512 维就够,千万级以上再上 1024 维。

这些组合在 AF 上的落地方式是把每类任务建成独立项目:项目里指定自己的模型调用顺序,主模型与兜底模型自己排,随时换 API 而不动业务代码;每个项目单独设预算上限与配额,视频这类按秒计费的任务尤其需要,跑失控的试片任务会在几小时内吃掉一个月预算;权限按团队分配,素材生产开给内容组,合同审阅只留给法务与风控。月底账单按项目自动拆分,哪条链路值不值这个钱,看数就知道。

想评估这几个模型在自己业务里的表现,可以联系 AF 团队开测试额度,我们帮你按任务类型搭一版模型组合先跑起来。