Kimi K3 与 GLM-4.6v 上线 AF:1M 上下文旗舰登顶 WebDev 榜,视觉模型价格减半
Author
Agentsflare Admin
Date Published
本篇核心内容:
- AgentsFlare 本期新增 Kimi K3 与 GLM-4.6v:Kimi K3 面向长上下文、代码与智能体任务,GLM-4.6v 面向图像理解、文档解析和多模态业务场景。
- Kimi K3 主打 1M 上下文与重型任务能力:模型采用约 2.8 万亿参数的 MoE 架构,定价为每百万 Token 输入 3 美元、输出 15 美元,适合整库代码重构、长文档分析和长链路智能体任务。
- GLM-4.6v 将视觉模型价格较上代减半:输入价格为每百万 Token 0.30 美元、输出为 0.90 美元,适合单据解析、图片审核、图表问答及批量视觉数据处理。
- 企业应根据任务复杂度分层使用模型:高复杂度长程任务使用 Kimi K3,高频视觉任务使用 GLM-4.6v,普通批量任务则可继续使用成本更低的模型;同时应尽快迁移已退役的 Claude 4 和 Gemini 预览版模型。
正文
AF 本期新增 2 个模型:7 月 15 日上线智谱视觉模型 GLM-4.6v,输入输出价较上代减半;7 月 20 日上线月之暗面旗舰 Kimi K3,1M 上下文,发布当天登上 Arena WebDev 榜首。同期退役 5 个旧版模型:claude-sonnet-4 与 claude-opus-4 已于 6 月 15 日停用,gemini 3.1 flash 与 gemini 3 pro 的 3 个预览版于 7 月 9 日至 17 日陆续停用,迁移建议见下文。
按日上新清单
7 月 15 日:GLM-4.6v(智谱 GLM-4.6 系列视觉模型,模型 id glm-4.6v)
7 月 20 日:Kimi K3(月之暗面 Kimi 系列旗舰,模型 id kimi-k3)
Kimi K3:1M 上下文的开源旗舰,上线即登 WebDev 榜首
月之暗面 7 月 16 日发布 Kimi K3,AF 于 7 月 20 日上线。这是 Kimi 系列迄今规模最大的一代:总参数约 2.8T 的 MoE 架构,1M token 上下文窗口,最大输出 131K token,并具备原生视觉能力,兼容 OpenAI Chat Completions 接口。定价 $3.00/1M 输入、$15.00/1M 输出、$0.30/1M 缓存读取。
和自家上一代 Kimi K2 Thinking(AF 价 $0.60/$2.50,262K 上下文)相比,K3 的迭代幅度主要在工程与 agent 任务上:SWE-bench Verified 76.8 对 71.3,BrowseComp 91.2 对 88.0,上下文窗口从 262K 扩到 1M,且在 1M token 长上下文评测中拿到 90.4 的保持率。代价是价格上了一个档位,从 $0.60/$2.50 涨到 $3/$15。K2 Thinking 仍然在售,两代形成明确的分工:日常批量任务用 K2 Thinking,重型长链路任务上 K3。
放到市场上看,K3 的定价正好与 Claude Sonnet 4.5 完全对齐(同为 $3/$15,缓存读取同为 $0.30),上下文则是 Sonnet 4.5 的 5 倍(1M 对 200K)。发布当天,K3 以 1679 分登上 Arena WebDev 榜首,领先 Claude Fable 5(1631)与 GPT-5.6 Sol(1618);在 Artificial Analysis 综合榜上排第 4,位于 Fable 5 与 GPT-5.6 各档之后。综合来看,K3 的长板在前端代码生成与长程 agent 执行,深度推理仍是 Anthropic 与 OpenAI 旗舰更强。
典型业务场景:跨仓库的代码迁移与重构。一个中型代码库连同 issue 历史、依赖文档整体塞进 1M 上下文,让模型在完整语境下做重构规划与逐文件修改,避免分段处理时上下文丢失导致的接口不一致。
GLM-4.6v:输入价减半的视觉模型,$0.30/1M 起
智谱 GLM-4.6 系列的视觉模型 GLM-4.6v 于 7 月 15 日上线 AF,模型 id glm-4.6v,支持图像理解等多模态对话场景,兼容 OpenAI Chat Completions 接口。定价 $0.30/1M 输入、$0.90/1M 输出、$0.05/1M 缓存读取。
这代最直接的变化是价格:上一代 GLM-4.5V 原厂定价 $0.60/1M 输入、$1.80/1M 输出,GLM-4.6v 输入输出双双减半,还加上了 $0.05 的缓存读取档。能力上,原厂将训练上下文扩展到 128K token,原生支持工具调用(function call),在 MMBench、MathVista、ChartQAPro 等多模态基准上做到同规模开源模型第一梯队,长文档理解任务上超过参数量更大的 Qwen3-VL-235B。
跨厂商对照,同价位的开源视觉选项主要是阿里 Qwen3-VL 系列:Qwen3-VL-235B-A22B Thinking 原厂价约 $0.26/1M 输入、$0.90/1M 输出,与 GLM-4.6v 几乎同价。两者的差异点在于 GLM-4.6v 的原生工具调用与长文档表现,Qwen3-VL 则胜在系列型号更全(32B 版低至约 $0.10/1M 输入)。做视觉任务选型时建议拿自己的真实样本各跑一轮,这个价位试错成本很低。
典型业务场景:单据与图纸的批量结构化。保险理赔照片审核、制造业质检报告解析、零售商品图合规检查这类高吞吐场景,按 $0.30/1M 输入的价格,百万级图片文档的处理成本比一年前低了一个数量级。
模型退役通知
以下 5 个模型已到达生命周期终点,现已退役:

仍在调用这些 id 的请求会失败,请尽快迁移。Claude 4 系列可平移到 claude-sonnet-4-5 / claude-haiku-4-5;gemini 3.1 flash 预览版可切换到 gemini-3.5-flash 或 gemini-3.6-flash 正式版。迁移前建议先在测试项目里对齐输出质量与成本,再切生产流量。
价格与计费对比
本期两个新模型均按 token 计费,与原厂定价一致。关键模型对比如下:

企业选型建议
长程 agent 与代码任务:Kimi K3 适合整库重构、长文档链路这类一次性喂入大量上下文的重型任务;日常代码补全与批量处理留给 Kimi K2 Thinking 或 GLM-4.6,成本相差 5 倍以上。
多模态与文档理解:GLM-4.6v 覆盖单据解析、图表问答、图片审核的主力需求;对精度要求极高的场景可以用 Claude Sonnet 4.5 做抽检复核,形成便宜模型跑量、贵模型把关的两层结构。
对话与通用任务:Claude Haiku 4.5($1/$5)仍是质量与成本平衡点;退役的 Claude 4 系列用户建议直接升级到 4.5 系列。