Kimi 系列怎么选?K3 / K2.6 / K2 实测对比
月之暗面(Moonshot)刚发了新旗舰 K3——AA Intelligence 57,全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol。 产品线现在是三档:K3 旗舰(AA 全球第 3)、K2.6 主力(API 开发性价比之选)、K2 轻量入门。 直接看数据。
一句话结论
追求最强能力选 K3。 AA Intelligence 57,全球第 3(仅次于 Claude Fable 5 和 GPT-5.6 Sol),国产模型第 1。1M 上下文,速度 62 t/s。但输出价 $15/M,是 K2.6 的 4 倍——贵,但能力确实强。
API 跑量用 K2.6。 Intelligence 44 和 DeepSeek V4 Pro 持平,$0.68/$3.42 在国内旗舰里不算最便宜但也不贵。网页端读 PDF/Excel/PPT 体验国内最好。7 月价格过山车:先涨到 $0.95/$4.00,7-21 又跌回 $0.68/$3.42。
预算极紧选 K2。 $0.57/$2.30、128K 上下文,做分类和短问答够用。但 128K 在 2026 年已经算小了,长文档别用它。
全系参数对照
| 型号 | Intelligence | 速度 t/s | 上下文 | 输出价 |
|---|---|---|---|---|
Kimi K3 新旗舰 · 全球第 3 | — | — | 1M | $15.00 |
Kimi K2.6 API 主力 | — | — | 262K | $3.42 |
Kimi K2 轻量入门 | — | — | 131K | $2.30 |
数据来源:Artificial Analysis(2026-07-21)、OpenRouter 定价。K2 不在 AA 主 leaderboard 评测范围内。
Kimi K3:国产首个全球 Top 3
K3 是月之暗面 7 月发布的新旗舰。AA Intelligence 57,全球第 3——仅次于 Claude Fable 5(60)和 GPT-5.6 Sol(59),超过 Claude Opus 4.8(56)和 Grok 4.5(54)。 这是国产模型首次在 AA 主榜上进入全球前三。
1M 上下文、62 t/s 速度。 上下文窗口和 GPT-5.6 Sol 持平(1M),速度 62 t/s 在旗舰级里算中上——比 Claude Fable 5(66 t/s)稍慢,但比 Claude Opus 4.8(56 t/s)和 GPT-5.6 Sol(53 t/s)都快。
Arena Text 1486±11,排第 10。 目前是 Preliminary 状态(仅 27 票),排名可能波动。但 Elo 1486 已经接近 Claude Opus 4.7(1494)和 Grok 4.5 的水准,说明 K3 在真实用户对话中的表现也不错。
价格不便宜:$3/$15 per M。 输出价是 K2.6 的 3.75 倍,是 DeepSeek V4 Flash($0.72)的 20 倍。这个价格定位是旗舰级的——对标 Claude Opus 4.8($15/M 输出)和 GPT-5.6 Sol。如果追求极致能力不差钱,K3 是当前国产最强选项。
Kimi K2.6:API 跑量 + 网页端体验天花板
K2.6 是 Kimi 上一代旗舰,AA Intelligence 44。和 DeepSeek V4 Pro 并列国产第二梯队——现在有了 K3(57)在上面,K2.6 的定位变成了「性价比主力」。 7-21 又跌回:输入 $0.68(原 $0.95,-28%),输出 $3.42(原 $4.00,-14%)。一个月内三变价,Kimi 的定价策略像在试探市场底线。
Kimi 的真正护城河不是这些数字,是网页端的长文本体验。 甩一份 80 页的 PDF 给 Kimi 网页端,它能直接定位到第三章的赔偿条款;丢一个 Excel 进去,它能按列做统计汇总;传一个 PPT,它能提取每页的要点。 这种「即传即读」的体验在国内没有对手。
速度 47 t/s 偏慢。 Qwen3.7 Max 的 200 t/s 是它的 4.4 倍。如果场景对延迟敏感(实时对话、批量处理),K2.6 不是最优选择。
Kimi K2:轻量但有限
K2 是 Kimi 的入门档:$0.57/$2.30、128K 上下文。价格确实便宜,但 128K 上下文在 2026 年已经算是「短」的了。 大部分竞品(DeepSeek、Qwen、GLM)都已经上到 1M 或 200K+。
K2 适合什么: 短问答、分类、摘要、简单对话。这些场景对上下文要求不高,K2 的价格优势能发挥出来。
K2 不适合什么: 长文档处理(128K 装不下百页 PDF)、复杂代码任务(上下文不够做跨文件分析)、需要高 Intelligence 的推理任务。 这些场景上 K2.6 或 DeepSeek V4 Flash 都比 K2 值。
Kimi vs 国产竞品
K3 vs GLM-5.2(国产旗舰对决)
K3 Intelligence 57 vs GLM-5.2 Intelligence 51,K3 高 6 分。价格上 K3 输出 $15 是 GLM-5.2($2.87)的 5 倍多。 GLM-5.2 的优势是便宜 5 倍且速度更快(155 t/s vs 62 t/s),K3 的优势是能力断层领先。 不差钱要最强选 K3,性价比优先选 GLM-5.2。
K2.6 vs DeepSeek V4 Pro(API 性价比对决)
V4 Pro Intelligence 44 和 K2.6 持平(7 月 AA),但 API 输出价 $0.87 比 K2.6 的 $3.42 便宜 75%。7 月 Kimi 价格过山车后这个价差仍然悬殊。 走 API 调用 V4 Pro 性价比碾压。K2.6 的网页端体验和长文本处理明显更好,但 API 端只是贵。
K2.6 vs Qwen3.7 Max(长文本 vs 全能)
Qwen3.7 Max Intelligence 46 比 K2.6 高 2 分,速度 200 t/s 是 K2.6 的 4.4 倍。 但 Kimi 的网页端读文档体验比 Qwen 好——这是产品层面的差异,不是模型能力能补的。 如果主要用网页端处理文档,K2.6 更顺手;如果主要用 API 做开发,Qwen3.7 Max 更强。
决策树
首选:Kimi K3(AA 全球第 3、1M 上下文)
备选:GLM-5.2(便宜 5 倍,Intelligence 51 国产第 2)
国际备选:Claude Fable 5 / GPT-5.6 Sol(需要代理)
首选:Kimi K2.6(国内网页端体验天花板)
备选:Kimi 网页端免费额度先用完再说
首选:DeepSeek V4 Pro(Intelligence 44、$0.87/M)
速度优先:Qwen3.7 Max(Intelligence 46、200 t/s)
Kimi K2.6 排第三(网页端体验好但 API 性价比一般)
首选:DeepSeek V4 Flash($0.18/M、1M 上下文)
备选:Kimi K2($2.30/M、128K 上下文)
注意:K2 的 128K 上下文限制较多
几个注意事项
- Kimi 网页端和 API 是两套体验。网页端的长文本处理做了很多产品层优化(分段加载、引用高亮),API 端没有这些。别用网页端的体验来预期 API 的表现。
- K3 刚发布,Arena 投票还很少。AA Intelligence 57 来自标准评测,比较可靠;Arena 1486 分只有 27 票,排名可能波动。建议等 1-2 周投票充分后再看 Arena 排名。
- Kimi 定价波动大。K2.6 一个月内三变价(7-3 涨、7-17 再涨、7-21 跌回),K3 的 $15/M 输出价对标国际旗舰。如果价格敏感,建议关注 DeepSeek / Qwen 作为备选。
- 国内直连稳定。月之暗面在国内有节点,API 延迟和稳定性比国际模型好。