Kimi K2.6
Moonshot AI · 🇨🇳国内代码/Agent 主力,AA 中国第 5 + SuperCLUE 智能体维度国内前三
发布日期:2026-04-20 · 覆盖数据源:3 / 6 (Arena · Pricing · HHEM)
Moonshot 当前旗舰。AA Intelligence 43 中国榜第 5,Agentic Index 是国内前三。LMArena Code Arena 进入前 10,是国内少数进入 Code Top 10 的模型。2026-05-30 降价:输入 $0.684/M、输出 $3.42/M,比 Claude Sonnet 便宜 5 倍。
关键指标
输出价格
$3.42
/ 百万 token
LMArena · 人类盲测排名
arena.ai · 抓取于 2026-07-21| 分类 | 最佳变体 | 排名 | Elo |
|---|---|---|---|
| 🌐 Web Dev | kimi-k2.6 | #9 | 1518.6610497328365 |
| 📄 Document | kimi-k2.6 | #15 | 1449.1991142966685 |
| 💻 Code | kimi-k2.6 | #18 | 1514.7056213523192 |
| 👁️ Vision | kimi-k2.6 | #21 | 1265.2150269929964 |
| 🏆 Overall | kimi-k2.6 | #37 | 1461.2072022523466 |
只展示 Top 10 内出现的分类与变体。同一分类下若有多个变体(thinking / search 等),只显示排名最靠前的。 LMArena 是 Elo 分,人类盲测两两投票算出来—— 「人类觉得好」≠「客观最强」,但反映真实使用体验。
SuperCLUE · 中文能力测评
未收录:SuperCLUE 5 月榜 Kimi-K2.6-Thinking 总分 68.66,国内第二,智能体 80.95 国内最高。
API 价格与国内可用性
来源 openrouter.ai · 抓取于 2026-07-22| 输入价格 | $0.68 / 百万 token |
| 输出价格 | $3.42 / 百万 token |
| 上下文窗口 | 262K tokens |
| 国内可用性 | 可用 |
| 最近核验 | 2026-07-21T04:05:39.907396+08:00 |
同档对手价格
| 模型 | 输入 | 输出 | 国内 |
|---|---|---|---|
| NVIDIA Nemotron 3 Ultra · NVIDIA | $0.60 | $3.60 | 需代理 |
| Amazon: Nova Pro 1.0 · | $0.80 | $3.20 | |
| Kimi K2.7 Code · Moonshot AI | $0.82 | $3.75 | 可用 |
| GLM 5.1 · Z.ai (智谱) | $0.97 | $3.04 | 可用 |
Vectara HHEM · 幻觉率实测
vectara/hallucination-leaderboard · 2026-07-02T04:24:22.584572+08:00| 幻觉率(Hallucination Rate) | 10.8% (越低越好 · 全榜第 67 / 105) |
| 事实一致率 | 89.2% |
| 答题率(Answer Rate) | 99.7% |
Vectara HHEM-2.3 是开源的事实一致性评估器。让模型对 7700+ 篇文档(新闻/科技/科学/医疗/法律/体育/商业/教育)做摘要, 温度=0,HHEM 评估摘要是否「捏造原文里没说的内容」。 幻觉率不等于"模型质量"——它只衡量摘要任务的事实一致性,做题强的旗舰模型反而经常更爱"加戏"。 但对 RAG、客服、医疗法律这种「不能瞎说」的场景,这是目前最有参考价值的指标之一。
什么时候选它 / 别选它
适合场景
- 国内代码主力——AA 中国第 1,价格只是 Claude Sonnet 的 1/4
- Agent 编排任务——Agentic 65.97 是国内最高
- 需要走国内 API(合规、不走代理)的开发场景
不适合场景
- 极致追求 SOTA 智能分——AA Intelligence 53.9,与 GPT-5.5 的 60.24 还有 6 分差距
- 短问答跑量——上面还有 DeepSeek V4 Flash 这种 $0.2/M 输出的选项
- 前端 WebDev——LMArena 排第 7,落后 Claude/GLM-5.1