模型配置
本页介绍 Kimi Code 提供的模型,以及如何在各客户端之间切换。
模型总览
Kimi Code 目前提供 Kimi K3 与 Kimi K2.7 Code 两个模型、共 3 个模型 ID,可在客户端或第三方工具中按模型 ID 选择。各模型规格对比如下:
| Model ID | k3 | kimi-for-coding | kimi-for-coding-highspeed |
|---|---|---|---|
| 模型版本 | Kimi K3 | Kimi K2.7 Code | Kimi K2.7 Code |
| 说明 | Kimi 最强旗舰编程模型,2.8T 参数规模,首个 3T 级开源模型;1M 上下文窗口 + low / high / max 三档思考深度,擅长复杂工程任务与长程推理 | 成熟稳定的 Coding ��型,Thinking 开启状态下可靠遵循指令,编程任务成功率高 | K2.7 Code 的高速版,编码能力一致,输出速度约为普通版 5–6 倍 |
| 速度 | 常规速度 | 常规速度 | 高速版(6 倍速 3 倍消耗) |
| 上下文窗口 | 最高 1M | 256k | 256k |
| 思考程度 | reasoning_effort:low / high / max(默认 high) | Thinking:ON | Thinking:ON |
| 调用限制 | Andante:暂不支持 Moderato:上下文窗口 256k Allegretto 及以上:上下文窗口最高 1M | 所有会员可用 | Allegretto 档位以上 |
需要更高档位的会员套餐?
不同会员套餐解锁不同的模型、上下文与速度能力,可 前往升级订阅 →。
为什么新模型上线后消耗变多了?
切换模型后,之前建立的上下文缓存 (cache) 在新模型上不再命中,这部分上下文需要重新预填充 (prefill)。因此刚切到新模型时消耗会偏高。建议操作:
- 新开 session 再使用新模型:能让效果更好、消耗更少。
为什么模型 ID 写对了还是报 401?
当请求的能力超出当前套餐权限时,服务端会返回 401,常见三种情况:
- 无 K3 调用权限:套餐低于 Moderato 时无法调用
k3,需升级至 Moderato 及以上。 - 无 1M 权限:Moderato 套餐用户调用
k3时支持最高 256K 上下文;Allegretto 及更高档位支持最高 1M 上下文。 - 无高速版权限:部分套餐不含高速版,升级至 Allegretto 及更高档位套餐即可调用
kimi-for-coding-highspeed。
完整报错文案与处理方式详见 错误参考。
为什么高速版提速不明显?
两个常见原因:
- 模型 ID 填错:高速版 ID 必须是
kimi-for-coding-highspeed,填错会兜底到标准版kimi-for-coding,不报错也不加速。 - 工具与脚本占了大头:高速版只加快模型输出;一次任务里工具调用(读写文件、执行命令等)与脚本执行的耗时不受影响,这部分占比大时整体提速就不明显。
如何减少因思考程度切换带来的消耗?
切换思考程度(effort)会让已建立的上下文缓存(cache)失效,原本能命中缓存的上下文需要重新预填充(prefill)。为避免频繁触发重新预填充:
- 根据任务复杂度选定思考程度后,在同一会话内尽量保持一致;
- 确需改用不同思考程度时,新建会话再切换,而不是在长会话里反复切换。
如何切换模型
使用注意
- 建议在新会话中体验 K3:切换模型会使已建立的缓存失效。建议开启新会话,避免产生额外 token 消耗的同时获得更好体验。
- 填写 Model ID,不是模型版本名:调用模型时需要填写上表中的 Model ID(如
k3、kimi-for-coding、kimi-for-coding-highspeed),如果填写成模型版本名(如Kimi K3、K2.7 Code),会调用失败。 - K3 / K2.7 关闭 thinking 会被路由到 K2.6:若需使用 K3 或 K2.7 Code,请保持 thinking 开启;关闭 thinking 后请求会被路由到 K2.6。
切换到目标模型的方式:
官方客户端
- 官方 Kimi Code CLI:输入
/model即可切换模型,无需修改配置;列表里暂未出现最新模型时,/logout后重新/login即可。 - Kimi Code for VS Code:在输入栏下拉菜单中选择目标模型;若目标模型还没出现,重启 VS Code 或重新安装插件即可。
第三方工具
把工具里的 Model ID 配置为目标模型即可。详细步骤如下:
- 在 Kimi Code 控制台 创建 API Key。
- 在工具中填入 Base URL 和相应模型 ID。
Kimi Code API 同时兼容 OpenAI 和 Anthropic 两种协议,Base URL 如下:
| 协议 | Base URL |
|---|---|
| OpenAI 兼容 | https://api.kimi.com/coding/v1 |
| Anthropic 兼容 | https://api.kimi.com/coding/ |
详细配置步骤请参考对应工具的接入文档:
在第三方工具中使用 K3 前请注意
K3 的接入配置与 K2.7 Code 略有不同,使用前请确认以下两点:
- 上下文窗口:部分工具默认的上下文窗口并非最高 1M,需手动将上下文窗口字段配置为
1048576,才能用满 K3 的最高 1M 上下文。 - 思考程度(effort):K3 支持
low/high/max三档;工具传入的 effort 会按下表映射:
# 默认
null / undefined → high
其它未知取值 → HTTP 400 请求报错
# → max
ultra / max / xhigh → max
# → high(推荐)
high / medium → high
# → low
low / minimum / light → low
# → 关闭思考
none → thinking.type disabled