Kimi 入门指南
你可以在聊天框中输入问题、上传文件,也可以根据需要切换不同模型。 打开 kimi.com,试着发送一条消息,和 Kimi 打个招呼:
选择模型
Kimi 提供多种模型。点击输入框上方的模型切换按钮即可切换。
| 模型 | 推理强度 | 适用场景 |
|---|---|---|
| K2.6 | 标准 / 高 | 快速对话与问答,响应更快 |
| K3 | 低 / 高 / 最高 | 聊天与 Agent 任务;综合能力最强 |
| K3 Swarm | 低 / 高 / 最高 | 大规模搜索与批量处理,一次完成 |
K2.6 在 Chat 中不消耗额度(在 Kimi Work 中作为 K2.6 Agent 使用时,仍会消耗会员额度);K3 和 K3 Swarm 按额度计费。详情请参见会员权益。
关于 Kimi K3
Kimi K3 是 Kimi 目前能力最强的模型,拥有 2.8 万亿参数,基于 Kimi Delta Attention (KDA) 与 Attention Residuals 构建,具备原生视觉能力和 100 万 token 上下文窗口。作为全球首个开源的 3T 级模型,K3 面向长周期编程、知识工作与推理等前沿智能场景而设计,在编程、长周期执行以及广泛的通用智能任务中达到领先水平。
内置工具
开箱即用,无需配置:
| 工具 | 说明 |
|---|---|
| 网页搜索(Web Search) | 实时网页搜索,获取最新新闻与信息 |
| 抓取工具 | 直接访问指定 URL(网页、文档、图片及其他在线资源) |
| 图片搜索 | 支持以文搜图和以图搜图,快速发现视觉内容 |
| IPython | 执行 Python 代码,用于数据分析与可视化 |
| 记忆 | 智能记忆,记录你的个人偏好与使用习惯 |
视觉与多模态能力
Kimi K3 支持对图片、视频和办公文档(PDF/Word/Excel)的全场景理解,采用原生多模态架构(不是外挂式 OCR)。它可以直接解析文档内容,并完成中高阶办公任务(例如编写 Excel 公式,或生成 PPT 大纲/VBA 代码)。结合原生视觉能力与 100 万 token 上下文窗口,它能够处理更长、更复杂的多模态材料。
多模态�入支持
- 图片:PNG、JPEG、WebP、GIF 等(通过 URL、Base64 或本地文件上传)
- 视频:MP4 等(通过 video_url,或图片帧序列 + fps 参数)
- 文档:PDF、Word、Excel、TXT、Markdown 等
- 在线资源:URL、文章链接
- 图片搜索:上传图片,搜索相关或相似图片
- 视频理解:支持视频理解,可分析屏幕录制并复刻交互逻辑
- 视觉编程:上传截图或屏幕录制,生成前端代码(HTML/Vue/React 等);可根据设计稿自动还原网页
输出格式
- 纯文本 / 图文混排:标准对话式回复
- Markdown:包含标题�列表、表格与链接的富文本
- 代码块:HTML/Vue/React/Python/JSON/Mermaid 等(带语言标识)
- JSON 结构化数据:强制以 JSON 模式输出
- Mermaid 图表:流程图、时序图、思维导图等
- LaTeX 数学公式:行内与块级数学表达式
- 双模式输出(Thinking):同时返回
reasoning_content(思考过程)和content(最终答案) - 工具调用格式:函数调用(Function Calling)标准格式(面向开发者)
重要说明
- 文件输出:K3 可以端到端生成可编辑文档(如
.pptx、.docx、.xlsx、.pdf)及其他复杂交付物;K2.6 更侧重快速问答,仅输出文本(如 PPT 大纲、Word 正文或代码)。
提示:如需生成图片、音频或视频,请点击 "+" → 插件,选择对应功能,并搭配 K3 使用。若要创建复杂的可编辑文档或执行多步骤任务,建议选择 K3 或 K3 Swarm,以获得完整体验。
会话与对话轮次
当你点击 "新建聊天" 时,可以把它理解为与 Kimi 开始一段较长的对话。
| 概念 | 类比 | 技术定义 |
|---|---|---|
| 会话 | 一整场会议(从开始到结束) | 一次有明确起点和终点的完整聊天过程 |
| 轮次 | 一次交流(你说一句,Kimi 回一句) | 你的输入与 Kimi 的回复构成一次往返 |
主要区别
会话
- 连续记忆:Kimi 会记住当前聊天中的所有上下文
- 跨轮上下文:每次回复都会参��此前的对话内容,作为下一轮的上下文
- 边界清晰:点击 "新建聊天" = 重新开始;此前上下文会被清空 轮次
- 累计计数:第 1 轮、第 2 轮……逐步增加
- 记忆有限:轮次过多(例如 50+)时,Kimi 可能会“忘记”较早的内容,尤其是在长文写作或要求严格的任务中
- 上下文长度限制:受 token 数量限制;随着轮次累积,最早的内容可能会被压缩
特殊情况:如果一次问答就结束了对话,那么 1 轮 = 1 个会话。
为什么要区分二者
在同一个会话中,你发送的每个新问题或指令,都会基于此前所有轮次来作答。随着轮次增加、内容变长,回复质量可能会逐渐下降。
常见场景
场景 1:切换话题
- 不建议:在一个已经写了 3 万字小说的会话中提问“帮我计算税费”
- 建议:为税费问题开启新会话,避免 Kimi 将小说人物与税务概念混淆 场景 2:处理长文档
- 经过数十轮对话后,Kimi 可能会“忘记”一开始设定的规则或文件摘要
- 解决方法:在任务中途主动总结(“总结一下我们目前的计划”),或开启新会话 场景 3:理解产品限制
- 上下文长度限制以 token 计算,但在日常理解中,可以把它看作“轮次”
- 如果你看到“开始新聊天”的提示,说明当前会话的轮次已经过多
最佳实践
每个任务开启一个新会话:写文章、做研究、调试代码等彼此独立的任务,建议分别使用独立会话,避免上下文互相干扰。
长会话中定期总结:超过 20 轮后,主��请 Kimi 总结关键信息,避免重要内容丢失。
及时清理敏感信息:聊天历史会被保留;处理完私人内容后,请删除整个会话。