Kimi K2: 开放权重思维模型
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2 是 Moonshot AI 于 2025 年 7 月发布的开源思考模型,基于混合专家(MoE)Transformer 架构构建,拥有约 1 万亿总参数和每 token 320 亿激活参数。该模型支持思维链(CoT)推理、128,000 token 的上下文窗口,以及代理工具使用工作流。Kimi K2 是 Kimi k1.5 的后继者,Kimi k1.5 是 Moonshot AI 此前推出的长上下文推理模型,标志着该公司与 DeepSeek R1 和 Meta 的 Llama 4 一同进入了前沿开源模型领域。
| 属性 | 值 |
| 开发者 | Moonshot AI |
| 架构 | 专家混合(MoE)Transformer |
| 总参数量 | 约1万亿 |
| 每token激活参数量 | 约320亿 |
| 上下文窗口 | 128,000 tokens (约96,000–100,000词) |
| 许可证 | 修改版MIT许可证 |
| 发布日期 | 2025年7月 |
| 模型变体 | Kimi K2 base, K2-Instruct |
| 主要用例 | 软件工程、数学推理、自主AI工作流 |
["目录","- Moonshot AI 是谁?","- Kimi K2 的技术架构","- 开放权重 vs. 开源:Kimi K2 实际发布了什么","- Kimi K2 的思考方式:推理模式详解","- Kimi K2 的训练过程","- Kimi K2 基准测试表现","- Kimi K2 对比竞品模型","- Kimi K2 的用例与智能体能力","- 如何访问 Kimi K2","- 局限性与坦诚的权衡","- 常见问题解答","- 哪种用例适合您?决策框架"]
Moonshot AI 是谁?
Moonshot AI 是一家总部位于北京的人工智能研究公司,成立于2023年,获得阿里巴巴、腾讯和红杉中国投资。该公司在西方市场以 Kimi 人工智能产品品牌而闻名。该公司的中文名称在英文中意为“月球的暗面”。 Moonshot AI 是中国多家资金雄厚的人工智能实验室之一,与 DeepSeek、百度和阿里云并列。
该公司早期以长上下文研究打响了名号,开发了最早的一些模型,这些模型能够将整本书籍作为单个提示进行处理。其面向消费者的产品 Kimi 聊天助手在中国积累了数千万用户。Kimi K2 是 Moonshot AI 首个公开发布的、处于前沿规模的开源模型。
阿里巴巴持有双重仓位:它既是 Moonshot AI 的投资者,也是通过其自有的 Qwen 2.5 模型系列构成的直接竞争对手。Moonshot AI 的融资记录和产品往绩将其定位为一家严肃的研究机构,而非投机性的初创公司。
如需全面了解 Moonshot AI 的公司背景和全线产品,请参阅 Moonshot AI:公司概览与 Kimi 产品指南.
Kimi K2 的技术架构
Kimi K2 使用了混合专家模型 (MoE) Transformer 架构(与 GPT-4 和 Claude 所用的基础架构类型相同),这种设计使模型能够扩展到拥有 1 万亿个总参数,同时将推理成本保持在与一个 320 亿参数的密集模型相当的水平。
Kimi K2 中的混合专家模型工作原理
将混合专家模型 (Mixture of Experts) 想象成一家拥有数百名专科医生的大型医院。当病人就医时,只有相关的专科医生负责处理该病例,而不是医院里的每位医生都参与每一次会诊。该模型会将每个输入路由到其网络的相关子集,而不是同时动用所有参数。
定义:混合专家模型 (MoE) 混合专家模型是一种稀疏 Transformer 架构,它将模型参数划分为称为“专家”的专门子网络。一个学习到的路由机制会在每个输入 token 的计算中仅激活这些专家中的一小部分,而不是在每次计算时运行所有参数。其结果是,该模型在拥有一个非常大网络的知识容量的同时,在推理时仅花费一个更小网络的计算量。
Kimi K2 拥有约 1 万亿个总参数,分布在数百个专家子网络中。在推理过程中,每个 token 仅激活其中约 320 亿个参数。这意味着推理成本接近 32B 稠密模型,而非 1T 稠密模型。DeepSeek R1 和 Mixtral 采用了相同的架构原理,确立了 MoE 作为该规模下经证实的先例。
实际操作中的含义 在生产环境中运行 Kimi K2 的成本,大致相当于运行一个 320 亿参数的密集模型。1 万亿参数的指标指的是总知识容量,而非每次查询的计算成本。对于评估自托管部署的团队来说,相关的硬件基线是相当于 32B 密集模型的配置,而非 1T 的。
上下文窗口和推理规格
Kimi K2 支持 128,000 个 token 的上下文窗口,这相当于在单次提示中输入大约 96,000 到 100,000 个单词。具体而言:一部长篇小说的全文、整个软件代码库或一整年的会议记录,都可以容纳在单个 Kimi K2 上下文中。
这种能力的重要性不仅限于简单的文档摘要。无论是需要模型在编写补丁前阅读完整代码库的智能体工作流,还是在撰写综合报告前需处理多份文档的研究流程,都依赖于长上下文窗口,以确保在多次调用过程中不会出现信息丢失。
开放权重 (Open-Weight) vs. 开源 (Open Source):Kimi K2 实际发布了什么
Kimi K2 是开放权重的,而非完全开源。其训练后的模型权重可在修改后的 MIT 许可证下公开下载,但月之暗面 (Moonshot AI) 尚未发布训练数据或完整的训练代码。
许多关于 Kimi K2 的文章将“开源”和“开放权重”混为一谈,但它们的意思并非相同。
开放权重 vs. 开源:Kimi K2 实际发布了什么
| 借助 Kimi K2 的开放权重发布,你可以: | 借助 Kimi K2 的开放权重发布,你不能假设: |
|---|---|
| 从 Hugging Face 下载已训练的模型权重 | 能够访问预训练数据集 |
| 在自己的硬件上本地运行推理 | 能够独立复现完整的训练流程 |
| 使用自己的数据微调权重 | 能够声称该模型在监管或合规方面是“完全开放”的 |
| 部署模型用于商业产品(受许可条款约束) | 能够覆盖修改后的 MIT 许可中超出标准 MIT 条款的任何限制 |
Kimi K2 以修改版的 MIT 许可证发布。标准的 MIT 许可证是宽松的,通常允许商业用途、修改和重新分发。“修改版的 MIT”许可证可能在这些条款之外添加额外条件。在任何商业部署之前,请在 Kimi K2 官方许可证文件. 核实具体条款。本文章发布后,许可证条款可能会被更新。
--- ## Kimi K2 的思考方式:推理模式详解
Kimi K2 是一个思考模型,这意味着它在生成最终答案之前会产生一个扩展的内部推理过程,而不是立即响应提示。这种行为使其与 GPT-4o 或 Claude 等标准指令遵循模型在默认模式下的表现不同。
什么是思考模型?
定义:思考模型 思考模型会在给出最终回应前,生成一个可见的思维链(CoT)推理过程。这个扩展的内部推理过程会处理子问题、检查中间结论,并在确定答案前纠正错误。其结果是在涉及多步骤、数学推导、代码调试或形式逻辑等复杂任务上,准确性得到可衡量的提高。术语“思考模型”、“推理模型”和“思维链模型”都描述了相同的能力范式。
OpenAI 的 o1 和 o3 模型是最早被广泛认可的思考模型,确立了这一类别。DeepSeek R1 将相同的范式带入了开源权重领域。Kimi K2 属于同一类别模型。在 AIME 2025 数学基准测试(一项测试多步数学推理能力的测试)中,Kimi K2 的得分约为 49.5%;在 GPQA Diamond(一项研究生级别科学推理基准测试)上,根据 Moonshot AI 的技术报告,其得分约为 75.1%。
K2-Instruct 中的思考模式与非思考模式
K2-Instruct 是 Kimi K2 基础模型的指令跟随与聊天变体,它支持两种不同的运行模式:思考模式和非思考模式。
思考模式 激活完整的 CoT 推理流程。模型会在其最终答案之前生成一个可见的中间推理步骤草稿。使用思考模式来应对准确性比延迟更重要的任务:解决复杂的算法问题、调试微妙的竞态条件、完成多步骤的证明。
非思考模式更适合速度比深度推理更重要的任务:回答事实性问题、生成样板代码、以及答案无需多步推导的文档摘要。由于省去了冗长的推理过程,响应速度会更快。
一个实际的例子:如果你问 Kimi K2 "2 + 2 是多少?",两种模式都会产生相同的正确答案。如果你问 "给定这个包含 500 行代码的 Python 函数,其中二进制搜索实现存在一个偏移一的错误,请找出并修复该错误",思考模式将在回答前逐步分析逻辑,而非思考模式可能产生更快但不可靠的结果。API 允许你在两种模式之间切换。有关控制此切换的 API 参数,请参阅 如何访问 Kimi K2 部分。
Kimi K2 的训练方法
Kimi K2 的训练遵循了一个多阶段流程,Moonshot AI 在其模型的技术报告中对此进行了描述。该流程结合了大规模预训练、强化学习阶段以及自定义优化器,以生成最终的模型能力。
训练流程
根据官方技术报告的描述,Moonshot AI 通过四个连续阶段训练了 Kimi K2:
- 在广泛的文本和代码语料库上进行大规模预训练,构建模型的通用知识和语言理解能力。
- 在精选的指令遵循数据上进行有监督微调 (SFT),教导模型以有用的格式响应用户提示。
- 采用基于规则奖励的强化学习 (RL),通过在可验证任务上获得正确答案的正面信号,训练模型提高其推理和工具使用行为。
- 在整个训练过程中应用 MuonClip 优化器,以在大规模环境下稳定训练过程。
强化学习(RL)阶段值得简要说明。与旨在模仿示例输出的标准监督微调不同,RL 通过奖励模型在推理任务上给出正确答案来迭代调整其行为。Kimi K2 的 RL 框架使用基于规则的奖励,这意味着它会根据可验证的真实情况检查答案,而不是完全依赖人类偏好反馈(RLHF)。这种区别对技术评估者很重要:基于规则的 RL 在数学和代码等结构化任务上往往能带来更一致的推理改进,因为正确性是客观可衡量的。
MuonClip:Moonshot AI 的训练创新
MuonClip 是 Moonshot AI 开发的一款自定义训练优化器,专门用于稳定大规模 MoE(混合专家模型)的训练。Kimi K2 的大部分介绍都只是顺带提及,因此本节将深入探讨。
简单来说,训练神经网络涉及根据误差信号反复调整数百万(或数万亿)个参数。在拥有1万亿参数的专家混合(MoE)模型规模下,这些调整有时会变得不稳定,导致参数更新失控增长,这种现象被称为梯度爆炸。MuonClip通过结合两个组件来解决这个问题:Muon优化器(一种根据参数几何结构调整步长的梯度下降变体)和梯度裁剪(一种限制任何单一参数更新最大值以防止数值失控的技术)。MuonClip这个名字就是这两个组件的混合词。
在技术层面:标准的大型语言模型训练使用 AdamW 优化器。根据 Moonshot AI 的技术报告,MuonClip 通过引入梯度裁剪对 Muon 优化器进行了改进,以解决在大规模 MoE 架构中常见的训练不稳定性问题。Moonshot AI 报告称,在这种架构下,与 AdamW 相比,MuonClip 提高了训练稳定性和最终的模型质量。这些是 Moonshot AI 的主张,源自 Kimi K2 技术报告(arXiv:2502.16982 —— 引用前请核实 URL)。在发布时,针对这些主张的独立第三方验证仍在进行中。
这在实践中意味着什么 更好的训练稳定性可在训练过程中产生更可靠的收敛,进而转化为更强大的最终模型能力。MuonClip 并非一种超参数选择;Moonshot AI 将其定义为针对超大规模 MoE 模型训练不稳定性问题的研究贡献。如果稳定性主张在独立评估中得到证实,它将代表前沿开源权重模型训练方法论的一项重大进展。
Kimi K2 基准性能
下表根据 Moonshot AI 的技术报告,总结了 Kimi K2 在六项基准测试中的得分。每个基准测试说明都解释了分数的实际含义,因为没有背景信息的百分比,无法让你判断是否该使用该模型。
| 基准 | 测试内容 | Kimi K2 分数 | 参考分数 |
|---|---|---|---|
| SWE-bench Verified | 在实际软件仓库中进行有针对性的代码更改,以解决现实世界的GitHub问题 | ~65.8% | DeepSeek R1: ~49.2% |
| GPQA Diamond | 研究生水平的科学推理,涵盖生物学、化学和物理学 | ~75.1% | GPT-4o: ~53.6% |
| MMLU | 广泛的学术知识,涵盖57个学科 | ~87.4% | DeepSeek R1: ~84.0% |
| AIME 2025 | 使用竞赛级别的问题进行多步数学问题解决 | ~49.5% | DeepSeek R1: ~70.0% |
| LiveCodeBench | 在从竞争性编程竞赛中持续更新的问题上进行编码能力测试,以减少训练数据污染 | ~53.7% | DeepSeek R1: ~65.9% |
| Tau-bench (Airline) | 在模拟客户服务环境中的多步工具使用和代理任务完成 | ~54.9% | GPT-4o: ~46.0% |
基准数据源自 Moonshot AI 的技术报告和 Kimi K2 模型卡。这些数据为发布时的自主报告,可能会在独立评估完成后进行更新。在做出部署决策前,请参阅官方技术报告以核实当前的评分。
对从业者而言,Headline 结果是 SWE-bench Verified。这项基准测试旨在测试模型是否能根据真实的 GitHub 问题描述,阅读相关代码,并生成一个能够实际修复经人工验证的代码库中问题的补丁。截至 2025 年 7 月,Kimi K2 在该基准测试中约 65.8% 的得分使其成为实际软件工程任务中表现最出色的权重开放模型之一,且明显高于 DeepSeek R1 在同一基准测试中约 49.2% 的得分。
在 AIME 2025 中,对比结果发生了反转:DeepSeek R1 的得分约为 70.0%,而 Kimi K2 约为 49.5%,这表明 DeepSeek R1 在纯数学竞赛题目上更具优势。在 GPQA Diamond 科学推理方面,Kimi K2 约 75.1% 的得分显著超过了 GPT-4o 的约 53.6%。
实际应用上的意义 Kimi K2 的基准测试表现使其成为工程和科学推理任务的潜在选择。如果您的主要用途是软件开发辅助或科学分析,SWE-bench 和 GPQA 的分数将直接相关。如果您的基准是纯数学竞赛题,DeepSeek R1 目前在 AIME 2025 上的得分更高。两个模型并非在所有任务上都占优,这对于做出部署决策是准确的考量。
Kimi K2 与竞争模型的对比
将 Kimi K2 与其最接近的竞争对手进行对比,可以揭示该模型在基准测试中的领先优势、性能相当的方面,以及哪些权衡对部署决策至关重要。以下比较仅限于已命名的基准测试,以避免未经证实的概括。
Kimi K2 对比 DeepSeek R1
Kimi K2 和 DeepSeek R1 都是开放权重 MoE 思维模型,这使得它们成为最直接的架构比较。两者都能生成思维链推理轨迹。两者都提供可下载的权重。关键区别在于基准测试表现、参数规模和训练方法。
| 属性 | Kimi K2 | DeepSeek R1 |
|---|---|---|
| 架构 | MoE 变体 | MoE 变体 |
| 总参数量 | 约 1 万亿 | 约 6710 亿 |
| 每令牌激活参数量 | 约 320 亿 | 约 370 亿 |
| 思考模式 | 是 (K2-Instruct) | 是 |
| SWE-bench 认证 | 约 65.8% | 约 49.2% |
| AIME 2025 | 约 49.5% | 约 70.0% |
| LiveCodeBench | 约 53.7% | 约 65.9% |
| MMLU | 约 87.4% | 约 84.0% |
| 训练创新 | MuonClip 优化器 | GRPO 强化学习 |
在软件工程任务(SWE-bench Verified)方面,Kimi K2 遥遥领先。在数学竞赛问题(AIME 2025)和编程竞赛(LiveCodeBench)方面,DeepSeek R1 的得分更高。在常识(MMLU)方面,Kimi K2 小幅领先。没有哪一个模型在所有方面都占优;选择取决于对您的应用而言,哪个任务类别更重要。
DeepSeek V3 是 DeepSeek 的非思考型稠密指令模型,为非推理任务的比较提供了标准基准。在指令遵循基准测试中,将非思考模式下的 Kimi K2 与 DeepSeek V3 进行对比时,两者的表现大致相当,不过直接的同类评估应采用等效的推理设置。
Kimi K2 和 DeepSeek R1 与 Meta 的 Llama 4 一同,加入了开放权重模型的前沿行列。在报告发布时,Kimi K2 的技术报告中并未提供 Kimi K2 与 Llama 4 之间的直接基准对比数据;请参考当前的基准排行榜以获取最新对比。
Kimi K2 vs. Claude Sonnet 和 GPT-4o
将 Kimi K2 与 Claude Sonnet 和 GPT-4o 进行比较,导向了一个不同的决策:并非哪个思考模型更强大,而是开源模型是否能提供足够的性能来取代托管的专有 API。
在 SWE-bench Verified 上,Kimi K2 的得分约为 65.8%。截至撰写本文时,Claude Sonnet 4 在 SWE-bench Verified 上的具体得分尚未得到独立确认;在进行并排比较之前,请参阅 Anthropic 发布的基准测试文档以获取最新数据。Claude Sonnet 提供托管型 API,内置速率限制、安全过滤和正常运行时间保证,且无需基础设施开销。Kimi K2 则提供开放权重,没有按 Token 计费的 API 锁定,并支持完全在自有硬件上运行。对于处理海量请求且 Token 成本持续累积的团队而言,大规模自托管开放权重模型的经济效益将显著提升。
GPT-4o 是 OpenAI 的多模态指令遵循模型,与 OpenAI 专用的思考模型 o1 和 o3 不同。直接将 Kimi K2 的思考模式与 GPT-4o 的标准模式进行架构上的比较,并非完全等同。在 GPQA Diamond 科学推理方面,根据公开的基准测试数据,Kimi K2 的约 75.1% 性能远超 GPT-4o 的约 53.6%。在推理和编码任务方面,Kimi K2 达到了此前仅通过专有 API 才能获得的出色性能水平,同时无需依赖这些 API 即可部署。
这种权衡是具有实际意义的:Claude 和 GPT-4o 提供了托管的可靠性和安全基础设施,而自托管的开源权重模型默认并不包含这些。对于有合规要求或缺乏多余 GPU 基础设施的团队,在进行评估时应将这一运营差距考虑在内。
Kimi K2 对比 Kimi K3
Kimi K3 是 Moonshot AI 的下一代旗舰推理模型,在 Kimi K2 之后发布。Kimi K2 确立了开放权重 MoE 推理基准,而 Kimi K3 则在架构和基准表现上更进一步。对于评估是部署 K2 还是直接升级至 K3 的团队而言,关键的比较点是参数规模、benchmark Delta 和推理成本。
欲查看 Kimi K3 的架构、基准性能及访问期权的全面评测,请参阅 Kimi K3:Moonshot AI 的旗舰推理模型.
Kimi K2 应用场景与智能体能力
Kimi K2 的设计涵盖了三个主要用例类别:软件工程与编程、数学与科学推理,以及多步骤智能代理任务的完成。上文中的基准分数直接对应这些类别。
Kimi K2 作为智能代理的骨干
Agentic AI 描述的是能够自主规划和完成多步骤任务的系统,无需在每一步都获得人类指令,即可调用诸如网络搜索、代码执行环境、文件系统和 API 等外部工具。这与标准聊天机器人不同,后者会在采取任何行动之前等待人类提示。
Kimi K2 在 Moonshot AI 的技术报告中显示,在 Tau-bench 航空领域基准测试中得分约为 54.9%。Tau-bench 测试的是模拟环境中的多步工具使用和智能体任务完成情况,是智能体能力声明最直接的基准测试证据。
两个具体的流程场景说明了这在实际操作中的具体表现:
场景 1:软件工程代理。一位开发者将 Kimi K2 指向一个 GitHub 存储库,并描述了一个已报告的错误:“用户在高并发请求的身份验证流程中遇到竞态条件。” Kimi K2 读取相关源文件,识别出导致竞态条件的锁定模式,生成引入了适当互斥锁处理的补丁,并运行现有测试套件以验证没有回归。人类审查并合并了该拉取请求。该模型在没有分步指示的情况下完成了完整的识别-诊断-修复-验证周期。
场景 2:研究综合代理。此处输出的是对五家 SaaS 供应商定价模型进行的结构化竞争性分析,包含标准化数据和一个建议部分。为了生成此报告,Kimi K2 会查询每家供应商的公开定价 API 或文档页面,将数据标准化为一致的模式,并标记出各供应商之间有差异的定价变量。收到报告的产品策略师在将其分发给利益相关者之前,会审查建议的措辞。没有进行手动数据收集;该代理自主完成了每一步检索和综合。
这些场景取决于 Kimi K2 的 128,000 个 token 上下文窗口,该窗口能够让它一次性容纳整个代码库或文档集。它们还依赖于其工具使用能力以及其思考模式推理,来处理单个任务中的多步骤决策。
Kimi K2 最擅长哪些任务?
根据 Moonshot AI 的技术报告,Kimi K2 在这五个类别的任务中得分最高:
- 软件工程与代码补丁: SWE-bench Verified 约 65.8%,截至 2025 年 7 月在开放权重模型中位居前列
- 科学与研究生水平推理: GPQA Diamond 约 75.1%,大幅高于 GPT-4o 在同一基准测试中发布的得分
- 广泛的学术知识: MMLU 约 87.4%,涵盖 57 个学科领域
- 代理工具使用与任务完成: Tau-bench Airline 约 54.9%,衡量多步骤自主任务的完成情况
- 长文档分析: 128,000 token 的上下文窗口,支持在单个提示词中处理完整代码库或完整文档
根据 Moonshot AI 报告的数据,DeepSeek R1 在数学竞赛题(AIME 2025:约 49.5%)和编程竞赛(LiveCodeBench:约 53.7%)领域目前的得分更高。
如何访问 Kimi K2
Kimi K2 可通过三个渠道获取:Hugging Face 上的 Kimi K2-Instruct 模型卡、Moonshot AI 官方 API 以及 OpenRouter。
在 Bybit 上交易 MOONSHOT 代币: Moonshot AI 的增长已引起加密货币交易者的关注 — Bybit 提供 MOONSHOTUSDT 永续合约 供有兴趣交易 MOONSHOT 代币的人士。另请参阅 Moonshot AI 在 Bybit 上的 IPO 交易机会.
访问渠道概览
| 频道 | 方法类型 | 费用 | 最佳适用 |
|---|---|---|---|
| Hugging Face (权重下载) | 自托管推理 | 免费下载;需承担基础设施成本 | 拥有 GPU 集群并希望完全控制部署的团队 |
| Moonshot AI API | 托管 API | 按 token 收费(请在 platform.moonshot.cn 平台核实当前价格) | 想要快速访问而无需设置基础设施的开发者 |
| OpenRouter | 第三方 API 聚合器 | 按 token 收费(请在 openrouter.ai 核实当前价格) | 使用跨多个模型提供商的统一 API 的开发者 |
模型权重可从 Hugging Face 免费下载。通过 Moonshot AI 或 OpenRouter 进行 API 访问需按 token 计费。新推出模型的 API 定价频繁变动;在做出部署决策前,请直接从各提供商的定价页面核实当前的输入/输出 token 成本。本文中的定价信息反映了发布时可用的信息。OpenRouter 是一个第三方聚合服务,与 Moonshot AI 无关。
官方 Kimi K2 技术报告可在 arXiv (arXiv:2502.16982 — 引用前请验证网址) 查阅,该报告是本文引用的基准数据及训练方法细节的权威来源。
有关 Kimi API 在 K3 和 K2 的定价层级完整细分,请参阅 Moonshot Kimi API 定价 2026:计划和成本指南.) ### 从 Hugging Face 下载权重
直接从 Hugging Face 上的 Kimi K2-Instruct 模型卡片. 下载 Kimi K2-Instruct 权重
开始本地部署的步骤:
- 如果您还没有 Hugging Face 账号,请先创建一个。
- 访问
huggingface.co/moonshotai/Kimi-K2-Instruct并查看模型卡片以获取最新文档。 - 安装 Hugging Face
transformers库:pip install transformers。 - 使用
huggingface-cli download moonshotai/Kimi-K2-Instruct或通过transformersAutoModel API 下载权重。 - 在进行任何商业部署前,请先核实 Kimi K2 官方许可证文件 中的许可条款。
本地推理的硬件要求: 一个拥有约 1 万亿总参数的全精度 Kimi K2 模型需要大量的 GPU 基础设施。对于全 BF16 精度推理,预计需要多个高显存 GPU(例如 8x H100 80GB 或同等设备)。量化版本(GGUF、AWQ、GPTQ 格式)可显著降低硬件要求。部署时请查看 Hugging Face 模型卡片和社区仓库,以获取可用的量化版本。没有多 GPU 集群访问权限的用户应使用上述 API 访问渠道,而非尝试本地部署。
调用 Kimi K2 API
Moonshot AI API 遵循与 OpenAI 兼容的接口,因此现有的 LLM 客户端库仅需极少修改。以下示例使用了指向 Moonshot AI 端点的 openai Python 库。
下方的 API 端点、模型标识符和身份验证方法反映了撰写本文时的可用接口。使用前,请在 Moonshot AI API 文档中核实当前的 API 文档。
from openai import OpenAI
Kimi K2: 开放权重思维模型
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2: 开放权重思维模型
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", base_url="https://api.moonshot.cn/v1", # 验证当前端点 )
Kimi K2: 开放权重思维模型
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
response = client.chat.completions.create( model="kimi-k2-instruct", # 验证当前模型标识符 messages=[ {"role": "user", "content": "解释互斥锁和信号量之间的区别。"} ] ) print(response.choices[0].message.content)
Kimi K2: 开放权重思维模型
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2: 开放权重思维模型
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
response_thinking = client.chat.completions.create( model="kimi-k2-instruct", messages=[ {"role": "user", "content": "调试此 Python 函数并解释修复方法:[在此处粘贴代码]"} ], extra_body={"thinking": True}, # 在当前文档中验证参数名称 ) print(response_thinking.choices[0].message.content)
Moonshot AI 官方 API 的定价可能会有变动。在做出部署决策前,请直接从 Moonshot AI 的定价页面查阅当前的输入/输出代币费用。
限制与坦诚的权衡
Kimi K2 的基准测试分数介于约 49.5% (AIME 2025) 至约 87.4% (MMLU) 之间,以下权衡因素对部署决策至关重要:
["训练数据和代码未公开。 开放权重版本仅提供训练好的权重。需要完整训练可复现性、学术界训练过程复现或对训练数据溯源进行监管透明度的组织,仅凭此版本无法满足这些要求。","本地部署需要大量的 GPU 基础设施。 在消费级硬件上对拥有万亿参数的 MoE 模型进行全精度推理是不可行的。缺乏多 GPU 集群访问权限的团队将需要依赖 API 访问或量化变体,这可能会影响输出质量。","基准测试数据由 Moonshot AI 在发布时自行报告。 在发布时,所有基准测试分数的独立第三方验证工作正在进行中。模型发布时的自我报告分数,历史上显示与后来的独立评估存在一些差异。请将分数视为具有方向性参考意义,而非已得到明确验证。","API 的可用性取决于 Moonshot AI 的基础设施。 与下载权重并在本地运行不同,基于 API 的访问会产生对第三方服务的依赖。有严格正常运行时间要求的团队应计划好这种运营依赖性。","修改后的 MIT 许可证可能包含超出标准 MIT 的限制。 标准 MIT 是允许性的,但 Moonshot AI 的修改版本可能增加了条件。在进行知识产权敏感部署的组织的法律团队应审查实际的许可证文件,而不仅仅是许可证名称。","发布时未确认原生多模态能力。 Kimi K2 是一个文本和代码模型。请查阅当前模型卡以获取发布后添加的任何多模态更新。","自行托管时的安全措施由部署者负责。 开放权重模型不包含专有 API 默认提供的托管式安全过滤。在本地部署 Kimi K2 的团队必须实现自己的内容和安全层。"]
常见问题
这些问题反映了继 2025 年 7 月发布后,基于“其他人还在问” (People Also Ask) 模式下关于 Kimi K2 的最常见搜索。
Kimi K2 与 DeepSeek R1 之间有什么区别?
Kimi K2 和 DeepSeek R1 都是生成思维链推理轨迹的开放权重 MoE 思维模型。Kimi K2 拥有约 1 万亿总参数,而 DeepSeek R1 拥有约 6710 亿参数,在 SWE-bench Verified(约 65.8% 对比约 49.2%)和 MMLU 上得分更高。DeepSeek R1 在 AIME 2025(约 70.0% 对比约 49.5%)和 LiveCodeBench 上得分更高。主要的训练区别在于 Kimi K2 使用了 MuonClip 优化器,这是 Moonshot AI 研究的一项贡献。
Kimi K2 是开源模型还是开放权重模型?
Kimi K2 是开放权重模型,而非完全开源。训练好的模型权重可根据修改版的 MIT 许可协议公开下载,但 Moonshot AI 并未发布预训练数据集或完整的训练代码。开放权重意味着你可以下载、运行和微调模型;这并不意味着你可以获取完整复现训练过程所需的一切。
什么是 AI 中的思考模型?
思维模型在给出最终答案之前,会生成一段延长的思维链 (CoT) 推理过程,通过中间步骤进行思考,而不是立即做出回答。这种方法能显著提高处理复杂多步骤任务(如数学、代码调试和科学推理)的准确性。在 Kimi K2 之前,OpenAI 的 o1/o3 和 DeepSeek R1 是最广为人知的范例。
Kimi K2 有多少个参数?
Kimi K2 拥有大约 1 万亿个总参数,其中在推理过程中,每个 token 大约激活 320 亿个参数。这种区别很重要:推理成本接近 32B 稠密模型,而不是 1T 模型,因为 MoE 架构在处理每个 token 时仅激活参数的一个子集。
谁开发了 Kimi K2?
Kimi K2 由 Moonshot AI 开发,这是一家总部位于北京的人工智能研究公司,成立于 2023 年。公司获得了包括阿里巴巴、腾讯和红杉中国在内的投资者的支持,并且与任何使用相似品牌的美国组织无关。
什么是 Moonshot AI?
Moonshot AI 是一家中国人工智能研究公司,成立于 2023 年,总部位于北京。该公司在阿里巴巴和腾讯等主要投资者的支持下,以长上下文(long-context)语言模型研究而闻名。其消费者产品线 Kimi 聊天助手在中国拥有数千万用户。
Kimi K2 在哪些基准测试中表现出色?
根据 Moonshot AI 的技术报告,Kimi K2 的得分约为:SWE-bench Verified ~65.8%(软件工程)、GPQA Diamond ~75.1%(科学推理)、MMLU ~87.4%(广泛的学术知识)、Tau-bench Airline ~54.9%(智能体工具调用)、AIME 2025 ~49.5%(数学推理)以及 LiveCodeBench ~53.7%(竞赛编程)。分数均为发布时的自测分数。
我可以在本地运行 Kimi K2 吗?
是的,Kimi K2 是开放权重模型,其权重可以在本地运行。全精度推理需要大量的 GPU 基础设施(例如,8x H100 80GB 这样的大内存 GPU)。量化版本会降低硬件要求,但可能会影响输出质量。对于大多数没有多 GPU 集群的用户来说,通过 Moonshot AI 或 OpenRouter 进行 API 访问是使用该模型的实际途径。
Kimi K2 的上下文窗口是多少?
上下文窗口为 128,000 个 token,约等于 96,000 至 100,000 个单词。这允许在单个提示内处理长文档、完整的代码库或扩展的对话历史记录。
Kimi K2 在编程方面是否优于 Claude?
在 SWE-bench Verified(一项测试真实 GitHub 问题的基准)中,Kimi K2 的得分约为 65.8%。在撰写本文时,Claude Sonnet 4 的具体 SWE-bench Verified 得分尚未独立确认;请查阅 Anthropic 公布的基准测试以获取最新数据。哪种模型更可取取决于您的部署情境:Kimi K2 提供开放权重灵活性,且无按 Token 锁定的限制,而 Claude 提供托管式 API 的可靠性、安全过滤以及更简单的基础设施设置。
什么是 AI 中的混合专家模型?
混合专家模型 (Mixture of Experts, MoE) 是一种稀疏 Transformer 架构,它将模型的参数划分为被称为“专家”的专业化子网络,并将每个输入标记 (token) 仅路由至这些专家中的相关子集,而非运行所有参数。这使得模型在推理时仅需消耗小型网络的计算量,却能拥有极大型网络的知识容量。Kimi K2 在处理每个标记时,仅激活其 1 万亿总参数中的约 320 亿个参数。
什么是 MuonClip,它为什么重要?
MuonClip 是 Moonshot AI 开发的一款定制化训练优化器,它结合了 Muon 优化器和梯度裁剪,以防止大规模 MoE 模型出现训练不稳定性。根据 Moonshot AI 的技术报告,在此规模下,它与标准的 AdamW 优化器相比提高了训练稳定性。更好的训练稳定性带来更可靠的收敛,并且,据 Moonshot AI 报告,最终模型能力更强。
Kimi K2 是否可以免费使用?
模型权重可从 Hugging Face 免费下载。通过 Moonshot AI 官方 API 或 OpenRouter 进行 API 访问将产生按 Token 计算的费用,具体费用因提供商而异,并可能随时更改。除了您自身的基础设施成本外,自托管下载的权重是免费的。在确定访问方式之前,请务必在各提供商的定价页面核实当前的 API 价格。
Kimi K2 最擅长哪些任务?
根据 Moonshot AI 的技术报告,Kimi K2 在以下方面表现最强:软件工程和代码修复(SWE-bench Verified ~65.8%),研究生级别的科学推理(GPQA Diamond ~75.1%),智能多步工具使用(Tau-bench ~54.9%),广泛的学术知识(MMLU ~87.4%),以及长文档分析(128,000 个 token 上下文窗口)。数学竞赛问题和编程竞赛是 DeepSeek R1 目前得分更高的领域。
Kimi K2 是如何训练的?
根据 Moonshot AI 的技术报告,Kimi K2 的训练分为四个阶段:(1) 针对文本和代码数据的大规模预训练;(2) 针对指令遵循数据的有监督微调;(3) 采用基于规则奖励的强化学习,以提高推理和工具使用能力;(4) 在整个训练过程中应用 MuonClip 优化器,以在大规模训练中保持过程稳定。RL 阶段使用的是基于规则的正确性奖励,而非完全依赖人类反馈。
哪个用例适合您?决策框架
在 Kimi K2 和备选模型之间做出正确选择取决于三个部署变量:您是否需要开放权重的灵活性、编码和智能体任务是否是您的主要工作负载,以及您的基础设施是否支持本地部署。
如果您需要用于软件工程或科学推理的开源模型:根据截至 2025 年 7 月的可用基准数据,Kimi K2 的 SWE-bench Verified 分数约为 65.8%,GPQA Diamond 分数约为 75.1%,使其在这些类别中位列顶级开源模型之一。在决定之前,请直接根据您具体的任务类型对其进行评估。
**如果您需要一个主要用于数学竞赛题目或编程竞赛的开放权重模型:**根据目前报告的基准测试,DeepSeek R1 在 AIME 2025(约 70.0%)和 LiveCodeBench(约 65.9%)取得的更高分数,使其成为处理这些特定任务的更佳选择。
如果您目前正在通过 API 使用 Claude 或 GPT-4o 来执行编程或推理任务: Kimi K2 作为一种开源权重替代方案,在多项关键任务上提供了相当的基准测试性能。其权衡点在于运维方面:托管的专有 API 提供可靠性和安全基础设施;而自托管的开源权重模型则需要您自行构建和维护该基础设施。
如果您的组织需要完全的训练透明度或监管数据溯源: Kimi K2 仅发布开放权重的做法并不满足这一要求。其训练数据和完整的训练代码并未公开。
如果您的团队缺乏多 GPU 基础设施:请使用 Moonshot AI API 或 OpenRouter 来获取 API 访问权限,而不是本地部署。在选择接入方式前,请核实各提供商的当前价格。
截至撰写本文时,Moonshot AI 尚未发布未来模型发布的确认路线图。根据已发表的成果,该公司的研究重点主要集中在长上下文处理、MoE 扩展以及智能体能力开发。在此之外的任何前瞻性陈述在得到官方正式确认之前,都应被视为推测。