Kimi K3:Moonshot AI 的推理模型
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
发布于:2025年7月 | 最后更新于:2025年7月
Moonshot AI 推出了其旗舰级推理大语言模型 Kimi K3,直接进入了与 GPT-4o、Claude 3.7 Sonnet、DeepSeek V3 和 Qwen3 在2025年的前沿人工智能领域的竞争。该模型建立在 Moonshot AI 的长上下文技术传承之上,同时转向了以推理为先的设计,旨在解决复杂的数学、软件工程和科学问题。本指南涵盖 K3 的架构和技术规格、跨五大评估套件的基准测试性能、与竞争对手的正面比较,以及如何通过 Kimi 应用或 Kimi 应用程序编程接口 (API) 访问 K3。
TL;DR: Kimi K3 概览
- 开发者: Moonshot AI (月之暗面),中国北京
- 发布日期: 2025年7月
- 架构: 混合专家模型 (MoE) Transformer
- 参数: 总计 671B,每轮前向传播激活 32B (根据 Moonshot AI 的技术报告)
- 上下文窗口: 128K tokens
- 顶级基准测试 (AIME 2025): 96.2 (pass@1,根据 Moonshot AI 的技术报告)
- 开源权重: 否。仅限 API 和消费者应用访问。
- 访问方式: Kimi AI 助手,网址 kimi.ai / Moonshot AI 开发者平台
什么是 Kimi K3?
Kimi K3 是由 Moonshot AI (月之暗面) 开发并于 2025 年 7 月发布的大型语言模型 (LLM),它被设计为一个优先考虑推理的旗舰模型,利用增强型思维链处理 (extended chain-of-thought processing) 来解决数学、软件工程以及知识密集型专业任务中的复杂多步问题。大型语言模型 (LLM) 是一种在海量文本语料库上训练的深度学习模型,能够生成、翻译、总结和推理自然语言;K3 属于这一类别的前沿梯队,其特点是参数量达数千亿。
Kimi K3 的定位是一个推理模型,它在生成最终答案之前会产生明确的中间思考步骤。这种方法提高了处理复杂问题的准确性,但与标准的指令遵循模型相比,响应时间会增加。Kimi K3 与 OpenAI o3 和 DeepSeek R1 属于同一能力级别,这些模型在 2024 年和 2025 年确立了推理范式。
K3 接替了 Moonshot AI 之前的旗舰模型 Kimi K2,后者被定位为专注于工具使用和长上下文文档处理的智能体模型。从 K2 到 K3 的过渡代表了从智能体能力向通用推理的刻意转变。根据 Moonshot AI 的官方博客,K3 于 2025 年 7 月发布时已同步在 Kimi 应用及 API 上线。
Moonshot AI:Kimi K3 背后的公司
Moonshot AI(月之暗面)是一家总部位于北京的人工智能公司,成立于 2023 年,以开发 Kimi 系列大语言模型以及 kimi.ai 上的 Kimi 智能助手应用而闻名。该公司由杨植麟创立,他曾是清华大学和卡内基梅隆大学的研究员,也是早期基于 Transformer 的语言模型 XLNet 的共同作者,该模型曾直接与 BERT 竞争。根据彭博社(Bloomberg)和 Crunchbase 的报道,截至 2025 年中,Moonshot AI 据悉已融资超过 10 亿美元,估值约为 33 亿美元,使其成为中国估值最高的人工智能初创公司之一。
Moonshot AI 的创始技术理论是长上下文专业化。早期 Kimi 模型提供了百万 token 的上下文窗口,而当时大多数竞争对手的上限仅为 32K 或 128K tokens,这为 Moonshot AI 带来了独特的产品标识。该公司的模型演进路线如下:Kimi (2023年,首个长上下文模型) -> Kimi K2 (2025年中,一款具备工具使用能力的智能体 MoE 模型) -> Kimi K3 (2025年7月,本文档介绍的旗舰推理模型)。
凭借 K3,Moonshot AI 已将其定位从长文本专业化扩展到顶尖的推理基准性能,使其直接与 OpenAI、Anthropic、Google DeepMind、DeepSeek 和阿里云展开竞争。
如需全面了解 Moonshot AI 的产品系列及其公司背景,请参阅 Moonshot AI:公司概览与 Kimi 产品指南.
Kimi K3 架构与技术规格
Kimi K3 采用混合专家模型 (MoE) 设计,拥有 6710 亿总参数、128K 标记的上下文窗口,以及通过基于强化学习 (RL) 的后训练产生的扩展推理能力。该架构在 Moonshot AI 的 Kimi K3 技术报告中得到证实。
模型大小和参数数量
根据月之暗面 (Moonshot AI) 的技术报告,Kimi K3 拥有 6,710 亿个总参数,每次前向传播中激活的参数量为 320 亿个。在混合专家 (MoE) 架构中(这是自 2017 年以来所有现代大语言模型的基础设计,此处以其稀疏激活形式应用),总参数反映了模型在所有专家子网络中的全部容量,而激活参数仅反映了每次推理过程中参与的子集。这种区别使得庞大的总参数量在推理时变得计算可行:6,710 亿个总参数在每次推理时仅激活 320 亿个,从而使推理成本与规模小得多的稠密模型相当。
Kimi K2,Moonshot AI 的前身模型,采用了一种 MoE(混合专家)设计,拥有约 1 万亿(trillion)总参数和 320 亿(billion)活跃参数。K3 在保持相同的活跃参数数量的同时,减少了总参数数量,Moonshot AI 的技术报告将这种配置归因于专家路由效率的提升。K3 的活跃参数与总参数比率(320 亿/6710 亿)高于 K2(320 亿/1 万亿),这表明每次前向传播的专家利用率更高。
上下文窗口
Kimi K3 支持 128K 个 Token 的上下文窗口,这意味着它可以在单次交互中处理约 96,000 个英文单词,或大约 5,000 至 10,000 行代码。上下文窗口是模型一次可以处理的最大文本量;更大的窗口能够让模型在不丢失信息的情况下分析整本书籍、代码库或多文档研究集。
供参考:GPT-4o 支持 128K token,Claude 3.7 Sonnet 支持 200K token,而 Gemini 2.5 Pro 支持高达 1M token。K3 在上下文长度上与 GPT-4o 持平,落后于 Claude 3.7 Sonnet 和 Gemini 2.5 Pro。K2 也使用了 128K 上下文窗口,与 K3 一致;K2 之前的早期 Kimi 模型提供 1M token 窗口,这是 Moonshot AI 创立时的产品差异化优势。这种长上下文优势并未延续到 K2 或 K3,Moonshot AI 尚未公开解释这一权衡。128K 窗口内的实际应用包括全文法律文件审查、中型代码库的完整分析,以及无需文档分块的多源研究综合。
训练方法论
Moonshot AI 的技术报告描述了一个标准的大规模预训练阶段,随后是通过基于强化学习(RL)的后训练来提升推理性能。Moonshot AI 尚未在其公开技术报告中披露 Kimi K3 的总预训练数据规模(以 token 为单位)。所使用的具体强化学习变体(GRPO、PPO 或其他方法)也尚未在公开文档中得到确认。
思维链(CoT)推理是一种技术,模型在得出最终答案之前会生成明确的中间推理步骤,从而提高复杂多步问题的准确性。这种后训练方法已被 DeepSeek R1 和 OpenAI 的 o 系列模型确立为推理模型性能提升的主要驱动力。截至 2025 年 7 月,Moonshot AI 尚未公开确认 K3 的训练数据知识截止日期;需要此数据的读者应直接查阅 Moonshot AI 的官方文档。
Kimi K3 对比 Kimi K2:发生了什么变化
Kimi K3 代表了从 Kimi K2 的智能体优先定位,向推理优先的通用旗舰级设计的战略转型。
| 属性 | Kimi K2 | Kimi K3 |
|---|---|---|
| 架构 | MoE | MoE |
| 总参数 | ~1T | 671B |
| 激活参数 | ~32B | 32B |
| 上下文窗口 | 128K tokens | 128K tokens |
| 主要定位 | Agentic / 工具使用 | 推理 / 旗舰 |
| AIME 2025 (pass@1) | 未报告 | 96.2 (来自 Moonshot AI) |
| MMLU Pro | 未报告 | 80.5% (来自 Moonshot AI) |
| LiveCodeBench | 未报告 | 65.8% (来自 Moonshot AI) |
| 发布日期 | 2025年中 | 2025年7月 |
| 开源状态 | 否 | 否 |
K2 到 K3 最显著的变化是定位的转变:从代理式工具调用转向通用推理,并获得了显著提升的基准测试得分支持。总参数量从约 1T 下降至 671B,而激活参数维持在 32B。对于现有的 K2 用户,K3 在多步推理任务上带来了显著增强的性能,同时保持了相同的上下文窗口和访问模式。
欲了解 Kimi K2 架构、开放权重访问模型以及智能体能力的完整详解,请参阅 什么是 Kimi K2?Moonshot AI 的开放权重推理模型.
Kimi K3 的主要功能
- 扩展推理能力: Kimi K3 应用思维链 (CoT) 推理,生成明确的中间步骤,以提高复杂数学、编程和逻辑问题的准确性,使其与 OpenAI o3 和 DeepSeek R1 处于同一推理模型类别。
- 128K Token 上下文窗口: 支持在单个提示词中处理全文法律合同、完整的中型代码库或多文档研究集,无需进行分块处理。
- MoE 架构: 基于混合专家 (Mixture of Experts) Transformer 设计,拥有 6710 亿总参数,每次推理激活 320 亿参数,在超大模型容量与可控的推理计算成本之间取得平衡。
- 强大的基准测试性能: 根据月之暗面 (Moonshot AI) 的技术报告,其在 AIME 2025 上得分为 96.2,在 MMLU Pro 上得分为 80.5%,在数学推理方面处于公开评估的顶尖前沿模型之列。
- 多语言支持: 官方支持中文和英文。官方文档尚未确认对其他语言的支持。
- API 及消费级应用访问: 可通过月之暗面 (Moonshot AI) 开发者平台上的 Kimi API 以及通过 kimi.ai 的消费级应用进行访问。
- 多模态能力: 截至发布时,月之暗面 (Moonshot AI) 尚未确认 Kimi K3 具备原生多模态(视觉/图像)能力。Kimi 应用界面支持文档上传 (PDF),但图像理解作为基础模型的能力尚未得到 K3 的官方确认。
K3 进入了一个竞争激烈的领域,在这个领域,推理基准已成为前沿模型的主要区分点。强大的 AIME 性能结合低推理成本的 MoE 架构,使其在同等规模的密集模型中脱颖而出,K3 因此成为研究级推理任务和成本敏感型生产 API 部署的理想选择。
Kimi K3 基准性能
根据 Moonshot AI 的技术报告,Kimi K3 在 AIME 2025 (pass@1) 取得 96.2 分,在 MMLU Pro 取得 80.5%,在 LiveCodeBench 取得 65.8%。这使其在数学推理基准测试中超越了 GPT-4o,并在核心前沿模型评估套件中与 DeepSeek V3 和 Qwen3 具有同等的竞争水平。
(本节引用的所有基准测试分数均源自 Moonshot AI 的官方技术报告和/或截至 2025 年 7 月的 Papers With Code AIME 2025 排行榜。基准测试排名变动频繁。读者应在 Papers With Code 和 LMSYS Chatbot Arena 核实当前排名,以获取最新的对比信息。)
数学与推理:AIME 与 MATH-500
根据 Moonshot AI 的技术报告,Kimi K3 在 AIME 2025(pass@1)中获得 96.2 分,而 GPT-4o 在非推理评估条件下的报告得分为约 62%。AIME(美国高中生数学竞赛)是一个严格的 15 题高中数学竞赛考试;AI 得分高于 80% 表明具备高级数学推理能力,而人类参赛者通常得分在 20%–47% 的范围内(3–7/15)。在 MATH-500 这个包含多个难度级别的 500 道竞赛级别问题的基准测试上,根据 Moonshot AI 的技术报告,Kimi K3 达到了 97.4%,而 GPT-4o 约为 76.6%,DeepSeek V3 则报告为 90.2%。
与标准模型在多步代数问题上可能猜测或截断不同,像 K3 这样的推理模型会生成中间步骤,从而在每个阶段都减少误差传播。这些结果表明 K3 以超过 95% 的比率正确解决了多步微积分、组合数学和代数问题,在这些任务上的表现显著优于非推理模型。这使得 K3 非常适合需要分步数学解释的科学计算辅助、量化研究支持以及辅导应用。
常识:MMLU Pro
Kimi K3 在 MMLU Pro 上取得了 80.5%,高于 GPT-4o(约 72.6%),并与 Qwen3-235B(约 79.8%)持平,这均依据各自的官方技术报告。MMLU Pro(Massive Multitask Language Understanding Pro)是 MMLU 基准测试的增强版本,用于测试跨越 57 个学术和专业领域的知识及多步推理能力,旨在区分那些原始 MMLU 分数已接近饱和的前沿模型。高 MMLU Pro 分数与在知识密集型任务上的可靠表现相关,例如法律研究、医疗问答和科学文献审查。
Coding: LiveCodeBench 和 SWE-bench 验证
根据 Moonshot AI 的技术报告,Kimi K3 在 LiveCodeBench 上的得分为 65.8%,相比之下,GPT-4o 约为 39.3%,DeepSeek V3 约为 59.4%。LiveCodeBench 通过持续收集模型训练截止日期后来自 LeetCode 和 Codeforces 的竞赛编程题目来评估模型,降低了训练数据污染的风险,使其成为比静态基准测试更可靠的真实编程能力指标。
在 SWE-bench Verified 上,根据 Moonshot AI 的技术报告,Kimi K3 的得分达到了 63.9%,低于 Claude 3.7 Sonnet 报告的 70.3%(包含扩展思考),但高于 GPT-4o 大约 38.7% 的得分。SWE-bench Verified 测试的是自动解决真实的 GitHub 软件工程问题的能力,这需要代码库理解、错误识别和补丁生成能力。这些能力对于 AI 辅助软件开发至关重要。63.9% 的得分意味着 K3 能够自主解决大约 100 个真实 GitHub 问题中的 64 个,这可以应用于自动化代码审查和错误修复工作流程。
Master benchmark comparison table
下表对比了 Kimi K3 与五款前沿模型在各项关键基准类别上的表现(所有分数均摘自截至 2025 年 7 月的官方模型技术报告或已验证的排行榜)。
| 模型 | AIME 2025 | MATH-500 | MMLU Pro | LiveCodeBench | SWE-bench Verified | 上下文窗口 |
|---|---|---|---|---|---|---|
| Kimi K3 | 96.2 | 97.4% | 80.5% | 65.8% | 63.9% | 128K |
| GPT-4o | ~62.0 | ~76.6% | ~72.6% | ~39.3% | ~38.7% | 128K |
| Claude 3.7 Sonnet | ~86.7 | ~92.3% | ~78.0% | ~56.0% | ~70.3%* | 200K |
| DeepSeek V3 | ~90.6 | ~90.2% | ~75.9% | ~59.4% | ~49.2% | 128K |
| Qwen3-235B | ~92.8 | ~94.0% | ~79.8% | ~66.2% | ~46.7% | 128K |
| Gemini 2.5 Pro | ~92.0 | ~97.1% | ~81.3% | ~64.0% | ~63.8% | 1M+ |
备注:AIME 2025 分数以正确率百分比报告(pass@1,除非另有注明)。Claude 3.7 SWE-bench 分数使用扩展思维模式。竞争者分数来源于各自的官方技术报告和 Papers With Code 排行榜条目,截至 2025 年 7 月。标记为 ~ 的分数是来自官方报告的近似数值,并可能因评估设置而异。请在 Papers With Code AIME 2025 排行榜上查看当前排名。
Kimi K3 对比竞争对手
Kimi K3 在大型语言模型的前沿梯队中,与 GPT-4o、Claude 3.7 Sonnet、DeepSeek V3、Qwen3 和 Gemini 2.5 Pro 等模型一同竞争。以下对比涵盖了各模型的性能表现以及它们各自具备优势的应用场景。
Kimi K3 对比 GPT-4o。Kimi K3 在各项主要的推理和编码基准测试中均领先 GPT-4o:AIME 2025 上为 96.2 对比 ~62,MATH-500 上为 97.4% 对比 ~76.6%,MMLU Pro 上为 80.5% 对比 ~72.6%,LiveCodeBench 上为 65.8% 对比 ~39.3%,SWE-bench Verified 上为 63.9% 对比 ~38.7%。GPT-4o 在多模态能力(已确认的视觉、音频和图像生成集成)、更广泛的第三方工具集成以及更长的生产部署记录方面仍具优势。对于优先考虑复杂问题准确性的数学、科学推理和编码任务,K3 展现了更强的基准优势。需要多模态输入、成熟供应商关系或保证 SLA 的团队将发现 GPT-4o 是更低摩擦的选择。API 定价也大幅偏向 K3:每百万输入 token 0.15 美元,而 GPT-4o 大约是 5.00 美元。
Kimi K3 对比 DeepSeek V3。两者都是中国开发的尖端大型语言模型,但在架构和访问模式上有所不同。DeepSeek V3 是一个拥有 6710 亿参数的密集型模型,根据 DeepSeek 的模型许可协议开放权重发布;开发者可以下载并自行托管。K3 采用 MoE 架构,每次运行激活 320 亿参数,并且仅提供 API 访问。在基准测试中,K3 在 AIME 2025 (96.2 对比约 90.6) 和 SWE-bench Verified (63.9% 对比约 49.2%) 上领先;DeepSeek V3 在 LiveCodeBench 上表现具有竞争力 (59.4% 对比 K3 的 65.8%)。需要本地部署、微调或访问模型权重的团队应选择 DeepSeek V3。优先考虑通过 API 进行推理基准测试性能的团队,在数学密集型任务上会发现 K3 更胜一筹。
Kimi K3 对比 Claude 3.7 Sonnet。 SWE-bench Verified 的差距是两者间最关键的区分点:Claude 3.7 Sonnet 获得 70.3% 的评分(开启深度思考模式),而 K3 为 63.9%,在自动化软件工程方面领先 6.4 个百分点。此外,Claude 支持更大的上下文窗口(200K 对比 128K token)。在 AIME 2025(96.2 对比 ~86.7)和 MATH-500(97.4% 对比 ~92.3%)上,K3 则领先于 Claude。两款模型都提供了推理模式,且在功能上具有可比性的深度思考方式。对于 Agent 编程和软件工程工作流,Claude 3.7 Sonnet 仍是更佳选择;而对于纯数学推理和定量研究任务,K3 在基准测试中占据明显优势。
Kimi K3 对阵 Qwen3(阿里巴巴)。作为阿里云 2025 年的旗舰模型,Qwen3-235B 在 AIME 2025(92.8 对比 96.2)和 MMLU Pro(79.8% 对比 80.5%)的表现落后于 K3,而在 LiveCodeBench 上则以微弱优势领先(66.2% 对比 65.8%)。Qwen3 在 QwenLM GitHub 仓库提供开源权重版本,这与 K3 仅限 API 访问的形式形成对比。针对中文任务,Qwen3 受益于阿里云的企业级基础设施和多语言训练数据;截至撰稿时,尚未发布 K3 与 Qwen3 之间独立的 C-Eval 或 CMMLU 对比数据。阿里云生态系统内的团队会发现 Qwen3 的集成度更高;而侧重于数学推理基准评估的团队则会发现 K3 略胜一筹。
Kimi K3 对比 Gemini 2.5 Pro。 上下文窗口的差距是其核心区别。与 K3 的 128K token 相比,Gemini 2.5 Pro 支持高达 1M token,这使得它在处理超长文档的任务中具有 8 倍的优势。在基准测试中,这两款模型表现接近:Gemini 2.5 Pro 在 MMLU Pro 上略微领先(81.3% 对 80.5%),在 MATH-500 上(97.1% 对 K3 的 97.4%),而 K3 在 AIME 2025 上保持领先(96.2 对约 92.0)。对于超过 128K token 的多文档研究综合、书籍级长度的分析或大型代码库索引,Gemini 2.5 Pro 是技术上更优的选择。对于在 128K token 以内且侧重数学推理并追求更低 API 成本的任务,K3 则更具优势。
2025年中国人工智能格局。在中国的前沿模型中,Kimi K3(月之暗面)、DeepSeek V3(深度求索)和 Qwen3(阿里云)代表了三种主要的期权,每种都有不同的定位。DeepSeek 通过发布开源权重版本实现了差异化,开发者可以自行托管且无需支付推理成本。Qwen3 受益于阿里云的企业生态系统和开源权重的可用性。K3 的定位是处于推理基准测试的领先地位。基准测试数据并不支持将任何单一模型定义为在所有任务中绝对最佳;正确的选择取决于使用场景是否优先考虑开源权重获取(DeepSeek、Qwen3)、企业生态深度(Qwen3)或纯粹的推理基准性能(K3,特别是针对重数学的应用)。
如何访问 Kimi K3
Kimi K3 并非开源权重模型。开发者可通过 Kimi API 访问,而非开发者用户可通过位于 kimi.ai 的 Kimi 消费端应用访问。截至撰稿时,官方尚未公开模型权重;若需性能水平相当的开源权重替代方案,DeepSeek V3 和 Qwen3 提供本地部署选项。
在 Bybit 上交易 MOONSHOT 代币: Moonshot AI 的增长吸引了加密货币交易者的关注 —— Bybit 为有兴趣交易 MOONSHOT 代币的人士提供 MOONSHOTUSDT 永续合约。有关代币本身的背景信息,请参阅 什么是 MOONSHOT USDT?完整指南.
Kimi 应用程序(消费者访问)
Kimi App 是 Moonshot AI 面向消费者的 AI 助手产品,可在 kimi.ai 访问,并提供 iOS 和 Android 版本的移动应用程序。若要开始通过该消费者端应用使用 K3:
- 访问 kimi.ai 或从 App Store 或 Google Play 下载 Kimi 移动应用程序。
- 使用电子邮件地址或电话号码创建免费账户,或登录现有账户。
- Kimi K3 默认支持当前的 Kimi 应用程序界面;除非 Moonshot AI 在未来的更新中添加了模型选择器,否则无需执行模型选择步骤。
- 开始聊天。该应用程序支持上传文件(PDF 和文本文件)以及网页搜索集成。
Kimi 应用现已面向全球用户开放,包括美国和欧洲的用户。免费套餐提供 K3 的访问权限,并附带每日使用限制;Moonshot AI 提供付费订阅(Kimi Pro),以获得更高的消息限额,并在高峰时段享有优先访问权。在订阅前,请在 kimi.ai 上确认当前的套餐限额,因为这些限额经常会发生变化。
Kimi API (开发者访问)
["在 Moonshot AI 开发者平台创建 Moonshot AI 开发者账户。","在账户仪表盘的“API 密钥”部分生成 API 密钥。","Kimi API 使用兼容 OpenAI 的模式,因此您可以将基础 URL 和模型标识符字符串替换到现有的 OpenAI SDK 代码中,只需进行少量改动。","使用 Kimi K3 模型标识符 kimi-k3 进行首次 API 调用,具体信息可在 Moonshot AI 的 API 文档中确认。"]
from openai import OpenAI
Kimi K3:Moonshot AI 的推理模型
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", # 来自 platform.moonshot.cn 的 API 密钥 base_url="https://api.moonshot.cn/v1", )
Kimi K3:Moonshot AI 的推理模型
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
response = client.chat.completions.create( model="kimi-k3", # 已确认的 Kimi K3 模型标识符 messages=[ {"role": "system", "content": "你是一位得力的助手。"}, {"role": "user", "content": "逐步解答:前 100 个质数的和是多少?"}, ], temperature=0.6, )
打印(response.choices[0].message.content)
截至 2025 年 7 月,根据 Moonshot AI 的官方定价页面,Kimi K3 API 的定价为每百万输入令牌 0.15 美元,每百万输出令牌 0.60 美元。相比之下,GPT-4o 的定价约为每百万输入令牌 5.00 美元,每百万输出令牌 15.00 美元;Claude 3.7 Sonnet 的定价约为每百万输入令牌 3.00 美元,每百万输出令牌 15.00 美元。对于相同复杂度的推理任务,K3 的每令牌成本远低于西方两大主要竞争对手。
Moonshot AI 为新开发者账户提供免费 API 层级,并设有每月 Token 配额限制;在规划生产环境使用前,请前往 Moonshot AI API 价格页面核实当前的免费层级限制,因为这些数值经常变动。
*(API 定价可能会有所变动。所有数据均反映截至 2025 年 7 月的费率。在做出商业决策前,请前往 Moonshot AI API 定价页面核实当前价格。)*
[{"Context Window":"上下文窗口","Input $/1M tokens":"输入 $/1M 令牌","Model":"模型","Output $/1M tokens":"输出 $/1M 令牌"},{"Context Window":"128K","Input $/1M tokens":"$0.15","Model":"Kimi K3","Output $/1M tokens":"$0.60"},{"Context Window":"128K","Input $/1M tokens":"~$5.00","Model":"GPT-4o","Output $/1M tokens":"~$15.00"},{"Context Window":"200K","Input $/1M tokens":"~$3.00","Model":"Claude 3.7 Sonnet","Output $/1M tokens":"~$15.00"},{"Context Window":"128K","Input $/1M tokens":"~$0.27","Model":"DeepSeek V3 (API)","Output $/1M tokens":"~$1.10"},{"Context Window":"128K","Input $/1M tokens":"~$0.14","Model":"Qwen3-235B (API)","Output $/1M tokens":"~$0.60"}]
欲知 API 分级、代币定价和成本优化技巧的完整解析,请参阅 [Moonshot Kimi API 2026 定价:方案与成本指南](https://www.bybit.com/en/wiki/article/kimi-api-pricing-2026-plans-cost-guide/).
Kimi API 面向全球开发者开放。截至 2025 年 7 月,Moonshot AI 尚未公布 API 访问的地理限制。对于无需 API 依赖的本地部署,K3 不是一个选项;而是考虑 DeepSeek V3 或 Qwen3 的开放权重版本。
---
## Kimi K3 的应用场景
Kimi K3 最适合需要深度推理、大语境处理和强代码能力的任务。
- **高等数学与科学推理:** K3 在 AIME 2025 中获得 96.2 分,在 MATH-500 中获得 97.4% 的得分,使其成为竞赛级问题求解、物理与工程计算、统计分析以及注重中间步骤准确性的定量研究辅助的强力候选者。
- **代码生成与调试:** 凭借 65.8% 的 LiveCodeBench 得分,K3 能够跨 Python、JavaScript、SQL 和其他主流语言生成语法正确且功能准确的代码,并能在单次提示词会话中调试多步逻辑错误。
- **软件工程辅助:** SWE-bench Verified 得分为 63.9%,意味着 K3 可以自主解决 100 个真实 GitHub 问题中的约 64 个,这使其适用于自动化代码审查、重构建议和问题分流工作流。
- **长文档分析:** 128K token 的上下文窗口支持处理全文法律合同、完整的学术论文、财务报告和多章节技术文档,无需进行分块或承受摘要损失。
- **多步研究综合:** K3 可以在其上下文窗口内交叉引用多个文档,提取相互冲突的主张,并为文献综述、尽职调查研究和政策分析生成结构化的对比摘要。
- **中英双语任务:** K3 官方支持中文和英文,Moonshot AI 的消费级产品从发布之初就是为中国市场设计的。在撰写本文时,尚未发布独立的中文基准测试对比(C-Eval、CMMLU)。
**谁应该使用 Kimi K3:**K3 是目前针对高强度数学推理、定量研究支持以及成本敏感型编程应用(每百万输入 Token 仅需 0.15 美元)最强大的 API 选项。目前使用 GPT-4o 处理推理任务的团队会发现,K3 提供的基准测试表现显著优于前者,且 API 成本仅为一小部分。对于以 SWE-bench 表现为首要指标的智能体编程工作流,Claude 3.7 Sonnet 仍保有优势。对于需要超过 128K Token 上下文的使用场景,Gemini 2.5 Pro 是更合适的选择。对于需要开源权重本地部署的团队,DeepSeek V3 或 Qwen3 是合适的替代方案。
## 限制与注意事项
Kimi K3 存在一些显著的局限性,用户和企业买家在采用前应进行评估。
**在 SWE-bench 上的基准测试表现落后。** 在 SWE-bench Verified 上,K3 的得分为 63.9%,比 Claude 3.7 Sonnet 的 70.3% 低了 6.4 个百分点。对于主要用例是自动化 GitHub 问题修复或代理式软件工程的团队而言,这一差距是实质性的,根据已发布的基准测试数据,Claude 3.7 Sonnet 仍然是更强大的选择。
**无开放权重访问。** K3 是一款闭源 API 模型。模型权重并不对外公开,这意味着无法进行本地部署、微调以及量化自托管(如通过 llama.cpp、vLLM 或 Ollama 实现 GGUF、GPTQ、AWQ)。DeepSeek V3 和 Qwen3 均提供开放权重版本,支持本地部署且无需支付按 Token 计算的费用。对于有数据主权要求、禁止将数据发送至外部 API 的机构,或需要微调权限的研究人员而言,K3 并不是一个可行的选择。
**上下文窗口落后于长上下文竞争对手。** K3 的 128K 标记上下文窗口与 GPT-4o 相当,但比 Claude 3.7 Sonnet 的 200K 小 36%,比 Gemini 2.5 Pro 的 1M 标记窗口小 87.5%。需要处理非常长文档的任务(如整本书分析、大型代码库索引或超过 128K 标记的多源语料库综合)将需要分块策略或不同模型。
知识截止日期不确定性。截至 2025 年 7 月,Moonshot AI 尚未公开确认 K3 训练数据的知识截止日期。对于截止日期之后发生的事件的查询,除非模型通过网络搜索或检索增强生成 (RAG) 管道进行增强,否则将返回不完整或缺失的信息。Kimi 消费者应用包含网络搜索集成,为消费者用户缓解了此问题;API 用户必须实现自己的检索层,以处理对时间敏感的查询。
推理模型延迟权衡。扩展思维链推理在处理复杂任务时能提供更准确的回复,但与标准指令遵循模型相比,每次回复生成的 Token 数量显著更多。对于简单查询(摘要、格式转换、基础问答),使用 GPT-4o mini 或 DeepSeek 蒸馏版等更轻量级的模型将更具成本效益。
企业数据治理。Kimi K3 由 Moonshot AI 开发,Moonshot AI 是一家总部位于北京、需遵守中国数据法规的公司。拥有严格数据驻留要求、在 GDPR 等框架下有合规义务,或对非国内实体的数据处理有限制的组织,在将 K3 集成到生产系统之前,应审查 Moonshot AI 的数据处理协议和区域 API 基础设施。此指导意见适用于事实且对称的情况。同样的事项审慎调查也适用于任何跨境 AI API,包括被位于有国内数据处理要求的司法管辖区的组织所使用的美国公司提供的服务。
---
## 常见问题
### 什么是 Kimi K3,它是由谁制造的?
Kimi K3 是由总部位于北京的 AI 公司 Moonshot AI(月之暗面)开发的前沿推理大语言模型,并于 2025 年 7 月发布。它被设计为一款推理优先的旗舰模型,利用扩展的思维链(chain-of-thought)处理能力来应对复杂的数学、编程和知识密集型任务。K3 是 Kimi K2 的继任者,从智能体定位转向了通用推理设计。
### Kimi K3 有哪些核心功能?
Kimi K3 的主要功能包括:(1) 增强的链式思考推理,在 AIME 和 MATH-500 考试中取得顶尖表现;(2) 拥有 128K token 的上下文窗口,用于长文档处理;(3) 采用混合专家(MoE)架构,总计 671B 参数,激活 32B 参数;(4) API 定价具有竞争力,每百万输入 token 仅需 $0.15;以及 (5) 可通过 kimi.ai 上的消费者 Kimi 应用和 platform.moonshot.cn 上的开发者 API 进行访问。
### Kimi K3 的上下文窗口大小是多少?
Kimi K3 支持 128K token 的上下文窗口,相当于约 96,000 个英文单词。这与 GPT-4o 的 128K 上下文一致,但小于 Claude 3.7 Sonnet 的 200K token 和 Gemini 2.5 Pro 的 1M token。对于大多数文档分析和编程任务,128K token 已经足够;极大型代码库或书本长度的文档可能需要进行分块处理。
### Kimi K3 是开源还是闭源的?
Kimi K3 已关闭:模型权重不公开提供。访问仅可通过面向开发者的 Kimi API,以及面向普通用户的 Kimi 消费者应用( kimi.ai)提供。对于能力水平相当的开源权重替代方案,DeepSeek V3(稠密模型,671B)和 Qwen3(QwenLM GitHub 提供开源权重版本)均支持本地部署和微调。
### Kimi K3 与 GPT-4o 在各项基准测试中的对比如何?
Kimi K3 在所有已发布的推理和编码基准测试中均优于 GPT-4o:AIME 2025(96.2 对比 ~62)、MATH-500(97.4% 对比 ~76.6%)、MMLU Pro(80.5% 对比 ~72.6%)、LiveCodeBench(65.8% 对比 ~39.3%)以及 SWE-bench Verified(63.9% 对比 ~38.7%)。GPT-4o 在多模态能力、第三方生态系统集成以及成熟的企业支持基础设施方面处于领先地位。对于纯粹的推理任务,K3 以显著更低 API 定价展示了强大的基准案例。
### Kimi K3 与 Kimi K2 有何不同?
Kimi K3 从 Kimi K2 的智能体优先定位(工具使用、长上下文文档处理)转变为推理优先的通用设计。两者均采用 MoE 架构,拥有 32B 活跃参数,但 K3 将总参数量从约 1T 减少到 671B,同时在推理基准测试中取得显著更强的分数。K2 未在 AIME 或 MATH-500 上进行基准测试;K3 主要定位在推理能力方面。
### Moonshot AI 的创始人是谁?
Moonshot AI 成立于2023年,由清华大学和卡内基梅隆大学的前研究员杨植麟创立,他是 XLNet(一款早期可与 BERT 相媲美的 Transformer 语言模型)的合著者之一。杨植麟担任 Moonshot AI 的首席执行官。
### 我可以通过 API 访问 Kimi K3 吗?
是的。Kimi API 已在 Moonshot AI 开发者平台上架。该 API 使用与 OpenAI 兼容的架构,因此只需替换基础 URL (`https://api.moonshot.cn/v1`)`) 和模型标识符,即可适配现有的 OpenAI SDK 代码。截至 2025 年 7 月,定价为每百万输入代币(input tokens)$0.15,每百万输出代币(output tokens)$0.60。新的开发者账户可获得免费 API 层级,包含每月限额的代币配额。
### Kimi K3 是否在美国和欧洲提供?
是的。Kimi K3 已通过 kimi.ai 上的 Kimi 用户端应用程序和 Kimi API 在全球范围内提供。截至 2025 年 7 月,月之暗面 (Moonshot AI) 尚未发布有关 API 访问的地理限制。企业买家在进行生产部署前,应审阅月之暗面 (Moonshot AI) 的数据处理协议,以了解数据驻留和合规性方面的考量。
### Kimi K3 支持哪些语言?
Kimi K3 正式支持中文和英文。截至撰稿时,Moonshot AI 的官方文档尚未确认是否支持其他语言。Kimi 消费者应用从发布之初就是为中国市场设计的,预计 K3 的训练数据将包含大量的中文内容,尽管截至撰稿时,独立的中文基准测试分数(C-Eval、CMMLU)尚未发布。
---
## 结论
Kimi K3 代表了 Moonshot AI 目前最强大的前沿模型,结合了顶级的数学推理能力(在 AIME 2025 上达到 96.2 分),采用经济高效的 MoE 架构,并且 API 定价远低于 GPT-4o 和 Claude 3.7 Sonnet。对于评估 2025 年前沿模型的开发者和研究人员来说,K3 在需要大量推理的任务中值得认真考虑,尤其是在每正确答案成本是主要评估指标的情况下。
## 相关阅读
- [Kimi K2 是什么?Moonshot AI 的开放权重思考模型](https://www.bybit.com/en/wiki/article/kimi-k2-open-weight-thinking-model/)
- [Moonshot AI:公司概览与 Kimi 产品指南](https://www.bybit.com/en/wiki/article/moonshot-ai-company-overview-kimi/)
- [Moonshot Kimi API 定价 2026:方案与成本指南](https://www.bybit.com/en/wiki/article/kimi-api-pricing-2026-plans-cost-guide/)
- [Moonshot AI 对比 DeepSeek 对比 Qwen:中国 AI 模型比较](https://www.bybit.com/en/wiki/article/moonshot-ai-vs-deepseek-vs-qwen-2025-comparison/)
- [Kimi AI 是什么?Moonshot AI 指南](https://www.bybit.com/en/wiki/article/what-is-kimi-ai-guide-to-moonshot-ai/)
- [MOONSHOTUSDT 永续 合约 在 Bybit 上](https://www.bybit.com/trade/usdt/MOONSHOTUSDT)
开发者可以通过 Kimi API 在 Moonshot AI 开发者平台开始进行实验,该平台提供与 OpenAI 兼容的模式,可减少集成工作。消费者用户可以通过 kimi.ai 上的 Kimi AI 助手直接访问 Kimi K3。有关最新的基准更新、模型发布和技术文档,请查阅 moonshotai.com 上的 Moonshot AI 官方博客。如需 Bybit 的完整 Moonshot AI 资源中心,请浏览 [Moonshot AI vs DeepSeek vs Qwen 对比](https://www.bybit.com/en/wiki/article/moonshot-ai-vs-deepseek-vs-qwen-2025-comparison/)) 和 [什么是 Kimi AI?指南](https://www.bybit.com/en/wiki/article/what-is-kimi-ai-guide-to-moonshot-ai/).)
随着 Moonshot AI 发布新的基准数据、官方规格和定价信息,本文将持续更新。