一个 2.8 万亿参数的开源权重模型进了企业云
9 月 18 日,月之暗面的 Kimi K3 在 Amazon Bedrock 上线。按 Moonshot AI 的说法,这是首个达到 2.8 万亿参数的开源模型;公司称它把原生视觉能力与 1M token 上下文结合在一起,并相对 Kimi K2 取得约 2.5 倍的扩展效率提升。
结构上,官方把增益归给两项架构更新——Kimi Delta Attention 与 Attention Residuals,分别改善信息在序列长度与模型深度上的流动;模型采用称为 Stable LatentMoE 的专家混合设计,896 个专家中实际激活 16 个,并从监督微调阶段起进行量化感知训练,权重用 MXFP4、激活用 MXFP8。
官方自己说的位置与短板
Moonshot AI 明确表示,Kimi K3 的整体表现仍落后于闭源的 Claude Fable 5 与 GPT 5.6 Sol,同时称它在自家评测套件里达到了前沿水平并稳定优于其他被测试的模型。
官方列出的限制有两条值得记:一是模型在保留思考历史的模式下训练,如果 Agent 框架没有把历史思考内容回传,生成质量会变得不稳定;二是它偏向长程任务,在指令模糊时可能替用户做出意外决定,需要在系统提示里加上更明确的行为约束。
Bedrock 上第一个支持显式提示缓存的开源权重模型
AWS 表示,Kimi K3 是 Amazon Bedrock 上第一个支持显式提示缓存的开源权重模型,目标正是那些需要反复回传大量上下文的长期编码与知识工作流。云平台侧,Bedrock 自 2025 年以来已接入 DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI 与 Qwen 等多家开源权重模型;2026 年又把工具调用、结构化输出、推理、响应流式输出以及 Responses 与 Chat Completions API 做成平台能力而非逐模型集成,新模型上线即可使用。
调用方式上,Kimi K3 通过跨区域推理概入面提供:global.moonshotai.kimi-k3 会把每个请求路由到全球任一受支持的区域,AWS 称其成本比地理概入面低约 10%;us.moonshotai.kimi-k3 则把处理限制在美国境内,满足数据驻留要求。前置条件包括可用的 AWS 账号与 Bedrock 权限、Python 3.10 以上,以及 bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream 与 bedrock:CreateInference 权限。
数据处理与时间线
AWS 表示,与其他开源权重模型一致,客户数据在 AWS 数据边界内处理、不与模型提供方共享、也不用于训练底层模型;推理请求始终启用零数据留存,零操作员访问则阻止 AWS 操作员在推理期间接触提示与补全内容。
Kimi K3 并非新模型:Moonshot AI 在 2026 年 7 月首次介绍它时表示完整权重会在 7 月 27 日前放出,当时的提供渠道是 Kimi App、Kimi Work 桌面应用、Kimi Code 终端工具与 Kimi API。Bedrock 上线意味着它开始进入企业采购与合规流程覆盖的渠道。
长上下文模型的比价方式要改了:不看每百万 token 的单价,先看缓存命中率。