前沿热点
前沿热点

Kimi K3 今晚开源:2.8 万亿参数全球最大,杨植麟把中美模型差距压到 3 个月

7 月 27 日晚,月之暗面正式开源 Kimi K3 权重:2.8 万亿参数 MoE、100 万 token 上下文,全球最大开源模型,对标 Anthropic Fable 5。从 7 月 16 日发 API 到今晚放权重,杨植麟用十天把中美模型差距从 6-9 个月压到 3-5 个月。拆解规格、跑分、翻盘逻辑与白宫指控。

发布于 2026年7月27日3 分钟阅读
<!-- kimi-k3-open-weights-opensource | hotspot | Kimi K3 今晚开源 -->

7 月 27 日晚,月之暗面把 Kimi K3 的模型权重挂上了下载页,免费、可商用、能自部署。这是全球第一个迈过两万亿参数门槛、还允许开发者自由下载改造的大模型。从 7 月 16 日先发 API 和 app,到今晚放权重,中间只隔了十天。

2.8 万亿参数到底多大

K3 总参数 2.8 万亿,架构是 Stable MoE,每层 896 个专家里激活 16 个;上下文窗口 100 万 token,原生能看图,还内置常驻的「思考模式」。横向比:DeepSeek V4 Pro 约 1.6 万亿,小米 1.02 万亿,阿里 3970 亿,K3 比第二名大约七成。两个自研结构是亮点,Kimi Delta Attention(混合线性注意力)和 Attention Residuals(残差连接的替代方案)此前都在 GitHub 公开过。权重用 MXFP4 量化,激活用 MXFP8,训练时就做了量化感知。

跑分对标 Fable 5

Moonshot 官方基准称 K3 与 Anthropic Fable 5「旗鼓相当」,大幅超过 Opus 4.8、GPT-5.6 Sol 和 GPT-5.5。独立榜单更克制:Artificial Analysis 智能指数排第三,前面是 Fable 5 和 GPT-5.6 Sol Max;Arena 前端代码盲测拿第一,直接盖过美国头部模型;Vals AI 排第二。关键是成本,对标 Fable 5 这一级的推理能力,价格只有它的零头。

杨植麟的翻盘

创始人杨植麟 34 岁,清华和卡内基梅隆出身,平克·弗洛伊德乐迷,「月之暗面」这名字就取自专辑《月之暗面》。过去 18 个月公司被 DeepSeek 压着打,市场地位一度滑坡,K3 是反手。数据很猛:K3 上线后日营收涨了六倍,6 月年经常性收入到 3 亿美元(4 月还是 2 亿),正以 500 亿美元估值找新一轮融资,最快今年港股 IPO。发布当天竞品跳水,Z.ai 跌 30%,MiniMax 跌 16%,阿里跌 4%。

开源背后的算账

为什么不闭源收钱?杨植麟的逻辑是用开放换用户基数和开发者社区,争当全球开源 AI 的引力中心。地缘上更锋利,路透社点破过,开源让中国公司既秀肌肉又扩影响,正好对冲美国的芯片限制。白宫没闲着,科技政策办公室主任 Michael Kratsios 上周公开指控 Moonshot 用被禁的英伟达芯片训练 K3,还对 Fable 等美国模型做大规模蒸馏,Moonshot 没回应。研究者 Nathan Lambert 的判断是:开源对闭源、中国对美国的差距,已经从六到九个月压到三到五个月。

参数堆到 2.8 万亿是工程能力,敢在风头上把权重全放出去是战略选择。下载页已经开了,跑不跑、怎么跑,看你的算力。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-27

常见问题

Kimi K3 是什么?什么时候开源的?
月之暗面(Moonshot AI)7 月 16 日发布的旗舰大模型,2.8 万亿参数 MoE 架构、100 万 token 上下文。7 月 27 日晚正式开放权重下载,免费可商用、可自部署,是目前全球最大的开源模型。
2.8 万亿参数意味着什么?普通人怎么用?
参数是大模型规模的指标,2.8 万亿使 K3 成为目前最大的开源模型,比 DeepSeek V4 Pro 大约 75%。权重开放后开发者可下载、修改、自托管,需要充足算力。普通人直接用 Kimi app 或 API 即可,无需碰权重。
为什么说 Kimi K3 对标 Anthropic Fable 5?
Moonshot 官方基准称 K3 与 Fable 5「旗鼓相当」,大幅超过 Opus 4.8 和 GPT-5.6 Sol;独立榜单 Artificial Analysis 排第三(落后 Fable 5 和 GPT-5.6 Sol Max),Arena 前端代码盲测第一。但成本远低于 Fable 5。

相关文章

前沿热点

Kimi K2.8 Preview 上线:抢编码 Agent 的日常入口

2026-09-14 月之暗面推出新一代主力模型 Kimi K2.8 Preview,在 Kimi Code 与 Kimi Work 全量上线:官方称综合性能接近旗舰 K3,编码与 Agent 能力较 K2.7 Code 全面提升,思考效率显著改善;支持 low/high/max 三档思考强度(与 K3 对齐,默认 max,CLI 用 /effort 切换)与图片、视频双模态输入;1M 超长上下文向全部会员档位开放、含免费档 Adagio;Model ID 仍为 kimi-for-coding,Claude Code、OpenCode、Codex 等第三方工具零改配置即可无感升级,追求速度的 Allegretto 及以上会员可换 kimi-for-coding-highspeed;请求路由上,K3 关闭 thinking 后会自动转交 K2.8 无思考版本。计费随订阅会员(0 到 699 元每月),不按 token 计费;月之暗面 ARR 从 2026 年 6 月的 3 亿美元增至 8 月破 10 亿美元。本文不做发布会复述,核心判断是这套组合拳的意图在抢编码 Agent 的日常流量入口,把竞争维度从跑分换成单位任务成本与迁移摩擦;并点明三个待验证处:官方未公布任何 benchmark 跑分(流传的 SWE-bench Pro 63.2%、OSWorld-Verified 81.2% 实为 Claude Sonnet 5 数据,本文严格标注归属)、开放权重未公布、以及 K2.8 无专属 GitHub 代码仓(实测 moonshotai 组织 43 个仓库,最新模型仓止于 K3、K2.5、K2),故按站内纪律只做热点、不做开源项目介绍。

2026年9月15日9 分钟阅读
前沿热点

DeepSeek V4.1 Flash 开源:非对称结构意味着什么

DeepSeek 于 2026-09-10 正式开源 V4.1 Flash:552B 参数 MoE,采用非对称 Causal-Encoder-Decoder 结构,输入激活仅 8B、输出 16B,原生多模态,官方称显著压缩 KV Cache 以降低 Agent 场景成本;API 同步上线,模型名改为 deepseek-flash 即可调用,腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已全量接入。该模型在 9-08 曾以「内测中间版」形式出现,9-10 转正——这段从临时候转正的时间线本身就值得留意。本文逐条拆发布事实,判断真正的工程信号不在参数量而在「非对称结构 + 输入激活 8B」带来的长上下文与 Agent 成本结构变化,算 KV Cache 压缩对多轮轨迹堆积的实际账,并给出未公开评测对照、与自家 V4-Flash 的换代关系、并发与价格待确认等冷思考。需说明:本次开源的是模型权重(HuggingFace),DeepSeek 官方组织下并无 V4.1 Flash 的专属代码仓。

2026年9月10日9 分钟阅读