前沿热点
前沿热点

阿里 Qwen3.8-Max 发布:2.4 万亿参数 MoE 旗舰,能自主编程十数天

2026-08-03 阿里通义发布 Qwen3.8-Max:2.4 万亿参数 MoE 旗舰,1M 上下文(输入 991K/输出 131K),原生视觉理解贯穿规划-执行-验证,定位「自主编程十数天交付完整项目」。定价输入 ¥12/M、输出 ¥36/M,显式缓存命中 ¥1(未命中 ¥12 的 1/12)。三入口:博客/千问平台/Qwen Studio。

发布于 2026年8月3日4 分钟阅读
<!-- qwen3-8-max-hotspot | hotspot | 阿里 Qwen3.8-Max 发布:2.4 万亿参数 MoE 旗舰,能自主编程十数天 -->

8 月 3 日,阿里通义正式发布 Qwen3.8-Max。这不是一次常规迭代——2.4 万亿参数的 MoE 旗舰,上下文捅到 1M,官方直接把定位写成「可自主编程十数天交付完整项目」。一句话:模型不再只被问「会不会」,而是被要求「干完没」。

旗舰规格:2.4 万亿参数 MoE,1M 上下文

Qwen3.8-Max 是 MoE(混合专家)架构,总参数 2.4 万亿,旗舰定位。MoE 的意思是大虽然大,但每次推理只激活一部分专家网络,实际计算量远小于参数总量——这是把模型做大又不把推理成本做飞的关键。

上下文窗口 1M tokens。单次对话最多塞 991K 输入、吐 131K 输出;开思考模式后输入仍到 983K,最大思维链 262K。把一本长篇小说连同参考文档一次性丢进去,它边读边干。原生视觉理解是标配:图像、文本、视频都能进,输出文本。官方强调视觉贯穿「规划-执行-验证」全流程,支持超长文档和长视频的深度语义解析——不是贴个 OCR,是真拿来干活。

定价:缓存命中打到约一折

千问 AI 平台公布的调用价:

项目价格(每百万 tokens)
输入¥12
输出¥36
输入(自动缓存命中)¥1.5
显式缓存创建¥15
显式缓存命中¥1

亮点在缓存。显式缓存命中 ¥1 对比未命中输入 ¥12,差 12 倍。长程任务里前缀重复率高,把公共前缀缓存住,实际输入成本能压到约一折。显式缓存创建 ¥15 比普通输入贵 25%,但只付一次,后续命中就按 ¥1 走。这是给「长对话、多轮迭代」场景准备的成本开关——而 Qwen3.8-Max 的定位恰恰就是长程任务,两件事咬合得很紧。

从「答题」到「干活」:长程自主任务

真正值得盯的不是参数表,是定位变了。官方原文写的是「编程与办公能力全面跃升,可自主编程十数天交付完整项目」「胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果」。

翻译一下:模型被设计成能接住一个需要持续工作十几天的项目,自己规划、自己执行、自己验证、自己迭代,而不是一轮问答。这跟过去「问一句答一句」的用法是两回事。配套能力也照着这个目标铺:函数调用接外部工具、结构化输出保证 JSON 格式、联网搜索补实时信息、批量任务跑规模、还开放微调。前缀补全(Partial Mode)让你给定前缀它严格接续,适合卡住生成节奏的工程场景。

「长程任务中自主规划与闭环迭代,持续进化」——这句话如果实测能撑住,意味的是 agent 框架跟模型本身开始绑定了。过去 agent 是套壳调模型,现在模型自己长出了 agent 的骨头。

怎么立刻上手

三个入口,按用途选:

看法

国产旗舰这一轮拼的已经不是跑分数字,是「能干多久的活」。2.4 万亿参数加 1M 上下文是入场券,自主编程十数天、闭环迭代才是 Qwen3.8-Max 想立的旗。缓存定价打到一折说明阿里也想清楚了:长程任务要跑起来,单次调用必须便宜到敢让它反复试。

真正的问题是「十数天交付」能不能在真实工程里复现。官方定位写得漂亮,但模型自己规划十几天的任务链、中间不跑偏不崩盘,这是最难的事——要等开发者把它扔进真实代码库、跑过长链路任务才见分晓。今天先把入口占住,自己试一把比看任何跑分都实在。


参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-08-03

常见问题

Qwen3.8-Max 参数量多大?
2.4 万亿参数,MoE(混合专家)架构,旗舰定位。MoE 意味着总参数虽大,但每次推理只激活一部分专家网络,实际计算量远小于参数总量,是把模型做大又不把推理成本做飞的关键。
上下文有多长?
上下文窗口 1M tokens。单次对话最大输入 991K、最大输出 131K;开思考模式后最大输入 983K、最大输出 131K,最大思维链 262K。原生视觉理解支持图像、文本、视频输入。
调用价格多少?
千问 AI 平台定价:输入 ¥12/百万 tokens、输出 ¥36/百万 tokens。缓存命中便宜很多--自动缓存命中 ¥1.5、显式缓存命中 ¥1(对比未命中输入 ¥12,差 12 倍)。显式缓存创建 ¥15,只付一次后续命中按 ¥1 走,适合长程任务的前缀复用。

相关文章

前沿热点

DeepSeek V4.1 Flash 开源:非对称结构意味着什么

DeepSeek 于 2026-09-10 正式开源 V4.1 Flash:552B 参数 MoE,采用非对称 Causal-Encoder-Decoder 结构,输入激活仅 8B、输出 16B,原生多模态,官方称显著压缩 KV Cache 以降低 Agent 场景成本;API 同步上线,模型名改为 deepseek-flash 即可调用,腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已全量接入。该模型在 9-08 曾以「内测中间版」形式出现,9-10 转正——这段从临时候转正的时间线本身就值得留意。本文逐条拆发布事实,判断真正的工程信号不在参数量而在「非对称结构 + 输入激活 8B」带来的长上下文与 Agent 成本结构变化,算 KV Cache 压缩对多轮轨迹堆积的实际账,并给出未公开评测对照、与自家 V4-Flash 的换代关系、并发与价格待确认等冷思考。需说明:本次开源的是模型权重(HuggingFace),DeepSeek 官方组织下并无 V4.1 Flash 的专属代码仓。

2026年9月10日9 分钟阅读
前沿热点

阿里把 Qwen4 的架构提前摊牌了:Qwen3.8-Flash-Next 放出 125B 权重,唯独没放协议文件

阿里 8 月 26 日放出 Qwen3.8-Flash-Next:一个多模态 MoE 模型,更是 Qwen4 架构的早期预览——官方给它定的角色,等同于当年 Qwen3-Next 之于 Qwen3.5。主模型 125B,额外挂 51B N-gram embeddings,每 token 只激活 6B;相比 Qwen3.7-Plus 训练成本约 1/9,coding 与 office 任务反而更强。四维升级逐个拆开:GDN 压缩历史叠加 QSA 用压缩索引器在微块粒度挑重点、Gated Residual 把残差流扩成 4 分支、N-gram Embedding 可卸载到主机内存靠异步预取与计算重叠、优化器换成 Muon。原生 262,144 tokens,YaRN 可外推到 1M。生产版 Qwen3.8-Flash 在 QwenCloud 报价 \$0.16/\$0.47 每百万 token(不同来源口径略有出入,以官网为准)。但真正的悬念是协议:GitHub 仓库没有 LICENSE 文件,license 字段为 None,README 只让读者去 HF/ModelScope 模型页查看,社区已经有人在追问「为什么不是 Apache 2.0」——本文标注为未确认,商用前务必自行核对模型页协议。

2026年8月30日6 分钟阅读
前沿热点

腾讯开源 770B 旗舰 Hy4 preview:它参与了它自己的训练

腾讯 8 月 28 日发布并开源新一代旗舰 Hy4 preview(770B 总参/49B 激活 MoE,78 层):Gated DSA 稀疏注意力 + IndexCache 跨层索引复用 + iHC 恒等超连接,README 明言架构「inspired by DeepSeek and GLM」,原生 MTP 层支持 3 token 投机解码,1M 上下文,Apache 2.0 开放 BF16+FP8 双版本权重。腾讯内部 163 位专家对 203 个工程任务盲评 2.99/4.00,小胜 GLM-5.3(2.92)与 Kimi K3(2.94,均为内部口径)。最大看点是递归自改进早期闭环:模型首次参与训练方法、数据策略、评测框架与底层算子的自动化优化,自主把推理端到端吞吐提了 31.8%。OpenRouter 快照价输入 $0.834/输出 $2.501 每百万 token,WorkBuddy/CodeBuddy 两周免费。

2026年8月29日6 分钟阅读