首页

前沿热点

紧跟 AI 行业热点事件,快速追踪解读,约 1000 字精炼分析。

GPT-6 Astra 发布:OpenAI 称迈入 AGI 时代

OpenAI 于 2026-09-03 发布新一代旗舰 GPT-6 Astra,总裁 Greg Brockman 宣告「欢迎来到 AGI 时代」。核心规格:105 万 token 上下文、12.8 万 token 输出、知识截止 2026-04-30、图文输入文本输出;API 定价 \$10/\$50 每百万 token(GPT-5.6 Sol 的 2.5 倍)。能力跃迁:FrontierMath Tier 4 97.6%、ARC-AGI-3 99.9%、ExploitBench 100%(首个达「关键」级网络安全能力)、OSWorld 2.0 72.6%、Terminal-Bench 4.0 57.9%;对齐越权率从 Sol 的 48% 降到 0%。灰度节奏先开放可信访问企业、Daybreak 网络安全项目,再铺 API 与 ChatGPT 订阅,经 AWS 提供。

Gemini 3.8 Flash 发布:更聪明但单任务更贵

2026-09-02(美东)/ 9-3 国内,Google DeepMind 同发 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber,6 周内第 3 个 Flash 版本。3.8 Flash 定位"最聪明的 Flash 工作马":1M 上下文、64K 输出、三档思考、知识截止 2026-03;定价与 3.7 Flash 持平(输入 $0.75/输出 $3.75,优惠至 2026-12-31,之后 $1.50/$7.50)。基准:DeepSWE v1.1 73.7%(逼近 Opus 5 的 74.0%)、Terminal-Bench 2.1 89.4%(世界 #1)、HLE-Verified 54.9%;短板在 Terminal-Bench 4.0 仅 19.1%、OSWorld 2.0 59.0%。Flash Cyber 仅经 Fairwind Program 限可信防御方,无公开价【未确认】。关键反差:单价未涨,但 Artificial Analysis 实测单任务成本因"更努力"上涨约 40%($0.40→$0.58)。所有分数含官方口径与第三方实测,引用须标注。

Claude Fable 5.1 与 Mythos 5.1:同一模型两套护栏

2026-09-01 Anthropic 同时发布 Claude Fable 5.1 与 Mythos 5.1:同一底层模型,两套安全策略与开放范围。Fable 5.1 全面开放(API claude-fable-5-1),Mythos 5.1 仅面向经审核的美国网安与生命科学机构(API claude-mythos-5-1),两家均在 Anthropic / AWS / GCP / Azure Foundry 上架。规格一致:1M 上下文、128K 输出、自适应思考常开、知识截止 2026-06。定价未变(输入 $10/M、输出 $50/M),仅缓存读取由 $1 降至 $0.25/M(降幅 75%),官方测算典型负载省约 25%、高度 agentic 最高省约 45%(均为官方口径,非第三方实测)。安全侧误报率网络安全降约 60%、生物医学降约 85%,Fable 5.1 放开"发现"漏洞但利用仍重定向 Opus;EFS 让客户数据驻留自有云、等同零数据保留。所有 benchmark 分数与成本数字均属 Anthropic 官方口径,引用时须标注未经第三方复核。

停更 7 周,憋出占历史一半 PR 的大版本:OpenClaw 2.0 是地基重造,升级前请先备份

OpenClaw 2.0 于 2026-08-31 发布(tag v2026.8.1,GitHub API 实测 388,423 星、TypeScript、license 字段 NOASSERTION 实为 MIT)。这个版本停更近 7 周、合并 16,000+ PR(约占历史累计一半)、有 933 位贡献者,是地基级重造而非小版本。两条主线最关键:浏览器端成为一等公民、Gateway 收口凭据与权限;凭证治理引入 private credential requests(掩码请求,值不进 chat/模型上下文)与 opt-in proxy(protected-secret substitution 只发生在批准的目标地址)。两个 breaking change——OpenProse 插件与 /prose 命令移除、codex/* 与 openai-codex/* 路由统一迁到 openai/*(冲突不自动解决);会话迁 SQLite,降级有界;插件 SDK 弃用死线 2026-09-01。README 四家对比表已过时(2.0 才引入 Shared Cloud Sessions 与 Active Memory),不可当现状结论。

8·31 同日三变:Sonnet 5 恢复标准价、GPT-5.4 退出 Codex、两个 Kimi 模型下线

2026 年 8 月 31 日,三件互不相干的事撞在同一天:Claude Sonnet 5 的 API 首发价到期,从每百万 token 输入 2 美元、输出 10 美元恢复到标准的 3 与 15 美元;GPT-5.4 与 GPT-5.4 mini 对 ChatGPT 账号登录的 Codex 用户停止提供,由 GPT-5.6 Terra 与 Luna 取代;月之暗面的 kimi-k2.5 与 moonshot-v1 同日下线,迁移目标指向 kimi-k3。真正容易被漏掉的是第二层:Sonnet 5 换过 tokenizer,相同输入会映射出 1.0 到 1.35 倍的 token 数,叠加费率后编码类负载的复合涨幅在 65% 到 100% 之间,纯文本负载接近 50%,且这次只影响 API、Consumer 订阅不受影响。本文把三件事按「下线 / 替换 / 涨价」三类拆开,给出各自的紧迫性与对应动作,并附一份往后两个月的到期日历:9 月 14 日 Claude Code 限额调整、10 月 10 日 DashScope 退役 30 多个模型 ID、10 月 24 日 deepseek-chat 与 deepseek-reasoner 弃用、11 月 12 日 OpenAI 离开 Cursor、约 11 月 21 日 GPT-5.6 Sol 促销到期。价格为 2026-08-31 快照,存在口径分歧之处文中已逐条标注。

阿里把 Qwen4 的架构提前摊牌了:Qwen3.8-Flash-Next 放出 125B 权重,唯独没放协议文件

阿里 8 月 26 日放出 Qwen3.8-Flash-Next:一个多模态 MoE 模型,更是 Qwen4 架构的早期预览——官方给它定的角色,等同于当年 Qwen3-Next 之于 Qwen3.5。主模型 125B,额外挂 51B N-gram embeddings,每 token 只激活 6B;相比 Qwen3.7-Plus 训练成本约 1/9,coding 与 office 任务反而更强。四维升级逐个拆开:GDN 压缩历史叠加 QSA 用压缩索引器在微块粒度挑重点、Gated Residual 把残差流扩成 4 分支、N-gram Embedding 可卸载到主机内存靠异步预取与计算重叠、优化器换成 Muon。原生 262,144 tokens,YaRN 可外推到 1M。生产版 Qwen3.8-Flash 在 QwenCloud 报价 \$0.16/\$0.47 每百万 token(不同来源口径略有出入,以官网为准)。但真正的悬念是协议:GitHub 仓库没有 LICENSE 文件,license 字段为 None,README 只让读者去 HF/ModelScope 模型页查看,社区已经有人在追问「为什么不是 Apache 2.0」——本文标注为未确认,商用前务必自行核对模型页协议。

腾讯开源 770B 旗舰 Hy4 preview:它参与了它自己的训练

腾讯 8 月 28 日发布并开源新一代旗舰 Hy4 preview(770B 总参/49B 激活 MoE,78 层):Gated DSA 稀疏注意力 + IndexCache 跨层索引复用 + iHC 恒等超连接,README 明言架构「inspired by DeepSeek and GLM」,原生 MTP 层支持 3 token 投机解码,1M 上下文,Apache 2.0 开放 BF16+FP8 双版本权重。腾讯内部 163 位专家对 203 个工程任务盲评 2.99/4.00,小胜 GLM-5.3(2.92)与 Kimi K3(2.94,均为内部口径)。最大看点是递归自改进早期闭环:模型首次参与训练方法、数据策略、评测框架与底层算子的自动化优化,自主把推理端到端吞吐提了 31.8%。OpenRouter 快照价输入 $0.834/输出 $2.501 每百万 token,WorkBuddy/CodeBuddy 两周免费。

「牛来」真身揭晓:智谱开源 GLM-5.3-Flash,追平 Claude Opus 4.8 只花四十分之一价钱

匿名模型 Ox-Alpha 8 月 20 日空降 OpenRouter,首日调用量登顶并终结 DeepSeek 56 天霸榜;8 月 26 日晚智谱官宣揭晓:它就是开源的 GLM-5.3-Flash(320B-A18B)。GLM-5 系列首个原生多模态模型(视频/图像/文本/文件输入),稀疏+线性注意力混合架构让注意力计算量降 3 倍、KV 缓存缩小 4.4 倍;Artificial Analysis 综合智能指数 57 分追平 Claude Opus 4.8,定价(输入 0.8/输出 2.8 元每百万 token)约为其四十分之一,全部流量跑在 10 万张国产算力卡上,权重以 MIT 协议开放。一个转折要记住:缓存命中 0.23 元反而高于 DeepSeek V4-Flash 闲时的 0.05 元,缓存命中率超九成的编程 Agent 先算账再换。

Anthropic 冲 2 万亿估值 IPO:先给华尔街画了张 30 万亿美元的饼

《华尔街日报》8 月 25 日报道:Anthropic 在 IPO 招股书中提出超过 30 万亿美元的潜在市场规模(TAM)预测,超过 SpaceX 的 28.5 万亿美元纪录,成为商业史上最庞大的市场叙事。其测算逻辑不是现有软硬件销售额,而是全球所有「可被 AI 模型替代或完成的工作」的全部经济价值与劳动力成本。计划 2026 年秋季挂牌、目标募资最高 1000 亿美元、估值锚定 2 万亿美元--距 5 月 9000 亿美元私募估值四个月再翻 2.2 倍。底气是 2026 Q2 单季营收 116 亿美元并首次实现调整后营业利润为正;风险是数据中心建设受阻、海外低价模型竞争与二级市场容错率降低。9 月招股书正式披露是下一个节点。

Wan3.0 正式上线:单段 30 秒、PPT 直接变视频,API 每秒 0.3 元起

8 月 24 日阿里云宣布视频生成大模型 Wan3.0 正式上线(区别于 8 月初换代预告):单段时长从 Wan 2.7 的 15 秒翻到 30 秒,首次支持 doc/xls/ppt/pdf/md 五种办公文档直接上传生成,参考生视频可传文件或网页链接。API 按秒计费,480P 0.3 元/秒、720P 0.6 元/秒、1080P 1.2 元/秒,8 月 24 日-9 月 23 日百炼与千问 AI 平台统一 7 折--一条 15 秒 720P 成片首发期仅 6.3 元。8 个体验入口开放,美图、京东灵境等已接入;注意其不支持 Function Calling、联网搜索、批量推理与上下文缓存,定位是生成引擎而非 Agent。