首页

硬核横评

主流 AI 工具的真实场景对比测试,含独家数据与对比表格。

GPT-6 Astra 登顶后,四大旗舰真实差距

GPT-6 Astra 发布后,把四大同档旗舰放一张表硬核横评:Astra、Claude Fable 5.1、Gemini 3.8 Flash、GPT-5.6 Sol。结论分维度:推理数学 Astra 近乎满分(FrontierMath T4 97.6%、ARC-AGI-3 99.9%),Sol 的 ARC-AGI-3 仅 7.8%;编码 Agent 必须分版本看 Terminal-Bench——Astra 4.0 版 57.9% 居首,Gemini 在 2.1 版 89.4% 但 4.0 版仅 19.1%;SWE-bench Pro 上 Fable 5.1 的 81.2% 最高;计算机使用 OSWorld 2.0 Astra 72.6% 领先;网络安全 ExploitBench Astra 100%;对齐越权率 Astra 0% 对 Sol 48% 是最大鸿沟。性价比:优惠期 Gemini \$0.75/\$3.75 最低,Astra 与 Fable 同为 \$10/\$50。

编码推理旗舰横评:五款同档模型真实差距

2026 年 8 月底至 9 月初,Gemini 3.8 Flash、Qwen3.8-Max-0902、Muse Spark 1.3、Claude Fable 5.1 与 GPT-5.6 Sol 扎堆发布,构成一轮"coding agent"军备竞赛。横评按价格哲学分两档:便宜工作马(Gemini $0.75、Muse $1.25)拼单任务成本;高端前沿(Fable $10/$50、GPT-5.6 Sol $4/$20)。最大陷阱是基准版本碎片化——Qwen 用 TerminalBench 3.0、Fable 用 4.0、其余用 2.1,绝不可摆在一列硬比;本文所有表严格按版本拆分。价值标杆:Muse(智能指数 61、单任务约 $0.40)与 Gemini(近 Opus 5 编码、单价 1/7)最划算;Fable 5.1 拿下 agentic 科学(Terminal-Bench-Science 52.6%)与 SWE-bench Pro(81.2%)。分数均厂商/第三方口径,未确认项已标注。

缓存经济学:命中率如何决定 agentic 真实账单

2026-09-01 Fable 5.1 把 cache read 单价从 $1 降至 $0.25/M(降幅 75%),社群欢呼"agent 更便宜",但账单是单价乘以 token 结构:cache read 占比越低,降幅落到总成本越有限。本文拆 token 为四类(fresh input / cache write / cache read / output),给成本公式,按四种负载档位做敏感性分析——占比 10% 仅省约 7.5%、33% 约 25%、60% 约 45%(基于官方降幅的推演,非实测)。结论:单价只是第四位因素,命中率、布局稳定、轮次与输出长度更关键;六个工程前提把命中率做上去(前缀不变、布局稳定、turn-scoped 指令、服务端裁剪历史、按频率选 TTL、命中率可观测)。跨厂商横向套用须按官网 2026-09-02 快照填六维向量。

一个 agent 被攻破就全盘失守:四套凭证与权限治理方案横评

凭据从配置项变成了攻击面,但绝大多数团队防线还停在"给 agent 套个沙箱"。本文与站内沙箱隔离横评明确分工:沙箱管"代码在哪跑",凭据治理管"密钥怎么用、动作谁批、凭据能不能外带"。对比 OpenClaw 2.0、OpenWorker、OpenHuman 与传统密钥托管四套方案,按凭据生命周期六环节(存/用/批/外带/审计/多 agent)拆:OpenClaw 掩码请求 + opt-in proxy 目标白名单;OpenWorker hard floors + 自主权阶梯 + reviewer model + 熔断器,且无人值守绝不自批;OpenHuman Privacy Mode 在 Rust core 强制 + agent 间 E2E 加密。二手数据(SaaS Sentinel 转述,未找到一手报告)显示 1 个 agent 妥协概率 0.24、7 个升到 0.86,风险随数量超线性增长——前提是"任一 agent 提议即执行"。

涨价之后怎么选:11 个模型的真实 token 成本横评,把峰谷、缓存与 tokenizer 三重口径算进去

模型标价至少套着三层衣服,只看标价等于只看最外面那层:时段(DeepSeek 8 月 17 日起峰谷计价,工作日 9:00–12:00 与 14:00–18:00 为高峰、闲时减半、周末全天闲时,同一模型单价差一倍)、缓存(命中前缀缓存的输入 token 单价远低于标准输入,变量不在厂商手里而在你的提示词结构里)、分词(Sonnet 5 换分词器后相同输入映射 1.0 到 1.35 倍 token 数,且倍数随内容类型浮动)。本文统一口径为「综合单价 =(输入单价 + 输出单价)÷ 2」,即假设输入输出 token 数量相等,作为中立起点,再给三种典型负载比重的重算结果,并覆盖 11 个模型的标价、缓存命中价、峰谷价与分词放大后的实际位置。结论不是「哪个模型最便宜」,而是「不存在最便宜的模型,只存在对你这个负载最便宜的模型」——脱离输入输出比重、缓存命中率与内容类型给出的比价,只是在比标价而非比成本。国内模型价格来自 2026-08-24 逐页复核、8-28 再复核的官方定价页速查表,海外价格来自 2026-08-31 汇总,存在口径冲突的项目文中逐条标注。未做实际调用压测。

稀疏注意力五强横评:QSA 挑 token、GDN 压历史、DSA 复用索引,长上下文用不用得起看这一层

长上下文的注意力成本,各家是用不同办法打下来的——本篇按「架构路线」而非参数或价格给开放权重旗舰分个类。主角 Qwen3.8-Flash-Next 走 GDN 压缩历史 + QSA 微块粒度挑重点的混合路线(125B 主模型 + 51B N-gram embedding,每 token 激活 6B,原生 262,144 可 YaRN 外推到 1M);对照 Hy4 preview 的 Gated DSA 加 IndexCache 跨层索引复用、GLM-5.3-Flash 的稀疏与线性注意力混合、以及 DeepSeek 的 DSA 路线。路线分野归纳为三类:稀疏挑 token、线性/递归压缩、以及两者混合;再用参数、激活比、上下文、许可证与 API 价格快照做辅助列。与站内两篇旧横评分工:那两篇分别算 320B 级 API 价格账与 700B-2.8T 级部署门槛账,本篇只算架构路线账。选型结论给出五条场景路线,并提醒一句:激活比省的是算力,注意力机制决定的是长上下文能不能用得起;协议未确认的模型,商用前先查模型页。

腾讯 770B 只激活 49B:五款万亿级开源旗舰横评,决定部署成本的不是总参数

Hy4 preview(770B/49B)发布把开源旗舰的参数军备推到新高,但决定部署成本的不是总参数:激活参数省的是算力,权重驻留吃的是显存。本篇横评五款开放权重旗舰--Hy4 preview、GLM-5.3、Kimi K3(2.8T)、DeepSeek V4(1.6T 口径)、Qwen3.8-Max(2.4T)--按总参/激活比、上下文、许可证、显存门槛(工程估算口径)与 API 价格快照逐项对表。与 8-27 价格横评分工:那篇算 320B 级 API 账,本篇算 700B-2.8T 级参数与部署门槛账。五条按场景结论:追最新选 Hy4(Apache 2.0+MTP 投机解码+FP8 友好)、要参数规模选 K3、要成熟生态选 GLM/DeepSeek、阿里系合规选 Qwen,以及共同一条--先看每 token 成本与稀疏注意力,再看总参。

DeepSeek 提价 350% 九天后,智谱半价杀入:轻量旗舰 API 五强横评,编程党先别急着换模型

DeepSeek 8 月 17 日把 V4-Flash 高峰输出提价 350%(2 元到 9 元/百万 token)并首推峰谷定价,九天后智谱上线 GLM-5.3-Flash(输出 2.8 元)正面接招。本篇把账拆到场景算:零缓存的对话/RAG/长文档场景 GLM 便宜近半(优惠期 27%-31%);但缓存命中率超九成的编程 Agent 场景,V4-Flash 闲时按 90 万/百万走缓存算反而便宜约 32%(推算口径)--提价的那家在它最重的用户群里可能还是更便宜的。高峰时段(9-12、14-18 点)GLM 无峰谷差价优势最大;Kimi K3 输出 100 元/M 是能力溢价不是性价比;行业账本揭示提价是集体动作(DeepSeek 净亏 7.15 亿、智谱定价 +83% 调用量反 +400%)。附五条按场景选型结论。

会思考的生图模型横评:GPT-Image 2 对上 Nano Banana Pro 与 Seedream 5.0 Pro 怎么选

生图赛道打到了新维度:思考、文字渲染、编辑与图层。本篇横评新一代五强--GPT-Image 2(首个原生推理生图模型,Thinking 模式联网+8 张一致性,文字渲染约 99%)、Nano Banana Pro(Gemini 3 Pro Image,多轮编辑不洗牌的口碑王,原生 4K)、Seedream 5.0 Pro(7 月 8 日上线,中文小字终于不乱码+图层分离,1K 单张 0.3 元)、Ideogram 4.0(6 月 3 日开放 9.3B 权重的文字渲染专精)、FLUX.2(生图编辑一体+10 参考图)。独家成本账:GPT-Image 2 low 档 $0.006 是全表地板价,Seedream 5.0 Pro 是 1K-2K 性价比王,开放权重两强的真实成本是显卡。按场景给五条结论,所有价格标注口径与快照日期。

一条 30 秒 1080P 视频要花多少钱:六大 AI 视频生成 API 成本横评

Wan3.0 上线把「一条 30 秒 1080P 成片到底多少钱」变成可以精算的题。本文横评六大视频生成 API 的成本账:Wan3.0 官方 1080P 1.2 元/秒、单段 30 秒直出 36 元(9-23 前 7 折 25.2 元);可灵 3.0 约 30 元但需 3 段拼接;Sora 2 pro 30 秒破百;海螺 768P 3 段仅 12 元全表最低。独家算账揭示单段时长上限是被忽视的隐性成本--段数 × 抽卡系数(15-20% 不达标)× 拼接工时才是真实价格,并给出「480P 抽卡 + 1080P 出片」省 65% 的实战打法。所有价格标注官方/聚合口径与日期,代表性对比非亲自压测。