首页

硬核横评

主流 AI 工具的真实场景对比测试,含独家数据与对比表格。

AI 编程工具免费额度横评:只算不花钱的账

本篇只算免费账、不比模型能力:横向对比 Qoder、Cursor、Trae、Windsurf、Claude Code、Codex 六家(取数 2026-09-18,均以官方定价页为准)的免费档内容与限制。核心发现:Trae 免费档账面最厚(1000 高级请求 + 5000 补全每月)、Cursor Hobby 给 2000 补全 + 50 慢速请求、Windsurf 每月 25 prompt credits + 每日 5 次 Cascade;Claude Code 与 Codex 无真正免费档,完整使用需 $20/月订阅。窗口期内 Qoder 的 Qwen3.8-Flash 限免 + 每日 100 Credits 是当前白嫖上限。文末按白嫖党、轻度、重度三类人群给组合策略,并提醒免费的真实成本:数据、锁定与窗口期后涨价。

自托管 AI 助手五方横评:形态与归属

本篇不比模型能力、只比"形态与归属":横向对比 Octop、Open WebUI、Dify、FastGPT、LibreChat 五方(星数均为 2026-09-17 GitHub API 快照)在定位分层、多用户能力、部署形态、开源许可、模型接入、数据归属六个维度的差异。核心发现:MIT(Octop/LibreChat)与自定义许可(Open WebUI/Dify/FastGPT)在商用与再分发上差别实在;"家庭/小团队每人独立记忆"的多用户隔离目前只有 Octop 以第一设计目标实现。文末按个人尝鲜、家庭共享、小团队、知识库应用、工作流编排五类人群给选型建议,企业引入前务必读各仓 LICENSE 原文。

实时视频生成模型横评:谁能边聊边改

本篇不比画质、只比"形态与归属":横向对比 Vidu S2、可灵 Kling、即梦 Jimeng、豆包 Seedance、Sora 2、HiDream-O1-Video 在实时交互与实时编辑能力、交付形态(网页/API/开源权重/商业产品)、开源闭源归属、适用场景上的差异。核心判断:选实时视频工具买的不是画质,而是工作流——能否边聊边改、改稿成本多高、产物归谁。文末给出按电商试穿、虚拟人直播、广告短片、个人玩票等场景的选型建议,并提醒实时画质与成本尚无第三方统一评测,别被"实时"营销词带节奏。

AI 图表工具横评:生成之后归谁、以何形态存在

本篇不比画质、只比可客观核验的维度,开篇第一节即声明评测口径与边界:非亲自压测,数据为 2026-09-15 从各项目官方仓库实核,星标实时变动,不打主观画质分。对照五个项目:cathrynlavery/diagram-design(39,807 星、MIT、HTML、未关闭 issue 44、2026-04-16 建仓)、mermaid-js/mermaid(90,244 星、MIT、TypeScript、1,785 个未关闭 issue、2014-11-01 建仓)、excalidraw/excalidraw(131,918 星、MIT、TypeScript、3,471 个未关闭 issue、2020-01-02 建仓)、terrastruct/d2(25,416 星、MPL-2.0、Go、528 个未关闭 issue、2022-09-05 建仓)、plantuml/plantuml(13,313 星、LGPL-3.0、Java、588 个未关闭 issue、2010-11-04 建仓)。分析骨架是三类范式:文本引擎类(Mermaid、D2、PlantUML,作者只描述结构、版式交给引擎,代价是版式不可控与渲染依赖),自包含产物类(diagram-design,由编码 Agent 直接产出可离线打开的 HTML 加内联 SVG,代价是绘图规范很重),以及手绘交互类(Excalidraw,强项是人与人协作草图,AI 直接产出的是场景文件而非成品图)。核心判断:选图表方案买的不是能不能生成图,而是图生成之后归谁、以什么形态存在、谁能打开。文末给出按团队形态分档的选型建议表,并如实标注图谱:许可证只说类型差异与分发含义不同、不下商用绝对结论;问题密度一节明确声明非质量判决,因为三者体量、年龄与功能面差异巨大。

开源不等于可商用:世界模型横评四本账

本篇不比画质、只算四本账,主题是世界模型与空间智能开源项目的选型(与站内图像能力横评、批次 23 Agent 长上下文成本账、批次 24 语音云本地账明确分工):一看开源程度,二看许可证的商用边界,三看硬件门槛,四看数据与控制权。用 2026-09-14 GitHub API 快照横比七项:Robbyant/lingbot-world-v2(1755 星,CC BY-NC-SA 4.0 非商用,官方 14B 八卡与 1.3B 二卡)、闭源 Genie 3(公开报道口径 720p 24fps、约 1 分钟一致性、不支持多人)、bilawalsidhu/gods-eye-view(32,399 星,MIT,浏览器本地)、Robbyant/lingbot-map(17,022 星,Apache-2.0,ECCV 2026 oral,流式 3D 重建)、Robbyant/lingbot-world v1(4449 星,Apache-2.0)等。核心论点:开源不等于可商用,非商用许可证是硬边界;三类项目层级不同(生成式、重建式、前端聚合式),选型先问要解决哪一环;硬件口径三方打架(README 示例、仓库脚本、媒体宣传),做预算以官方代码仓为准。附对比表与按个人、小团队、商用集成三档的选型建议。

云端 vs 本地语音 AI 成本与可控性横评

本篇不比能力、只算账,主题是语音 AI 的**云端实时语音 API 与本地开源工具**两条路线的成本结构与可控性(与站内 8-26 图像模型能力横评、批次 22 图像成本账、批次 23 Agent 长上下文成本账明确分工)。开篇指出语音成本比文本/图像更难建模:实时性、并发路数、音频时长分布、语言/方言覆盖、隐私合规五个维度叠加。随后用五维对照(单价与计费、延迟与实时、隐私合规、可控性定制、语言覆盖)逐维比较云端代表 GPT-Live-1(闭源、按量、开箱实时)与本地代表 VoiceStudio(开源、一次性算力、数据不出机、引擎可换),配五维评分表与五类场景选型表,并按个人/小团队/批量三量级给结论。所有单价一律符号化(P_cloud / C_local)或标「以官方定价页为准」,量级判断标工程估算口径。冷思考点名厂商「按需付费更省」只覆盖落在甜区内的那一个工作负载,真正决定账单的是并发 N、时长分布 T 与是否强制实时,建议自建度量。

Agent长上下文成本横评:只算工具调用的账

本篇不比能力、只算账,主题是 Agent 长上下文与多轮轨迹的上下文成本(与站内 8-26 图像模型能力横评、批次 22 的图像成本账明确分工)。开篇给出可复算的单轮成本公式,并点明常驻前缀是每轮都要重付的那一笔。随后横向对比五根杠杆——前缀缓存、KV Cache 压缩与稀疏注意力、上下文压缩折叠、工具输出裁剪、轨迹重放改增量提交——各自的收益量级、实现成本、风险与适用场景,配五杠杆对照表与三类场景(单任务 10 轮工具调用、长轨迹编程 Agent、批量离线任务)成本结构表,并按个人、小团队、批量三种量级给出杠杆优先级。所有单价一律符号化(P_in / P_out / P_cache)或标注「以官方定价页为准」,量级判断均标注工程估算口径,不伪装成实测。冷思考:厂商的「降本 X%」通常是特定 workload 下的最优值,真正决定账单的是缓存命中率、上下文分布与工具输出长度,建议自建度量而不是采信发布数字。

闭源 API 与开源权重:一张图到底谁更省

ChatGPT Images 2.5 与蚂蚁开源 LLaDA-Image 同周撞车,文生图进入闭源 API 与开源自部署的分野期。本篇不算画质、只算成本与可控性账:闭源 API、开源权重自部署、第三方按秒计费平台、本地消费级硬件、国产云 API 五条路线,按 100 张/天与 10000 张/天两档量级推算单张成本,配对比表与分场景选型(个人玩票/电商批量/数据敏感/需微调品牌风格/追求最强画质),并点名许可证未标注、按秒计费冷启动、中文渲染、数据出境四类坑。与站内 8-26 推理式图像模型能力横评明确分工,代表性对比非亲自压测,价格以官网为准。

英伟达130亿收HF:开源模型托管5强横评与选型

英伟达收购 Hugging Face 后,"开源模型放哪儿、跑哪儿"成为必答题。本篇横评五个模型托管与分发平台:Hugging Face(Hub+Spaces+Inference Providers)、ModelScope 魔搭(国内合规与下载优势)、Replicate(按秒计费一键 API 化)、fal.ai(生成式推理见长)、OpenRouter(多模型聚合路由)。含官网 2026-09 快照价格(HF PRO \$9/月、Replicate T4 \$0.000225/秒、fal Serverless H100 低至 \$1.89/时等)、大对比表与分场景选型;并声明与站内 API 网关横评的上下游分工。代表性对比,非亲自压测。

CodeArena 横评:Fable 5.1 守擂,Qwen 1/8 价逼近

CodeArena 是 LMArena 运营的前端编程榜(端到端生成 Web 应用,人类偏好 Elo)。截至 2026-09-03 真实格局:Claude Fable 5.1 以 1765 领榜(\$40/M),Qwen3.8-Max-0902 首日 1691、现约 1688(\$5/M,仅 1/8 价逼近前排),Gemini 3.8 Flash 1567(廉价版 #18),Kimi K3 约 1674;GPT-6 Astra 刚 9/3 发布、编程分待更新。核心启示:Elo 是偏好非正确率,选模型要看性价比与自身需求。