首页

实战 SOP

场景化落地教程,含真实截图、Prompt、工作流模板与踩坑记录。

用 GPT-6 Astra 搭建长任务智能体工作流

基于 GPT-6 Astra 真实能力(105 万上下文、12.8 万输出、对齐越权 0%)搭建长任务智能体的实战 SOP:先完成三项准备(OpenAI Python SDK 1.50+、OPENAI_API_KEY 环境变量、API 白名单),再按长上下文规划→定义工具(函数调用 + 计算机使用)→异步调用模式→中途纠偏→验收与成本控制的顺序落地。重点:开局只放任务目标、验收标准、工具清单与关键背景让模型先出计划;工具须写清 name/description/parameters;异步用流式事件 + 后台队列 + 任务 id 轮询;纠偏直接注入新指令无需重启;验收用独立脚本做断言、默认收小 max_output_tokens 并设日花费上限。

Kimi 开放平台原生接入 Codex 与 Claude Code

Kimi 开放平台(月之暗面)现可把 OpenAI/Anthropic 兼容工具原生指向 Kimi,无需自建代理。两条路:① OpenAI Responses API 接 Codex——base_url=https://api.moonshot.cn/v1,~/.codex/config.toml 配 KIMI_API_KEY 与 wire_api="responses";② Anthropic Messages API 接 Claude Code——base_url=https://api.moonshot.cn/anthropic,~/.claude/settings.json 的 env 配 ANTHROPIC_BASE_URL/ANTHROPIC_AUTH_TOKEN=Kimi Key/ANTHROPIC_MODEL=kimi-k3[1m]([1m] 选 1M 上下文)。模型含 kimi-k3(1M)/kimi-k2.7-code(256K 强制思考)/kimi-k2.7-code-highspeed/kimi-k2.6。Responses API 暂不支持视频。本文给可套用配置片段、最小验证步骤与 6 条避坑(含 [1m] 不可省、kimi-k2.7-code 强制思考、配额分档)。速率为分档制,确切数字以控制台为准。

Claude Fable 5.1 API 破坏性变更迁移 SOP

2026-09-01 Fable 5.1 发布列了三条破坏性 API 变更,任何一条都可能在切模型时直接 400 或静默退化。① tool_choice=any/tool 返回 400,改用 auto + strict tool use/structured outputs;②思考块模型绑定单向兼容——Fable 5.1 能读旧模型的 thinking block,旧模型读不了新的,降级时丢失推理链;③编辑历史轮次使思考块失效,对 2026-08-31 及之后创建的账号强制报错。本文给出升级前三步自查、逐条迁移代码、迁移后回归验证(并行调用分布、thinking 连续性、20+ 轮压测、水印/C2PA 下游兼容)、灰度降级与回滚,以及八条避坑(含整文件重写倾向、低 effort 凭记忆作答、改写历史击穿缓存)。beta 能力 turn-scoped system messages 与 context-editing 为解药,header 确切名称以官方文档为准。

升级前先把状态目录备份了:OpenClaw 2.0 迁移、回滚与凭证加固实操 SOP

写给已在跑 OpenClaw 的工程师:怎么安全升 2.0、升不上去怎么退、升完怎么收紧凭证。第一原则——升级前整体备份 Gateway 的 configuration 与 state(不是单个客户端),并验证可恢复。四步升级:检查→openclaw doctor --fix→重启 Gateway→验证健康(模型访问验证通过才算生效)。两个 breaking change:OpenProse 插件与 /prose 命令移除(.prose 源文件保留)、codex/* 与 openai-codex/* 路由迁 openai/*(冲突手动修)。2026-09-01 插件 SDK 弃用(plugin-sdk-config-runtime-subpath → api.pluginConfig)死线就在今天。降级有界:SQLite 之后新建会话旧版读不到,整体回滚还会带回 approvals 与 dedup 记录。升后主动配五件事:开掩码凭证请求、配 proxy 白名单、精确授权、角色收敛、纠正 Incognito 误用。

模型下线迁移止血 SOP:4 步把涨价、替换与下线三类变更的账算清

2026 年 8 月 31 日集中发生三件事:Sonnet 5 的 API 费率从 2 与 10 美元恢复到 3 与 15 美元、GPT-5.4 与 GPT-5.4 mini 对 ChatGPT 登录的 Codex 用户停止提供、kimi-k2.5 与 moonshot-v1 同日下线。这三类变更的处理方式完全不同,但很多团队用同一套动作应对,结果要么过度反应要么反应不足。这篇给一套四步流程:第 0 步先分类,用公告里的关键词判断是下线(sunset / deprecated,当天必须处理)、替换(replace / default 变更,本周内,不报错但模型变了,需回归)还是涨价(只写 pricing,本月内,业务不中断但要重算成本);第 1 步依赖盘点,用一条 grep 把散落在各处的模型 ID 全扫出来,收敛到集中配置并接进 CI;第 2 步按类型执行迁移动作;第 3 步用分词放大系数、峰谷时段占比、缓存命中率三个系数重算月度成本。另附 11 条可复制检查清单、第 4 步的限额与告警与降级路径配置,以及七个踩坑点——最常见的一条是模型 ID 散落在代码里,改一处漏三处。

Qwen3.8-Flash-Next 全栈部署 SOP:125B 主模型 + 51B N-gram 嵌入,从托管 API 到 Apple Silicon 的三层路线

把 Qwen3.8-Flash-Next 从「能跑起来」推到「跑得省」的三层路线。托管层零运维:QwenCloud API 兼容 OpenAI 与 Anthropic 规范,QwenWork 的 Standard 模式由它驱动。服务化自部署给四条逐字出自官方 README 的命令:transformers serve(--continuous-batching)、SGLang(--tp-size 4 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder)、vLLM(--tensor-parallel-size 4 --max-model-len 262144 --enable-auto-tool-choice)与 TokenSpeed,四者都在 localhost:8000/v1 提供 OpenAI 兼容 API。本地与端侧另有 llama.cpp 的 GGUF、Apple Silicon 的 mlx-vlm 与 Unsloth。工程上最值得记的一点是额外那 51B N-gram embeddings 可以卸载到主机内存,靠异步预取与模型计算重叠——README 未给官方显存基线,故不猜硬件门槛,标注以官方 recipe 与实测为准。含 YaRN 外推 1M 的取舍、微调框架选择(Unsloth / Swift / Llama-Factory)与 7 条踩坑,其中第一条就是:GitHub 仓库无 LICENSE 文件,商用前先去模型页核对协议。

腾讯 770B 旗舰自部署 SOP:8 张 H100 连 FP8 权重都放不下,官方起步线是 16 张 B200

自部署腾讯 770B 旗舰 Hy4 preview 的完整 SOP。先泼冷水算清显存账:FP8 权重约 770GB,官方 vLLM recipe 明确基线是 16×B200 或 8×B300(weights+KV cache),8×H100(640GB)连 FP8 权重都放不下--激活 49B 省的是算力,770B 权重必须整份驻留显存。两条部署路线命令逐字出自官方 README:vLLM 预构建镜像(MTP 投机解码 num_speculative_tokens=3、FLASHMLA_SPARSE 注意力后端、hy_v4 工具/推理解析器)与 SGLang 预构建镜像(NEXTN 投机、tp-size 8)。含 OpenAI 兼容调用(temperature 0.9/top_p 1.0,no_think 关深度思考省输出 token)、AngelSlim 自量化、finetune 管线、7 条踩坑与 10 项上线 checklist;不自部署的可走腾讯云 TokenHub/OpenRouter 或 WorkBuddy/CodeBuddy 两周免费。

GLM-5.3-Flash 接入 SOP:一条 curl 跑通视觉 Coding,从百万 token 8 毛到 10 万张国产卡

从零接入 GLM-5.3-Flash、一天跑通视觉 Coding 的完整 SOP,三条路线按需取用:API 直调(10 分钟出第一个结果,一条 curl 跑通多模态;官方推荐参数 temperature 1、top_p 0.95、reasoning_effort max,thinking 仅支持 enabled 关不掉,stream 与 tool_stream 必须成对开);GLM Coding Plan 订阅(半小时把 20+ 编程工具接到 GLM,¥118/538/1078 三档、额度翻 3 倍);开源权重自部署(vLLM/SGLang,显存为工程估算口径)。核心交付是 Visual Coding 截图反馈回路:每轮渲染后把界面截图作为 image_url 回传,让模型看着自己的产出改代码。含参数验收清单、token 分类记账与 5 条踩坑。

GPT-Image 2 商用出图 SOP:从提示词结构化到成本控制,一张图 6 分到 1 块 5

「一张 AI 海报多少钱」在 GPT-Image 2 时代有了精确答案:官方 API 单张 0.006-0.211 美元,Batch 通道半价。这篇 SOP 从零走完「需求到成片」全流程:第一步把需求翻译成档位(Instant/Thinking、low/medium/high、3:1-1:3 比例、知识截止 2025-12 的联网坑);第二步提示词结构化(主体/布局/风格/文字锁定/约束五段原子法,文字必须显式锁定防乱码);第三步 API 调用(/v1/images/generations 的 curl 与 Python 示例、token 计价换算);第四步渠道选择(官方/Batch 半价/Azure 4K/聚合网关按张计价的成本表);第五步批量与五项质检清单;第六步七个踩坑实录(迭代编辑递减、输入图收费、low 档不能直接交付等)。含 1000 张海报 $30-120 的预算带算法。

Wan3.0 实战 SOP:从 PPT 到 30 秒成片的全流程

2026-08-24 阿里云百炼 Wan3.0-Video 上线,首次支持 PPT/PDF/Word 文档直输,单次 2-30 秒、480P/720P/1080P 三档,API 按秒计费 0.3/0.6/1.2 元。这篇 SOP 从零走完「文档变 30 秒成片」全流程:百炼 Key 与地域一致性、零代码入口、DashScope SDK(≥1.25.16)异步调用与 24 小时 video_url 时限、带时间戳的分镜 Prompt 模板、参考生视频 file/link 二选一,含成本表(1080P/30 秒原价 36 元、7 折 25.2 元、含抽卡预算 60-80 元)与 7 个踩坑。