OpenAI 技术报告:GPT 5.6 现在分析生产流量、改写 GPU 底层代码、为不同任务挑部署参数;20% 成本下降来自 OpenAI 自报,合并仍需人工签字。
按 OpenAI 刚发布的技术报告,GPT-5.6 现在被分到了四类工程任务上:分析生产流量、改写自己跑在 GPU 上的底层代码、设计推理加速用的草稿模型、按任务挑选最优部署参数。OpenAI 给出的量化结果是:端到端服务成本下降 20%,Token(模型一次生成一小段文字的最小单位)生成效率提升超过 15%。两组数字都来自 OpenAI 自家披露,目前没有独立第三方测量,系统卡也只是把工程细节公开化,没有给出外部可复现的实验。
五名披露作者里包括 Triton 的作者 Philippe Tillet。Triton 是 OpenAI 内部使用的 GPU 编程语言,目标是让不写 CUDA 的工程师也能写出能跑在 NVIDIA GPU 上的高性能代码。Triton 1.0 在 2021 年发布,五年后,OpenAI 把这件事接到了 GPT-5.6 身上:用自家模型去改写自家底层代码。
GPT-5.6 被分到的四类任务可以拆开看。第一类是生产流量分析:模型读真实请求数据,决定是否调整请求路由,也就是把不同类型的请求分配到不同的服务实例上。第二类是底层 Kernel 改写:OpenAI 的服务大量跑在 Triton 和 Gluon 之上。Gluon 是 Triton 的后继编译器,把 Python 风格的算子写法直接落到 GPU 指令;Kernel 是 GPU 上执行一次矩阵乘或一次注意力计算的那段最底层程序。GPT-5.6 被用来改写这些 Kernel。第三类是推测解码(speculative decoding)里的草稿模型(draft model)设计。推测解码是一种推理加速技巧:先用一个很小的草稿模型猜几个 Token,再让大模型一次性验证,验证通过就一口气把几个 Token 都发出去。GPT-5.6 负责设计这个草稿模型本身。第四类是按任务挑部署参数:把任务按批次大小(一次喂给 GPU 的请求数)、分片(把一个大模型拆到多张 GPU 上)、KV Cache(模型在生成过程中为已经读过的上下文保存的中间状态)分组,搜索每组的最优设置。
不过这个回路里还有几道闸门。OpenAI 在系统卡里明确:人类仍处于 human-in-the-loop(人在回路中)的圈里。模型可以提议代码改动、可以运行数百次不同结构与规模的实验、可以主动监控硬件故障与训练不稳定性并介入,但优化目标、工具权限、评测指标、上线决策都由人来定。模型做的是"写 PR(合并请求)"这一段,PR 能不能合,还是人点头。
这正是值得保留的反方质疑:如果合并仍需人类拍板,OpenAI 报告里 20% 的成本下降,到底有多大比例是"模型真的在优化整套系统",又有多少只是"工程师借模型更快地写代码"?OpenAI 的报告没有切分这条线,外部也暂时无法独立验证。
另一组数字更能说明这件事的规模。OpenAI 同期披露:每名活跃研究人员日均输出 Token 超过 GPT-5.5 时期峰值的两倍;过去半年内部编程推理用的研究算力增长 100 倍;内部 Agent Token 用量增长约 22 倍。Agent 指的是让模型自主调用工具、多步完成任务的运行方式。OpenAI 还搭了一个用 Rust 写的 Agent Harness(包裹模型循环的一层工程代码,专门用来减少 Agent 在多步循环里的重复劳动):工具说明书按需展示,工具返回默认上限 1 万 Token;Prompt(提示词)缓存只追加不覆写,前缀不变,下一轮循环可以直接复用之前缓存的输入。
把这两组数字放在一起读,含义是:AI 进步是不是已经被算力卡住了?研究算力涨 100 倍、内部 Agent 用量涨 22 倍,意味着边际改进越来越贵、越来越依赖把已有算力用得更聪明。GPT-5.6 这套自我优化机制正是"把算力用得更聪明"那条路线的工程化版本。
需要分开看的是另一条 RSI 路径。RSI(Recursive Self-Improvement,递归自改进)是 AI 安全与对齐领域的术语,指模型参与改进下一代或自身的过程。The Decoder 报道过 OpenAI 的另一项工作:GPT-5.6 的变体 Sol 用一条"定义相当模糊(fairly underspecified)的提示词",自主后训练了更小的 Luna 模型,这是模型-训练-模型的 RSI 路径。而本条 OpenAI 报告讲的是模型-优化-自己生产环境的 RSI 路径。两条线都叫 RSI,但走的是两个完全不同的环节:Sol 改的是下一代模型本身的训练,GPT-5.6 改的是模型运行所依赖的那套基础设施。把它们并在一起讲,会让一般读者以为模型已经开始"训练自己的下一代",而这件事目前还没发生。
量子位这篇中文报道用"左脚踩右脚"来描述这条循环。这不是玩笑,是一个工程上正在发生的改进回路:模型帮自己跑得更便宜,节省出来的算力又可以用来训练下一代模型,训练完的新模型再回来优化生产环境。而人类在哪个环节卡住合并闸门,就是这个循环目前最重要的安全边界。