发展趋势量子位5/10

GPT-5.6自己优化自己实锤了,新的左脚踩右脚已经出现

By henry

GPT-5.6自己优化自己实锤了,新的左脚踩右脚已经出现
图源:量子位

AI 摘要

OpenAI的RSI焚诀,它来了!

原文正文

GPT-5.6自己优化自己实锤了,新的左脚踩右脚已经出现

OpenAI的RSI焚诀,它来了!

henry 发自 凹非寺

量子位 | 公众号 QbitAI

OpenAI的RSI焚诀,它来了!

就在老黄开推摇旗呐喊、呼吁开放权重之后,OpenAI也突然Open了起来~

在最新技术报告中,他们老实交代了一部分RSI(AI递归自进化)心法:

让GPT-5.6左脚踩右脚,开始自己动手改造供自己运行的系统。

据报告透露,GPT-5.6已经被投入OpenAI的真实生产环境,用来分析线上流量、调整请求路由,甚至亲自下场改写底层Kernel、优化推测解码模型。

一套小连招下来,OpenAI的端到端服务成本降低了20%,Token生成效率也提升了15%以上。

而且,值得一提的是,在披露这套工程的五名作者里,还有大名鼎鼎的Triton之父Philippe Tillet。

2021年,OpenAI发布Triton 1.0时,目标还是让不懂CUDA的人也能写出接近专家水平的GPU程序。

五年后,GPT-5.6已经开始用Triton改写自己跑在GPU上的底层代码。

从教人类写Kernel,到让模型给自己改Kernel,味儿确实越来越像RSI了。

(你别说,也难怪翁荔回老东家。搞RSI,还得在OpenAI呐)

RSI焚决,先从底层优化开始

这件事之所以值得关注,就在于它已经有了几分RSI的味道。

所谓RSI,也就是递归式自我改进,说白了就是:

让AI进入一个“改进AI”的反馈回路——这一轮能力变强之后,再反过来加速下一轮升级。

当然,GPT-5.6现在还远没有完全实现GPT自动训练下一代GPT的RSI。

但它已经开始参与优化自己的运行环境:模型不仅是被工程师部署和调用的工具,也逐渐变成了改造模型系统本身的工程师。

具体来说,它干了四件事。

1、分析OpenAI真实的生产流量。

GPT-5.6会寻找不同机器和服务节点之间的负载不均,并测试新的路由策略,把请求分配到更合适的位置。

2、重写和优化生产Kernel。

GPT-5.6会深入模型的forward pass,寻找可以提前计算、省略或并行执行的部分,再通过Codex改写生产环境中的Triton和Gluon Kernel。

3、优化自己的推测解码系统。

GPT-5.6为自己的draft model设计方案,并自动运行数百次实验,测试不同的模型大小、结构和特征。

在训练过程中,它还会持续监控实验,并在发生硬件故障或训练不稳定时主动介入。

4、针对不同任务,自己寻找最优部署参数。

面对短对话、长上下文、代码任务等不同负载,GPT-5.6会自动搜索batching、sharding和KV Cache管理的更优组合。

四件事连起来,GPT-5.6参与的已经不再是某个孤立的代码任务,而是一条真实的工程反馈回路:

观察生产系统、寻找瓶颈、提出方案、运行实验、处理故障,再把有效改进部署回承载自己运行的系统。

人类依旧站在圈里

当然,RSI也没那么快,人类依旧站在圈里,也就是human in the loop。

GPT-5.6虽然开始参与改造自己,但优化目标、工具权限、评测指标,以及代码能否进入生产环境,仍然由人类决定。

而且,模型内部省完了,模型外面还有大量重复开销。

比如,ChatGPT Work和Codex执行复杂任务时,往往要不断经历:

模型思考—调用工具—读取结果—继续思考。

一次用户请求,背后可能循环十几轮甚至几十轮。

阅读原文
GPT-5.6自己优化自己实锤了,新的左脚踩右脚已经出现 · AI Daily