发展趋势量子位5/10

全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归

By 鹭羽

全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
图源:量子位

AI 摘要

扩散模型首次打通长程Agent任务

原文正文

全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归

扩散模型首次打通长程Agent任务

鹭羽 发自 凹非寺

量子位 | 公众号 QbitAI

终于!Agent赛道,不再是自回归(AR)模型一家独大。

长期处于非主流位置的扩散模型,也开始有了一席之地。

这些年但凡叫得上名字的Agent,从ChatGPT到Claude,底层清一色因果自回归LLM。

逐Token生成慢是慢了点,但行业默认,Agent的大脑只能如此。

蚂蚁却不这么想。

旗下inclusionAI团队陆续推出LLaDA系列模型,最新开源LLaDA2.2,实现扩散模型首次进入智能体长程任务!

准确来说,这是一款千亿参数的MoE扩散语言模型,原生支持128K上下文,也是全球首个大规模Agentic扩散模型。

总之自回归模型能干的,它也能干,自回归模型跑得慢的痛点,它也能一刀切。

更关键的是,它第一次将Levenshtein编辑、面向环境反馈的强化学习,以及长上下文工程架构,整合进同一套扩散模型Agent系统——

模型不仅能并行生成,还能在生成过程中自我增删、动态修正。

LLaDA2.2的出现同样有迹可循,从2.0时期的规模化尝试,到2.1版本的边写边改,再到如今的智能体觉醒。

半年时间、三代模型,依次完成扩散架构从生成工具到行动架构的递进。

扩散模型破局自回归垄断

其实自回归模型能统治Agent赛道这么久,也是有几分道理在的。

多轮对话、工具调用、环境反馈处理,这些任务本身就天然要求模型具备序列因果性。

一个Token一个Token蹦,逻辑链条才不容易断。

传统扩散模型则可以同时处理一个block中的多个位置,速度是比自回归快了,但代价就是Token之间彼此缺乏严格的序列条件约束。

放在普通文本生成场景里,这些问题倒不算什么,顶多影响一点可读性,读者看到两句重复的话,笑一笑就算了。

但Agent场景不一样。

Agent的输出是要被真实执行的,再小的bug也会影响整个流程,一步错步步错,错误会在后续交互中被持续固化成硬约束,最终导致整体目标漂移。

所以扩散模型想在更复杂困难的Agent环境中和自回归齐平,就须得迈过这一关。

对此,蚂蚁团队看得很清楚。

LLaDA2.0首先解决的,就是规模化问题。

它证明扩散模型并不是只能停留在小参数实验阶段,也能够与MoE等架构结合,真正落地工程。

在验证路线可信的前提下,蚂蚁再顺势推舟给出LLaDA2.1,进一步证明扩散模型边写边改的可用性。

LLaDA2.1引入Token-to-Token编辑机制,可以在生成过程中判断哪些Token应该保留,哪些Token需要替换。

但到了Agent,这样的局部修改还远远不够,它需要的是根本性的结构调整,实现边行动边纠错。

于是LLaDA2.2来了。

如何做到?三大技术拼图集中发力

LLaDA2.2的变化集中在三个方面,每一项单点突破固然重要,蚂蚁三合一系统集成在一起才是扩散模型拿到Agent入场券的重中之重。

让模型学会自改自生

传统扩散模型块并行解码的最大问题是结构刚性。生成完一个block,里面的Token就被钉死了。

要是错了,只能整段重来,长了也没法删,短了更没法补。

LLaDA2.2采用Levenshtein编辑范式,在块内支持四种原子操作:KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。

然后通过LCS最长公共子序列将块内草稿与目标序列对齐,动态生成编辑标签。

翻译一下就是,模型现在能对自己的生成结果修正了。

阅读原文
全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归 · AI Daily