全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
By 鹭羽

AI 摘要
扩散模型首次打通长程Agent任务
原文正文
全球首个Agentic扩散模型来了:边行动边纠错,128K上下文追平自回归
扩散模型首次打通长程Agent任务
鹭羽 发自 凹非寺
量子位 | 公众号 QbitAI
终于!Agent赛道,不再是自回归(AR)模型一家独大。
长期处于非主流位置的扩散模型,也开始有了一席之地。
这些年但凡叫得上名字的Agent,从ChatGPT到Claude,底层清一色因果自回归LLM。
逐Token生成慢是慢了点,但行业默认,Agent的大脑只能如此。
蚂蚁却不这么想。
旗下inclusionAI团队陆续推出LLaDA系列模型,最新开源LLaDA2.2,实现扩散模型首次进入智能体长程任务!
准确来说,这是一款千亿参数的MoE扩散语言模型,原生支持128K上下文,也是全球首个大规模Agentic扩散模型。
总之自回归模型能干的,它也能干,自回归模型跑得慢的痛点,它也能一刀切。
更关键的是,它第一次将Levenshtein编辑、面向环境反馈的强化学习,以及长上下文工程架构,整合进同一套扩散模型Agent系统——
模型不仅能并行生成,还能在生成过程中自我增删、动态修正。
LLaDA2.2的出现同样有迹可循,从2.0时期的规模化尝试,到2.1版本的边写边改,再到如今的智能体觉醒。
半年时间、三代模型,依次完成扩散架构从生成工具到行动架构的递进。
扩散模型破局自回归垄断
其实自回归模型能统治Agent赛道这么久,也是有几分道理在的。
多轮对话、工具调用、环境反馈处理,这些任务本身就天然要求模型具备序列因果性。
一个Token一个Token蹦,逻辑链条才不容易断。
传统扩散模型则可以同时处理一个block中的多个位置,速度是比自回归快了,但代价就是Token之间彼此缺乏严格的序列条件约束。
放在普通文本生成场景里,这些问题倒不算什么,顶多影响一点可读性,读者看到两句重复的话,笑一笑就算了。
但Agent场景不一样。
Agent的输出是要被真实执行的,再小的bug也会影响整个流程,一步错步步错,错误会在后续交互中被持续固化成硬约束,最终导致整体目标漂移。
所以扩散模型想在更复杂困难的Agent环境中和自回归齐平,就须得迈过这一关。
对此,蚂蚁团队看得很清楚。
LLaDA2.0首先解决的,就是规模化问题。
它证明扩散模型并不是只能停留在小参数实验阶段,也能够与MoE等架构结合,真正落地工程。
在验证路线可信的前提下,蚂蚁再顺势推舟给出LLaDA2.1,进一步证明扩散模型边写边改的可用性。
LLaDA2.1引入Token-to-Token编辑机制,可以在生成过程中判断哪些Token应该保留,哪些Token需要替换。
但到了Agent,这样的局部修改还远远不够,它需要的是根本性的结构调整,实现边行动边纠错。
于是LLaDA2.2来了。
如何做到?三大技术拼图集中发力
LLaDA2.2的变化集中在三个方面,每一项单点突破固然重要,蚂蚁三合一系统集成在一起才是扩散模型拿到Agent入场券的重中之重。
让模型学会自改自生
传统扩散模型块并行解码的最大问题是结构刚性。生成完一个block,里面的Token就被钉死了。
要是错了,只能整段重来,长了也没法删,短了更没法补。
LLaDA2.2采用Levenshtein编辑范式,在块内支持四种原子操作:KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。
然后通过LCS最长公共子序列将块内草稿与目标序列对齐,动态生成编辑标签。
翻译一下就是,模型现在能对自己的生成结果修正了。