跳到正文
原文
HF Daily Papers·· 5 天前精选AI 评分40

D-OPCD:通过 On-Policy 上下文蒸馏把智能体经验内化进扩散模型权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI 导读

论文提出 Diffusion On-Policy Context Distillation(D-OPCD),把 Text-to-Image 智能体 harness 累积的提示迭代、记忆与技能等能力通过 on-policy 蒸馏固化进扩散模型权重,使模型在仅接收原始查询时也能保留部分 harness 增益。

推荐理由

提出 D-OPCD 把智能体迭代增益固化进扩散模型权重,量化了脱离 harness 后仍可保留的提升幅度,并指出 harness 与模型持续协同进化的可行路径。

来源:HF Daily Papers · huggingface.co