跳到正文
热点事件持续更新

Dust:无需反向传播的 Transformer 零阶预训练方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,Dust 作为首个在预训练 Transformer 语言模型时可与反向传播竞争的零阶优化方法被提出。该方法在每个 token 上独立扰动激活(节点扰动),使每个 token 充当虚拟种群成员,从而在一次前向传播中并行评估所有成员,大幅提升效率。实验显示,自 1M tokens 起,Dust 比 EGGROLL 等先进的权重空间进化策略方法高效约 3 到 4 个数量级;同时其 243M 参数模型在多数种群规模下优于缩小 120 倍的小模型,展示了零阶优化在大规模语言模型预训练中的可行性。目前该方法仅在 Hacker News 报道中公开,尚未见其他来源的独立验证或后续进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. Hacker News
    Dust:无需反向传播的 Transformer 零阶预训练方法

    Dust 是首个在预训练 Transformer 语言模型时可与反向传播竞争的零阶优化方法。它在每个 token 上独立扰动激活(节点扰动),使每个 token 成为虚拟种群成员,一次前向传播即可并行评估所有成员。从 1M tokens 起,Dust 比 EGGROLL 等先进的权重空间进化策略方法高效约 3 到 4 个数量级,且 243M 参数模型在多数种群规模下优于缩小 120 倍的小模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。