跳到正文
原文
HF Daily Papers·· 2 天前AI 评分45

噪声去、偏见来:扩散语言模型的闭环激活引导定向偏见注入

Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering

AI 导读

研究者提出针对扩散语言模型(dLLM)的定向偏见注入攻击,通过比例-积分控制器在去噪过程中追踪目标答案概率并动态调整引导向量。在 LLaDA-8B-Instruct 上,BBQ 模糊题目标群体偏好从 1.8 升至 16.7 个百分点,SocialStigmaQA 污名化答案率从 17.6% 升至 58.1%,单次攻击约需单卡 GPU 40 分钟。

来源:HF Daily Papers · huggingface.co