跳到正文
原文
HF Daily Papers·· 4 天前精选AI 评分46

U-Space:通过机制可解释性量化大语言模型的不确定性

U-Space: Uncovering When and Why Uncertainty Arises in Language Models

AI 导读

研究团队提出 U-Space 方法,借助机制可解释性把大语言模型的不确定性映射到残差空间中的低维可解释基底上。U-Lens 把每个 token 状态投影到表示怀疑与确信的语义锚上,得到逐 token 的不确定性热图,可聚合成标量置信度,无需正确性标签、多次采样或额外训练;在多个推理基准的标准评估和长度控制评估下均优于已有基线,且迁移性强于有监督估计器。代码开源在 GitHub。

推荐理由

把不确定性量化做成残差空间中的可解释基底,为推理模型提供不需要标签或多次采样的置信度读数。

来源:HF Daily Papers · huggingface.co