跳到正文
原文
HF Daily Papers·· 2 天前AI 评分35

跨分词器在策略蒸馏的再思考:从对齐覆盖度到监督可靠性

Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability

AI 导读

跨分词器在策略蒸馏(OPD)研究显示,将反向 KL 限制在学生选出的 top-16 共享词表子集上,精度与全共享词表 OPD 相当,并优于现有跨分词器基线。严格 1:1 对齐已覆盖学生生成 token 的绝大部分,但 mismatch 组加入 span log-prob 的 MSE 监督反而降低精度。研究建议从最大化对齐覆盖度转向优先保证监督可靠性。

来源:HF Daily Papers · huggingface.co