HF Daily Papers·· 2 天前AI 评分33
数据稀缺场景下的 LLM 协同个性化偏好对齐
Collaborative Personalized Preference Alignment for LLMs under Data Deficiency
AI 导读
针对用户偏好异构且反馈数据稀缺导致 LLM 个性化对齐困难的问题,论文提出近似帕累托最优(APO)方法:先将更新兼容的用户分组,组内结合梯度下降与受控上升协调竞争目标,得到接近用户最优的初始化,再用少量本地适配迭代优化。在 Fed-ChatbotPA 和 UltraFeedback 上的实验表明,仅用 20 个本地样本即可稳定优于现有方法。
来源:HF Daily Papers · huggingface.co