跳到正文
原文
HF Daily Papers·· 2 天前精选AI 评分60

基础模型借鉴训练数据中的 token 线索即可获得推理能力

Base Models Can Reason By Taking a Cue From Training Data

AI 导读

该研究指出,在基础模型回复开头固定特定 token 线索,可使其在数学和编程推理任务上达到与 RL 训练版本相当的水平。回复前的 '. Okay' 线索将 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提升至 78%,'Alright,' 线索将 Qwen3-14B 从 72% 提升至 87%。

推荐理由

论文把基础模型的推理能力回溯到训练数据中的特定 token 线索,给出了一种不靠 RL 也能恢复推理表现的替代解释。

来源:HF Daily Papers · huggingface.co