HF Daily Papers·· 7 天前精选AI 评分37
受控实验检验大语言模型对序列结构的理解能力
Do LLMs Understand Sequential Structure? A Controlled Study of Inference and Generation
AI 导读
该研究通过策略识别、Markov 规则遵循与高阶序列依赖的受控实验,揭示了大语言模型在识别策略与忠实模拟之间存在显著差距:更长上下文未必带来帮助,且匹配的动作分布可能掩盖根本错误的生成机制。这些发现对将大语言模型作为行为模拟器和交互式智能体的评估方式提出了挑战。论文见 https://arxiv.org/abs/2610.04977
推荐理由
原文用受控实验区分识别策略与忠实模拟,指出更长上下文未必有效,并提示现有评测可能高估大语言模型的序列行为能力。
来源:HF Daily Papers · huggingface.co