跳到正文
原文
Ai2 Blog·· 3 小时前AI 评分45

AI2 发布 TutorMoments 预览版:评测大语言模型在辅导中能否把握"何时帮、何时放手"的取舍

TutorMoments: Do AI tutors know when to help and when to hold back?

AI 导读

Ai2 发布 TutorMoments 预览版——一个基于真实数学辅导回放的评测框架,用来衡量大语言模型在辅导学生时能否平衡"搭支架"与"放手"之间的取舍。对 7 个模型的初步测试显示,它们普遍倾向于过度帮助;即便在提示词中点明这一权衡,表现仍未追上人类教师的一致水平。团队同步开源了 462 份美国 2-7 年级脱敏转录文本(含 1500 余个教师标注关键时刻)、评分代码与回放结果。

来源:Ai2 Blog · allenai.org