跳到正文
原文
HF Daily Papers·· 2 天前AI 评分44

从证据到行动:工具调用智能体如何失败

From Evidence to Action: How Tool-Using Agents Fail

AI 导读

研究人员在十种模型与执行框架组合上测试发现,工具调用智能体静态动作评估能力强,但交互式执行能力明显更弱;失败多发生在执行前,智能体或调查不完整就停止,或证据未建立就行动。团队为此推出 SafeActBench,包含 656 个案例,覆盖 6 个操作域和 5 种协议。

来源:HF Daily Papers · huggingface.co