跳到正文
原文
HF Daily Papers·· 4 天前精选AI 评分35

CheckerBench:长程编码智能体能否从零开发静态分析检查器?

CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?

AI 导读

CheckerBench 是一个面向静态分析检查器开发的端到端智能体评测基准,包含源自 297 个 CVE、覆盖 167 个仓库与 85 类 CWE 的 300 个任务,每个任务附带漏洞版本、修复版本、固化分析环境与检查器脚手架。

推荐理由

提出了覆盖 297 个 CVE 的端到端检查器开发基准,并量化了当前编码智能体在该长程任务上的实际能力上限。

来源:HF Daily Papers · huggingface.co