HF Daily Papers·· 4 天前精选AI 评分35
CheckerBench:长程编码智能体能否从零开发静态分析检查器?
CheckerBench: Can Long-Horizon Agents Synthesize Static-Analysis Checkers?
AI 导读
CheckerBench 是一个面向静态分析检查器开发的端到端智能体评测基准,包含源自 297 个 CVE、覆盖 167 个仓库与 85 类 CWE 的 300 个任务,每个任务附带漏洞版本、修复版本、固化分析环境与检查器脚手架。
推荐理由
提出了覆盖 297 个 CVE 的端到端检查器开发基准,并量化了当前编码智能体在该长程任务上的实际能力上限。
来源:HF Daily Papers · huggingface.co