跳到正文
热点事件历史事件

CheckerBench发布静态分析检查器合成评测基准

1 篇报道1 个报道来源4 天前更新

先了解这件事

AI 综述

CheckerBench论文作者发布了一个面向静态分析检查器开发的端到端智能体评测基准CheckerBench与配套的CheckerLab评估框架:在21种模型-脚手架配置、每配置3次重复的测试中,平均Pass@1为32.30%,最高仅45.33%。 该基准包含300个任务,源自297个CVE,覆盖167个代码仓库与85类CWE;每个任务附带漏洞版本、修复版本、固化分析环境与检查器脚手架,用于测试长程编码智能体能否从零开发静态分析检查器。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. HF Daily Papers精选
    CheckerBench:长程编码智能体能否从零开发静态分析检查器?

    CheckerBench 是一个面向静态分析检查器开发的端到端智能体评测基准,包含源自 297 个 CVE、覆盖 167 个仓库与 85 类 CWE 的 300 个任务,每个任务附带漏洞版本、修复版本、固化分析环境与检查器脚手架。