OpenAI 推出 MentalHealthBench:心理健康对话评测基准
OpenAI 推出 MentalHealthBench,这是一项由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话中回复的有用性与安全性,帮助衡量模型在心理健康场景下的表现。</think>
OpenAI 推出 MentalHealthBench,这是一项由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话中回复的有用性与安全性,帮助衡量模型在心理健康场景下的表现。</think>
METR 研究指出,AI 在 2026 年大幅加速网络安全领域进展(漏洞报告速率较 2025 年明显提升),对数学研究有轻微但难以量化的影响,对 AI 研究本身则无可观测加速。
The article is about MindTopo, a new benchmark from Microsoft Research for testing topological reasoning in multimodal AI models (VLMs - Vision Language Models). Key points。
Import AI 第 468 期聚焦 AI 政策与竞赛博弈:智库 IFP 发布 23 项应对自动化 AI R&D 风险的政策建议,涵盖透明度、风险策略、AI 韧性等 7 类;MIT 与哥伦比亚大学研究者在论文《Racing to Ruin》中通过博弈模型分析,AI 企业能否实现协同放缓取决于透明度与对对手可信度的判断。
ScarfBench 是一个面向企业 Java 框架迁移的开源 AI 智能体评测基准,覆盖 Spring、Jakarta EE 与 Quarkus。基准包含 34 个应用、204 个迁移任务和 1,331 个专家测试,要求迁移后应用能够成功构建、部署并保持原有行为。