跳到正文
原文
HF Daily Papers·· 2 天前精选AI 评分37

OmniCapBench 面向细粒度音视频字幕的多层级诊断评测基准

OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

AI 导读

研究团队发布音视频字幕评测基准 OmniCapBench,把预测目标从自由文本改为可验证的原子单元,覆盖实体指代、视觉镜头和音频事件三条轨道。基准包含 786 个密集标注视频,通过确定性约束检查和局部语义对比定位 MLLM 在时间对齐、身份漂移、跨模态错位和幻觉描述上的具体错误。评测前沿 MLLM 显示其局部感知较强,但长程音视频推理明显偏弱,尤其在身份漂移和跨模态错位上问题突出。

推荐理由

该基准把音视频字幕评估拆成三条可验证轨道,能精确定位 MLLM 的具体感知错误,为全模态模型的改进提供可迁移的诊断路径。

来源:HF Daily Papers · huggingface.co