跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分22

OmniCapBench:面向细粒度音视频描述的分层结构化评估框架

OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

AI 导读

OmniCapBench 将音视频描述评估重构为深度结构化诊断框架,把预测目标从自由文本转为实体引用、视觉镜头和音频事件三类原子化可验证评估单元,并基于 786 段密集标注视频进行确定性约束检查与局部 LLM 语义比较。评测前沿 MLLM 显示其局部感知较强,但长时程音视频推理薄弱,尤其存在身份漂移与跨模态错位问题。

来源:Hugging Face Daily Papers · huggingface.co