VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding
VirtueBench: 在长视频理解中评估在不确定性下的可信度
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。
Comments Accepted to CVPR 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
VirtueBench: 在长视频理解中评估在不确定性下的可信度
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。
Comments Accepted to CVPR 2026
Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM
机构 * National University of Singapore(国立新加坡大学) ; Nanyang Technological University(南洋理工大学)
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。