arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-08-20 至 2026-08-20 共收录 4
2608.18532 2026-08-20 cs.CV 新提交

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

StateTrace:面向长视频中隐状态时空推理的以对象为中心的框架

Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) The University of Sydney(悉尼大学) Central South University(中南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) SenseTime Research(商汤科技研究院)

AI总结 StateTrace是一种以对象为中心的框架,为VideoLLMs赋予长视频隐状态推理能力,构建时空状态记忆并经实验显著提升了VideoLLMs在相关基准上的性能。

Comments 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-08-20 cs.CV cs.MM 版本更新

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-08-20 cs.CV 版本更新

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02945 2026-08-20 cs.CV 版本更新

VTONQA: A Multi-Dimensional Quality Assessment Dataset for Virtual Try-on

VTONQA: 用于虚拟试穿的多维质量评估数据集

Xinyi Wei, Sijing Wu, Zitong Xu, Yunhao Li, Huiyu Duan, Jia Wang, Ning Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 VTONQA是首个用于虚拟试穿的多维质量评估数据集,通过基准测试揭示现有方法的局限性,推动质量评估和VTON模型的发展。

Comments Accepted by ACM MM 2026, Dataset: this https URL (https://huggingface.co/datasets/weixiny0408/vtonqa)

详情

展开后加载摘要…

URL PDF HTML 收藏