arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM International Conference on Multimedia · 会议 · Multimedia

2026-07-31 至 2026-07-31 共收录 5
2607.28580 2026-07-31 cs.AI 新提交

DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架

Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li

机构 * Beihang University(北京航空航天大学) SKLCCSE

AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27761 2026-07-31 cs.LG cs.CV 新提交

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

DAS-PMVC:一种通过双对齐与结构增强实现的部分多视图聚类框架

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao

机构 * Dalian University of Technology(大连理工大学) Inspur Group Co., Ltd.(浪潮集团有限公司) China University of Mining and Technology(中国矿业大学) The University of Warwick(华威大学)

AI总结 该研究针对多视图聚类中的部分视图对齐问题,提出DAS-PMVC框架,通过锚点图结构对齐、结构增强特征学习与双对齐策略提升性能,在多数据集上优于现有最先进方法。

Comments 8 pages, 4 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27620 2026-07-31 cs.CV 新提交

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging

MedXplore:面向医学成像中可靠且无偏的广义类别发现

Jianwei He, Kailin Lyu, Junhao Dong, Long Xiao, Wenjie Hou, Jingze Lu, Di Wu, Lin Shu, Jie Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学)

AI总结 针对医学成像中广义类别发现存在的旧类偏差问题,提出MedXplore框架,通过FAAC与ACAM模块优化表征学习,在多基准上实现准确率提升且旧类误报率显著降低。

Comments accepted by ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏