ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Huawei Technologies Ltd.(华为技术有限公司)
;
State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
专题命中
VLM训练与架构
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs
ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型
Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu
机构
*
School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院)
;
S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
;
OPPO Research Institute(OPPO研究院)
;
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV
AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation
AC3S: 面向3D感知合成数据生成的自适应条件控制
Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Johns Hopkins University(约翰霍普金斯大学)
;
College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)
专题命中
VLM训练与架构
:vision language model(abstract);分类 cs.CV
机构
*
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Zhejiang University(浙江大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Tencent AI Lab Seattle(腾讯AI实验室西雅图)
TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation
机构
*
University of Maryland, College Park(马里兰大学帕克分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Alabama(阿拉巴马大学)
;
University of Washington(华盛顿大学)
;
Stanford University(斯坦福大学)