CheXPO: Preference Optimization for Chest X-ray VLMs with Counterfactual Rationale
Xiao Liang, Jiawei Hu, Di Wang, Zhi Ma, Lin Zhao, Ronghan Li, Bo Wan, Quan Wang
机构
*
The Key Laboratory of Smart Human-Computer Interaction(智能人机交互关键实验室)
;
Wearable Technology of Shaanxi Province, Xidian University, Xi'an, China(陕西 wearable 技术, 西安电子科技大学, 中国)
;
Nanjing University of Science and Technology(南京理工大学)
MGAA: Multi-Granular Adaptive Allocation fof Low-Rank Compression of LLMs
Guangyan Li, Yongqiang Tang, Wensheng Zhang
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院)
Bisecle: Binding and Separation in Continual Learning for Video Language Understanding
Yue Tan, Xiaoqian Hu, Hao Xue, Celso De Melo, Flora D. Salim
机构
*
School of Computer Science University of New South Wales(计算机科学学院新南威尔士大学)
;
School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院新南威尔士大学)
;
DEVCOM Army Research Laboratory(陆军研究实验室)
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, Zheng Liu
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Trento(特伦特大学)
;
Renmin University of China(中国人民大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Hong Kong Polytechnic University(香港理工大学)
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
Hantao Lou, Changye Li, Jiaming Ji, Yaodong Yang
机构
*
Institute for AI, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国)
;
State Key Laboratory of General Artificial Intelligence, Institute for AI, Peking University, Beijing, China(通用人工智能国家重点实验室,人工智能研究院,北京大学,北京,中国)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.AI、cs.LG
Unifying Specialized Visual Encoders for Video Language Models
Jihoon Chung, Tyler Zhu, Max Gonzalez Saez-Diez, Juan Carlos Niebles, Honglu Zhou, Olga Russakovsky
机构
*
Department of Computer Science, Princeton University, Princeton, NJ, United States(普林斯顿大学计算机科学系)
;
Salesforce Research, Palo Alto, CA, United States(Salesforce研究)
RONA: Pragmatically Diverse Image Captioning with Coherence Relations
Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee
机构
*
The Pennsylvania State University(宾夕法尼亚州立大学)
;
National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)
专题命中
VLM训练与架构
:MLLM(abstract);分类 cs.CV、cs.AI
CommentsAccepted in the NAACL Fourth Workshop on Intelligent and Interactive Writing Assistants (In2Writing), Albuquerque, New Mexico, May 2025, https://in2writing.glitch.me
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
Chancharik Mitra, Brandon Huang, Tianning Chai, Zhiqiu Lin, Assaf Arbelle, Rogerio Feris, Leonid Karlinsky, Trevor Darrell, Deva Ramanan, Roei Herzig
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
IBM Research(IBM研究院)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
机构
*
Nankai University(南开大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
University of Science and Technology of China(中国科学技术大学)
;
Wuhan University(武汉大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI