机构
*
Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系)
;
Sony AI(索尼AI)
;
Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)
Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration
增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复
Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi
机构
*
Department of Electronics
;
Information \ 'an Jiaotong University Xi'an China
;
School of Information
;
Communications Engineering \ 'an Jiaotong University Xi'an China
;
School of Mathematics
;
Statistics \ 'an Jiaotong University Xi'an China
;
Information \ 'an Jiaotong University
;
Communications Engineering \ 'an Jiaotong University
;
Statistics \ 'an Jiaotong University
专题命中
幻觉与鲁棒性
:VLM(title,abstract);vision language model(abstract);分类 cs.AI
机构
*
Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT)(中国科学院人工智能安全重点实验室,计算技术研究所)
;
University of Chinese Academy of Sciences (UCAS)(中国科学院大学)
;
Peking University(北京大学)
Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations
超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器
Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan
机构
*
Hanoi University of Science and Technology(河内科技大学)
;
Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
;
Nanjing University(南京大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)
A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models
基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御
Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang
机构
*
Singapore Management University(新加坡管理大学)
;
China University of Mining and Technology(中国矿业大学)
;
The University of Melbourne(墨尔本大学)
;
Anhui University(安徽大学)
;
Xi’an Jiaotong University(西安交通大学)
;
Sun Yat-sen University(中山大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV、cs.LG
Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation
清晰的道路,清晰的视野:智能交通中多天气恢复的进展
Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary
机构
*
Finolex Academy of Management and Technology(Finolex管理与技术学院)
;
Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室)
;
Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院)
;
SPACE42
;
Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)
Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li
机构
*
School of Computing, Australian National University(澳大利亚国立大学计算学院)
;
School of EECS, The University of Queensland(昆士兰大学电气工程与计算机科学学院)
;
FreiNexus
;
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中
其他VLM
:multimodal large language model(abstract);分类 cs.CV、cs.AI
GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model
GenSmoke-GS:一种基于生成模型的多阶段方法,用于从烟雾退化图像中生成新视角
Qida Cao, Xinyuan Hu, Changyue Shi, Jiajun Ding, Zhou Yu, Jun Yu
机构
*
School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)
;
School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)