机构
*
The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州))
;
National University of Singapore(新加坡国立大学)
;
ShanghaiTech University(上海科技大学)
;
East China Normal University(华东师范大学)
;
Nanjing University of Information Science & Technology(南京信息工程大学)
;
Zhejiang University(浙江大学)
;
Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所)
;
Shanghai AI Laboratory(上海人工智能实验室)
专题命中
视觉推理
:multimodal large language model(title);grounding(abstract,abstract_cn);分类 cs.CV
Dongyao Zhu, Zhen Wang, Xi Xiao, Han Jiang, Saeed Vahidian, Wei-Lun Chao, Tanya Berger-Wolf, Yu Su, Raju Vatsavai, Jianyang Gu
机构
*
North Carolina State University(北卡罗来纳州立大学)
;
UC, San Diego(加州大学圣地亚哥分校)
;
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Duke University(杜克大学)
;
Boston University(波士顿大学)
;
The Ohio State University(俄亥俄州立大学)
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
V-ABS:基于动作-观察者的动态视觉推理束搜索
Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu
机构
*
School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
;
Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所)
;
SenseTime Research(商汤科技研究院)
;
Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)
专题命中
视觉推理
:visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
无人机视角下视觉语言模型能否思考?统一无人机推理与生成
Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng
机构
*
Beijing Institute of Technology(北京理工大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部)
;
University of Macau(澳门大学)
Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
通过上下文对齐的视觉-语言模型实现负责任的多模态医疗推理
Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi
机构
*
Salim Habib University(萨利姆·哈比卜大学)
;
Institute of Business Administration Sukkur(苏库尔工商管理学院)
;
University of Central Florida(中佛罗里达大学)
;
The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
;
Toronto Metropolitan University(多伦多都会大学)
;
Vector Institute(向量研究所)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩
Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li
机构
*
The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
;
Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)
;
Hangzhou Dianzi University(杭州电子科技大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
机构
*
Tsinghua University(清华大学)
;
Microsoft Research Asia(微软亚洲研究院)
;
Xi’an Jiaotong University(西安交通大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning
ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测
Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Eastern Institute of Technology, Ningbo(宁波东部技术研究院)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Zhongguancun Academy(中关村学院)
专题命中
视觉推理
:MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
Hong Kong Baptist University(香港 Baptist 大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Institute of Automation, CAS(中国科学院自动化研究所)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中
视觉推理
:visual language model(title,abstract);visual reasoning(abstract);分类 cs.CV