机构
*
National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国)
;
Westlake University(西湖大学)
;
Southern Medical University(南方医科大学)
专题命中
视觉问答
:visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV
FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving
FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶
Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li
机构
*
Shanghai Jiaotong University(上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室)
;
Li Auto Inc.(Li汽车公司)
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
ORCA:用于文档视觉问答的协作代理协同推理
Aymen Lassoued, Mohamed Ali Souibgui, Yousri Kessentini
机构
*
Digital Research Center of Sfax, SMARTS Laboratory(突尼斯斯法克斯数字研究中心,SMARTS实验室)
;
École Polytechnique de Tunisie, University of Carthage(突尼斯理工学院,卡塔赫纳大学)
;
Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心)
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
;
Tongji University(同济大学)
;
MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)
专题命中
视觉问答
:MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
Ask Me Again Differently: GRAS for Measuring Bias in Vision Language Models on Gender, Race, Age, and Skin Tone
再次提问:GRAS用于测量视觉语言模型在性别、种族、年龄和肤色上的偏见
Shaivi Malik, Hasnat Md Abdullah, Sriparna Saha, Amit Sheth
机构
*
Guru Gobind Singh Indraprastha University(古鲁·戈宾德·辛格印度教普拉斯塔大学)
;
AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Indian Institute of Technology Patna, India(印度理工学院帕纳布分校)
专题命中
视觉问答
:vision language model(title,abstract);visual question answering(abstract);分类 cs.CV
Fuyu Dong, Ke Li, Di Wang, Nan Luo, Yiming Zhang, Kaiyu Li, Jianfei Yang, Quan Wang
机构
*
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Department of Mathematics, University of California, San Diego(加州大学圣地亚哥分校数学系)
;
School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
LVAgent: 通过多轮动态协作的MLLM代理实现长视频理解
Boyu Chen, Zhengrong Yue, Siran Chen, Zikang Wang, Yang Liu, Peng Li, Yali Wang
机构
*
Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院)
;
Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国)
;
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
世界在框架中:将文化混合视为视觉语言模型的新挑战
Eunsu Kim, Junyeong Park, Na Min An, Junseong Kim, Hitesh Laxmichand Patel, Jiho Jin, Julia Kruk, Amit Agarwal, Srikant Panda, Fenal Ashokbhai Ilasariya, Hyunjung Shim, Alice Oh
机构
*
Nanyang Technological University, Singapore
;
Singapore Management University, Singapore
;
National University of Singapore, Singapore
;
Nanjing University of Science \& Technology, Nanjing, China