TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment
TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐
Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele
机构
*
Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯)
;
Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)
Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics
视觉语言模型能预测未来状态吗?从逆动力学引导世界模型
Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti
机构
*
Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学)
;
Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学)
;
NVIDIA(NVIDIA公司)
;
University of Groningen(格罗宁根大学)
Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models
跳过层?视觉-语言模型中层跳过的理论条件
Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney
机构
*
Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校)
;
Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校)
;
AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试
Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che
机构
*
Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Central South University(中南大学)
;
Fudan University(复旦大学)
;
The University of Hong Kong(香港大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心)
;
Guizhou University(贵州大学)
CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping
CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取
Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)
;
Peng Cheng Laboratory(鹏城实验室)
;
Northeastern University(东北大学)
机构
*
School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院)
;
School of Computing Information Sciences, Saint Francis University, Hong Kong, China(圣弗朗西斯大学计算信息科学学院)
;
Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)
机构
*
Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia(人机交互实验室,意大利理工学院)
;
Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova(机器人与智能机器国家级博士项目(DRIM)和热那亚大学)
;
Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)
On the Cone Effect and Modality Gap in Medical Vision-Language Embeddings
关于医学视觉-语言嵌入中的锥效应与模态间隙
David Restrepo, Miguel L Martins, Chenwei Wu, Luis Filipe Nakayama, Diego M Lopez, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante
机构
*
CentraleSupélec, Université Paris-Saclay, France(中央理工巴黎高等学院,巴黎萨克雷大学,法国)
;
University of Porto, Portugal(葡萄牙波尔图大学)
;
University of Michigan, USA(美国密歇根大学)
;
Federal University of São Paulo, Brazil(巴西圣保罗联邦大学)
;
Universidad del Cauca, Colombia(哥伦比亚考卡大学)
;
Universidad de Buenos Aires, Argentina(阿根廷布宜诺斯艾利斯大学)
Mindstorms in Natural Language-Based Societies of Mind
自然语言基础的思维社会中的风暴
Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber
Commentspublished in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices