CommentsAccepted at Workshop on Integrating Image Processing with Large-Scale Language/Vision Models for Advanced Visual Understanding (LVLM) at IEEE International Conference on Image Processing (ICIP) 2025
GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation
GroundedSurg: 一种多手术流程的语言条件手术工具分割基准
Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir
机构
*
King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院)
;
Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院)
;
The University of Queensland(昆士兰大学)
;
Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法
Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院)
;
Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation
元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击
Kennedy Edemacu, Mohammad Mahdi Shokri
机构
*
The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校)
;
The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)
专题命中
视觉定位与Grounding
:grounding(abstract);multimodal large language model(abstract);分类 cs.AI
CloDS: Visual-Only Unsupervised Cloth Dynamics Learning in Unknown Conditions
CloDS: 未知条件下的视觉-only 无监督布料动力学学习
Yuliang Zhan, Jian Li, Wenbing Huang, Wenbing Huang, Yang Liu, Hao Sun
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)
;
School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
CPII under InnoHK(InnoHK下的CPII)
FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization
FiLo:通过细粒度描述和高质量定位实现零样本异常检测
Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang
机构
*
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
Objecteye Inc., Beijing, China(Objecteye公司)
;
Central South University, Hunan, China(中南大学)
EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection
EfficientPosterGen: 通过令牌压缩和准确违规检测的语义感知高效海报生成
Wenxin Tang, Jingyu Xiao, Yanpei Gong, Fengyuan Ran, Tongchuan Xia, Junliang Liu, Man Ho Lam, Wenxuan Wang, Michael R. Lyu
机构
*
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Wuhan University(武汉大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Dalian Maritime University(大连海事大学)
;
Renmin University of China(中国人民大学)
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining
非马尔可夫长时间 horizon 机器人操作 via 关键帧链
Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen
机构
*
Tongji University(同济大学)
;
University of Technology Sydney(技术悉尼大学)
;
University of Electronic Science and Technology of China(电子科学与技术大学)
;
Advanced Institute of Big Data(大数据先进研究院)
机构
*
National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学反伪工程研究中心)
;
School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
;
Sydney AI Centre, The University of Sydney(悉尼大学AI中心)
机构
*
Guangzhou Institute of Technology, Xidian University, Xi’an, China(广州科技研究院,西安电子科技大学,中国)
;
Department of Computer Science, Tianjin University of Technology, Tianjin, China(天津理工大学计算机学院,天津,中国)
;
Department of Respiratory, The Second Hospital of Tianjin Medical University, China(天津医科大学第二医院呼吸科,中国)
;
College of Pulmonary and Critical Care Medicine, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院呼吸与危重症医学科,北京,中国)
;
HeartVoice Medical Technology, Hefei, China(合肥心声医疗技术有限公司,中国)
;
School of Life Science and Technology, Xidian University, Xi’an, China(西安电子科技大学生命科学与技术学院,中国)
;
National Institute of Health Data Science, Peking University, Beijing, China(北京大学国家健康数据科学研究院,北京,中国)
;
Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院,北京,中国)
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);分类 cs.AI
DAWA: Dynamic Ambiguity-Wise Adaptation for Real-Time Domain Adaptive Semantic Segmentation
DAWA: 动态模糊度适应于实时领域自适应语义分割
Taorong Liu, Zhen Zhang, Liang Liao, Jing Xiao, Chia-Wen Lin
机构
*
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院)
;
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
;
Department of Electrical Engineering(电气工程系)
;
the Institute of Communications Engineering, National Tsing Hua University(清华大学通信工程研究所)