arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-03 至 2026-03-03 共收录 43 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 43 篇

2411.17237 2026-03-03 cs.CV 88%

Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment

Grounding-IQA: 多模态语言模型的接地图像质量评估

Zheng Chen, Xun Zhang, Wenbo Li, Renjing Pei, Fenglong Song, Xiongkuo Min, Xiaohong Liu, Xin Yuan, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Westlake University(西湖大学) Huawei(华为)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出grounding-IQA任务范式,通过结合多模态指称与图像质量评估,实现更细粒度的图像质量感知。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/zhengchen1999/Grounding-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09463 2026-03-03 cs.AI 86%

SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning

SpotAgent:通过代理推理在大视觉语言模型中实现视觉地理定位

Furong Jia, Ling Dai, Wenjin Deng, Fan Zhang, Chen Hu, Daxin Jiang, Yu Liu

机构 * Peking University(北京大学) StepFun

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);分类 cs.AI

AI总结 SpotAgent通过代理推理提升大视觉语言模型在地理定位中的表现,结合外部工具验证和强化学习优化,实现更精确和可靠的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01124 2026-03-03 cs.CV cs.AI 84%

ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

ClinCoT:面向医学视觉语言模型的临床感知视觉推理链

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Jianxu Chen, Haolin Yang, Imran Razzak, Yutong Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00437 2026-03-03 cs.CV 83%

Self-Correction Inside the Model: Leveraging Layer Attention to Mitigate Hallucinations in Large Vision Language Models

模型内部的自我校正:利用层注意力缓解大视觉语言模型中的幻觉

April Fu

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出了一种利用层注意力的内部自我校正机制,通过自我细化提高大视觉语言模型的视觉接地性,有效缓解幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01486 2026-03-03 cs.AI 79%

Agentic Multi-Source Grounding for Enhanced Query Intent Understanding: A DoorDash Case Study

代理多源接地以增强查询意图理解:一个DoorDash案例研究

Emmanuel Aboah Boateng, Kyle MacDonald, Akshad Viswanathan, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出一种代理多源接地系统,通过目录检索和网络搜索结合,提升多意图查询的准确率,已在DoorDash实现90.7%的准确率提升。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01927 2026-03-03 cs.AI cs.MA 79%

From Grounding to Planning: Benchmarking Bottlenecks in Web Agents

从基础到规划:网络代理中的瓶颈基准测试

Segev Shlomov, Ben wiesel, Aviad Sela, Ido Levy, Liane Galanti, Roy Abitbol

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过分析网络代理的规划和基础组件,发现规划是性能退化的主要原因,提出新的基准测试以改进代理能力。

Journal ref ECAI 2025 - 28th European Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03113 2026-03-03 cs.CV cs.CL 77%

Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection

通过基于梯度的自我反思缓解多模态幻觉

Shan Wang, Maying Shen, Nadine Chang, Chuong Nguyen, Hongdong Li, Jose M. Alvarez

机构 * NVIDIA Australian National University(澳大利亚国立大学) Data61, CSIRO(Data61,CSIRO)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GACD方法,通过梯度分析缓解多模态模型的幻觉问题,提升输出的视觉基础性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01224 2026-03-03 cs.CV cs.AI cs.HC cs.LG cs.RO 75%

Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction

单目3D物体位置估计用于人机交互的VLMs

Ari Wahl, Dorian Gawlinski, David Przewozny, Paul Chojecki, Felix Bießmann, Sebastian Bosse

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究利用VLMs通过单目RGB图像、自然语言输入和机器人状态估计3D物体位置,通过微调和条件路由技术提升预测性能,实现人机交互中的鲁棒预测。

Comments Accepted at Workshop on Integrating Image Processing with Large-Scale Language/Vision Models for Advanced Visual Understanding (LVLM) at IEEE International Conference on Image Processing (ICIP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00732 2026-03-03 cs.RO cs.CV 74%

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

UniHM: 一体化的视觉语言模型用于统一的灵巧手操作

Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 视觉定位与Grounding :vision language model(title);分类 cs.CV

AI总结 UniHM通过统一的视觉语言模型实现灵巧手操作,利用开放词汇指令提升泛化能力和物理可行性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01509 2026-03-03 cs.CV cs.AI 73%

Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling

通过提示优化和测试时扩展实现文本到视频生成的检索、细化与排序

Zillur Rahman, Alex Sheng, Cristian Meo

机构 * Algoverse AI

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3R框架,通过提示优化和测试时扩展提升文本到视频生成的准确性与效率。

Comments 2026 ICLR TTU Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01108 2026-03-03 cs.CV 70%

GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation

GroundedSurg: 一种多手术流程的语言条件手术工具分割基准

Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir

机构 * King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院) Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院) The University of Queensland(昆士兰大学) Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 GroundedSurg提出了一种多手术流程的语言条件手术工具分割基准,通过实例级接地和空间注释评估视觉-语言模型在临床真实场景中的性能。

Comments https://github.com/gaash-lab/GroundedSurg

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV 70%

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00172 2026-03-03 cs.CR cs.AI 70%

Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation

元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击

Kennedy Edemacu, Mohammad Mahdi Shokri

机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01274 2026-03-03 cs.LG cs.AI 62%

GlassMol: Interpretable Molecular Property Prediction with Concept Bottleneck Models

GlassMol:通过概念瓶颈模型实现可解释的分子属性预测

Oscar Rivera, Ziqing Wang, Matthieu Dagommer, Abhishek Pandey, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01844 2026-03-03 cs.CV cs.AI 62%

CloDS: Visual-Only Unsupervised Cloth Dynamics Learning in Unknown Conditions

CloDS: 未知条件下的视觉-only 无监督布料动力学学习

Yuliang Zhan, Jian Li, Wenbing Huang, Wenbing Huang, Yang Liu, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 CloDS通过无监督学习从多视角视觉数据中学习布料动力学,解决未知条件下的动态模拟问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06203 2026-03-03 cs.LG cs.AI 62%

Reference Grounded Skill Discovery

基于参考的技能发现

Seungeun Rho, Aaron Trinh, Danfei Xu, Sehoon Ha

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RGSD通过语义有意义的潜在空间实现技能发现,有效模仿和发现多样行为,在运动任务中优于模仿学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16612 2026-03-03 cs.CL cs.AI cs.CV 62%

MemeIntel: Explainable Detection of Propagandistic and Hateful Memes

MemeIntel: 可解释性地检测宣传性及仇恨言论的迷因

Mohamed Bayan Kmainasi, Abul Hasnat, Md Arid Hasan, Ali Ezzat Shahroor, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MemeIntel通过多阶段优化方法和视觉-语言模型,提升了阿拉伯语宣传性迷因和英语仇恨言论的检测与解释生成性能,准确率提升显著。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15852 2026-03-03 cs.CV cs.AI 62%

Advancing Complex Video Object Segmentation via Progressive Concept Construction

通过渐进式概念构建推进复杂视频对象分割

Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) CPII under InnoHK(InnoHK下的CPII)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SeC通过渐进式概念构建方法,在复杂视频对象分割任务中实现了显著性能提升,特别是在语义复杂场景下的表现优于现有方法。

Comments project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG 62%

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00155 2026-03-03 cs.CV cs.AI cs.IR 62%

EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection

EfficientPosterGen: 通过令牌压缩和准确违规检测的语义感知高效海报生成

Wenxin Tang, Jingyu Xiao, Yanpei Gong, Fengyuan Ran, Tongchuan Xia, Junliang Liu, Man Ho Lam, Wenxuan Wang, Michael R. Lyu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan University(武汉大学) Beijing University of Posts and Telecommunications(北京邮电大学) Dalian Maritime University(大连海事大学) Renmin University of China(中国人民大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 EfficientPosterGen通过语义感知检索、视觉上下文压缩和无代理布局检测技术,实现高效且可靠的学术海报自动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00136 2026-03-03 cs.CV cs.AI 62%

TinyVLM: Zero-Shot Object Detection on Microcontrollers via Vision-Language Distillation with Matryoshka Embeddings

TinyVLM:通过Matryoshka嵌入的视觉-语言蒸馏实现微控制器上的零样本目标检测

Bibin Wilson

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 TinyVLM通过Matryoshka嵌入和视觉-语言蒸馏,在微控制器上实现低内存的零样本目标检测

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00055 2026-03-03 cs.LG cs.AI 62%

M3-AD: Reflection-aware Multi-modal, Multi-category, and Multi-dimensional Benchmark and Framework for Industrial Anomaly Detection

M3-AD:面向工业异常检测的反思-aware 多模态、多类别和多维基准与框架

Chao Huang, Yanhui Li, Yunkang Cao, Wei Wang, Hongxi Huang, Jie Wen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 M3-AD提出了一种反思-aware 的多模态框架,通过RA-Monitor提升工业异常检测的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19096 2026-03-03 cs.LG 57%

The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers

衰减步骤的力量:提升基于符号的优化器的攻击稳定性和可迁移性

Wei Tao, Yang Dai, Jincai Huang, Qing Tao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出MDCS方法,通过衰减步长提升基于符号优化器的攻击稳定性和可迁移性,理论证明其收敛率最优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01545 2026-03-03 cs.CV 57%

Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory

无需训练的时空解耦推理视频分割与自适应对象记忆

Zhengtong Zhu, Jiaqing Fan, Zhixuan Liu, Fanzhang Li

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出无需训练的时空解耦推理视频分割方法SDAM,通过自适应对象记忆模块和时空解耦技术实现稳定的时间传播,优于现有微调方法。

Comments Accept by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01465 2026-03-03 cs.RO cs.AI 57%

Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining

非马尔可夫长时间 horizon 机器人操作 via 关键帧链

Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science and Technology of China(电子科学与技术大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Keyframe-Chaining VLA框架,通过提取和链接关键历史帧,解决长horizon机器人操作中的非马尔可夫依赖问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20999 2026-03-03 cs.CV 57%

VII: Visual Instruction Injection for Jailbreaking Image-to-Video Generation Models

VII: 视觉指令注入用于劫持图像到视频生成模型

Bowen Zheng, Yongli Xiang, Ziming Hong, Zerong Lin, Chaojian Yu, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学反伪工程研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学AI中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VII通过将恶意意图伪装为良性视觉指令,有效劫持图像到视频生成模型,实现高攻击成功率并降低拒绝率。

Comments Project page: https://Zbwwwwwwww.github.io/VII

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16145 2026-03-03 cs.AI cs.CL 57%

SpiroLLM: Finetuning Pretrained LLMs to Understand Spirogram Time Series with Clinical Validation in COPD Reporting

SpiroLLM:通过临床验证在COPD报告中微调预训练大语言模型以理解肺功能时间序列

Shuhao Mei, Yongchao Long, Xiaoyu Xiao, Shan Cao, Xiaobo Han, Shijia Geng, Jinbo Sun, Yuxi Zhou, Shenda Hong

机构 * Guangzhou Institute of Technology, Xidian University, Xi’an, China(广州科技研究院,西安电子科技大学,中国) Department of Computer Science, Tianjin University of Technology, Tianjin, China(天津理工大学计算机学院,天津,中国) Department of Respiratory, The Second Hospital of Tianjin Medical University, China(天津医科大学第二医院呼吸科,中国) College of Pulmonary and Critical Care Medicine, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院呼吸与危重症医学科,北京,中国) HeartVoice Medical Technology, Hefei, China(合肥心声医疗技术有限公司,中国) School of Life Science and Technology, Xidian University, Xi’an, China(西安电子科技大学生命科学与技术学院,中国) National Institute of Health Data Science, Peking University, Beijing, China(北京大学国家健康数据科学研究院,北京,中国) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院,北京,中国)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 SpiroLLM通过融合生理信号与大语言模型,实现对肺功能时间序列的解读,并在COPD诊断中展现出高准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23348 2026-03-03 cs.RO cs.CV 57%

Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts

为拟合物体操纵的物理常识知识而引入分析概念

Jiude Wei, Yuxuan Li, Cewu Lu, Jianhua Sun

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16953 2026-03-03 cs.CV 57%

Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations

面向无遮蔽标注的零样本遮蔽物分割

Cheng Lei, Jie Fan, Xinran Li, Tianzhu Xiang, Ao Li, Ce Zhu, Le Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Space42

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种无需遮蔽标注的零样本遮蔽物分割框架,通过结合MIM、M-LLM和MFA机制,实现高效分割与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01072 2026-03-03 cs.CV 57%

DAWA: Dynamic Ambiguity-Wise Adaptation for Real-Time Domain Adaptive Semantic Segmentation

DAWA: 动态模糊度适应于实时领域自适应语义分割

Taorong Liu, Zhen Zhang, Liang Liao, Jing Xiao, Chia-Wen Lin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Department of Electrical Engineering(电气工程系) the Institute of Communications Engineering, National Tsing Hua University(清华大学通信工程研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DAWA通过动态模糊度适应策略,在实时领域自适应语义分割中提升效率和效果,实现40 FPS的高速推理性能。

Comments PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏