arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7370 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7370 篇

2603.13507 2026-03-17 cs.CV 70%

MIRAGE: Model-agnostic Industrial Realistic Anomaly Generation and Evaluation for Visual Anomaly Detection

MIRAGE:模型无关的工业真实异常生成与评估用于视觉异常检测

Jinwei Hu, Francesco Borsatti, Arianna Stropeni, Davide Dalle Pezze, Manuel Barusco, Gian Antonio Susto

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 MIRAGE提出了一种无需训练和真实异常数据的自动化流程,通过API调用生成模型生成真实异常图像并生成像素级掩码,结合CLIP质量过滤器和轻量级双分支语义变化检测模块,评估生成图像的质量和异常分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13437 2026-03-17 cs.CV eess.SP 70%

Vision-Language Based Expert Reporting for Painting Authentication and Defect Detection

基于视觉-语言的专家报告用于绘画认证和缺陷检测

Eman Ouda, Mohammed Salah, Arsenii O. Chulkov, Gianfranco Gargiulo, Gian Luca Tartaglia, Stefano Sfarra, Yusra Abdulrahman

机构 * organization= Khalifa University of Science Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates organization= National Research Tomsk Polytechnic University , country= Russia organization= Academy of Fine Arts of Naples , city= Naples , country= Italy organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy organization= Department of Industrial Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy organization= Advanced Research Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。

Comments Submitted to Journal of Cultural Heritage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-03-17 cs.RO cs.AI 70%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12369 2026-03-16 cs.CV 70%

Human Knowledge Integrated Multi-modal Learning for Single Source Domain Generalization

融合人类知识的多模态学习用于单源域泛化

Ayan Banerjee, Kuntal Thakur, Sandeep Gupta

机构 * Impact Lab, Arizona State University(影响实验室,亚利桑那州立大学)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出GenEval方法,结合基础模型与人类知识提升单源域泛化性能,在糖尿病视网膜病变和癫痫发作区检测中取得优异结果。

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026, pp. 2380-2391

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12238 2026-03-13 cs.CV 70%

SceneAssistant: A Visual Feedback Agent for Open-Vocabulary 3D Scene Generation

SceneAssistant: 一种用于开放词汇3D场景生成的视觉反馈代理

Jun Luo, Jiaxiang Tang, Ruijie Lu, Gang Zeng

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SceneAssistant通过视觉反馈驱动代理实现开放词汇3D场景生成,结合3D物体生成模型和视觉-语言模型的空间推理能力,生成高质量且多样化的3D场景。

Comments Code: https://github.com/ROUJINN/SceneAssistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11563 2026-03-13 cs.CV cs.RO 70%

SVLL: Staged Vision-Language Learning for Physically Grounded Embodied Task Planning

SVLL:分阶段视觉-语言学习用于物理基础的具身任务规划

Yuyuan Yang, Junkun Hong, Hongrong Wang, Honghao Cai, Xunpeng Ren, Ge Wang, Mingcong Lei, Shenhao Yan, Jiahao Yang, Chengsi Yao, Xi Li, Yiming Zhao, Yatong Han, Jinke Ren

机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,CUHKSZ) SSE, CUHKSZ(SSE,CUHKSZ) SAI, CUHKSZ(SAI,CUHKSZ) Shenzhen University(深圳大学) University of Sydney(悉尼大学) Harbin Engineering University(哈尔滨工程大学) Ising AI

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 SVLL 通过分阶段学习和 Bias-DPO 对齐目标,实现稳健的物理基础具身任务规划,提升任务成功率并减少物理约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 70%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01555 2026-03-11 eess.IV cs.CV 70%

MGCR-Net:Multimodal Graph-Conditioned Vision-Language Reconstruction Network for Remote Sensing Change Detection

MGCR-Net:多模态图条件视觉-语言重建网络用于遥感变化检测

Chengming Wang, Guodong Fan, Jinjiang Li, Min Gan, C. L. Philip Chen

机构 * School of Computer Science and Technology, Shandong Technology and Business University(山东科技职业大学计算机科学与技术学院) School of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 MGCR-Net通过多模态图条件视觉-语言重建机制提升遥感变化检测的语义交互能力。

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-15, 2026, Art no. 4701515

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15205 2026-03-10 cs.CV 70%

Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation

利用幻觉减少可提示分割中的手动提示依赖

Jian Hu, Jiayi Lin, Junchi Yan, Shaogang Gong

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ProMaC框架,通过利用MLLM幻觉挖掘任务相关信息,提升分割精度与遮罩生成效果。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV 70%

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19112 2026-03-10 cs.CV 70%

Universal 3D Shape Matching via Coarse-to-Fine Language Guidance

通过粗到细的语言引导实现通用3D形状匹配

Qinfeng Xiao, Guofeng Mei, Bo Yang, Liying Zhang, Jian Zhang, Kit-lun Yick

机构 * Hong Kong Polytechnic University, HK SAR(香港理工大学) Fondazione Bruno Kessler, Italy(布鲁诺·凯斯勒基金会) University of Technology Sydney, Australia(悉尼科技大学)

专题命中 视觉定位与Grounding :vision language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 UniMatch通过粗到细的语言引导方法,实现跨类别非等距形状的通用3D匹配。

Comments Accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06854 2026-03-10 cs.SD cs.AI 70%

Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering

音频-语言模型在倾听吗?音频专家头用于自适应音频引导

Neta Glazer, Lenny Aharon, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文通过识别音频专家注意力头,提出一种方法来增强音频信息在音频-语言模型中的作用,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10828 2026-03-09 cs.RO cs.AI 70%

RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Language Model

RAG-Driver: 多模态大语言模型中基于检索的可泛化驾驶解释

Jianhao Yuan, Shuyang Sun, Daniel Omeiza, Bo Zhao, Paul Newman, Lars Kunze, Matthew Gadd

机构 * University of Oxford(牛津大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 RAG-Driver通过检索增强的上下文学习,实现高性能、可解释和可泛化的自动驾驶系统。

Comments 14 pages, 6 figures

Journal ref Robotics: Science and Systems (RSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV 70%

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02754 2026-03-04 cs.CV 70%

Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing

无需训练即可清晰感知:减轻多模态大语言模型在遥感中的幻觉

Yi Liu, Jing Zhang, Di Wang, Xiaoyu Tian, Haonan Guo, Bo Du

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) School of Computer Science, Chongqing University, China(重庆大学计算机学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 RADAR通过利用多模态大语言模型的内在注意力,无需训练即可减少遥感视觉问答中的事实性和逻辑性幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01108 2026-03-03 cs.CV 70%

GroundedSurg: A Multi-Procedure Benchmark for Language-Conditioned Surgical Tool Segmentation

GroundedSurg: 一种多手术流程的语言条件手术工具分割基准

Tajamul Ashraf, Abrar Ul Riyaz, Wasif Tak, Tavaheed Tariq, Sonia Yadav, Moloud Abdar, Janibul Bashir

机构 * King Abdullah University of Science and Technology (KAUST)(卡奥尔大学科学与技术学院) Thapar Institute of Engineering and Technology(塔帕尔工程与技术学院) The University of Queensland(昆士兰大学) Gaash Research Lab, National Institute of Technology Srinagar(加什研究实验室,锡纳加尔国家理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 GroundedSurg提出了一种多手术流程的语言条件手术工具分割基准,通过实例级接地和空间注释评估视觉-语言模型在临床真实场景中的性能。

Comments https://github.com/gaash-lab/GroundedSurg

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV 70%

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00172 2026-03-03 cs.CR cs.AI 70%

Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation

元数据中的隐藏攻击:多模态检索增强生成中的隐秘污染攻击

Kennedy Edemacu, Mohammad Mahdi Shokri

机构 * The City University of New York, CSI, Staten Island, NY 10314, USA(纽约城市大学,CSI,史泰登岛分校) The City University of New York, Graduate Center, New York, NY 10016, USA(纽约城市大学研究生中心)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究提出MM-MEPA,一种通过操纵多模态检索条目元数据来影响模型响应的隐秘污染攻击,展示了其在多模态RAG系统中的高攻击成功率和防御不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23730 2026-03-02 cs.AI 70%

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

解锁认知能力并分析感知-逻辑权衡

Longyin Zhang, Shuo Sun, Yingxu He, Won Cheng Yi Lewis, Muhammad Huzaifah Bin Md Shahrin, Hardik Bhupendra Sailor, Heng Meng Jeremy Wong, Tarun Kumar Vangani, Yi Ma, Qiongqiong Wang, Minh Duc Pham, Ridong Jiang, Jingtao Li, Jingyi Liao, Zhuohan Liu, Yanfeng Lu, Manas Gupta, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-03-02 cs.CV 70%

LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, SP Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14896 2026-03-02 cs.CV 70%

Leveraging Multimodal LLM Descriptions of Activity for Explainable Semi-Supervised Video Anomaly Detection

利用多模态大语言模型对活动的描述进行可解释的半监督视频异常检测

Furkan Mumcu, Michael J. Jones, Anoop Cherian, Yasin Yilmaz

机构 * Department of Electrical Engineering University of South Florida(电气工程系 佛罗里达州立大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出利用多模态大语言模型描述活动,以实现可解释的半监督视频异常检测,有效检测复杂交互异常并提升模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22033 2026-02-26 cs.CV 70%

RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking

RT-RMOT:一种用于RGB-热成像参照多目标跟踪的数据集和框架

Yanqiu Yu, Zhifan Jin, Sijia Chen, Tongfei Chu, En Yu, Liman Liu, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学) South-Central Minzu University(西南民族大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 RT-RMOT提出一种融合RGB和热成像特征的多目标跟踪框架,通过改进的RL策略优化提升全天候跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03594 2026-02-26 cs.CV 70%

TIPS Over Tricks: Simple Prompts for Effective Zero-shot Anomaly Detection

TIPS Over Tricks: 简单提示用于有效的零样本异常检测

Alireza Salehi, Ehsan Karami, Sepehr Noey, Sahand Noey, Makoto Yamada, Reshad Hosseini, Mohammad Sabokrou

机构 * University of Tehran(塔里哈大学) Amirkabir University of Technology(阿米尔卡比尔技术大学) Okinawa Institute of Science and Technology(冲绳科学技术大学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出TIPS模型,通过改进的backbone和解耦提示策略,在无需复杂模块的情况下提升零样本异常检测的图像和像素级性能。

Comments This is the extended version of the paper accepted in ICASSP'26, which will be publicly available in May. Authors' contributions may vary among the versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20696 2026-02-25 cs.AI 70%

PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding

PromptCD:通过极性提示对比解码提升测试时行为

Baolong Bi, Yuyao Ge, Shenghua Liu, Yuchen He, Siqian Tong, Lizhe Chen, Lingrui Mei, Zehao Li, Yiwei Wang, Yujun Cai, Ming-Hsuan Yang, Xueqi Cheng

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 PromptCD通过极性提示对比解码在测试时提升LLM和VLM的行为一致性,实现无需额外训练的广泛增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20543 2026-02-25 cs.CV 70%

Beyond Human Performance: A Vision-Language Multi-Agent Approach for Quality Control in Pharmaceutical Manufacturing

超越人类表现:一种视觉-语言多智能体方法用于制药制造中的质量控制

Subhra Jyoti Mandal, Lara Rachidi, Puneet Jain, Matthieu Duvinage, Sander W. Timmer

机构 * GSK, Enterprise AI(葛兰素史克、企业人工智能) Databricks

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种结合深度学习与视觉-语言模型的多智能体框架,用于提高制药制造中菌落形成单位检测的准确性和效率,实现高质量的质量控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19828 2026-02-24 cs.CV 70%

TextShield-R1: Reinforced Reasoning for Tampered Text Detection

TextShield-R1: 用于篡改文本检测的强化推理

Chenfan Qu, Yiwu Zhong, Jian Liu, Xuekang Zhu, Bohan Yu, Lianwen Jin

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV 70%

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21896 2026-02-24 cs.AI 70%

GenesisGeo: Technical Report

GenesisGeo:技术报告

Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Polytechnic Institute, Zhejiang University(浙江大学多科大学院) Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) Volkswagen Group Innovation(大众集团创新) School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)

专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06530 2026-02-20 cs.CV cs.CR 70%

Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance

面向图像伪造检测的通用反取证攻击框架 via 多模态指导

Haipeng Li, Rongxuan Peng, Anwei Luo, Shunquan Tan, Changsheng Chen, Anastasia Antsiferova

机构 * Shenzhen University, China(深圳大学) Nanyang Technological University, Singapore(南洋理工大学) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学) Lomonosov Moscow State University's Institute for Artificial Intelligence, Russia(罗蒙诺索夫莫斯科国立大学人工智能研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ForgeryEraser框架,通过多模态指导损失实现对图像伪造检测器的通用反取证攻击,揭示了VLMs依赖性带来的对抗性漏洞,并展示了对先进AIGC检测器的性能影响。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07931 2026-02-10 cs.CV 70%

Which private attributes do VLMs agree on and predict well?

VLMs在哪些隐私属性上达成一致并预测良好?

Olena Hrynenko, Darya Baranouskaya, Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构)

专题命中 视觉定位与Grounding :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文研究了VLMs在隐私属性识别上的表现,发现其在某些属性上与人类标注一致且预测准确,可辅助大规模图像数据集的隐私标注。

Comments This work has been accepted to the ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏