arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7370 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7370 篇

2606.22339 2026-06-23 cs.CV 新提交 70%

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

T-IMPACT:面向上下文图像-文本操纵的严重性感知基准

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

机构 * The University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 70%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11201 2026-06-16 cs.DB cs.AI 版本更新 70%

Bridging the Gap: Enabling Natural Language Queries for NoSQL Databases through Text-to-NoSQL Translation

弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询

Jinwei Lu, Jiawei Lu, Chen Zhang, Zhiqian Qin, Haodi Zhang, Yuanfeng Song, Raymond Chi-Wing Wong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-06-12 cs.CL cs.AI cs.DB 版本更新 70%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10242 2026-06-11 cs.CV 版本更新 70%

MedVeriSeg: Teaching LISA-Like Medical Segmentation Models to Verify Query Validity Without Extra Training

MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练

Qinyue Tong, Xiaozhen Wang, Ziqian Lu, Jun Liu, Yunlong Yu, Zheming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) Southern Medical University(南方医科大学) School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09360 2026-06-09 cs.CV 新提交 70%

ExDet: Open-Domain Open-Vocabulary Detection with Cross-modal Extrapolation and Rectification

ExDet: 基于跨模态外推与校正的开放域开放词汇检测

Yupeng Zhang, Yuzhong Feng, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出ExDet框架,通过文本引导外推(TGE)和检测器兼容校正(DCR)模块,无需额外训练即可增强开放域开放词汇检测的跨类别和跨域泛化能力,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08043 2026-06-09 cs.GR cs.CV 新提交 70%

OmniFaceRig: Fully Automatic Inner-Mouth-Aware Face Rigging Across Diverse 3D Character Topologies

OmniFaceRig: 跨多种3D角色拓扑的全自动内口感知面部绑定

Chao Wang, Guangyao Ma, John Doublestein, Junming Chen, Yiming Lin, Zhaoen Su, Xiaomin Luo, Shiyang Cheng, Jie Shen, Doug Roble, Dilin Wang, Yilei Li, Rakesh Ranjan

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出全自动端到端管道OmniFaceRig,将静态表面网格转换为含内口几何的FACS绑定,支持人类、人形及多种动物拓扑,无需手动标注或模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05445 2026-06-05 cs.AI 70%

Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

Brick-Composer: 使用多模态大语言模型进行多样化积木组装

Jiateng Liu, Bingxuan Li, Zhenhailong Wang, Rushi Wang, Kaiwen Hong, Cheng Qian, Jiayu Liu, Denghui Zhang, Katherine Driggs-Campbell, Manling Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Brick-Composer框架,通过人类设计火花、世界反馈和合成经验三种信号训练多模态大语言模型,解决积木组装中的积木选择和姿态估计问题,将步骤级组装成功率从低于1%提升至约15%。

Comments 10 Pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04282 2026-06-04 cs.CV 70%

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

FindIt:面向通用多模态大语言模型的格式感知视觉检测基准

Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根人工智能中心,图宾根大学) Woven by Toyota, Inc.(丰田公司) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉定位与Grounding :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出首个全面评估通用多模态大语言模型在可提示定位能力上的基准,涵盖四种核心任务,并标准化输入输出格式,揭示模型对格式约束的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02402 2026-06-02 cs.CV 70%

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos

未修剪长视频中被操纵片段的可解释取证

Yue Feng, Jingjing Li, Qijia Lu, Wei Ji, Jingrou Zhang, Fei Shen, Xiao Li, Yizhen Jia, Qiang Chen, Limin Wang, Wentong Li, Jie Qin

机构 * MoE Key Laboratory of Brain-Machine Intelligence Technology, College of Artificial Intelligence, Nanjing University of Aeronautics(脑机智能技术关键实验室、人工智能学院、南京航空航天大学) Dalian University of Technology(大连理工大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对长视频中AI生成片段的定位与解释任务,提出TASLE基准数据集和MSLoc粗到细取证方法,实现时序定位、真实性检测与可解释分析。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27645 2026-06-02 cs.CV 70%

OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

OpenDPR:面向遥感影像的基于视觉中心扩散引导原型检索的开放词汇变化检测

Qi Guo, Jue Wang, Yinhe Liu, Yanfei Zhong

机构 * Wuhan University(武汉大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出OpenDPR框架,通过扩散模型构建原型并检索视觉相似性,解决开放词汇变化检测中类别识别瓶颈,并设计S2C模块增强变化定位能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09632 2026-06-01 cs.CV cs.CL 70%

X-GS: An Extensible Framework for Perceiving and Thinking via 3D Gaussian Splatting

X-GS:基于3D高斯溅射的感知与思考可扩展框架

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出X-GS框架,包含感知器和思考器,统一多种3DGS技术实现实时在线SLAM与语义蒸馏,并支持多模态模型完成下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20395 2026-06-01 cs.CV cs.RO 70%

SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation

SpaCeFormer: 快速无提议开放词汇3D实例分割

Chris Choy, Junha Lee, Chunghyun Park, Minsu Cho, Jan Kautz

机构 * NVIDIA

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出SpaCeFormer,一种基于空间曲线变换的无提议方法,在0.12-0.30秒内完成场景分割,比多阶段2D+3D流水线快2-3个数量级,并构建了最大开放词汇3D实例分割数据集SpaCeFormer-3M,在ScanNet200上零样本mAP达11.1,提升2.8倍。

Comments Project page: https://nvlabs.github.io/SpaCeFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02220 2026-06-01 cs.CV cs.RO 70%

LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation

LangMap:一个用于分层开放词汇目标导航的人工验证基准

Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

机构 * AIML, Adelaide University(AIML,阿德莱德大学) East China Normal University(华东师范大学) NERC-RVC, Hunan University(NERC-RVC,湖南大学) The University of Western Australia(西澳大学) Breaker Industries

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对现有基准在分层语义目标导航中的不足,提出LangMap基准,通过人工验证的语义标注和对比注释协议,支持场景、房间、区域和实例四个层级的目标导航任务,并引入PlaNaVid基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28369 2026-05-28 cs.AI cs.SI 70%

CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

CyberJurors:电商纠纷裁决的多智能体模拟任务

Yanhui Sun, Wu Liu, Haifeng Ming, Xinru Wang, Hantao Yao, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 针对电商纠纷裁决需要从冗余多轮多模态证据中提取关键线索并依据平台特定惯例决策的问题,提出多智能体框架CyberJurors,通过个体裁决链式思维和集体陪审共识裁决提升裁决质量,在包含6000真实案例的基准上超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28239 2026-05-28 cs.CV 70%

Learning to Label: A Reinforced Self-Evolving Framework for Semi-supervised Referring Expression Segmentation

学习标注:一种用于半监督指代表达分割的强化自进化框架

Runlong Cao, Ying Zang, Chuanwei Zhou, Tianrun Chen, Tong Zhang, Zhen Cui, Chunyan Xu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Information Engineering, Huzhou Normal University(湖州师范学院信息工程学院) School of Artificial Intelligence, Nanjing University of Posts and Telecommunications(南京邮电大学人工智能学院) National Key Laboratory of Tibetan Language Intelligence(藏语智能国家重点实验室) Zhejiang University(浙江大学) Beijing Normal University(北京师范大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出L2L框架,通过强化学习将伪标签构建转化为可学习的决策过程,结合多模态大模型提取先验,实现半监督指代表达分割的联合优化。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26383 2026-05-27 cs.CV 70%

Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion

基于多阶段SAM3特征融合的零样本物体重识别在自我中心厨房视频中的应用

Dmytro Klepachevskyi, Alexander Wong, Sirisha Rambhatla, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对自我中心厨房视频中物体重识别的挑战,提出一种基于SAM3分割的多阶段零样本方法,通过融合SAM3、DINOv2和CLIP特征并引入掩码形状IoU和k-倒数重排序,将mAP从45.3%提升至52.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22274 2026-05-27 cs.CV 70%

CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation

CAGE-SGG:用于开放词汇场景图生成的反事实主动图证据

Suiyang Guang, Chenyu Liu, Ruohan Zhang, Siyuan Chen

机构 * Institute of Intelligent Vision and Embodied Cognition(智能视觉与具身认知研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出基于反事实关系验证的开放词汇场景图生成框架,通过分解谓词为软证据基并使用反事实验证器确保关系有视觉证据支持,从而提升可靠性、可解释性和泛化能力。

Comments This manuscript has been withdrawn by the authors because we found a methodological flaw in the formulation and evaluation of the proposed approach. The issue affects the reliability of the experimental results and the conclusions drawn from them. Therefore, the authors consider the current version unsuitable for citation or further use

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09943 2026-05-26 cs.AI 70%

PathMem: Toward Cognition-Aligned Memory Transformation for Pathology MLLMs

PathMem: 面向病理学多模态大模型的认知对齐记忆转换

Jinyue Li, Yuci Liang, Qiankun Li, Xinheng Lyu, Jiayu Qian, Huabao Chen, Kun Wang, Zhigang Zeng, Anil Anthony Bharath, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出PathMem框架,通过长期记忆与工作记忆的动态转换机制,实现结构化病理知识整合与可解释记忆控制,在WSI报告生成和开放诊断任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23891 2026-05-25 cs.CV 70%

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

Smart-Insertion-V: 通过闭环反馈双流框架实现逼真的视频插入

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出一种端到端双流框架Smart-Insertion-V,通过闭环反馈机制和双世界视角旋转位置编码解决参考对象与源视频风格域差异大的问题,实现无需掩码的逼真视频对象插入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13930 2026-05-25 cs.LG cs.HC cs.NE 70%

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

基于稀疏自编码器的脑电图基础模型机制可解释性

William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen

机构 * BrainCapture DTU Health Tech(技术大学丹麦健康技术) DTU Compute(技术大学丹麦计算) Department of Biomedical Data Science(生物医学数据科学系) Department of Computer Science(计算机科学系) Seer Medical(Seer医疗) Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院) University Hospital of Copenhagen(哥本哈根大学医院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.LG

AI总结 通过TopK稀疏自编码器从三种EEG Transformer中提取稀疏特征字典,结合临床分类法评估单语义性和纠缠性,并引入概念引导分析目标与非目标区域,揭示模型表征失败和临床纠缠问题。

Comments Preprint. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22068 2026-05-22 cs.CV 70%

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

COCOTree: 一个用于开放树状视觉分解的数据集和基准

Junhyub Lee, Seunghun Chae, Hyosu Kim

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出COCOTree数据集和基准,通过自动化生成管道和开放词汇空间,实现了对复杂物理组装的长尾分布的捕捉,并提出了Open Tree Quality (OTQ)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20425 2026-05-21 cs.AI 70%

AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows

AgentCo-op: 基于检索的互操作多智能体工作流合成

Shuaike Shen, Wenduo Cheng, Shike Wang, Mingqian Ma, Jian Ma

机构 * Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院雷和斯蒂芬妮·兰德计算生物学系) Machine Learning Department, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院机器学习系)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AgentCo-op,一种基于检索的多智能体工作流合成框架,通过类型化任务传递合成可执行工作流,并在执行证据表明失败时应用有界自引导局部修复。在两个开放世界基因组学案例研究中,AgentCo-op在不重设计或运行全局拓扑搜索的情况下,将独立开发的科学智能体和外部工具库整合到可审计的工作流中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19528 2026-05-20 cs.CV 70%

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs

Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里集团大模型研究院) HuPan Lab(虎派实验室) Alibaba Group(阿里集团)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18772 2026-05-20 cs.IR cs.AI cs.CL 70%

Improving Retrieval-Augmented Generation without Taxonomy-based Error Categorization

无需基于分类的错误归类即可改进检索增强生成

Gongbo Zhang, Yifan Peng, Chunhua Weng

机构 * Columbia University(哥伦比亚大学) Weill Cornell Medicine(韦尔·科恩医学中心)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出RePAIR方法,通过直接将错误的RAG输出映射到错误缓解行动计划,无需依赖细粒度错误分类和显式批评者监督,从而提升检索增强生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18593 2026-05-19 cs.CR cs.AI cs.RO 70%

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

并非你所要求的:家庭机器人操作中的字体攻击

Ali Iranmanesh, Peng Liu

机构 * Cyber Security Lab(网络安全实验室) The Pennsylvania State University(宾夕法尼亚州立大学) State College, USA(州立学院,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。

Comments 10 pages, 1 figure, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18547 2026-05-19 cs.AI 70%

VISAFF: Speaker-Centered Visual Affective Feature Learning for Emotion Recognition in Conversation

VISAFF: 以说话者为中心的视觉情感特征学习用于对话中的情感识别

Linan ZHU, Zihao Zhai, Xiao Han, Yuqian Fu, Xiangfan Chen, Xiangjie Kong, Guojiang Shen

机构 * Zhejiang University of Technology(浙江工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出VISAFF框架,通过以说话者为中心的视觉情感特征学习方法,解决对话中情感识别中的复杂场景问题,提升计算效率并避免大规模模型微调的高成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17669 2026-05-19 cs.AI 70%

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

多模态文化遗产品知图扩展与语言和视觉模型

Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

机构 * Center for Studies and Research in Computer Science and Communication, CNAM(计算机科学与通信研究所以及CNAME)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出了一种多模态方法,利用语言和视觉模型扩展文化遗产品知图,通过构建多模态知识图谱WJoconde并建立评估基准,提高知识图谱的扩展效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16431 2026-05-19 cs.CV 70%

CT-DegradBench: A Physics-Informed Benchmark for CT Degradation Detection and Severity Estimation

CT-DegradBench:一种用于CT退化检测和严重程度估计的物理引导基准

Yousra Nabila Taifour, Marouane Tliba, Zuheng Ming, Marie Luong, Nour Aburaed, Aladine Chetouani, Gorkem Durak, Alessandro Bruno, Faouzi Alaya Cheikh, Habib Zaidi, Ulas Bagci, Azeddine Beghdadi

机构 * Université Sorbonne Paris Nord(索邦巴黎北大学) University of Dubai(迪拜大学) Northwestern University(西北大学) IULM University(IULM大学) Norwegian University of Science and Technology(挪威科学与技术大学) University of Geneva(日内瓦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CT-DegradBench,一个用于评估CT退化检测和严重程度估计的基准,结合语义先验和频域线索,提出SeSpeCT框架,在多模态嵌入空间中构建免训练的语义质量轴,实现退化类型和严重程度的联合预测。

Comments Accepted in CVPR 2026 VISION Workshop (DEXTER track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15997 2026-05-18 cs.CV 70%

Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning

分割、检测与解释:一种用于CT外观推理的统一框架

Yuyuan Liu, Can Peng, Yingyu Yang, Qianye Yang, Cheng Ouyang, J. Alison Noble

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出统一框架,整合语言引导的视觉推理,提升CT图像分割与检测的精度,并提供外观推理输出。

Comments 8 pages, 4 figures, submitted to IEEE Transactions on Medical Imaging (TMI)

详情

展开后加载摘要…

URL PDF HTML 收藏