arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-12 至 2026-08-12 共收录 47 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2509.25143 2026-08-12 cs.CV cs.CL 版本更新 79%

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

TemMed-Bench:评估视觉语言模型的时序医学图像推理能力

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 73%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2505.23399 2026-08-12 cs.AI 版本更新 87%

GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning

GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架

Jusheng Zhang, Yijia Fan, Wenjun Lin, Ruiqi Chen, Haoyi Jiang, Wenhao Chai, Jian Wang, Keze Wang

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(title);分类 cs.AI

AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。

Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 85%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新 81%

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08557 2026-08-12 cs.CL cs.CV cs.LG 版本更新 62%

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

OpenVisTool:用于合成具有指导性的视觉工具使用轨迹的开源方案

Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出OpenVisTool框架,构建含因果监督的视觉工具使用轨迹数据集OpenVisTool-42K,微调后模型视觉工具使用性能提升,大模型接近领先闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10129 2026-08-12 cs.CV cs.AI 版本更新 62%

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

LaViT:对齐潜在视觉思维以进行多模态推理

Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Utrecht University(乌特勒支大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2607.18577 2026-08-12 cs.CV 版本更新 91%

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

无基础的注意力:医学视觉语言模型中视觉解释的因果评估

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(萨伊勒实验室,纽黑文大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title);LLaVA(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究医学视觉语言模型中视觉解释的因果评估,通过多种方式审核注意力热图忠实度,发现没有评估的VLM满足忠实标准,热图虽视觉上安心但不忠实,临床解释需可控指标和因果扰动而非仅视觉检查。

Comments iMIMIC Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09302 2026-08-12 cs.CV 版本更新 89%

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

用于宫腔镜手术场景分割的自举式视觉-语言模型

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出首个基于VLM的宫腔镜手术场景分割方法VLM-hyster,通过类别特定文本提示与掩码蒸馏分支提升性能,在自行构建的4020张图像数据集上表现优于现有模型,获多中心验证,具临床应用潜力。

Comments Accept by Biomedical Signal Processing and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06869 2026-08-12 cs.CV cs.CL 版本更新 85%

DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding

DAEP:面向医学视频语料时序答案 grounding 的难度感知证据规划

Tianjian He, Yujie Liu, Zhiping Huang, Changbo Xu

机构 * TikTok, ByteDance(字节跳动TikTok) Beijing Institute of Graphic Communication(北京印刷学院) Lingnan University(岭南大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 BIGC团队提出DAEP方案,通过多模态证据排名与难度感知规划,在NLPCC 2026共享任务中以0.2728的平均得分获第一名,提升了医学视频时序答案定位的性能。

Comments 12 pages, 2 figures, 5 tables, accepted by NLPCC 2026 Shared Task Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-12 cs.CV 版本更新 84%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15821 2026-08-12 cs.CL cs.AI cs.LG 版本更新 84%

The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages

真相留在家族中:通过模型谱系中继承的真相头增强上下文基础

Miso Choi, Seonga Choi, Mincheol Kwon, Woosung Joung, Jinkyu Kim, Jungbeom Lee

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title);MLLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究发现基础LLM与下游变体间存在上下文真相分数的强继承性,提出TruthProbe软门控策略放大真相头以提升上下文真实性并减少多模态幻觉。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17162 2026-08-12 cs.AI q-bio.GN 版本更新 79%

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型

Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 71%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04872 2026-08-12 cs.CV cs.AI 版本更新 62%

EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

EventCoT:用于推理时间定位的以事件为中心的视频思维链

Youngkil Song, Yoonjae Baek, Dongwon Kim, Inho Kim, Dongkeun Kim, Suha Kwak

机构 * Pohang University of Science and Technology(浦项科技大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Handong Global University(韩东国际大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出EventCoT框架解决推理时间定位难题,先对视频进行以事件为中心的分词,再在识别出的事件内推理生成答案,通过嵌入匹配确定时间间隔,在相关任务中取得好结果。

Comments 27 pages, 11 figures, 19 tables. Co-corresponding authors: Dongkeun Kim and Suha Kwak

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 62%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08849 2026-08-12 cs.CL cs.AI cs.DB cs.MA cs.SC 版本更新 57%

SatIR: Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching

SatIR:可扩展的高召回率约束满足基于信息检索的临床试验匹配

Zikai Zhou, Yufei Jin, Yilin Xu, Yu-Chiang Wang, Chieh-Ju Chao, Monica S. Lam

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Samueli Electrical and Computer Engineering, UCLA(UCLA Samueli电气与计算机工程系) Department of Computer Science and Informatics, Emory University(埃默里大学计算机科学与信息学系) Mayo Clinic(梅奥诊所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SatIR通过将临床试验资格条件和摘要转化为形式约束,结合SMT、关系代数和大语言模型,提升了临床试验匹配的召回率和效率,优于基于相似度的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13319 2026-08-12 cs.AI cs.HC 版本更新 57%

Situation Graph Prediction for User Perspective Modeling

情境图预测:用户建模的结构化视角推断

Jisung Shin, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) University of Toronto(多伦多大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) MIT Media Lab(MIT媒体实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。

Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 50%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03253 2026-08-12 cs.SD 版本更新 50%

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

CLASVS:用于歌声合成中保留旋律的歌词编辑的连续潜变量自回归

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CLASVS是用于歌声合成的连续潜变量自回归模型,通过SCT路由与PSCG方法实现保留旋律的歌词编辑,在普通话基准上优于离散自回归Vevo2,降低46.2%的宏观音素错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09874 2026-08-12 cs.CL cs.SI 版本更新 50%

Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis

模拟有组织群体行为:新框架、基准和分析

Xinkai Zou, Yiming Huang, Zhuohang Wu, Jian Sha, Nan Huang, Longfei Yun, Jingbo Shang, Letian Peng

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Irvine(加州大学尔湾分校) Meta

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出新框架和基准,用于模拟有组织群体决策,通过结构化分析模型提升预测性能,并揭示群体行为随时间的变化及跨群体相似性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2608.07917 2026-08-12 cs.AI 版本更新 83%

TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents

TongGuOCR:面向中文历史文献的布局感知与 token 增强 OCR 框架

Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 文档图表理解 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 针对中文历史文献OCR的复杂布局、生僻字等挑战,提出TongGuOCR框架,通过布局感知预处理与token增强识别模块,在M5HisDoc等基准上取得优于同类模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2604.08941 2026-08-12 cs.LG 版本更新 85%

Predictive Entropy as a Joint Screen for Error and Paraphrase Instability in Medical Vision-Language Models

预测熵连接校准与改写敏感性在医疗视觉-语言模型中

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究医疗视觉语言模型在部署中的校准和改写敏感性问题,通过预测熵方法发现决策边界接近性是共同原因,并展示单一熵阈值能有效识别不可靠和改写敏感的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09816 2026-08-12 cs.RO 版本更新 83%

Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation

用于零样本物体目标导航的分层快慢ReAct智能体

Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究针对零样本物体目标导航,提出分层快慢ReAct智能体,结合价值图控制器与坐标锚定记忆及VLM,在HM3D、MP3D验证集上取得零样本方法最高成功率,远前沿审议可提升性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26148 2026-08-12 cs.HC cs.CL 版本更新 75%

Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations

超越截图:评估VLMs对UI动画的理解

Chen Liang, Xirui Jiang, Naihao Deng, Eytan Adar, Anhong Guo

机构 * University of Michigan(密歇根大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 本文提出AniMINT数据集,评估VLMs对动态UI动画的理解能力,发现其在基础运动检测上可靠,但高阶解释仍不一致,揭示了模型性能的关键瓶颈。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 11 篇

2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 87%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 幻觉与鲁棒性 :multimodal large language model(title);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03793 2026-08-12 cs.CL cs.CV 版本更新 81%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 81%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03730 2026-08-12 cs.CV 版本更新 79%

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡布斯大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24602 2026-08-12 cs.CV 版本更新 74%

Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift

基于主导性的测试时适应以应对视觉-语言模型在模态特定偏移下的表现

Lixian Chen, Mingxuan Huang, Yanhui Chen, Junyi Lin, Yang Shi

机构 * Guangdong University of Technology(广东工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文研究了视觉-语言模型在部署时视觉与文本分支不对称偏移的问题,提出MG-MTTA方法通过控制模态可靠性而非仅预测熵来提升性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏