arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-19 至 2026-08-19 共收录 75 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 24 篇

2604.01460 2026-08-19 cs.CV 版本更新 77%

Reinforcing Consistency in Video MLLMs with Structured Rewards

通过结构化奖励强化视频MLLMs的一致性

Yihao Quan, Zeru Shi, Jinman Zhao, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究通过结构化奖励提升视频MLLMs的一致性,发现传统监督不足,提出结合事实和时间单元的奖励机制,提升视频理解准确性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19759 2026-08-19 cs.CV 版本更新 77%

Vision-Language Enhanced Foundation Model for Semi-Supervised Medical Image Segmentation

增强视觉-语言能力的半监督医学图像分割基础模型

Jiaqi Guo, Mingzhen Li, Hanyu Su, Keigo Healy, Lexiaozi Fan, Neda Tavakoli, Santiago López-Tapia, Daniel Kim, Aggelos K. Katsaggelos

机构 * ECE, Northwestern University(电气工程与计算机科学系,西北大学) Stats, Northwestern University(统计学系,西北大学) Radiology, Northwestern University(放射学系,西北大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出VESSA模型,通过增强视觉-语言能力的半监督方法提升医学图像分割精度,实验表明其在有限标注条件下表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17584 2026-08-19 cs.RO 新提交 75%

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

HODAgent:面向物理世界人机交互的按需、响应式人形机器人

Wang Warren Chen, Jiahao Zhang, Zhenjiang Li, Mingxu Wang, Lei Yi, Yuchen Kang, Shuo Sun, Ziping Chen, Jie Chen

机构 * Xiaopeng(小鹏)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-19 cs.CV cs.AI 新提交 73%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-19 cs.SE 新提交 71%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12289 2026-08-19 cs.LG cs.AI cs.NE 版本更新 62%

The Standard Interpretable Model: A general theory of interpretable machine learning to deductively design interpretable methods using Lagrangian mechanics

标准可解释模型:一种基于拉格朗日力学的可解释机器学习通用理论,用于演绎设计可解释方法

Pietro Barbiero, Giovanni De Felice, Mateo Espinosa Zarlenga, Francesco Giannini, Filippo Bonchi, Mateja Jamnik, Giuseppe Marra, Ruggero Noris

机构 * IBM Research (CH)(IBM研究院(瑞士)) University of Oxford (UK)(牛津大学(英国)) University of Cambridge (UK)(剑桥大学(英国)) KU Leuven (BE)(鲁汶大学(比利时)) Institute of Physics of the Czech Academy of Sciences (CZ)(捷克科学院物理研究所(捷克))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出标准可解释模型(SIM),基于拉格朗日力学从前提演绎出可解释性对称性和约束,通过最小化拉格朗日函数得到最优可解释模型,解决现有方法局限性并指导新方法设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17715 2026-08-19 q-fin.RM cs.AI 新提交 57%

Communicating Credit Risk with Large Language Models: Evaluation of Explanations from Standard and Alternative Data-Based Models

利用大语言模型传达信用风险:基于标准数据与替代数据模型的解释评估

Sahab Zandi, Noah Kostesku, Christophe Mues, María Óskarsdóttir, Cristián Bravo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究探究大语言模型能否作为解释层转化信用风险模型的事后解释,构建三类流程并采用三类LLM,发现证据表征是解释质量的关键制约,专业人士对证据标准要求更严格。

Comments 49 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17848 2026-08-19 cs.LG cs.SI 新提交 57%

MoRAX: Mobility-based Representation Augmentation for Geospatial Foundation Models

MoRAX:面向地理空间基础模型的基于移动性的表示增强方法

Ya Wen, Jixuan Cai, Yulun Zhou, Alec Kirkley

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 MoRAX是增强地理空间基础模型的轻量级框架,利用人类移动性数据补充区域功能结构,其教师模型在多国多城市的八项预测任务中优于基线,学生模型性能接近教师,可实现零样本部署与跨国家迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17605 2026-08-19 cs.CL cs.AI cs.SD 新提交 57%

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

多轮对话式AI:从文本到多模态交互——数据、模型、评估与开放挑战

Syeda Faiza Ahmed, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究综述多轮对话式AI的发展现状,梳理其在数据、模型等方面的进展,指出多模态交互能力提升但存在记忆等短板,并提出相关研究议程。

Comments Multi-turn Conversational AI; Multimodal Dialogue; AudioLLMs; Conversational Memory; Tool-Augmented Agents; Dialogue Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16185 2026-08-19 cs.CL cs.AI 版本更新 57%

LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents

LENS:基于动态原始文档的潜在证据探索的上下文内搜索

Xingjun Wang, Gongsheng Li, Qi Fan, Yunlin Mao, Luyan Su, Yingda Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对动态原始文档的上下文内搜索问题,提出无索引框架LENS,通过迭代选择候选证据并更新置信度实现预算约束下的证据定位,在多组实验中其证据召回率和答案依据表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-19 cs.CL cs.AI 版本更新 57%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Ruoxi Cheng, Haoxuan Ma, Hongyi Zhang, Junming Zhang, Ranjie Duan, Qiaolin Xia, Hao Wang, Yu Lu, Haibo Shi, Xingjun Ma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-19 cs.CL 新提交 50%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-19 cs.SE 新提交 50%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Submitted to ICSE 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-08-19 cs.CL 版本更新 50%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Javier Parapar, Xi Wang

机构 * University of Sheffield(谢菲尔德大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 3 篇

2608.17205 2026-08-19 cs.CL cs.CV 新提交 79%

Which Source Wins? Task-Dependent Reliance in Vision-Language Models

哪个来源更胜一筹?视觉-语言模型中依赖关系的任务依赖性

Rodela Ghosh, Aviral Gupta, Guangjing Wang

机构 * University of South Florida(南佛罗里达大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究探究视觉-语言模型的模态依赖,通过构建算术与图表冲突基准,发现其依赖关系随任务、证据结构等变化,不同模型在对应基准中呈现相反的模态依赖模式。

Comments 20 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-19 cs.CV cs.AI 版本更新 79%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, MingKun Jiang, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17550 2026-08-19 cs.CV cs.CL 新提交 57%

Code as Representation: A Compilable Parsing Paradigm for Academic Documents

代码作为表示:学术文档的可编译解析范式

Rihui Jin, Jun Wang, chengyuan zhu, Liang Mingyu, Yue Gao, Li Yunxuan, Kuicai Dong, Guilin Qi, Lin Ren, Yongrui Chen, Xinbang Dai, Jiaqi Li, Tongtong Wu, Gholamreza Haffari

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 5 篇

2608.17512 2026-08-19 cs.RO 新提交 75%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17318 2026-08-19 cs.CV cs.RO 新提交 70%

If, Then, Otherwise: Diagnosing Conditional Branching in Vision-Language Navigation

如果、那么、否则:诊断视觉-语言导航中的条件分支

Seoyoung Lee, Neel P. Bhatt, Pranay Samineni, Cong Liu, S P Sharan, Timothy Barclay, Gregory M. Wagner, Daniel Milan, Sandeep Chinchali, Ufuk Topcu, Atlas Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Collins Aerospace(柯林斯航空航天公司)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对视觉-语言导航智能体的条件分支诊断需求,提出基于场景图的基准CondVLN及轻量级神经符号分支选择模型,可暴露智能体的逻辑决策失败并提升性能2倍。

Comments 11 pages, 1 figure, 3 tables. Project page: this https URL (https://condvln.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-19 cs.RO 新提交 67%

EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn)

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18046 2026-08-19 cs.LG 版本更新 57%

SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用

Zhuohang Fan, Beichen Zhang, Yuanfa Li, Changqiao Wu, Wei Liu, Jian Luan, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。

Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17774 2026-08-19 eess.SY eess.SP 新提交 50%

Edge-Native Embodied Intelligence for Action-Aware Wireless Edge Networks

面向动作感知无线边缘网络的边缘原生具身智能

Yiru Wang, Chuanao Jiang, Jiahui Cui, Zide Fan, Lei Wang, Zehui Xiong, Dong In Kim

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 该研究提出边缘原生具身智能(ENEI)框架,整合6G技术与具身智能,通过双向循环解决具身智能部署的资源与延迟问题,经案例验证可支撑自适应具身无线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 9 篇

2608.17084 2026-08-19 cs.CL 新提交 88%

Uncertainty-Aware Decision Making in Multimodal Large Language Models

多模态大语言模型中的不确定性感知决策

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Khalifa University of Science and Technology(哈利法科技大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);grounding(abstract)

AI总结 本调查围绕决策中心框架,综述多模态大语言模型(MLLMs)的不确定性感知决策相关研究,对比同类调查并指出源感知分解等开放问题,核心是不确定性需改善多模态证据下的系统行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17723 2026-08-19 cs.CV 新提交 85%

Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability

用于模拟仪表读数的视觉-语言模型:专业化、迁移与可靠性的实证研究

Abdul Mueez, Aaditya Baranwal, Junior Chaj-Mejia, Guneet Bhatia, Jason T. Voelker, Shruti Vyas

机构 * University of Central Florida(中佛罗里达大学) Siemens Energy(西门子能源)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过实证评估Qwen2.5-VL-7B-Instruct模型在模拟仪表读数任务中的表现,发现其经QLoRA微调后在三类数据集上误差较低,但存在迁移性能下降和高置信度错误问题,暂不适合直接部署为工厂监控流程。

Comments Submitted to Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新 85%

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: this https URL (https://xishuxishu.github.io/Know3D.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 83%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17306 2026-08-19 cs.CV cs.AI 新提交 81%

Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

学习无需学习的内容:用于鲁棒视觉-语言模型的对抗性解耦提示调优

Yang Chen, Zhan Zhuang, Yanbin Wei, Zebin Chen, Hua Liu, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有对抗性提示调优存在的鲁棒泛化过拟合问题,提出ADAPT框架,通过双提示机制解耦鲁棒与伪鲁棒特征,提升模型对未见类别对抗样本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-19 cs.AI cs.MM 版本更新 70%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13706 2026-08-19 cs.CL cs.AI 版本更新 57%

CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

CLAIR-Fin:用于跨模态金融问答中声明级验证与自适应辩论的对抗性多智能体框架

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud, M. F. Mridha, Md. Alam Hossain

机构 * Ahsanullah University of Science and Technology(阿萨努拉科技大学) Jashore University of Science and Technology(杰索尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本研究提出CLAIR-Fin九智能体框架,针对跨模态金融问答的声明级验证与自适应辩论,在BB-FinQA-X数据集上提升了模型忠实度,且弃权比例合理,优于相关基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17717 2026-08-19 cs.RO 新提交 50%

CompCPZ: Preserving Multi-Modal Intent in Language-Guided Robot Manipulation

CompCPZ:在语言引导的机器人操作中保留多模态意图

Zhen Zhang, Ahmad Hafez, Peng Xie, Yanliang Huang, Wenyuan Wu, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。

详情

展开后加载摘要…

URL PDF HTML 收藏