arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-06 至 2026-08-06 共收录 77 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2608.04510 2026-08-06 cs.RO cs.AI 新提交 83%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05138 2026-08-06 eess.AS cs.AI cs.CL 新提交 74%

Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains

让Nemotron学习希腊语:针对专业领域现代希腊语的语料库挖掘、检索适配与生成落地

Ayoub Kirouane, Christos Petrocheilos

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本研究针对现代希腊语缺失于Nemotron检索模型及主流多语言基准的问题,提出Nemotron检索栈的端到端适配方案,含语料库挖掘等步骤,推出首个希腊语RAG基准HERA,适配后的模型在多项指标上显著提升。

Comments 15 pages, 10 figures, 7 tables. Includes release of the HERA benchmark and Sophea Nemo RAG models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04576 2026-08-06 cs.CL 新提交 67%

Causal Evidence Extraction and Triangulation in Crisis Reports using Large Language Models: A ReliefWeb-based Study

基于大型语言模型的危机报告中因果证据提取与三角验证:一项基于ReliefWeb的研究

Yuanjun Zhang, Mourad Oussalah

机构 * University of Oulu(奥卢大学) LUT University(拉普兰塔理工大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 该研究基于ReliefWeb数据,提出两阶段LLM流水线提取危机报告中结构化因果证据,结合上下文保留的三角验证方法,在100份专家标注报告中取得优异性能,为现金援助的食品相关结果提供了高收敛性证据。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 32478-32491, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 67%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 62%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01407 2026-08-06 cs.CV cs.AI 版本更新 62%

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交 57%

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04424 2026-08-06 cs.CV 新提交 57%

Thinking with Anchors: Grounded and Efficient Document Reasoning

基于锚点思考:接地且高效的文档推理

Sichen Zhu, Yuchen Zhu, Wenzhuo Xu, Jason Kuen, Wanrong Zhu, Jing Shi, Xuan Shen, Quanyi Wang, Yiwei Wang, Yujun Cai, Bing Shuai, Qin Zhang, Yongxin Chen, Shilong Liu, Molei Tao, Jiuxiang Gu

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学) Adobe(奥多比公司) ZJU(浙江大学) NUIST(南京信息工程大学) SEU(东南大学) Physion Labs(Physion实验室) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 该研究提出面向推理的ADOPD 2026数据集,将多类文档元素转化为视觉锚点,支持区域语义标注、统一视觉-语言接地等能力,解决现有模型在文档计数任务上的不足,推动文档理解向锚点接地的智能方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 57%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05451 2026-08-06 cs.LG cs.CL 版本更新 57%

RingSQL: Schema-Independent Synthetic Data Generation for Text-to-SQL Reinforcement Learning

RingSQL: 通过不依赖模式的模板生成合成数据以用于文本到SQL推理模型

Marko Sterbentz, Kevin Cushing, Cameron Barrie, Kristian J. Hammond

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RingSQL通过结合不依赖模式的模板和大语言模型生成,提升文本到SQL模型的准确性和多样性

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04645 2026-08-06 cs.PL 新提交 50%

Towards Datalog on Quantum Annealers: Compiling Recursive Logic Programs with Bottom-up Semantics to 2-local Ising Models

面向量子退火器的Datalog:将具有自底向上语义的递归逻辑程序编译为2局域伊辛模型

Bruno Rucy Carneiro Alves de Lima, Victor Henrique Cabral Pinheiro, Evgenii Dolzhkov, Joseph Haske

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究将递归Datalog程序编译为量子退火器可处理的2局域伊辛模型,经Lean 4验证正确性,还映射到商用退火器拓扑并表征基态获取情况。

Comments 12 pages, 4 pages of appendix, Datalog 2.0 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04195 2026-08-06 cs.SE 新提交 50%

SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References

SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27549 2026-08-06 cs.SE 版本更新 50%

How Effective Are NPM Malicious Package Detectors? A Large-Scale Empirical Study

理解NPM恶意软件包检测:基于基准的实证分析

Wenbo Guo, Zhongwen Chen, Zhengzi Xu, Chengwei Liu, Ming Kang, Shiwen Song, Chengyue Liu, Yijia Xu, Weisong Sun, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文基于基准测试分析NPM恶意软件包检测,构建包含6420个恶意和7288个良性包的数据集,评估8种工具的性能,揭示工具精度-召回率由代码意图解析决定,GuardDog达到93.32% F1,SAP_DT检测率提升至79.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 5 篇

2607.29677 2026-08-06 cs.AI 版本更新 70%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 文档图表理解 :VLM(abstract_cn);grounding(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 62%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04832 2026-08-06 cs.CV cs.GR cs.LG 版本更新 62%

BIM-Native Tokenization for Constraint-Aware Room Layout Synthesis

基于标记的建筑:一种用于布局合成的Transformer

Manuel Ladron de Guevara, Jinmo Rhee, Ardavan Bidgoli, Vaidas Razgaitis, Michael Bergin

机构 * Higharc University of Calgary(卡尔加里大学)

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出SBM模型,通过统一建筑元素的异质特征集生成布局合成的Transformer架构,实现高保真房间嵌入和功能布局生成。

Comments 7 pages, 2 page References, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16060 2026-08-06 cs.CV 版本更新 57%

ArtChart: Faithful Artistic Chart Generation with Integrated Text Rendering

ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 50%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 文档图表理解 :vision language model(abstract)

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2608.05042 2026-08-06 cs.RO 新提交 75%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04501 2026-08-06 cs.CV 新提交 57%

Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs

隐私保护动作识别:分类、方法与隐私-效用权衡

Sareer Ul Amin, Muhammad Ayaz, Muhammad Munsif, Sanghyun Seo

机构 * Chung-Ang University(中央大学) Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院) College of Art and Technology, Chung-Ang University(中央大学艺术与技术学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 该研究通过PRISMA指导的综述,梳理32篇PPAR论文,提出分类法、评估协议等,分析各方法权衡,指出评估不足,推动PPAR从原型向部署发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新 50%

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 10 篇

2608.04604 2026-08-06 cs.CV 新提交 84%

COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation

COSMO:面向无源域自适应的共识驱动偏移调制

Bo Li, Junjie Peng, Xiaohua Xie, Jianhuang Lai

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对无源域自适应的源衍生证据遗忘问题,提出COSMO方法,通过锚定共享共识的协同适配实现样本级可靠性分配,在四个基准上达到最优性能,平衡了源证据保留与VLM互补证据吸收。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 83%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04244 2026-08-06 cs.CV cs.CL 新提交 83%

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。

Comments 27 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21105 2026-08-06 cs.CV 版本更新 83%

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

HalluScope:多模态大语言模型的细粒度幻觉诊断

Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, Zhonghai Wu

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型的幻觉问题,提出细粒度幻觉诊断任务,开发数据集并设计奖励函数,训练HalluScope-4B和HalluScope-8B模型,在多个基准测试中达最优,其诊断解释能有效指导目标模型纠正幻觉。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 74%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04246 2026-08-06 cs.RO cs.CV 新提交 70%

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

SAFECAST:结合对比集训练与校准的VLA策略鲁棒故障检测

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 SAFECAST 借助对比集扰动优化隐状态探测器训练与校准,在真实和模拟实验中显著提升 VLA 策略故障检测 ROC-AUC,且视觉与语言对比集扰动结合时效果最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04034 2026-08-06 cs.CR 新提交 67%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏