arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-21 至 2026-08-21 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 26 篇

2608.20336 2026-08-21 cs.CV 新提交 79%

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

WithEveryone:面向群体图像生成的统一规划与身份定位

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang

机构 * Fudan University(复旦大学) Hunyuan, Tencent(腾讯混元) The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对多人物群体图像生成的身份保留难题,提出WithEveryone框架,通过布局定位身份损失等技术,提升了人脸相似度并降低伪影,实现高身份覆盖率与低重复率。

Comments Project Page: this http URL (http://doby-xu.github.io/WithEveryone/);Code will be released: this http URL (http://github.com/Doby-Xu/WithEveryone/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19553 2026-08-21 cs.CV 新提交 79%

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

IoU曲线上定位精度的核心所在:无标注推理时的边界优化

Bo Ma

机构 * Auckland University of Technology(奥克兰理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出无标注推理时的边界优化(LFPR)方法,在多个视觉-语言定位数据集上提升了IoU曲线各精度指标,证明指代选择与边界精度部分可分离,为定位精度优化提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-21 cs.CV 版本更新 79%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19995 2026-08-21 cs.NE 新提交 78%

The Forward-Backward Disconnect: State Dynamics, Credit Assignment, and Biological Grounding in Neural Computation

前向-反向脱节:神经计算中的状态动力学、信用分配与生物学基础

Hadi Al Mubasher, Mariette Awad

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本文指出神经计算中前向计算已多样化但训练方法仍集中于梯度类误差传播机制的前向-反向脱节问题,提出涵盖状态动力学等三要素的分类法,强调需对齐三者以弥合该脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17584 2026-08-21 cs.RO 版本更新 75%

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

HODAgent:面向物理世界人机交互的按需、响应式人形机器人

Wang Warren Chen, Jiahao Zhang, Zhenjiang Li, Mingxu Wang, Lei Yi, Yuchen Kang, Shuo Sun, Ziping Chen, Jie Chen

机构 * Xiaopeng(小鹏)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract)

AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。

Comments we have received a formal directive from our company requiring all company assets to undergo a mandatory internal review process before any public release. We are now required to immediately withdraw the paper to comply with this policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 74%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19673 2026-08-21 cs.HC 新提交 71%

Grounding Mindfulness in Embodied Tangibles: A Scoping Review & Theoretical Framework for HCI Design

将正念建立在具身实体之上:面向人机交互设计的范围综述与理论框架

Tharaka Sachintha Ratnayake, Samangi Wadinambiarachchi, Sarah Schömbs, Jonathan Eden, Denny Oetomo, Wafa Johal

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究通过对65项正念实体设备的HCI范围综述,提出基于S-ART框架的理论及ESE、ESA模型,为HCI中正念技术的设计、评估及未来研究提供原则性基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 67%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-21 cs.AI cs.LG 版本更新 62%

LLM Capability Limits: Static Emergence and Dynamic Boundary Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19902 2026-08-21 cs.AI q-bio.NC 新提交 57%

Bringing analytic rigor to agentic AI for science: The Brain Researcher platform for neuroimaging data analysis

为面向科学的智能体AI赋予分析严谨性:用于神经影像数据分析的Brain Researcher平台

Zijiao Chen, Nicholas Lu, Xinhui Li, Jocelyn A. Ricard, Ce Ju, Huan H. Wang, Christian Kindermann, Jeanette A. Mumford, Steven Dillmann, James Kent, Alejandro de la Vega, Sanmi Koyejo, Vince D. Calhoun, Joshua W. Buckholtz, Juan Helen Zhou, Steffen Bollmann, Russell A. Poldrack

机构 * Stanford University(斯坦福大学) Tri-institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS)(三机构神经成像与数据科学转化研究中心(TReNDS)) Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Inria(法国国家信息与自动化研究所) CEA(法国原子能和替代能源委员会) Université(大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究推出Brain Researcher智能体研究平台,用于神经影像数据分析,其遵循分析规则等要求,提升了工具选择准确率与可验证依据,嵌入方法判断以增强智能体AI的分析严谨性。

Comments 103 pages, 19 figures; Supplementary Information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19535 2026-08-21 cs.AI cs.CL cs.DC cs.IR cs.PF 新提交 57%

From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG

从检索上下文到运行时控制:基于边缘设备的检索增强生成(RAG)的自适应压缩

Zlatan Feric, Amir Taherin, Yanzhi Wang, David Kaeli

机构 * Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对边缘RAG的上下文压缩问题,提出遥测驱动的自适应压缩方案,通过实验发现中等压缩可显著降低能耗且质量损失极小,主张基于工作负载和边缘遥测动态管理压缩。

Comments Accepted to appear in the Proceedings of the ACM AI Leadership Summit 2026. Zlatan Feric and Amir Taherin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05605 2026-08-21 cs.LG cs.NE 版本更新 57%

From Prediction to Self: Developmental Conditions for Agency in Minimal Neural Systems

从预测到自我:最小神经系统中能动性的发展条件

Evan Ye

机构 * Independent Researcher(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 通过40个逐步增加的实验,研究最小GRU系统如何区分自我与世界因果影响,发现四个严格顺序的发展条件,并提出能动性增益作为度量指标。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19008 2026-08-21 cs.AI 版本更新 57%

Computational Phenomenology of Borderline Personality Disorder: A Comparative Evaluation of LLM-Simulated Expert Personas and Human Clinical Experts

边缘型人格障碍的计算现象学:对LLM模拟专家人设与人类临床专家的比较评估

Marcin Moskalewicz, Anna Sterna, Karolina Drożdż, Kacper Dudzic, Marek Pokropski, Paula Flores

机构 * IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯洛多夫斯卡大学) University of Warsaw(华沙大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究比较了LLM模拟专家与人类专家在边缘型人格障碍定性分析中的表现,发现模型在某些方面与人类难以区分,并能识别人类遗漏的主题,展示了AI增强分析的潜力。

Comments 28 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19813 2026-08-21 eess.IV 新提交 50%

Energy-Mamba: A Physics-Constrained State-Space Model for Medical Image Classification

Energy-Mamba:用于医学图像分类的物理约束状态空间模型

Mohamed Mabrok, Yalda Zafari, Essam A. Rashed

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Energy-Mamba将物理约束融入Mamba状态空间模型,解决医学图像分类的表征漂移问题,在四个医学图像数据集上以更少参数实现了最优分类性能。

Comments This paper was accepted to the MICCAI 2026 workshop MLMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19699 2026-08-21 cs.MA 新提交 50%

An Evidence-Grounded Multi-Agent System for High-Level Bio-Robot Design

一种基于证据的用于高层生物机器人设计的多智能体系统

Yujun Chen, Tianle Li, Jiayu Chen, Zhen Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于 Qwen3.5-27B 的 micro_biorobot_agent 多智能体系统,用于高层生物机器人设计,在评估中得分领先,来源追踪检查可显著降低错误缺口。

Comments 15 pages, 2 figures, 9 tables, and 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19509 2026-08-21 cs.SE 新提交 50%

An Agentic RAG and Evaluation Framework for Assurance Case Generation: Industrial Use Case for the EU Cyber Resilience Act Compliance

用于保障案例生成的智能检索增强生成与评估框架:欧盟网络弹性法案合规性的工业用例

Fariz Ikhwantri, Iker Lasa Ojanguren, Dusica Marijan, Maria I. Maslioukova, José Arias Marin, Pavlos Kosmides

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于智能RAG的保障案例生成与评估框架,通过案例研究验证其可自动化欧盟网络弹性法案合规评定,减少人工并提升证据可追溯性。

Comments 6 pages, accepted at ISSRE 2026 (Industry track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-21 cs.SE 版本更新 50%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15469 2026-08-21 cs.CY 版本更新 50%

Aspirational Affordances of AI

AI的抱负性可供性

Sina Fazelpour, Meica Magnani

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文引入抱负性可供性与抱负性伤害概念,分析AI对抱负性可供性的影响及相关风险,拓展AI伤害讨论范畴,以深化对AI塑造抱负的心理与社会意义的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 5 篇

2608.19891 2026-08-21 cs.AI 新提交 89%

EXIMO: VLM Guided Exploration of VLA Policies

EXIMO:基于视觉语言模型引导的视觉语言动作策略探索

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

机构 * Google DeepMind(谷歌DeepMind)

专题命中 GUI与屏幕智能体 :VLM(title,summary_cn);vision language model(abstract);分类 cs.AI

AI总结 本研究提出EXIMO算法,通过VLM引导的探索、模仿、优化三阶段微调VLA策略,解决了VLA策略微调样本效率低的问题,性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19589 2026-08-21 cs.RO cs.CV 新提交 84%

OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation

OrthoSkillVLA:通过梯度感知技能子空间自适应实现持续技能学习

Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Electronic Science and Engineering, Southeast University(东南大学电子科学与工程学院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract_cn);分类 cs.CV

AI总结 OrthoSkillVLA是一种参数高效的持续技能学习框架,通过对VLM和ActionHead施加独立子空间约束、引入特征感知MoE解码器,实现预训练VLA模型的技能学习,可缓解灾难性遗忘。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 79%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19661 2026-08-21 cs.RO 新提交 75%

World-Model-Grounded LLM Planning for AUV and ASV Navigation Near Offshore Wind Farms

面向近海风电场区域自主水下航行器(AUV)与自主水面航行器(ASV)导航的世界模型赋能大语言模型规划

Markus Buchholz, Ignacio Carlucho, Yvan R. Petillot

机构 * Norwegian Defence Research Establishment (FFI)(挪威国防研究机构(FFI)) School of Engineering & Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 本研究提出世界模型赋能大语言模型规划方法,结合MPC闭环重规划器等组件,在近海风电场区域的AUV和ASV导航任务中,大幅降低目标距离误差,验证了其有效性。

Comments This work has been accepted to the IEEE IROS 2026 AQ2UASIM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18305 2026-08-21 cs.CV 版本更新 57%

SwipeGen: Bridging the Execution Gap in GUI Agents via Human-like Swipe Synthesis

SwipeGen: 通过类人滑动合成弥合GUI代理的执行差距

Xuan Wang, Siyuan Su, Quantong Fu, Yongxiang Hu, Yangfan Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV

AI总结 SwipeGen通过合成类人滑动交互提升GUI代理的执行能力,实验显示其滑动执行准确率较基线提升214%。

Comments Accepted to ACM MM 2026. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 5 篇

2608.19376 2026-08-21 cs.CV cs.AI 新提交 87%

Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?

在分布偏移下,边际覆盖率能否保证零样本视觉语言模型(VLM)的类条件安全性?

Jai Kumar Sharma, Amartya Dutta

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 幻觉与鲁棒性 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对CLIP等零样本VLM,发现边际共形覆盖率无法保证类条件安全性,源域校准无法迁移,目标域类别校准可改善尾部但需类别标签,指出其仅为平均可靠性统计量。

Comments Accepted at the ECCV 2026 Workshop on Uncertainty Quantification for Computer Vision (UNCV). 34 pages (16 main + 18 supplementary), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19208 2026-08-21 cs.CL cs.CV 新提交 83%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-08-21 cs.AI 版本更新 79%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Rishabh Jha, Amrita Singh, Prashanna Chudal

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-21 cs.AI cs.MM 版本更新 70%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Shiqin Wang, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments This work was accepted by WISE2026. 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05853 2026-08-21 cs.CV 版本更新 57%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 11 篇

2608.19285 2026-08-21 cs.CV cs.LG 新提交 90%

Clustering and Token Denoising for Faster and More Robust VLMs

用于更快、更鲁棒的视觉语言模型(VLM)的聚类与令牌去噪

Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

机构 * Université Paris-Saclay(巴黎-萨克雷大学) Univ. Rennes(雷恩大学) Vsora(沃索拉公司)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本研究提出无需训练的ClustRS算法,通过聚类与残差收缩剪枝VLM的视觉令牌,在基准测试中实现显著性能提升,为高效抗噪VLM部署提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏