arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2597 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 533 篇

2606.12366 2026-06-11 cs.RO 新提交 75%

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies

APT: 动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对连续动作专家模型对分布外语言指令泛化差的问题,提出APT两阶段训练方法,先预训练动作专家作为视觉-动作先验,再通过门控融合注入语言,显著提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 75%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15075 2026-08-18 cs.CV 新提交 74%

SA-GEM: Scale-Adaptive and Geospatial Evidence-Modulated Token Pruning for Efficient Remote Sensing Large Vision-Language Models

SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝

Kexin Ma, Jing Xiao, Bowen Xing, Liang Liao, Chia-Wen Lin

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23335 2026-07-28 cs.CV 新提交 74%

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

门总是关闭:关于向冻结的视觉语言模型注入辅助信号

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

机构 * University of Doha for Science and Technology(多哈科技大学) Pluralis Research(普卢拉利斯研究公司) North South University(南北大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27484 2026-06-29 cs.CV 新提交 74%

Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos

微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分

Mohammadmahdi Honarmand, Parnian Azizian, Aaron Kline, Kae Nurge, Zerin Nasrin Tumpa, Saimourya Surabhi, Kaitlyn Dunlap, Yang Qian, Ali Kargarandehkordi, Sameer Neupane, Peter Washington, Dennis P. Wall

机构 * Stanford University(斯坦福大学) University of Hawaii at Manoa(夏威夷大学马诺阿分校) University of California San Francisco(加利福尼亚大学旧金山分校)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV

AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 74%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18472 2026-06-18 cs.CV 新提交 74%

Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

通过正则化微调实现可域泛化的3D视觉-语言模型适应

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康考迪亚大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交 73%

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 73%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 73%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 73%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25527 2026-07-29 cs.CV cs.AI 新提交 73%

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation

阿格斯统一模型:迈向紧凑且经济的图像理解与生成统一模型

Weiming Zhuang, Jiabo Huang, Jingtao Li, Zhizhong Li, Chen Chen, Sina Sajadmanesh, Lingjuan Lyu

机构 * Sony AI(索尼人工智能公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在统一图像理解与生成,提出阿格斯统一模型,利用预训练视觉语言模型,引入混合视觉令牌,分两阶段训练,以最少数据和低成本实现良好性能,达当前最优,可作统一模型开发基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 73%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17653 2026-07-21 cs.CV cs.LG cs.MM 新提交 73%

LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation

LFM:利用基础模型进行无源通用域适应

Jing Li, Pan Liu, Meng Zhao, Wanli Xue, Yanhong Yang, Xu Cheng, Fan Shi, Jianhua Zhang, Qinghua Hu, Shengyong Chen

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) Engineering Research Center of Learning-Based Intelligent System, Ministry of Education of the People’s Republic of China, Tianjin University of Technology(中华人民共和国教育部基于学习的智能系统工程研究中心,天津理工大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) Engineering Research Center of City Intelligence and Digital Governance, Ministry of Education of the People’s Republic of China, Tianjin University(中华人民共和国教育部城市智能与数字治理工程研究中心,天津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究在无源数据时将预训练源模型适应到目标域的问题,提出LFM框架,利用视觉语言模型计算相似度确定标签转移类型、识别未知样本,通过共识策略精炼伪标签训练目标模型,实验验证了该框架的有效性和优越性。

Comments Accepted by IEEE Transactions on Multimedia (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15851 2026-07-20 cs.CV cs.LG 新提交 73%

Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction

用于现实测试时转导的具有动态收缩的冯·米塞斯-费舍尔混合模型

Jiazhen Huang, Zhiming Liu, Changhu Wang, Wei Ju, Ziyue Qiao, Xiao Luo

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 研究针对测试时视觉语言模型性能问题,从惩罚似然估计角度提出具有动态收缩的冯·米塞斯-费舍尔混合模型(MOON),该模型基于分布混合建模,能动态调整收缩强度处理不平衡,无需训练和特定超参,实验验证其性能和效率优势。

Comments Accepted by ICML 2026

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09104 2026-07-13 cs.CV cs.AI 新提交 73%

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

将大语言模型与图卷积网络集成用于半监督图像分类

Camila Piscioneri Magalhães, Lucas Pascotti Valem

机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) University of São Paulo (USP)(圣保罗大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08193 2026-07-10 cs.LG cs.AI 新提交 73%

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程

Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

机构 * Sapienza University of Rome(罗马第一大学) Sony AI(索尼人工智能)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04179 2026-07-07 cs.CV cs.AI 新提交 73%

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏

Zhaohong Liu, Hao Ye, Xianlin Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Digital Media & Design Arts(数字媒体与设计艺术学院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03143 2026-07-07 cs.CV cs.AI 新提交 73%

Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning

文本作为部分约束:用于稳健视觉语言学习的核心-残差对齐

Chengzhen Yu, Canran Xiao, Siyuan Ma, Yang Liu

机构 * Nanyang Technological University (NTU)(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 VLM训练与架构 :LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对自然字幕不明确致视觉语言对齐脆弱的问题,提出文本作为部分约束框架,以多视图字幕为不完全监督,提炼共识语义核心,降低相似度对未提及残差的依赖,提升视觉语言表征可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02542 2026-07-07 cs.AI cs.CV 新提交 73%

iFLYTEK-Embodied-Omni Technical Report

科大讯飞-具身全能技术报告

Yuan Zhang, Jingfei Ni, Guanchen Lu, Shiqi Zhang, Qingshan Xu, Chi Liu, Xin Nie, Wenjie Xu, Lin Gao, Zhiyuan Cheng, Mingxin Zhou, Jiajia Wu, Diyuan Liu, Jia Pan, Chao Ji

机构 * iFLYTEK LindenBot University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 73%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00434 2026-07-02 cs.CV cs.LG 新提交 73%

Information-Regularized Attention for Visual-Centric Reasoning

信息正则化注意力用于以视觉为中心的推理

Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan

机构 * FAIR at Meta(Meta 的 FAIR 部门) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对视觉语言模型中的对象幻觉、视觉基础弱和灾难性遗忘问题,提出信息正则化注意力机制,通过随机注意力显式调控视觉信息注入,改善表示学习稳定性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 73%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23885 2026-06-24 cs.CV cs.AI cs.CL cs.MM 新提交 73%

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

注意头:多模态大语言模型的拓扑表示对齐

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学) AMD Silo AI

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出头级表示对齐(HeRA)方法,在注意力头级别强制跨模态对齐,通过对比目标匹配局部拓扑结构,选择对齐最差的头进行训练,有效提升视觉任务性能并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20506 2026-06-19 cs.CV cs.AI 新提交 73%

FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining

FreeStyle: 从社区LoRA挖掘中实现风格-内容双参考生成的自由控制

Jinghong Lan, Wei Cheng, Yunuo Chen, Ziqi Ye, Peng Xing, Yixiao Fang, Rui Wang, Yufeng Yang, Xuanyang Zhang, Xianfang Zeng, Difan Zou, Gang Yu, Chi Zhang

机构 * Fudan University(复旦大学) StepFun Westlake University(西湖大学) University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出FreeStyle框架,利用社区LoRA作为锚点,通过两阶段课程学习(注意力级约束和频率感知RoPE调制)解决双参考生成中的内容泄露问题,并引入新基准和评估指标,实现风格对齐、内容保持与泄露抑制的平衡。

Comments 35 pages, 26figures. Project page: https://github.com/Blue2Giant/FreeStyle

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 73%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 73%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16633 2026-06-16 cs.CV cs.AI 新提交 73%

DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation

DCP-Prune:基于分布一致性保持的超低令牌剪枝

Xifeng Xue, Xiaokang Wang, Zirui Li, Ming-Ming Cheng, Guolei Sun

机构 * College of Computer Science, Nankai University(南开大学计算机学院) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出DCP-Prune框架,通过锚点-上下文图恢复和文本感知令牌聚类选择,在超低令牌预算下保持分布一致性,实现稳定高性能。

Comments The code will be released at: https://github.com/EMVision-NK/DCP-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16353 2026-06-16 cs.CV cs.AI 新提交 73%

What Should a Streaming Video Model Remember?

流式视频模型应该记住什么?

Haonan Ge, Yiwei Wang, Hang Wu, Yujun Cai

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of California, Merced(加州大学默塞德分校) The University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对流式视频理解中固定记忆预算下的长程历史利用问题,提出选择性潜在记忆框架SelectStream,通过惊喜驱动自适应窗口、优先级保持合并和查询条件图推理三个机制,实现高效在线推理,在多个基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交 73%

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏