arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-25 至 2026-05-25 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 10 篇

2601.21692 2026-05-25 cs.AI 91%

TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning

TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析

Mingzu Liu, Hao Fang, Runmin Cong

机构 * School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国) Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 针对微调即服务中的后门攻击,提出基于三组件注意力分布差异的无监督防御框架TCAP,通过高斯混合模型和EM投票聚合检测中毒样本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11146 2026-05-25 cs.CV cs.AI 88%

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

超越基于VLM的奖励:扩散原生潜在奖励建模

Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

机构 * The Hong Kong University of Science Huawei Hong Kong AI Framework \& Data Technologies Lab Tsinghua University The Australian National University

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。

Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI 79%

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02780 2026-05-25 cs.AI cs.LG 79%

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu

机构 * Department of Computer Science, Western University, London, Canada(加拿大伦敦西方大学计算机科学系) Department of Biochemistry, Western University, London, Canada(加拿大伦敦西方大学生物化学系)

专题命中 VLM训练与架构 :grounding(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出Cuttlefish,一种统一多模态大语言模型,通过缩放感知适配器和几何基础适配器,自适应调整结构令牌数量并注入几何线索,以提升异构结构推理性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23254 2026-05-25 cs.CV 77%

CARE: Class-Adaptive Expert Consensus for Reliable Learning with Long-Tailed Noisy Labels

CARE: 面向长尾噪声标签可靠学习的类别自适应专家共识

Mengke Li, Haiquan Ling, Lihao Chen, Yang Lu, Yiqun Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China.(深圳大学计算机科学与软件工程学院,中国深圳) Guangming Laboratory, Shenzhen, China.(深圳广明实验室,中国深圳) School of Informatics, Xiamen University, Xiamen, China.(厦门大学信息学院,中国厦门) School of Computer Science and Technology, Guangdong University of Technology, Guangzhou, China(广东工业大学计算机科学与技术学院,中国广州)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出CARE框架,利用视觉语言模型的三种互补监督源,通过类别自适应专家共识机制,根据类别频率对尾部类施加更严格的一致性、对头部类施加更宽松的一致性,以过滤不可靠信号并重新校准类别分布,从而在长尾噪声标签下实现可靠修正。

Comments poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05202 2026-05-25 cs.CV 77%

GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

GT-SVJ: 基于生成式Transformer的自监督视频评判器用于高效视频奖励建模

Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Inc.(Adobe公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出GT-SVJ,通过将视频生成模型重新用作能量模型,并利用对比目标训练,实现高效、时间感知的视频质量评估,在少量标注下达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21139 2026-05-25 cs.CV cs.LG 73%

Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving

蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习

Yang Wu, Qiang Meng, Zhaojiang Liu, Youquan Liu, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出CoPhy框架,通过蒸馏VLM知识到BEV编码器实现零推理成本的认知能力,并构建自回归BEV世界模型预测未来语义地图以提供可解释的物理沙盒,结合双奖励机制(物理奖励和安全约束、认知奖励和意图对齐)优化驾驶策略,在NAVSIM基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10016 2026-05-25 cs.CL 71%

Training-Free Multimodal Large Language Model Orchestration

免训练的多模态大语言模型编排

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 VLM训练与架构 :multimodal large language model(title)

AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 67%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22869 2026-05-25 cs.LG 57%

FuRA: Full-Rank Parameter-Efficient Fine-Tuning with Spectral Preconditioning

FuRA: 基于谱预条件的全秩参数高效微调

Yequan Zhao, Ruijie Zhang, Liyan Tan, Niall Moran, Tong Qin, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) Amazon Lab126(亚马逊实验室126)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.LG

AI总结 提出FuRA方法,通过块张量列车分解实现全秩谱预条件,在保持参数效率的同时提升微调性能,在LLM和VLM任务上优于全微调和LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏