arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-30 至 2026-06-30 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 26 篇

2606.28570 2026-06-30 cs.CV cs.AI cs.MA 86%

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG

数字化教练智能:基于VLM和RAG的整体运动员画像智能体框架

Deep Ghosal, Ishani Sen, Wazib Ansar, Amlan Chakrabarti

机构 * A.K. Choudhury School of Information Technology University of Calcutta(A.K.楚德里信息科技学院印度加尔各答大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出基于LLM的混合智能体框架,结合计算机视觉与视觉语言模型,通过3×3智能网格分块策略降低计算开销,并引入LLM-as-a-Judge自校正循环和双持久化RAG管道,实现符合印度体育局标准的自动化整体运动员评估。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28719 2026-06-30 cs.AI 84%

ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models

ComMem:视觉语言模型测试时自适应的互补记忆系统

Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.AI

AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。

Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06728 2026-06-30 cs.CV 83%

Multimodal Large Language Model driven Radiology Report Generation with Clinical Knowledge Enhancement

基于多模态大语言模型的放射科报告生成与临床知识增强

Miaojing Shi, Tianyu Cen, Zijie Yue, Meng Wei, Oluwatosin Alabi, Tom Vercauteren

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种融合多模态大语言模型与临床知识的放射科报告生成方法,通过解剖学特征提取、多模态报告生成及多任务学习提升报告的临床相关性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL 81%

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29350 2026-06-30 cs.CV cs.AI 79%

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合

Junzhou Chen, Jindong Wang, Gang Zhou

机构 * Department of Computer Science(计算机科学系) Department of Data Science(数据科学系) William & Mary(威廉玛丽学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29028 2026-06-30 cs.RO 75%

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

关键姿态探索:高效的自动轨迹标注与跨实体策略迁移

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。

Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28344 2026-06-30 cs.IR cs.AI cs.CL cs.CV cs.LG 75%

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PIXELRAG:网页截图在检索增强生成中优于文本

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。

Comments Our code is available at https://github.com/StarTrail-org/PixelRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12175 2026-06-30 cs.CV 70%

Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment

重新定义质量标准与距离感知评分建模用于图像编辑评估

Xinjie Zhang, Qiang Li, Xiaowen Ma, Axi Niu, Li Yan, Qingsen Yan

机构 * Northwestern Polytechnical University(西北工业大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29357 2026-06-30 cs.CV cs.AI cs.LG 67%

Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

利用视觉语言模型动态解析和更新自然语言规范以实现鲁棒的视觉语言跟踪

Xiao Wang, Liye Jin, Dan Xu, Yuehang Li, Lan Chen, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Peng Cheng Laboratory, Shenzhen(鹏城实验室深圳分部) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出语言依赖解析机制提取跟踪核心成分,并利用Qwen-VL进行成分感知的文本更新,在多个基准上取得一致优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29577 2026-06-30 cs.CV cs.AI 62%

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ShanghaiTech University, Shanghai, P.R.China(上海科技大学) University of California, Berkeley, USA(加州大学伯克利分校) University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 62%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL 62%

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05386 2026-06-30 cs.LG cs.AI cs.CL 62%

Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

强化微调自然缓解持续训练中的遗忘

Song Lai, Haohan Zhao, Rong Feng, Changyi Ma, Wenzhuo Liu, Hongbo Zhao, Xi Lin, Dong Yi, Qingfu Zhang, Hongbin Liu, Gaofeng Meng, Fei Zhu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了监督微调与强化微调在持续训练中的影响,发现强化微调能有效保留先验知识,优于监督微调和多任务训练,且在标准基准上提升模型通用知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17504 2026-06-30 cs.CV cs.AI 62%

InsertAnywhere: Geometrically Grounded and Optics-Aware Video Object Insertion

InsertAnywhere:基于几何和光学的视频物体插入

Hoiyeong Jin, Hyojin Jang, Junha Hyung, Jeongho Kim, Kinam Kim, Dongjin Kim, Huijin Choi, Hyeonji Kim, Jaegul Choo

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出InsertAnywhere框架,通过4D感知遮罩生成模块实现几何准确的物体放置,并引入光学感知表示对齐策略生成逼真光学效果,结合开放的ROSE++数据集提升复杂场景下的视频物体插入效果。

Comments 16 pages, project page: https://myyzzzoooo.github.io/InsertAnywhere/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30244 2026-06-30 cs.CV 57%

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

语义驱动的尺度与空间选择实现指代遥感图像分割中的高效跨模态对齐

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

机构 * University of Liverpool, UK(利物浦大学) University of Michigan, USA(密歇根大学) University of Twente, NL(埃因霍温理工大学) University of Bath, UK(巴斯大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 提出S4ECA框架,通过参数高效微调的双编码器适配器架构,利用语言引导的尺度与空间选择机制实现跨模态对齐,仅更新2.4%骨干参数即在RRSIS-D和RefSegRS数据集上达到最优性能。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29788 2026-06-30 cs.LG 57%

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

MemLeak: 诊断多模态智能体记忆中的信息泄露

Kuan Wang, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.LG

AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。

Comments 23 pages, 3 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29462 2026-06-30 cs.CV 57%

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

MIRROR: 通过Gromov-Wasserstein对齐从语言到图像的语义关系

Hong-Han Wang, Yuntao Wang, Hu Ding

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出MIRROR框架,通过半逆Gromov-Wasserstein问题将语言中的关系先验几何对齐到视觉表示,提升多模态大模型的关系一致性,无需额外参数或推理成本。

Comments Accepted to ECCV 2026. 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29208 2026-06-30 cs.CV 57%

Zero-Gated Language-conditioned Human Motion Prediction

零门控语言条件人体运动预测

Guanhui Qiao, Lu Zhou, Ding Jiang, Jinqiao Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出ZGL模型,通过零初始化的可学习门控将语言描述作为语义先验注入基于DCT的时空Transformer,在Human3.6M和CMU Mocap上提升运动预测精度。

Comments 5 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15632 2026-06-30 cs.CV 57%

A New Method to Capturing Compositional Knowledge in Linguistic Space

一种在语言空间中捕获组合知识的新方法

Jiahe Wan

机构 * School of Computer Science(计算机科学学院) South-Central Minzu University(西南民族大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 提出YUKINO方法,通过文本反转和“no”逻辑正则化,在无需硬负样本的情况下提升视觉语言模型的组合理解能力,在SugarCREPE基准上超越现有多模态SOTA模型8%以上。

Journal ref Neurocomputing, 2026: 133150

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 57%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06891 2026-06-30 cs.CV 57%

CLIMP: Contrastive Language-Image Mamba Pretraining

CLIMP:对比语言-图像Mamba预训练

Nimrod Shabtay, Itamar Zimerman, Eli Schwartz, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIMP是首个全Mamba架构的对比视觉语言模型,通过Mamba替代视觉和文本编码器,提升跨模态检索和鲁棒性,优于CLIP-ViT-B 7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16413 2026-06-30 cs.CV 57%

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM: 使大语言模型能够理解边界表示

Liyuan Deng, Hao Guo, Yongkang Dai, Yunpeng Bai, Yifan Zhu, Yuanyuan Gao, Huaxi Huang, Yilei Shi

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 BrepLLM通过双阶段训练管道,将B-rep数据转化为图表示并进行语义对齐,实现3D语言生成,展示了在3D物体分类和描述任务中的最佳性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08774 2026-06-30 cs.IR cs.AI 57%

Multimodal Representation Alignment for Cross-modal Information Retrieval

多模态表示对齐用于跨模态信息检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文研究多模态表示对齐对跨模态检索的影响,通过对比不同度量标准和嵌入空间,发现余弦相似度在对齐任务中表现最佳,同时 Wasserstein 距离提供了分布差异的补充视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30518 2026-06-30 cs.CL 50%

Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts

基于体制感知的同行专业化方法,用于在异构知识冲突下实现稳健的检索增强生成

Bo Wang, Heyan Huang, Yaolin Li, Yanghao Zhou, Jiahao Teng, Ziyi Yang, Ge Shi, Chong Feng

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出RAPS-DA框架,通过样本级三体制划分(接地、仲裁、抵抗)和token级双选择器,解决RAG中异构知识冲突问题,在固定模型规模下超越多种基线。

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30093 2026-06-30 cs.CL cs.IR 50%

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

基于Token共现图的高效检索增强生成

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

机构 * Università Politecnica delle Marche(波尔蒂纳拉理工大学) Università di Modena e Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出TIGRAG框架,利用滑动窗口共现统计构建Token共现知识图谱,结合图语义扩展和神经重排序实现多跳推理,在三个QA基准上优于稠密检索和图RAG方法,同时降低索引和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29660 2026-06-30 physics.hist-ph astro-ph.CO hep-ph hep-th 50%

What Naturalness Measures: Fine-Tuning and Informational Invariants in Cosmology and Dark Matter

自然性衡量什么:宇宙学和暗物质中的微调与信息不变量

Stefano Profumo

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文论证自然性不是客观概率或审美偏好,而是参数到可观测量映射的普适类,构成信息不变量;通过引力与暗物质候选者分析,展示微调追踪丰度映射的解析结构而非候选者性质。

Comments Follows companion papers 2606.21586 (Cosmology as Representation: Informational Invariance and the Limits of Scientific Realism) and 2606.12775 (Are Primordial Black Holes a Natural Dark Matter Candidate?). Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏