arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 511 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 511 篇

2607.23052 2026-07-28 cs.CV cs.CL cs.LG 新提交 82%

Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

相似性并非逻辑:双编码器视觉语言模型的因式推理

Sultan Alshehri, Zhantao Yang, Han Zhang, Marios Savvides

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG;VLM(comments)

AI总结 研究双编码器视觉语言模型组合约束失效问题,提出因式推理,将证据提取与约束执行分离,引入LCSE方法,在FACTOR-Bench上实验,提升了准确率并保持检索性能。

Comments Accepted at ICML 2026. 18 pages, 8 figures. Project page: https://sultanmo.github.io/factored-vlm Code and benchmark: https://github.com/SultanMo/factored-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10567 2026-08-12 cs.AI 新提交 81%

DashArena: Benchmarking LLMs on Interactive Analytic Dashboard Generation

DashArena:面向交互式分析仪表板生成的大语言模型基准测试

Xiaotong Wang, Dazhen Deng

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05780 2026-08-07 cs.CV 新提交 81%

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

用于高效长视频理解的证据驱动型动态视觉选择器

Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出基于目标MLLM内部注意力证据的动态视觉选择框架EviSelect,通过GRPO优化的随机策略实现高效长视频理解,在三个基准上性能更优,视觉token减少约50%、端到端加速3.9倍。

Comments Project Page: https://zhangbo135.github.io/EviSelect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03083 2026-08-05 cs.CV cs.CL 新提交 81%

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

GSTEP:面向高效视频大语言模型的全局时空密度驱动视觉令牌剪枝

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV

AI总结 本文提出即插即用的GSTEP剪枝框架,解决现有视频令牌剪枝方法的局部剪枝缺陷,在多个VideoLLMs上实现良好的准确率-效率权衡,在LLaVA-OneVision-7B上剪去75%视觉令牌,保留100.2%原始性能并获1.17倍端到端加速。

Comments 4 figures, accepted to ACM MM 26'

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28516 2026-07-31 cs.CV 新提交 81%

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

超越帧选择:用于长视频理解的生成式潜在证据聚合

Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) Baidu Inc.(百度公司) Alibaba Group(阿里巴巴集团) Xidian University(西安电子科技大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27959 2026-07-31 cs.CV cs.IR 新提交 81%

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索

Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。

Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27616 2026-07-31 cs.CV 新提交 81%

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

MPIE-Bench:解剖学上合理的多人交互编辑基准测试

Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(元石科技)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究针对多人交互编辑的解剖学与几何错误问题,构建了MPIE-Bench基准,提出MPIE-Eval评估方法,发现现有编辑模型在两个维度表现不均衡,且其评估比VLM清单更贴合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14189 2026-07-17 cs.CV cs.SD 新提交 81%

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

MultiRef-Compass:迈向多参考到音频-视频生成的综合评估

Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10172 2026-07-14 cs.RO cs.LG 新提交 81%

On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation

工业机器人操作中视觉语言动作模型的LoRA微调效率研究

Finn Ferchau, Daniel Pommer, Cristian Axenie

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学) Siemens AG(西门子股份公司) Fraunhofer Institute for Integrated Circuits (IIS)(弗劳恩霍夫集成电路研究所)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.LG

AI总结 研究工业机器人操作中VLA模型的LoRA微调效率,通过在四个精密装配任务上评估,发现特定LoRA配置不比FFT差,r = 32时性能饱和,均匀分配即可,冻结VLM等会降性能,该方法可减少VRAM且无性能损失。

Comments 12 pages, 5 figures, 3 tables. Accepted at the International Conference on Artificial Neural Networks (ICANN 2026); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02158 2026-07-03 cs.CV 新提交 81%

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

面向资源受限消费级GPU的视觉模型与VLM的高效PEFT方法及自适应检查点技术

Altay Toktassyn, Jurn-Gyu Park

机构 * Department of Computer Science, Nazarbayev University(计算机科学系,纳扎尔拜耶夫大学)

专题命中 VLM训练与架构 :VLM(title_cn,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 本文在2GB VRAM限制下,比较了五种PEFT方法在Transformer和Mamba视觉骨干上的表现,并提出了自适应梯度检查点算法,在CIFAR-100和DTD上评估了准确率、训练时间、能耗及多目标指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24253 2026-06-29 cs.CV 新提交 81%

TuringViT: Making SOTA Vision Transformers Accessible to All

TuringViT:让最先进的视觉Transformer人人可用

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25658 2026-06-25 cs.CV 新提交 81%

Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding

面向高效流式视频理解的动态固定预算记忆库

Baiyang Song, Yuli Lin, Qiong Wu, Tao Chen, Jun Peng, Xiao Chen, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出无训练方法CausalMem,通过在线语义基动态更新记忆库,在有限预算下最大化流式视频信息量,实现20倍视觉令牌压缩和82MB存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 81%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24740 2026-06-24 cs.CV 新提交 81%

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR: 面向生物医学视觉重编程的混淆感知提示专家混合模型

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院) Zhejiang University(浙江大学) Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Science Tokyo(东京科学大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出BioMedVR框架,通过可学习的VR模块实现预训练VLM在生物医学图像上的少样本适应,利用混淆最小化机制和提示专家混合模型解决细粒度分类中的类间混淆问题,在18个数据集上验证了优越性能。

Comments Accepted at ECCV 2026. 19 pages, 6 figures. Project page: https://jxliu-ai.github.io/biomedvr-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24051 2026-06-24 cs.CV 新提交 81%

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA: 基于BEV的DeepStack视觉-语言-动作模型的渲染-教师对齐

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

机构 * Zhejiang University(浙江大学) The 2012 Labs, Huawei(华为2012实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出DriveStack-VLA框架,通过DeepStack连接注入BEV表示并采用渲染-教师对齐增强空间感知,引入自批评模块优化轨迹选择,在多个驾驶基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18553 2026-06-18 cs.CV 新提交 81%

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning

基于知识的分层多模态检索用于新闻图像描述生成

Minh-Loi Nguyen, Xuan-Vu Le, Long-Bao Nguyen, Hoang-Bach Ngo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市分校理学院) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市分校)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出分层多模态文章检索增强的图像描述框架,通过结构感知检索和上下文精炼,结合VLM和LLM生成富含上下文细节的描述,在EVENTA 2025挑战赛中获得第5名。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 81%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04496 2026-08-06 cs.CV cs.LG 新提交 81%

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

DIVE:面向高效视觉-语言模型的动态迭代视觉证据构建

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究针对视觉-语言模型中视觉token导致的推理瓶颈,提出无需训练的DIVE框架,通过动态迭代构建视觉证据,在减少88.9%视觉token的同时保留98.2%的平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01821 2026-08-04 cs.CV cs.LG 新提交 81%

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

DAVET:面向扩散视觉-语言模型的降噪感知视觉证据轨迹分配

Yongkang Zhou, Xiang Xia, Cheng Yan, Fan Xu, Wuyang Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 DAVET 是一种无需训练的框架,通过根据扩散视觉-语言模型的生成状态自适应分配视觉证据,实现平均 1.55 倍加速且仅 1.86% 的平均性能下降,降低了视觉条件成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01644 2026-08-04 cs.CV cs.AI 新提交 81%

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法

Yu Chen, Xiaohong Li, Xiaole Wang, Jianjin Zhang, Jun Sun, Yafeng Deng

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04593 2026-07-07 cs.CV cs.AI 新提交 81%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02995 2026-07-07 cs.CV cs.AI 新提交 81%

VISTA: Auditing Semantic Divergence in Vision-Language Models

VISTA:视觉语言模型中的语义差异审计

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中视觉概念条件性差异,提出VISTA黑箱跨模型审计方法,结合语义熵与基于分布的差异标记异常,通过实验验证其有效性并发现新差异模式。

Comments Preprint. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02819 2026-07-07 cs.CR cs.AI cs.CV 新提交 81%

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

对大型视觉语言模型云边缘推理的视觉令牌操纵攻击

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

机构 * Department of Computer Science and Engineering, University of Nevada, Reno(内华达大学里诺分校计算机科学与工程系) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究黑盒中间人设置下的视觉令牌操纵攻击,提出四种简答攻击策略和基于优化的令牌选择方法,实验表明操纵少量视觉令牌可大幅降低大型视觉语言模型云边缘推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10797 2026-07-14 cs.CV 新提交 80%

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

用于从视频理解复杂装配动作的组合上下文微调视觉语言模型

Hao Zheng, Jinyi Huang, Tiantian Zheng, Xun Xu, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) The University of Auckland(奥克兰大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;vision language model(comments)

AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。

Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05949 2026-08-07 cs.AI cs.CV cs.LG 新提交 80%

VLMs for Videogame Data Annotation

用于视频游戏数据标注的视觉语言模型(VLMs)

Katrin Schmid, Iuri Frosio

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对VLMs在视频游戏应用受限的问题,探究其用于游戏帧序列奖励信号标注的可行性,分析其在游戏问答中的不足并提出应对措施,还研究了输入参数对标注质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 80%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10666 2026-07-14 cs.CV cond-mat.mtrl-sci cs.AI cs.LG 新提交 80%

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏

Shubham Rao

机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。

Comments 11 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 80%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交 80%

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 80%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏