arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 511 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 511 篇

2608.02446 2026-08-04 cs.IR cs.LG 新提交 87%

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

利用视觉语言模型推进Web规模搜索的相关性测量

Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title);分类 cs.LG

AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。

Comments RecSys'26 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26536 2026-07-30 cs.CV 新提交 87%

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models

TPCD:音调-压力对比解码与视觉语言模型中的无标签门控瓶颈

Jinkun Zhao, Kui Zhang, Wenjun Wu

机构 * Beihang University(北京航空航天大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出TPCD方法,利用压力诱导分布作为对比解码负分支,结合门控缓解视觉语言模型受高压提示时的不合理承诺问题,在多个基准测试中显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23913 2026-07-28 cs.AI 新提交 87%

GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models

GOTS:用于高分辨率视觉语言模型的贪婪正交令牌选择

Jun Ling, Tao Huang, Junzhuo Liu, Bowen Tang, Peng Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);InternVL(abstract);分类 cs.AI

AI总结 研究高分辨率视觉语言模型中令牌减少问题。提出GOTS方法,通过所选跨度互补性,无训练且与查询无关,每步选正交最大剩余能量令牌。在多主干和基准测试中性能优,还减少模型端首次令牌时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15689 2026-07-20 cs.CV 新提交 87%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06552 2026-07-08 cs.CV 新提交 87%

MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation

MonoIR-RS:基于CLIP和VLM适配的红外遥感视觉语言学习

Jiaju Han, Ma Yaqi, Yahui Chai, Xuemeng Sun, Xin Li, Qike Zhang, Yingying Zhao, Xiang Chen, Luwei Yang, Chengyin Hu, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Guizhou University(贵州大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV

AI总结 研究针对红外视觉语言理解未充分探索的问题,提出MonoIR-RS数据集及基准,结合多种方法构建并微调模型,提升红外遥感视觉语言学习性能,为红外与语言对齐提供可控测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25162 2026-06-25 cs.RO cs.CV cs.HC 新提交 87%

fARfetch: Enabling Collocated AR-HRC in Large Visually Diverse Environments with VLM-Driven AR Content Adaptation

fARfetch: 利用VLM驱动的AR内容适配实现大型视觉多样环境中的协同人机协作

Christian Fronk, Hanting Ye, David Hunt, Miroslav Pajic, Maria Gorlatova

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV

AI总结 提出fARfetch系统,通过共享语义环境映射、上下文微缩世界表示和VLM驱动的AR视图管理,在大型室外环境中保持AR内容可读性,实验表明任务完成时间减少66%,工作负荷显著降低。

Comments Accepted to the 2026 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN). Author accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 87%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13041 2026-06-12 cs.CV cs.GR cs.MM 新提交 87%

SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing

SeamEdit: 一种用于大图像语义编辑的黑盒VLM无关流水线

Xiangyu Lyu, Dan Lei

机构 * Technische Universität Darmstadt(达姆施塔特工业大学) Fine-Arts Educator, Yuncheng Middle School(运城中学美术教师)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.CV

AI总结 提出SeamEdit,一种无需训练、模型无关的流水线,通过五阶段后处理解决大图像分块编辑中的语义变形、对齐漂移和接缝伪影问题,实现高质量语义编辑。

Comments 19 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08169 2026-06-09 cs.RO cs.AI cs.CL cs.HC cs.LG 新提交 87%

CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning

CLASP: 基于语言驱动的机器人技能选择与组合,采用任务参数化学习

Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR),机器人与机电一体化研究所(RMC)) Technical University of Munich (TUM)(慕尼黑工业大学(TUM))

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出CLASP架构,结合任务参数化核化运动基元(TP-KMP)与预训练视觉语言模型(VLM),通过自然语言命令实现技能选择、组合和主动学习,无需微调,在7自由度机械臂上达到73.3%-100%成功率。

Comments 23 pages, 11 figues, 4 tables, 1 listing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18710 2026-06-18 cs.CR 新提交 87%

Image Prompt Reconstruction Attacks on Distributed MLLM Inference Frameworks

分布式多模态大模型推理框架上的图像提示重建攻击

Xinjian Luo, Hongyan Chang, Jianxin Wei, Yuncheng Wu, Xiaofeng Gao, Meikang Qiu, Ting Yu, Xue Liu

专题命中 VLM训练与架构 :MLLM(title,summary_cn)

AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09131 2026-06-09 cs.AI cs.CL cs.CV cs.LG 新提交 87%

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由

Siyuan Liu, Jinyang Wu

机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。

Comments 18 pages, 4 figures. Submitted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08622 2026-08-11 cs.CV 新提交 86%

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

VADER:用于视频大语言模型幻觉缓解的自适应去偏方法

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本研究针对视频大语言模型的幻觉问题,提出无训练自适应去偏框架VADER,通过视觉焦点重分配与选择性证据擦除模块结合对比解码,在LLaVA-Video-7B等模型的EventHallusion任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29412 2026-08-03 cs.CV 新提交 86%

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs

注意力头中的角色断裂:理解和检测视觉语言模型中的幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Nan Duan, Tong Jia, Chaoran Luo, Ying Li

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出注意力头的角色断裂现象,构建无需微调的轻量级线性检测器,在6个VLMs和4个基准上平均AUROC达93.23,可检测VLM幻觉并支持干预操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24470 2026-06-24 cs.AI 新提交 86%

The Latent Bridge: A Continuous Slow-Fast Channel for Real-Time Game Agents

潜在桥:用于实时游戏智能体的连续慢-快通道

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 针对实时游戏智能体,提出一种可学习的连续潜在桥(Latent Bridge),将慢速推理VLM的残差投影到快速反应VLM的输入嵌入空间,在7个Atari游戏和驾驶域中匹配或超越文本桥,且增益高度可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 86%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments this https URL (https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 86%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03875 2026-08-05 cs.LG cs.AI 新提交 86%

Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning

通过结构感知微调增强视觉语言模型奖励模型

Pyrros Koussios, Chenhao Li, Xin Chen, Andreas Krause

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出结构感知微调(SAFT)方法,利用LoRA适配器和内在结构先验优化视觉语言模型奖励信号,实现更快策略收敛与更好对齐,为稳定文本条件强化学习提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00035 2026-08-04 cs.AI cs.CV 新提交 86%

Linguistic Context Recodes Visual Representations in Vision-Language Models

语言上下文对视觉语言模型中的视觉表示进行重编码

Brian Song, Michael A. Lepori, Ellie Pavlick

机构 * Brown University(布朗大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究揭示视觉语言模型中语言上下文会重编码视觉表示,通过对比引导向量和属性调制两种机制,为跨模态动态处理提供了因果证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14125 2026-07-17 cs.LG cs.CV 新提交 86%

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models

CARPRT:用于黑盒视觉语言模型的类感知零样本提示重加权

Ruijiang Dong, Zesheng Ye, Jianzhong Qi, Lei Feng, Feng Liu, Gang Niu, Masashi Sugiyama

机构 * University of Melbourne(墨尔本大学) Southeast University(东南大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) The University of Tokyo(东京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 研究针对预训练视觉语言模型零样本图像分类中提示与类独立性假设不成立的问题,提出类感知零样本提示重加权方法CARPRT,通过无训练方式量化提示与类的相关性并调整权重,实验表明该方法优于现有方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15880 2026-06-16 cs.CV cs.AI 新提交 86%

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

深度残差注入:多模态大语言模型的全频谱取证信号感知

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Ke-Yue Zhang, Yue Zhou, Caiyong Piao, Bin Li, Taiping Yao, Bo Wang, Youchang Xiao, Shouhong Ding

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在取证中难以同时保留语义知识和捕获低级生成器伪影的问题,提出Deep-VRM方法,通过将伪影特定视觉信号作为残差路径注入中间层,实现全频谱信号感知,达到鲁棒检测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06853 2026-06-08 cs.CV cs.AI 新提交 86%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10066 2026-06-10 cs.CV cs.AI cs.LG 新提交 86%

A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

公共医学视觉语言基准中预训练污染的受控审计

Bruce Changlong Xu, Lan Wu, Alexander Ryu

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Mayo Clinic(梅奥诊所)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 审计发现公共医学VLM基准存在图像源重叠和文本规范顺序交换性信号,但确认的像素级重复罕见,且现有成员推理检测器在小规模医学VLM队列中不可靠。

Comments 30 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 85%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交 85%

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27910 2026-07-31 cs.AI 新提交 85%

A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models

跨架构视觉语言模型中基于方向的推理时防御措施审计

Xiangyu Yin, Tora Bodin, Rohan Menon, Chih-Hong Cheng

专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26554 2026-07-30 cs.CV 新提交 85%

MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

MedARC:面向3D医学视觉-语言模型的无训练视觉令牌自适应冗余压缩

Yitao Zhu, Mengjun Liu, Yingji Fu, Haowen Pang, Anqi Qiu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对3D医学VLMs的视觉令牌冗余压缩问题,本文提出无训练框架MedARC,整合三类线索估计令牌重要性,通过显著性感知合并策略压缩令牌,在CT-RATE和MR-RATE上实现性能保持的同时降低开销。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 85%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31719 2026-07-01 cs.CL cs.AI 新提交 85%

Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

Nan Li, Albert Gatt, Massimo Poesio

机构 * Utrecht University(乌得勒支大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.AI

AI总结 研究视觉-语言模型在对话中是否混淆潜在共享与已共享信息,发现模型过度依赖地图内容预测对齐,忽视对话历史中的基础建立过程。

Comments 17 pages, 9 figures, 8 tables; accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08420 2026-06-26 cs.CV 新提交 85%

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs

CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模

Sergios Gatidis, Curtis Langlotz, Christian Bluethgen

机构 * Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心) Department of Radiology, Stanford University(斯坦福大学放射学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出CheXanatomy框架,通过自回归令牌空间监督将解剖知识融入预训练视觉-语言模型,实现解剖分割,在合成和真实X光片上性能媲美U-Net,并提升域迁移鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23087 2026-06-23 cs.LG 新提交 85%

FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models

FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练

Zhida Jiang, Zhaolong Xing, Yang Pei, Xiaolong Chen, Yuanhang Xiao, Chengzhi Huang, Xiyu Liu, Haopeng Liu, Qingyuan Sang, Lingfeng Zhou, Jiaxing Wang, Zicheng Zhang, Wenzhe Wang, Xinyu Liu, Yan Li, Zhen Chen, Ke Zhang

机构 * Huawei(华为)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏