arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2861 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 263 篇

2607.00465 2026-07-02 cs.CV cs.CL cs.LG 新提交 62%

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

StochasT:基于随机轮次深度的视觉指令微调学习

Yuan Qing, Chengzhi Mao, Boqing Gong

机构 * Boston University(波士顿大学) Rutgers University(罗格斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 62%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 62%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26891 2026-06-26 cs.CV cs.AI 新提交 62%

Bridging Vision and Language Concepts through Optimal Transport Semantic Flow

通过最优传输语义流桥接视觉与语言概念

Chenyang Zhang, Anqi Dong, Guangming Zhu, Nuoye Xiong, Siyuan Wang, Lin Mei, Liang Zhang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出最优传输流概念瓶颈模型(OTF-CBM),通过逆最优传输学习数据驱动的语义代价,并利用非平衡最优传输流匹配建模视觉块与文本概念间的语义转换,实现可解释的几何关系捕获,提升分类精度与概念忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24759 2026-06-24 cs.CV cs.AI 新提交 62%

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom organization= SpaceTimeLab, Department of Civil, Environmental Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07558 2026-06-24 cs.CV cs.AI cs.DL 新提交 62%

Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing

基于百年跨度扫描文档档案微调的页面图像分类器,用于进一步的内容特定处理

Kateryna Lutsai, Dana Křivánková, Pavel Straňák, David Novák

机构 * Institute of Formal and Applied Linguistics, Charles University MFF(查尔斯大学数学与物理学院形式与应用语言学研究所) Institute of Archaeology, Czech Academy of Sciences(捷克科学院考古研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对历史文档数字化中手动分类不可行的问题,提出基于视觉内容类型(文本、表格、图形)的自动页面图像分类系统,采用微调深度网络(RegNetY-16GF达99.16%准确率)实现近完美分类,并公开模型、数据集和代码。

Comments 29 pages, 19 figures, 13 tables. arXiv admin note: text overlap with arXiv:2507.21114

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21419 2026-06-23 cs.CV cs.AI 新提交 62%

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

MIRCaps: 一个大规模混合域数据集,包含图像级和区域级描述,用于细粒度视觉-语言学习

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

机构 * Changwon National University(昌原国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 为解决通用与监控视频领域的混合域图像-描述数据集匮乏问题,构建了包含14万图像、98万图像级描述、174万区域级描述和139万边界框的大规模数据集,通过互补描述类型帮助视觉语言模型学习细粒度视觉属性,并在图像描述和目标检测任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20477 2026-06-23 cs.CV cs.CL cs.LG 新提交 62%

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

面向放射学的空间定位2D视觉-语言模型的可扩展训练

Yusuf Salcan, Simon Ging, Robin Tibor Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany(德国弗莱堡大学计算机视觉组) Department of Radiology, Medical Center -- University of Freiburg, Germany(德国弗莱堡大学医学中心放射科) CRIION-AI Lab, Freiburg, Germany(德国弗莱堡CRIION-AI实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出RefRad2D大规模双语数据集,通过LLM和自动分割生成空间定位数据,训练RadGrounder模型联合完成报告生成、VQA和空间定位,在外部基准上取得竞争性结果。

Comments Accepted for MICCAI 2026. First two authors: equal contribution. Last two authors: equal supervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14703 2026-06-15 cs.CV cs.CL cs.LG 新提交 62%

Gaze Heads: How VLMs Look at What They Describe

注视头:视觉语言模型如何观察它们所描述的内容

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11889 2026-06-11 cs.CV cs.AI cs.RO 新提交 62%

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

面向自动驾驶危险检测的视觉-语言模型任务对齐稳定性分析

Everett Richards

机构 * Everett Richards(埃弗里特·里奇ards)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉-语言模型在自动驾驶危险检测中,嵌入漂移与任务对齐危险分数变化的关系,发现不同腐败类型导致不同的失效模式,建议基准测试包含任务对齐稳定性指标。

Comments 8 pages (5 main body + 3 references / appendices). ICML 2026 Workshop on Combining Theory and Benchmarks (CTB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09871 2026-06-10 cs.CV cs.AI cs.LG 新提交 62%

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

SD-GRPO:面向长格式视觉-语言生成的可验证片段分解

Hyunwoong Kim, Seongeun Lee, Hannah Yun, Junhyun Park, Jonggwon Park

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出SD-GRPO方法,通过将长格式输出分解为片段并计算逐片段优势,解决GRPO在视觉-语言任务中粗粒度信用分配不足的问题,实验证明其在多种长格式生成任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08894 2026-06-09 cs.CV cs.CL 新提交 62%

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

推理视觉语言模型对语义视觉干扰具有鲁棒性吗?

Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang, Ziyi Wang, Hao Li, Yang Cui, Wenhao Cai, Jingyu Sun, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Marex Imperial College London(帝国理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对推理VLM在真实场景中易受语义视觉干扰的问题,提出Distract-Bench基准,发现推理VLM对语义干扰的鲁棒性低于感知退化,且干扰常被纳入推理过程导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 62%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11933 2026-08-13 cs.CV 新提交 57%

Dual Anchors, Do It Better: Hierarchical Group Merging for Zero-Shot Anomaly Detection

双锚点,效果更佳:用于零样本异常检测的分层分组合并方法

Jimin Roh, DongKyu Kim, Suk-Ju Kang

机构 * Sogang University(西江大学) LG Electronics(LG电子) NAVER Cloud(NAVER云)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 针对现有CLIP-based零样本异常检测方法的局限,提出Dual-Anchor框架,结合分层图像锚点与文本锚点,在8个工业和6个医疗基准上实现了优异泛化性能。

Comments 10 pages, 5 figures, 4 tables. Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11474 2026-08-13 cs.CV 新提交 57%

Test-Time Hallucination Control in Large Vision-Language Models

大型视觉语言模型的测试时幻觉控制

Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani

机构 * Australian National University(澳大利亚国立大学) The University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) York University(约克大学) Lancaster University(兰卡斯特大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。

Comments Accepted at ECCV 2026 MUCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10959 2026-08-12 cs.CV cs.CR 新提交 57%

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

专题命中 图文多模态 :any-to-any(abstract);分类 cs.CV

AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10758 2026-08-12 cs.CV 新提交 57%

Where To Look? : Causal Tracing of Vision Encoders in VLM

看向何处?:视觉语言模型中视觉编码器的因果追踪

Naren Kumar S, Tirth Bhatt, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度甘地纳格尔印度理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究通过因果追踪方法,发现视觉语言模型的高因果性视觉标记常位于目标区域外,其强大多模态性能不代表存在空间定位因果表示,还揭示了视觉感知、利用与推理视觉结构的差距,提供了研究视觉信息处理的因果框架。

Comments 10 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07863 2026-08-11 cs.CV eess.IV 新提交 57%

LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

LHSDet:基于视觉问答的高分辨率AI生成图像检测方法

Qian Yao, Jun-Jie Huang, Yongjun Wang, Luming Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Academy of Military Science(军事科学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对现有AI生成图像检测方法忽略高分辨率细节、难以应对未知生成模型的问题,提出LHSDet,将检测任务转为视觉问答,采用三分支架构,在各类生成模型上实现高检测准确率与稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-08-11 cs.CV 新提交 57%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交 57%

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交 57%

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 57%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 57%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02980 2026-08-05 cs.CV 新提交 57%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02790 2026-08-05 cs.CV 新提交 57%

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计

Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey Plis

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) TReNDS Center(TReNDS中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 57%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00239 2026-08-04 cs.CV 新提交 57%

Semantically Calibrated Evidence Composition for CT Vision-Language Learning

面向CT视觉-语言学习的语义校准证据组合

Guoliang You, Haifan Gong, Xiaomeng Chu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究针对CT视觉-语言学习中局部证据与全局上下文结合的问题,提出SCOPE框架,通过语义校准实现证据组合,在CT-RATE和RadChestCT数据集上的宏AUC优于现有SOTA。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00235 2026-08-04 cs.CV 新提交 57%

Attention-Steered Vision-Language Models for Sign Language Translation

用于手语翻译的注意力引导视觉-语言模型

Meibo Hu, Guohao Sun, Annemarie D. Ross, Sheng Li, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) University of Virginia(弗吉尼亚大学) National Technical Institute for the Deaf(国家聋人技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28967 2026-08-03 cs.CV cs.LG 新提交 57%

Visual Distribution Anchoring for Efficient Prompt Tuning

用于高效提示调优的视觉分布锚定

Pouya Parsa, Raoof Zare Moayedi, Seongjin Choi

机构 * University of Minnesota(明尼苏达大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出无需训练的VDA框架,用未标记目标池的类级视觉原型增强冻结语义分类器,在10次ImageNet到目标域迁移中显著提升多个视觉-语言模型性能,且与各类分类器互补。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏