arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5039 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5039 篇

2607.26596 2026-07-30 cs.CV cs.AI 新提交 79%

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 79%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19060 2026-07-28 cs.CV cs.LG 版本更新 79%

Shift-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment

用于微调CLIP的移位感知校准:利用图像-文本对齐

Song-Lin Lv, Yu-Yang Chen, Zhi Zhou, Lan-Zhe Guo

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20993 2026-07-24 cs.CV cs.AI 新提交 79%

Sparse Concept Channels in Frozen 3D CT Vision Encoders

冻结的3D CT视觉编码器中的稀疏概念通道

Farhad Nooralahzadeh, Lea Bogensperger, Christian Bluethgen, Michael Krauthammer

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究3D医学图像解释中视觉语言模型内部单元对临床发现的编码,提出无训练概念通道探测(CCP)方法,通过实验证明该方法能清晰表征冻结医学编码器对发现的表示,在临床疗效和NLG指标上表现优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07033 2026-07-24 cs.CV cs.AI 版本更新 79%

AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning

AnchorPrune:用于视觉令牌剪枝的相关性锚定上下文扩展

Kyuan Oh, Bumsoo Kim

机构 * Chung-Ang University(崇实大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对大型视觉语言模型推理成本高、视觉令牌冗余问题,提出无需训练的AnchorPrune框架,通过构建相关性锚点并扩展,自适应确定锚点大小,分配预算恢复上下文,提升了模型的准确率与效率,尤其在严重压缩下效果显著。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00462 2026-07-23 cs.CV cs.AI 版本更新 79%

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

LatentLens: 揭示大语言模型中高度可解释的视觉标记

Benno Krojer, Shravan Nayak, Oscar Mañas, Vaibhav Adlakha, Desmond Elliott, Siva Reddy, Marius Mosbach

机构 * University of Cambridge(剑桥大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。

Comments ICML 2026 (Camera Ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 79%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08839 2026-07-13 cs.CV cs.LG 新提交 79%

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

混合探针:通过探针在多模态大语言模型中从特权模态学习

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究多模态大语言模型在特权模态设置下的问题,提出混合探针(MoP)框架及MoP跨模态训练(MoP-X),通过结构化探测机制分离模态信号,经评估在多任务中优于基线,有效利用辅助模态训练可提升性能。

Comments Preprint (16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06522 2026-07-08 cs.AI cs.CV 新提交 79%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02484 2026-07-03 cs.CV cs.AI 新提交 79%

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

对抗文本噪声与冗余:熵感知的密集视觉令牌剪枝

Xuehui Wang, Xuankun Yang, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出熵感知密集剪枝(EADP)框架,通过熵过滤文本噪声并利用子模最大化选择令牌,在严格预算下保留细粒度视觉线索,提升VLM精度-效率权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新 79%

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31495 2026-07-01 cs.AI cs.LG 新提交 79%

Surprise as a Signal for Plasticity and Metacognition

惊喜作为可塑性和元认知的信号

Louis Mouchon

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出预测误差信号可作为可塑性门控和元认知基础,在冻结编码器上实现持续学习与视觉语言模型自适应,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29350 2026-06-30 cs.CV cs.AI 79%

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合

Junzhou Chen, Jindong Wang, Gang Zhou

机构 * Department of Computer Science(计算机科学系) Department of Data Science(数据科学系) William & Mary(威廉玛丽学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26794 2026-06-26 cs.CV cs.AI 新提交 79%

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新 79%

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10244 2026-06-26 cs.CV cs.LG 版本更新 79%

Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective

从自动标注视角解决半监督少样本学习

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A\&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出SWIFT方法,通过温度锐化softmax输出和分阶段训练,利用视觉语言模型和开放数据,在半监督少样本学习中显著提升性能,接近监督学习水平。

Comments Accepted to ECCV 2026. Website and code: https://tian1327.github.io/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新 79%

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);visual language model(abstract);分类 cs.CV、cs.AI

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18586 2026-06-18 cs.CV cs.AI 新提交 79%

APT: Atomic Physical Transitions for Causal Video-Language Understanding

APT: 用于因果视频语言理解的原子物理转变

Shang Wu, Haoran Lu, Songling Liu, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出原子物理转变(APT)作为视频中因果状态变化的显式表示,并构建混合来源数据集,通过APT-Tune微调方法使VLM学习物理转变而不遗忘事件级知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16799 2026-06-16 cs.CV cs.AI 新提交 79%

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

解耦语义与失真:面向AI生成图像质量评估的多尺度双流视觉-语言对齐

Zijie Meng

机构 * Zijie Meng(孟子杰)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MST-CLIPIQA多尺度双流框架,通过显式表示解耦实现层次化视觉-语言对齐,在五个基准上取得质量SRCC平均提升1.11%、图文对应SRCC提升2.35%的新SOTA结果。

Comments 11 pages, 2 figures Accepted by ICME2026(spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13288 2026-06-12 cs.CV cs.AI cs.CL 新提交 79%

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

跨模态掩码组合概念建模以增强视觉-语言组合性

Wei Li, Zhen Huang, Xinmei Tian

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室) Independent Researcher(独立研究员)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MACCO框架,通过掩码一个模态的组合概念并从另一模态完整上下文重建,增强视觉-语言模型的组合理解能力,在五个基准上显著提升。

Comments Accepted to ACL 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13024 2026-06-12 cs.LG cs.AI 新提交 79%

CausalMoE: A Billion-Scale Multimodal Foundation Model for Granger Causal Discovery with Pattern-Routed Heterogeneous Experts

CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现

Bo Liu, Di Dai, Jingwei Liu, Jiarui Jin, Xiaocheng Fang, Guangkun Nie, Hongyan Li, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出CausalMoE,一种十亿规模多模态格兰杰因果基础模型,通过模式路由混合异构专家解耦动态机制,结合因果自注意力与LLM/VLM先验,实现稀疏因果图恢复,在监督和少样本场景中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12809 2026-06-12 cs.AI cs.LG 新提交 79%

MLUBench: A Benchmark for Lifelong Unlearning Evaluation in MLLMs

MLUBench: 多模态大语言模型终身遗忘评估基准

He Li, Haoang Chi, Qizhou Wang, Yunxin Mao, Zhiheng Zhang, Jie Tan, Tongliang Liu, Wenjing Yang, Bo Han

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MLUBench基准,评估多模态大模型在连续遗忘请求下的性能,发现现有方法存在累积退化,并揭示多模态对齐保持的挑战,提出LUMoE方法缓解退化。

Comments 36 pages, accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03180 2026-06-03 cs.CV cs.CL cs.LG 79%

GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations

GLINT:面向细粒度放射学表征的稀疏门控视觉-语言对齐

Jonggwon Park, Seongeun Lee, Junhyun Park, Hannah Yun, Hyunwoong Kim, Sohyun Jeong, Hyewon Kang, Byungmu Yoon, Kyoyun Choi

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对放射学图像-报告全局对齐与局部病灶尺度不匹配的问题,提出GLINT框架,通过稀疏门控对齐和密集特征正则化实现零样本分类、定位和分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01710 2026-06-02 cs.CV cs.LG 79%

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

零样本VLM中虚假相关性的密度感知转换

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Victoria, Australia(计算与信息系统学院,墨尔本大学,维多利亚,澳大利亚)

专题命中 VLM训练与架构 :VLM(title_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出密度感知转换(DAT)方法,利用局部几何密度项修正图像-文本相似度,以缓解CLIP等视觉语言模型在零样本分类中因虚假相关性导致的性能下降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01503 2026-06-02 cs.CV cs.AI cs.CL 79%

On the Limits of Token Reduction for Efficient Unified Vision Language Training

论高效统一视觉语言训练中令牌缩减的极限

Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

机构 * University of Michigan(密歇根大学) Sony AI(索尼人工智能)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过分析层注意力分配,发现视觉理解与视觉生成在令牌冗余上存在不对称性,设计任务特定加速器,但统一训练中任务特定令牌丢弃导致协同损失,表明高效统一建模需保留共享跨任务结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00390 2026-06-02 cs.CV cs.AI 79%

Zamba2-VL Technical Report

Zamba2-VL 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出基于混合架构Zamba2的视觉语言模型Zamba2-VL,在图像理解等基准上媲美Transformer模型,且首次令牌延迟降低约一个数量级。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12824 2026-05-28 cs.IR cs.CV cs.LG 79%

NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval

NanoVDR:将20亿参数的视觉语言检索器蒸馏为7000万参数的纯文本编码器用于视觉文档检索

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 利用查询-文档不对称性,通过蒸馏将20亿参数的视觉语言模型教师蒸馏为7000万参数的纯文本学生编码器,采用点态余弦对齐目标,实现视觉文档检索的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI 79%

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26110 2026-05-26 cs.LG cs.CL cs.CV 79%

Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning

Prism:面向可扩展多模态持续指令微调的插件式可复现基础设施

Jun-Tao Tang, Yu-Cheng Shi, Zhen-Hao Xie, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 针对多模态持续指令微调中工程瓶颈问题,提出Prism插件式代码库,通过轻量级插件注册机制分离算法开发与骨干实现,支持大规模训练流水线,实现可复现、可扩展的实验。

Comments Code is available at https://github.com/LAMDA-CL/Prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI 79%

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏