arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2607.17770 2026-07-21 cs.CV cs.AI cs.LG 新提交 67%

Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence

通过潜在激活一致性测量稀疏自编码器中的单语义性

Katarzyna Filus, Sebastian Pokuciński

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对可解释人工智能中评估稀疏自编码器单语义性的挑战,提出无标签的Tversky单语义性分数(TMS),通过激活集一致性衡量。在多种模型和设置下评估,结果显示TMS受编码器各向异性影响小,能揭示训练动态,还能体现概念删除有效性。

Comments This is a preprint version. A shorter version of this paper has been accepted for presentation and publication in the post-workshop proceedings of the 8th International Workshop on eXplainable Knowledge Discovery in Data Mining (XKDD 2026), co-located with ECML PKDD 2026. The appendix is included only in this preprint and is not part of the peer-reviewed proceedings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 67%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 67%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09365 2026-07-13 cs.RO 新提交 67%

PhysV2A: Reachability-Gated and Semantic-Mask-Constrained Feasibility Completion for Video-to-Robot Manipulation

PhysV2A:用于视频到机器人操作的可达性门控和语义掩码约束的可行性完成

Haohui Huang, Junda Duan, Tao Teng, Chenguang Yang

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) University of Liverpool(利物浦大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 研究如何将视频衍生的6D对象运动转换为机器人可执行轨迹,提出PhysV2A框架,通过可达性门控选择和语义掩码约束细化可操作性,经真实机器人实验验证,该框架能提升任务成功率、减少运动可行性失败并产生更好轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交 67%

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05883 2026-07-08 cs.RO 新提交 67%

DexTele: A Dual-Arm Dexterous Teleoperation System Based on Motion Retargeting and Adaptive Force Control

DexTele:一种基于运动重定向和自适应力控制的双臂灵巧遥操作系统

Yuanchuan Lai, Qing Gao, Ziyan Liang, Xianfeng Cheng, Junjie Hu, Zhaojie Ju

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) School of Computing, University of Portsmouth(计算学院,朴茨茅斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 研究针对双臂灵巧遥操作中运动重定向和抓取的挑战,提出DexTele系统,通过视觉运动重定向模块和自适应抓取模块,结合运动图编码器、视觉语言模型等技术,实现多平台精确运动重定向与柔顺抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00423 2026-07-02 cs.CL 新提交 67%

Selective Test-Time Debiasing for CLIP via Reward Gating

通过奖励门控实现CLIP的选择性测试时去偏

Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract_cn)

AI总结 提出基于强化学习的测试时自适应框架RG-TTA,根据输入对偏见的敏感性选择性应用去偏,在减少偏见的同时保持零样本性能。

Comments 15 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31909 2026-07-01 cs.RO 新提交 67%

CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations

CoDex: 无需演示学习组合式灵巧功能性操作

Bowen Jiang, William Painter Reger, Roberto Martin-Martin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出零演示框架CoDex,结合视觉语言模型与强化学习,自主发现并执行涉及物体内部机制操控的灵巧操作策略,在多种工具任务中验证了其有效性。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026. Project page: https://robin-lab.cs.utexas.edu/CoDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 67%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29357 2026-06-30 cs.CV cs.AI cs.LG 67%

Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

利用视觉语言模型动态解析和更新自然语言规范以实现鲁棒的视觉语言跟踪

Xiao Wang, Liye Jin, Dan Xu, Yuehang Li, Lan Chen, Yaowei Wang, Yonghong Tian, Jin Tang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Peng Cheng Laboratory, Shenzhen(鹏城实验室深圳分部) Shenzhen Graduate School, Peking University(北京大学深圳研究生院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出语言依赖解析机制提取跟踪核心成分,并利用Qwen-VL进行成分感知的文本更新,在多个基准上取得一致优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21368 2026-06-23 cs.CV cs.AI cs.LG 新提交 67%

Graph-of-Differences: Anatomy-Structured Difference Alignment for Medical Image Re-Identification

差异图:面向医学图像再识别的解剖结构差异对齐

Nichula Wasalathilaka, Abhijit Das, Imran Razzak, Dwarikanath Mahapatra

机构 * Khalifa University(哈利法大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Peradeniya(佩拉德尼亚大学) MedOS

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出差异图(GoD)方法,通过解剖图结构对齐进行身份比较,提升医学图像再识别的准确性和可解释性,在眼底和胸部X光数据集上Rank-1分别提升7.1和3.1个百分点。

Journal ref MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 67%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13289 2026-06-15 eess.SP 版本更新 67%

Semantic Communication for the Internet of Underwater Things: Architectures, Applications, Challenges, and Future Directions

水下物联网的语义通信:架构、应用、挑战与未来方向

Ruhul Amin Khalil, Asiya Jehangir, Hanane Lamaazi, Saddaf Rubab, Nasir Saeed

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 本文综述了语义通信在水下物联网中的应用,探讨了其架构、学习驱动方法及代表性应用,并指出了关键研究方向,旨在提升资源受限水下网络的通信效率。

Comments 33 pages, 10 figures, and 9 tables. The paper is submitted to IEEE for Possible Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10305 2026-06-10 cs.RO 新提交 67%

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作

Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09798 2026-06-09 cs.RO 新提交 67%

SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps

SynManDex: 从合成人类预抓取中合成类人灵巧抓取

Yanming Shao, Zanxin Chen, Wenwei Lin, Mingjie Zhou, Tianxing Chen, Xiaokang Yang, Yichen Chi, Yao Mu

机构 * Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Shenzhen University(深圳大学) Fudan University(复旦大学) University of Hong Kong(香港大学) ZTE Corporation(中兴通讯股份有限公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 提出SynManDex流水线,利用生成的人类预抓取作为启发,通过机器人原生优化实现力闭合接触,生成类人灵巧抓取,在仿真和真实机器人上取得高成功率和类人性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02274 2026-06-09 cs.RO 版本更新 67%

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Dexterity-BEV: 对齐3D世界与动作以实现通用机器人策略学习

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

机构 * DexForce Technology(德克斯技术公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出Dexterity-BEV框架,通过对齐顶点图和顶点谱的3D表示以及鸟瞰图对齐,解决2D基础模型在3D操作中的局限性,提升机器人策略的泛化能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31530 2026-06-03 eess.AS cs.SD 67%

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

UNISON: 通过深度LLM融合的统一声音生成与编辑框架

Zhaoqing Li, Haoning Xu, Jingran Su, Yaofang Liu, Zhefan Rao, Huimeng Wang, Jiajun Deng, Tianzi Wang, Zengrui Jin, Rui Liu, Haoxuan Che, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Huawei Research Hong Kong(华为香港研究)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn)

AI总结 提出UNISON,一个基于潜在扩散的统一框架,通过层间深度LLM融合和多任务架构,实现语音生成、声音生成和音频编辑,在多个任务上达到或超越专业模型性能,且参数量减少约4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 67%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19684 2026-06-03 cs.LG cs.AI cs.CL cs.CV 67%

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

CoMPAS3D: 一个用于交互动作的数据集和基准

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica Lim

机构 * School of Computing Science Simon Fraser University(计算科学学院西蒙弗雷泽大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CoMPAS3D数据集和评估框架,通过动作可读性和熟练度适当性等客观指标,解决交互式动作生成中缺乏社交上下文评估的问题。

Comments https://rosielab.github.io/compas3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19358 2026-05-28 cs.CE 67%

RoofNet: A Global Multimodal Dataset for Roof Material Identification from Earth Observation

RoofNet: 用于地球观测屋顶材料识别的全球多模态数据集

Benjamin Tarver, Noelle Law, Sasha Getz, Yuki Miura

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 针对建筑屋顶材料数据缺失问题,提出RoofNet数据集,包含101个国家49,662个建筑实例的14类屋顶材料标签,结合多模态标注流程和微调方法,将零样本分类准确率从4.9%提升至47.7%,并展示了材料感知数据对灾害风险评估的影响。

Comments v3: Restructured manuscript with updated framing, added hazard case study, clarified data release/licensing, and refined main text and appendix for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01247 2026-05-28 cs.CV cs.AI cs.LG 67%

Beyond Interpretability: When, Why, and How Sparse Autoencoders Enable Label-Free Visual Steering

超越可解释性:稀疏自编码器何时、为何以及如何实现无标签视觉引导

Gerasimos Chatzoudis, Zhuowei Li, Gemma E. Moran, Hao Wang, Dimitris N. Metaxas

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Department of Statistics, Rutgers University(罗格斯大学统计系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出无标签视觉稀疏引导方法VS2,通过训练稀疏自编码器并利用其重构误差和稀疏特征放大来引导冻结的视觉语言模型,在九个图像分类数据集上提升零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26941 2026-05-27 cs.IR cs.MM 67%

The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval

第二届EReL@MIR研讨会:面向多模态信息检索的高效表示学习

Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Xi Wang, Qijiong Liu, Qian Li, Joemon M. Jose

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本研讨会旨在探讨多模态基础模型在信息检索中的效率瓶颈,并提出通过组织学术与工业界交流,推动高效表示学习的新方法、度量标准和基准。

Comments Accepted as a workshop proposal at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25423 2026-05-26 cs.RO 67%

OPAL: Omnidirectional Path-efficient Aerial 3D expLoration

OPAL: 全方位路径高效空中三维探索

Yoga Satwik Chappidi, Avideh Zakhor

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出OPAL框架,通过在歧义分支点进行360度偏航旋转替代计算密集的全局路径规划,实现计算简单、路径短且覆盖率高的自主探索。

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10921 2026-05-26 cs.CV cs.AI cs.LG 67%

FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model

FG-CLIP 2: 一种双语细粒度视觉-语言对齐模型

Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Ji Ao, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出FG-CLIP 2双语视觉语言模型,通过区域-文本匹配、长描述建模和文本内模态对比损失等细粒度监督,在英中双语上实现细粒度对齐,在29个数据集上取得最优结果。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23477 2026-05-25 cs.RO 67%

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

语义结构化混合专家用于组合机器人操作

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn)

AI总结 提出语义结构化混合专家扩散策略(SMoDP),通过视觉语言模型标注的技能语义指导专家专业化,实现参数高效的多任务组合操作。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12960 2026-05-21 cs.CL 67%

DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

DiM\textsuperscript{3}: 通过方向和幅度感知融合连接多语言和多模态模型

Zijing Wang, Mingyang Wang, Ercong Nie, Yongkang Liu, Shi Feng, Mengjie Zhao, Daling Wang, Xiaocui Yang, Hinrich Schütze

机构 * Northeastern University, China(东北大学,中国) CIS, LMU Munich, Germany(慕尼黑莱布尼茨大学计算机学院,德国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本研究提出DiM3方法,通过在共享语言模型骨干中融合残差更新,实现多语言和多模态能力的无缝整合,从而提升多语言性能并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07570 2026-05-20 q-bio.NC cs.AI cs.CV cs.LG 67%

How does longer temporal context enhance multimodal narrative video processing in the brain?

更长的时间上下文如何增强大脑对多模态叙事视频的处理?

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty

机构 * Technische Universität Berlin(柏林技术大学) Microsoft Research(微软研究院) IIT Delhi(德里理工学院) Microsoft(微软) IIIT-Hyderabad(海得拉巴理工学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究探讨了视频片段时长和叙事任务提示如何影响自然电影观看过程中大脑模型对多模态大语言模型(MLLMs)的对齐情况,发现增加片段持续时间显著提高了大脑对齐程度,而单模态视频模型则无明显提升。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17954 2026-05-19 cs.CV cs.AI cs.LG 67%

A More Word-like Image Tokenization for MLLMs

一种更像单词的图像标记化方法用于大规模语言模型

Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

机构 * Seoul National University(首尔国立大学) Ewha Womans University(成均馆大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种解耦视觉标记化方法(DiVT),通过将图像块嵌入聚类为语义单元,使每个标记对应于独特的视觉概念,从而提升多模态模型的性能和效率。

Journal ref Proceedings of the IEEE/CVF International Conference on Pattern Recognition and Computer Vision (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02977 2026-05-14 cs.CV cs.AI cs.LG 67%

Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding

对图像与长描述中的森林和树木进行对齐以实现视觉基础理解

Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu

机构 * Agency for Defense Development(国防发展局) University of Michigan(密歇根大学) POSTECH

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CAFT模型,通过分层视觉语言学习原理,解决长描述中细节丰富的场景理解问题,实现图像与文本的细粒度对齐,取得六个长文本检索基准的最优性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏