arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2603.20192 2026-03-23 cs.CV cs.AI 62%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19807 2026-03-23 cs.CV cs.AI 62%

Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision

通过语义引导监督增强统一多模态模型的对齐

Jiyeong Kim, Yerim So, Hyesong Choi, Uiwon Hwang, Dongbo Min

机构 * Ewha Womans University(成均馆大学) Soongsil University(顺天大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Semantically-Grounded Supervision方法,通过构建视觉接地图和语义引导的破坏输入,解决统一多模态模型中的粒度不匹配和监督冗余问题,提升生成质量和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 62%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11656 2026-03-17 cs.CV cs.AI cs.RO 62%

SToRM: Supervised Token Reduction for Multi-modal LLMs toward efficient end-to-end autonomous driving

SToRM:面向高效端到端自动驾驶的多模态大语言模型监督令牌缩减

Seo Hyun Kim, Jin Bok Park, Do Yeon Koo, Hogun Park, Il Yong Chun

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SToRM框架,通过监督令牌缩减方法在保持性能的同时降低计算成本,实现实时端到端自动驾驶。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18269 2026-03-17 cs.CV cs.AI 62%

StreamingTOM: Streaming Token Compression for Efficient Video Understanding

StreamingTOM: 流式令牌压缩以实现高效的视频理解

Xueyi Chen, Keda Tao, Kele Shao, Huan Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 StreamingTOM通过双阶段框架解决流式视频视觉-语言模型中预-后LLM瓶颈,实现kv-cache压缩和低延迟,提升实时视频理解效率。

Comments Accepted at CVPR 2026. Project page: https://yige24.github.io/StreamingTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18600 2026-03-17 cs.CV cs.AI cs.CL 62%

OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation

OraPO:基于 oracle 的强化学习用于数据高效且事实准确的放射科报告生成

Zhuoxiao Chen, Hongyang Yu, Ying Xu, Yadan Luo, Long Duong, Yuan-Fang Li

机构 * Oracle Health & AI(Oracle健康与人工智能)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 OraPO 通过 FactScore 奖励机制提升放射科报告生成效率,在受限预算下实现 SOTA 性能,使用小规模 VLM 和适度硬件,在 CheXpert Plus 数据集上取得 0.341 的 F1 分数。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12717 2026-03-16 cs.RO cs.AI cs.LG 62%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10210 2026-03-12 cs.CV cs.AI 62%

Delta-K: Boosting Multi-Instance Generation via Cross-Attention Augmentation

Delta-K: 通过交叉注意力增强提升多实例生成

Zitong Wang, Zijun Shen, Haohao Xu, Zhengjie Luo, Weibin Wu

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Nanjing University(南京大学) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09109 2026-03-12 cs.CV cs.AI 62%

VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs

VIVID-Med: 基于LLM监督的结构化预训练用于可部署的医学ViT

Xiyao Wang, Xiaoyu Tan, Yang Dai, Yuxuan Fu, Shuo Li, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) National University of Singapore(新加坡国立大学) Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VIVID-Med通过LLM监督的结构化预训练方法,实现轻量级可部署的医学ViT模型,在医学图像分析中表现出高效和强泛化能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05621 2026-03-12 cs.RO cs.AI cs.CL cs.LG cs.MA 62%

RACAS: Controlling Diverse Robots With a Single Agentic System

RACAS:通过单一代理系统控制多样化机器人

Dylan R. Ashley, Jan Przepióra, Yimeng Chen, Ali Abualsaud, Nurzhan Yesmagambet, Shinkyu Park, Eric Feron, Jürgen Schmidhuber

机构 * Center of Excellence in Generative AI, King Abdullah University of Science and Technology (KAUST), Saudi Arabia(沙特王国科学与技术大学生成人工智能卓越中心) Dalle Molle Institute for Artificial Intelligence Research (IDSIA), Switzerland(人工智能研究达勒莫利 institute) Università della Svizzera italiana (USI), Switzerland(瑞士意大利大学) Scuola universitaria professionale della Svizzera italiana (SUPSI), Switzerland(瑞士意大利专业大学) Robotics, Intelligent Systems, and Control Lab, King Abdullah University of Science and Technology (KAUST), Saudi Arabia(机器人、智能系统与控制实验室,沙特王国科学与技术大学(KAUST)) Department of Process Control, AGH University of Krakow, Poland(波兰克拉科夫AGH大学过程控制系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 RACAS通过单一代理系统实现跨平台机器人控制,无需修改代码或模型,有效降低机器人原型开发难度。

Comments 7 pages in main text + 1 page of appendices + 1 page of references, 5 figures in main text + 1 figure in appendices, 2 tables in main text; source code available at https://github.com/janprz11/robot-agnostic-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06459 2026-03-09 cs.CV cs.AI 62%

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

基础模型知道几何吗?通过冻结特征进行连续物理测量

Yakov Pyotr Shkolnikov

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究发现视觉-语言模型通过冻结特征可实现连续几何测量,LoRA微调和架构分析揭示了路径训练缺陷及中层注意力头对几何信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26346 2026-03-03 cs.CV cs.AI cs.CL 62%

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

EditReward:一种用于指令引导图像编辑的人类对齐奖励模型

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) Independent(独立研究者)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。

Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22716 2026-02-27 cs.CV cs.AI 62%

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

机构 * University of Macau(澳门大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21829 2026-02-26 cs.CV cs.AI 62%

StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles

StoryMovie: 一个用于视觉故事语义对齐的语料库,结合电影剧本和字幕

Daniel Oliveira, David Martins de Matos

机构 * INESC-ID(INESC-ID研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 StoryMovie通过结合电影剧本和字幕,提升视觉叙事模型的语义对齐能力,使对话归属更准确。

Comments 15 pages, submitted to Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01085 2026-02-26 cs.CV cs.AI 62%

Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection

学习关键要素:通过相对误差驱动的样本选择进行优先概念学习

Shivam Chandhok, Qian Yang, Oscar Manas, Kanishk Jain, Leonid Sigal, Aishwarya Agrawal

机构 * Mila - Québec AI Institute(魁北克人工智能研究所) University of British Columbia(不列颠哥伦比亚大学) Université de Montréal(蒙特利尔大学) Vector Institute for AI(人工智能矢量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PROGRESS通过相对误差驱动的样本选择,实现高效视觉-语言模型的指令微调,减少数据和计算需求,提升学习效率和泛化能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 62%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18019 2026-02-23 cs.CV cs.AI 62%

DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE

DeepSVU: 向深入的安全导向视频理解迈进:通过统一的物理世界正则化MoE

Yujie Jin, Wenxin Zhang, Jingjing Wang, Guodong Zhou

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DeepSVU任务,通过统一物理世界正则化MoE方法,提升视频中威胁的识别、归因和评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 62%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16826 2026-02-20 cs.LG cs.AI 62%

HiVAE: Hierarchical Latent Variables for Scalable Theory of Mind

HiVAE:用于可扩展理论之心的层次潜在变量

Nigel Doering, Rahath Malladi, Arshia Sangwan, David Danks, Tauhidur Rahman

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 HiVAE通过层次化变分架构提升理论之心推理能力,解决现实时空领域中的心理状态推断问题,并提出自监督对齐策略以增强潜在表示的参照性。

Comments Accepted at the Workshop on Theory of Mind for AI (ToM4AI) at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), Singapore, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15318 2026-02-18 cs.CV cs.AI 62%

Sparrow: Text-Anchored Window Attention with Visual-Semantic Glimpsing for Speculative Decoding in Video LLMs

Sparrow: 一种基于文本锚定窗口注意力与视觉语义窥视的推测解码方法用于视频大语言模型

Libo Zhang, Zhaoning Zhang, Wangyang Hong, Peng Qiao, Dongsheng Li

机构 * National Key Laboratory of Parallel and Distributed Computing(平行与分布式计算国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of Defense Technology(国防科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Sparrow通过文本锚定窗口注意力与视觉语义窥视方法,解决视频大语言模型中推测解码的性能下降问题,实现2.82倍加速。

Comments 15 pages , 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14445 2026-02-17 cs.LG cs.AI cs.CL cs.NE 62%

Selective Synchronization Attention

选择性同步注意

Hasi Hays

机构 * Department of Chemical Engineering, University of Arkansas, Fayetteville, AR 72701, USA(化学工程系,阿肯色大学,法雷维尔,AR 72701,USA)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性同步注意机制,通过振荡模型实现高效自注意,具备自然稀疏性、统一编码和单次计算优势,替代Transformer提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14432 2026-02-17 cs.LG cs.AI stat.ML 62%

S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations

S2D:选择性谱衰减用于神经激活的量化友好条件化

Arnav Chavan, Nahush Lele, Udbhav Bamba, Sankalp Dayal, Aditi Raghunathan, Deepak Gupta

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 S2D通过选择性谱衰减减少神经激活异常值,提升模型在量化过程中的准确性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14237 2026-02-17 cs.CV cs.AI 62%

AbracADDbra: Touch-Guided Object Addition by Decoupling Placement and Editing Subtasks

AbracADDbra: 通过解耦放置和编辑子任务实现触控引导的对象添加

Kunal Swami, Raghu Chittersu, Yuvraj Rathore, Rajeev Irny, Shashavali Doodekula, Alok Shukla

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 AbracADDbra通过解耦放置和编辑子任务,利用触控先验实现高效精准的对象添加,提升了交互式编辑的用户体验和编辑质量。

Comments Accepted in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 62%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI 62%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 62%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 62%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18862 2026-02-11 cs.CV cs.AI 62%

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

TAMMs: 卫星图像时间序列中基于时序感知的多模态模型用于变化理解和预测

Zhongbin Guo, Yuhao Wang, Ping Jian, Chengzhi Li, Xinyue Chen, Zhen Yang, Ertai E

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 TAMMs通过时序感知多模态模型统一执行卫星图像时间序列中的变化理解和未来预测,提升长程时间动态建模能力。

Comments Published as a conference paper at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07540 2026-02-10 cs.CV cs.LG 62%

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

基于LLM的诊断证据对齐用于有限配对情况下的医学视觉-语言预训练

Huimin Yan, Liang Bai, Xian Yang, Long Chen

机构 * Institute of Intelligent Information Processing, Shanxi University(山西大学智能信息处理研究所) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学阿利安斯商学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出LLM引导的诊断证据对齐方法,旨在解决有限配对数据下医学视觉-语言预训练的诊断表示学习问题,通过提取关键诊断证据提升跨模态对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07311 2026-02-10 cs.CV cs.AI 62%

LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery

LUCID-SAE:学习统一的视觉-语言稀疏代码以发现可解释的概念

Difei Gu, Yunhe Gao, Gerasimos Chatzoudis, Zihan Dong, Guoning Zhang, Bangwei Guo, Yang Zhou, Mu Zhou, Dimitris Metaxas

机构 * Rutgers University(罗杰斯大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LUCID-SAE通过统一视觉-语言稀疏编码方法,实现了跨模态的可解释概念发现与多模态表示的鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏