arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45985 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4643 篇

2604.21409 2026-04-24 cs.CV 79%

S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images

S1-VL:具有图像思维的科学多模态推理模型

Qingxiao Li, Lifeng Xu, QingLi Wang, Yudong Bai, Mingwei Ou, Shu Hu, Nan Xu

机构 * ScienceOne AI

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 S1-VL是一种支持科学推理和图像思维的多模态模型,通过Python代码执行图像处理,提升科学图表、显微图像和几何推理等复杂场景的性能。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17949 2026-04-21 cs.CV 79%

ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection

ZSG-IAD:一种用于零样本 grounded 工业异常检测的多模态框架

Qiuhui Chen, Jiaxiang Song, Shuai Tan, Weimin Zhong

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ZSG-IAD框架,通过多模态数据生成结构化异常报告和像素级掩码,采用语言引导的两跳接地模块和可执行规则GRPO提升可靠性,实现在多个工业异常基准上的强零样本性能和透明解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17278 2026-04-21 cs.CV 79%

PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习

Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PestVL-Net框架,结合视觉与语言模型,解决细粒度害虫识别难题,通过RWKV架构和多模态大语言模型实现高效害虫学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 79%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 79%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08815 2026-04-13 cs.CV 79%

Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models

通过上下文对齐的视觉-语言模型实现负责任的多模态医疗推理

Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi

机构 * Salim Habib University(萨利姆·哈比卜大学) Institute of Business Administration Sukkur(苏库尔工商管理学院) University of Central Florida(中佛罗里达大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Toronto Metropolitan University(多伦多都会大学) Vector Institute(向量研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种上下文对齐的框架,通过整合多种临床证据提升医疗多模态推理的可靠性与可信度,实验显示其在胸部X光数据集上提升了判别性能并减少幻觉关键词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 79%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04780 2026-04-07 cs.CV 79%

CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models

CLEAR: 解锁统一多模态模型中退化图像理解的生成潜力

Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang, Linhao Yu, Yao Chen, Yiqian Zhang, Haiyun Guo, Shuohuan Wang, Yu Sun

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 CLEAR通过三个步骤提升统一多模态模型在退化图像中的理解能力,包括监督微调、潜在表示桥梁和交错GRPO,增强模型在退化输入下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04608 2026-04-07 cs.CV 79%

Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection

超越语义:通过通用物理描述符揭示合成检测的物理本质

Mei Qiu, Jianqiang Zhao, Yanyun Qu

机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) Xia'men University(厦门大学)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04145 2026-04-07 cs.AI 79%

Solar-VLM: Multimodal Vision-Language Models for Augmented Solar Power Forecasting

Solar-VLM:用于增强太阳能发电预测的多模态视觉语言模型

Hang Fan, Haoran Pei, Runze Liang, Weican Liu, Long Cheng, Wei Wei

机构 * North China Electric Power University(华北电力大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Solar-VLM框架,通过融合时序观测、卫星图像和文本天气信息,提升太阳能发电预测的准确性,采用多模态编码器和图注意力网络捕捉空间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23095 2026-04-07 cs.CV 79%

Revisiting Multimodal Positional Encoding in Vision-Language Models

重新审视视觉-语言模型中的多模态位置编码

Jie Huang, Xuejing Liu, Sibo Song, Ruibing Hou, Hong Chang, Junyang Lin, Shuai Bai

机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01749 2026-04-03 cs.CV 79%

Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

超声-CLIP:面向超声图像-文本理解的语义感知对比预训练

Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou

机构 * Hangzhou City University(杭州城市大学) Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) City University of Hong Kong(香港城市大学)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV 79%

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26349 2026-03-30 stat.ML cs.AI cs.LG 79%

Generative Score Inference for Multimodal Data

多模态数据生成分数推断

Xinyu Tian, Xiaotong Shen

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出生成分数推断(GSI)框架,通过深度生成模型生成合成样本近似条件分数分布,提升多模态学习中的不确定性量化能力,在大语言模型幻觉检测和图像描述不确定性估计中取得最佳性能。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22070 2026-03-26 cs.CV 79%

Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning

通过多模态贝叶斯分布学习适应点云分析

Xingyu Zhu, Liang Yi, Shuo Wang, Wenbo Zhu, Yonglinag Wu, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(脑信息处理实验室,中国科学技术大学) Opus AI Research(Opus AI研究院) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BayesMM框架,通过多模态贝叶斯分布学习实现测试时点云分析的持续适应,利用文本先验和流式视觉特征的高斯分布融合,提升在分布偏移下的鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 79%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22179 2026-03-24 cs.AI 79%

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型

Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley

机构 * Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系) Bakar Institute, UCSF(Bakar研究所,旧金山大学) UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划) Department of Radiology, Stanford University(斯坦福大学放射学系) Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biology, Stanford University(斯坦福大学生物学系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 MARCUS通过多模态视觉-语言模型实现心电图、超声和心脏磁共振成像的端到端解读,其多代理架构在心脏诊断中表现出优于前沿模型的准确率和自由文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21426 2026-03-24 cs.CV 79%

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

面向不确定性的多模态大语言模型知识蒸馏

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen

机构 * NEC Laboratories America, Inc.(NEC美洲实验室) University at Buffalo, SUNY(布法罗大学) Rutgers University(罗格斯大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Beta-KD框架,通过统一贝叶斯视角平衡数据与教师指导,提升多模态VQA任务性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17910 2026-03-23 cs.CL 79%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05551 2026-03-18 cs.IR cs.CV 79%

AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction

AutothinkRAG: 多模态文档问答中检索增强推理的复杂度感知控制

Jiashu Yang, Chi Zhang, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xu Jia, Xunliang Cai

机构 * Dalian University of Technology(大连理工大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 图文多模态 :image-text(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出AutoThinkRAG,通过查询复杂度路由器和感知-推理解耦架构,提升多模态文档问答的效率与鲁棒性,实验表明在DocBench和MMLongBench上准确率提升,且降低计算与成本消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22596 2026-03-17 cs.CV 79%

SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning

SAM-R1:通过强化学习利用SAM进行多模态分割的奖励反馈

Jiaqi Huang, Zunnan Xu, Jun Zhou, Ting Liu, Yicheng Xiao, Mingwen Ou, Bowen Ji, Xiu Li, Kehong Yuan

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SAM-R1框架,通过整合任务特定的细粒度奖励与定制优化目标,提升多模态模型在图像理解任务中的细粒度推理与分割对齐能力,仅用3k训练样本即在多个基准上取得优异表现。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13370 2026-03-17 cs.CV cs.LG 79%

GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning

GraphVLM:多模态图学习的视觉语言模型基准测试

Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * NYU Shanghai(纽约大学上海分校) New York University(纽约大学) Rice University(休斯顿大学) East China Normal University(华东师范大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13163 2026-03-16 cs.CV cs.LG 79%

Towards Faithful Multimodal Concept Bottleneck Models

迈向可信的多模态概念瓶颈模型

Pierre Moreau, Emeline Pineau Ferrand, Yann Choho, Benjamin Wong, Annabelle Blangero, Milan Bhan

机构 * Ekimetrics Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) Télécom Paris(巴黎电信学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出f-CBM框架,通过可微泄漏损失和Kolmogorov-Arnold网络预测头,解决多模态场景下的概念检测与泄漏问题,实现任务准确度、概念检测和泄漏减少的最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10335 2026-03-12 cs.CV 79%

Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models

Fuel Gauge: 在大型多模态模型中提前估计链式推理长度

Yuedong Yang, Xiwen Wei, Mustafa Munir, Radu Marculescu

机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电气与计算机工程系)

专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV

AI总结 Fuel Gauge通过提取隐藏信号提前预测链式推理长度,有效解决LMMs中的内存碎片化和推理效率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07989 2026-03-10 cs.CV 79%

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

AutoTraces:通过多模态大语言模型实现自回归轨迹预测

Teng Wang, Yanting Lu, Ruize Wang

机构 * Southeast University(东南大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21497 2026-03-10 cs.CV 79%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04894 2026-03-06 cs.AI 79%

Differentially Private Multimodal In-Context Learning

差分隐私多模态上下文学习

Ivoline C. Ngong, Zarreen Reza, Joseph P. Near

机构 * University of Vermont, Burlington, VT, USA(佛罗里达大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DP-MTV是首个实现多样本多模态上下文学习的差分隐私框架,通过激活空间中的任务向量聚合,在保持隐私的前提下提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04878 2026-03-06 cs.CV 79%

Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation

基于结构观测的图像-文本对比学习用于CT报告生成

Hong Liu, Dong Wei, Qiong Peng, Yawen Huang, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医学数据科学研究院) Jarvis Research Center, Tencent YouTu Lab, Shenzhen, China(腾讯YouTu实验室 Jarvis研究部) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou, China(西湖大学医学人工智能实验室)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出基于结构观测的图像-文本对比学习框架,用于提升CT报告生成的临床效率和准确性。

Comments Accept to IPMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03380 2026-03-05 cs.RO cs.AI 79%

LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics

LiteVLA-Edge: 量化在设备上多模态控制用于嵌入式机器人

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Clark Atlanta University(克拉克阿特兰大学) Siemens Corporation(西门子公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 LiteVLA-Edge通过量化和GPU加速,在嵌入式机器人中实现低延迟的多模态控制,提供模块化本地执行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02609 2026-03-04 cs.CV cs.RO 79%

VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction

VLMFusionOcc3D: 基于VLM的多模态3D语义占位预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥克辛大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 VLMFusionOcc3D通过融合视觉语言模型的语义先验,提升多模态3D语义占位预测的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏