arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-08 至 2026-04-08 共收录 90 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2603.24536 2026-04-08 cs.CL cs.HC 57%

Robust Multilingual Text-to-Pictogram Mapping for Scalable Reading Rehabilitation

鲁棒多语言文本到图示映射以实现可扩展的阅读康复

Soufiane Jhilal, Martina Galletti

机构 * Sony Computer Sciences Laboratories(索尼计算机科学实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出一种多语言AI界面,通过自动增强文本并映射相关图示,帮助特殊教育需求儿童提高阅读理解能力,经过五种语言评估显示系统在语义安全性和可用性方面具有技术可行性。

Comments Accepted at IEEE ICALT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14998 2026-04-08 cs.CV 57%

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

FinCriticalED:一个用于金融事实级OCR的视觉基准

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhuohan Xie, Mingquan Lin, Prayag Tiwari, Jimin Huang, Guojun Xiong, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈尔姆斯塔德大学) Harvard University(哈佛大学) University of Manchester(曼彻斯特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FinCriticalED基准,用于评估OCR和视觉语言模型在金融关键证据上的保真度,发现数值和货币单位是最脆弱的事实类型,揭示了词汇准确性和事实可靠性之间的差距。

Comments Xueqing Peng: Corresponding-Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21210 2026-04-08 cs.CV 57%

Toward Generalizable Forgery Detection and Reasoning

朝通用伪造检测与推理方向发展

Yueying Gao, Dongliang Chang, Bingyao Yu, Haotian Qin, Muxi Diao, Lei Chen, Kongming Liang, Zhanyu Ma

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出FDR-Task任务,利用多模态大语言模型实现伪造检测与推理,通过MMFR数据集和FakeReasoning框架提升检测与推理性能。

Comments Accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05366 2026-04-08 cs.CV 57%

The DeepSpeak Dataset

DeepSpeak 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DeepSpeak数据集,包含超过100小时的真实和深度伪造音频视频内容,旨在解决复杂的说话人头像场景。通过提供高质量的真实数据和生成的深度伪造数据,以及基于嵌入的身份匹配方法,提升深度伪造检测的鲁棒性。

Comments https://github.com/hfaridlab/deepspeak

Journal ref Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 7 篇

2511.01594 2026-04-08 cs.RO cs.CV 85%

MARS: Multi-Agent Robotic System with Multimodal Large Language Models for Assistive Intelligence

MARS:基于多模态大语言模型的多智能体机器人系统用于辅助智能

Renjun Gao

机构 * School of Computer Science and Engineering, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MARS系统利用多模态大语言模型实现风险感知和个性化辅助,通过多智能体决策框架提升智能家庭机器人在动态环境中的表现。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05533 2026-04-08 cs.AI 79%

Experience Transfer for Multimodal LLM Agents in Minecraft Game

在Minecraft游戏中多模态大语言模型代理的经验迁移

Chenghao Li, Jun Liu, Songbo Zhang, Huadong Jian, Hao Ni, Lik-Hang Lee, Sung-Ho Bae, Guoqing Wang, Yang Yang, Chaoning Zhang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Echo框架,通过分解经验为五维,使代理能从历史交互中提取可操作知识,提升复杂环境下的任务解决效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18836 2026-04-08 cs.RO 78%

Multimodal Classification Network Guided Trajectory Planning for Four-Wheel Independent Steering Autonomous Parking Considering Obstacle Attributes

四轮独立转向自主泊车的多模态分类网络引导轨迹规划考虑障碍属性

Jingjia Teng, Yang Li, Yougang Bian, Manjiang Hu, Yingbai Hu, Guofa Li, Jianqiang Wang

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出基于多模态感知网络和混合A*搜索的轨迹规划框架,通过考虑障碍属性提升四轮独立转向车辆在狭窄环境中的导航效率和安全性。

Comments The manuscript in this current form requires substantial revision. For this reason, I request the withdrawal of the submission to allow for comprehensive improvement before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05014 2026-04-08 cs.RO cs.AI cs.CV 73%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07432 2026-04-08 cs.AI 70%

TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering

TS-Agent:通过迭代洞察获取理解并推理原始时间序列

Penghang Liu, Elizabeth Fons, Annita Vapsi, Mohsen Ghassemi, Svitlana Vyetrenko, Daniel Borrajo, Vamsi K. Potluru, Manuela Veloso

机构 * JPMorgan AI Research, NY, USA(摩根大通人工智能研究院,纽约,美国)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 TS-Agent通过迭代洞察获取机制,在时间序列理解和推理任务中匹配或超越文本、视觉及时间序列语言模型基线,尤其在零样本设置下表现更优。

Comments NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI 70%

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05265 2026-04-08 cs.HC 50%

Semantic Reality: Interactive Context-Aware Visualization of Inter-Object Relationships in Augmented Reality

语义现实:增强现实中的交互式上下文感知多物体关系可视化

Xiaoan Liu, Eric J Gonzalez, Nels Numan, Andrea Colaço, Lucy Abramyan, Chen Zhu-Tian, Ryo Suzuki, Mar Gonzalez-Franco

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Semantic Reality系统,通过多模态推理和空间锚定技术,实现增强现实中的多物体关系交互可视化,提升任务理解和参与度。

Comments 15 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 18 篇

2604.05522 2026-04-08 cs.CL 87%

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

跨模态指代对齐:在全模态大语言模型中实现可靠信息传输

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);multi-modal(abstract);omni-modal(abstract)

AI总结 研究提出跨模态指代对齐问题,通过CrossOmni数据集和两种方法提升全模态推理能力,揭示指代意识缺失是跨模态推理弱化的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-04-08 cs.CL cs.CV 84%

From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01831 2026-04-08 cs.LG cs.AI 83%

Routing-Based Continual Learning for Multimodal Large Language Models

基于路由的多模态大语言模型持续学习

Jay Mohta, Kenan Emir Ak, Gwang Lee, Dimitrios Dimitriadis, Yan Xu, Mingwei Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06124 2026-04-08 cs.CV cs.AI 81%

Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery

轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型

Hao Chen, Fang Qiu, Fangchao Dong, Defei Yang, Eve Bohnett, Li An

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Florida(佛罗里达大学) Auburn University(奥本大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 81%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05748 2026-04-08 cs.CV 79%

SVC 2026: the Second Multimodal Deception Detection Challenge and the First Domain Generalized Remote Physiological Measurement Challenge

SVC 2026: 第二届多模态欺骗检测挑战赛及首个领域通用远程生理测量挑战

Dongliang Zhu, Zhiyi Niu, Bo Zhao, Jiajian Huang, Shuo Ye, Xun Lin, Hui Ma, Taorui Wang, Jiayu Zhang, Chunmei Zhu, Junzhe Cao, Yingjie Ma, Rencheng Song, Albert Clapés, Sergio Escalera, Dan Guo, Zitong Yu

机构 * Wuhan University(武汉大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Hefei University of Technology(合肥工业大学) University of Barcelona(巴塞罗那大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SVC 2026挑战赛,旨在通过多模态欺骗检测和远程脉搏波测速估计任务,推动对细微视觉信号的鲁棒表示学习研究。

Comments Accepted by the SVC workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05632 2026-04-08 cs.CV 79%

SGANet: Semantic and Geometric Alignment for Multimodal Multi-view Anomaly Detection

SGANet:语义与几何对齐用于多模态多视角异常检测

Letian Bai, Chengyu Tao, Juan Du

机构 * Smart Manufacturing Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)智能制造学域) College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SGANet通过语义与几何对齐方法,提升多模态多视角异常检测的性能,实验表明其在SiM3D和Eyecandies数据集上达到最先进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05629 2026-04-08 cs.CV 79%

A Unified Foundation Model for All-in-One Multi-Modal Remote Sensing Image Restoration and Fusion with Language Prompting

一种统一的多模态遥感图像修复与融合的全功能基础模型 with语言提示

Yongchuan Cui, Peng Liu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出LLaRS模型,通过最优传输和混合专家层实现多模态遥感图像修复与融合,结合大规模数据集提升模型性能与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04999 2026-04-08 cs.LG cs.AI 79%

PRIME: Prototype-Driven Multimodal Pretraining for Cancer Prognosis with Missing Modalities

PRIME:面向癌症预后分析的原型驱动多模态预训练方法,适用于缺失模态

Kai Yu, Shuang Zhou, Yiran Song, Zaifu Zhan, Jie Peng, Kaixiong Zhou, Tianlong Chen, Feng Xie, Meng Wang, Huazhu Fu, Mingquan Lin, Rui Zhang

机构 * University of Minnesota(明尼苏达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学) National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research(高性能计算研究所,新加坡科技研究局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 PRIME通过原型记忆银行实现缺失模态下的多模态自监督预训练,提升在碎片化临床数据中的预测性能,实现结构对齐和鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07833 2026-04-08 cs.CV 79%

MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization

MIMIC:多模态逆向用于模型解释与概念化

Animesh Jain, Alexandros Stergiou

机构 * University of Twente(特温特大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MIMIC框架,通过逆向处理多模态模型内部编码,提升模型可解释性与概念化能力,采用联合逆向与特征对齐目标,结合三种正则化器提升空间对齐、图像平滑与语义真实度。

Comments Accepted at CVPRw 2026 - How Do Vision Models Work? (HOW) Workshop, Project page: https://anaekin.github.io/MIMIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05668 2026-04-08 eess.SP 78%

A BEV-Fusion Based Framework for Sequential Multi-Modal Beam Prediction in mmWave Systems

基于BEV融合的毫米波系统中顺序多模束预测框架

Jiaming Zeng, Cunhua Pan, Haoyang Weng, Ruijing Liu, Hong Ren, Jiangzhou Wang

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于BEV融合的框架,通过统一相机、激光雷达、雷达和GPS模态,在共享鸟瞰图表示中实现空间一致的多模融合,提升毫米波系统中束预测的准确性。

Comments 13pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV 70%

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

专题命中 多模态训练与对齐 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05931 2026-04-08 cs.CV cs.AI 62%

Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning

基于一致性策略学习的显著性引导表示用于视觉无监督强化学习

Jingbo Sun, Qichao Zhang, Songjun Tu, Xing Fang, Yupeng Zheng, Haoran Li, Ke Chen, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SRCP框架,通过显著性引导动态任务和一致性策略提升视觉无监督强化学习的零样本泛化能力,改进了传统SR方法在高维视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03054 2026-04-08 cs.CV cs.AI 62%

IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation

IBISAgent: 通过MLLMs增强像素级视觉推理以实现通用生物医学对象指称与分割

Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai, Xuhong Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IBISAgent,通过多步决策过程增强MLLMs的像素级视觉推理能力,解决现有分割方法在隐式分割标记和迭代优化方面的不足,提升生物医学分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05863 2026-04-08 cs.CL 57%

LoRM: Learning the Language of Rotating Machinery for Self-Supervised Condition Monitoring

LoRM:学习旋转机械的语言以实现自监督的条件监测

Xiao Qin, Xingyi Song, Tong Liu, Hatim Laalej, Zepeng Liu, Yunpeng Zhu, Ligang He

机构 * University of Warwick(华威大学) Queen Mary University of London(伦敦玛丽女王大学) University of Sheffield(谢菲尔德大学) Advanced Manufacturing Research Centre, University of Sheffield(谢菲尔德大学先进制造研究中心) Tongji University(同济大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 LoRM通过将旋转机械信号视为机器语言,利用预训练语言模型进行多模态信号分析,实现实时条件监测,展示了在工具状态监测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05581 2026-04-08 cs.CV 57%

High-Resolution Single-Shot Polarimetric Imaging Made Easy

高分辨率单次拍摄偏振成像的实现

Shuangfan Zhou, Chu Zhou, Heng Guo, Youwei Lyu, Boxin Shi, Zhanyu Ma, Imari Sato

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) National Institute of Informatics(国立信息学研究所) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Key Laboratory of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出EasyPolar框架,通过三相机系统和置信度引导网络实现高分辨率偏振成像,解决多视角融合中的对齐问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05405 2026-04-08 cs.CV 57%

Weather-Conditioned Branch Routing for Robust LiDAR-Radar 3D Object Detection

针对恶劣天气的分支路由用于鲁棒的激光雷达-雷达3D目标检测

Hongsheng Li, Lingfeng Zhang, Zexian Yang, Liang Li, Rong Yin, Xiaoshuai Hao, Wenbo Ding

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于天气条件的分支路由方法,通过动态调整模态偏好提升恶劣天气下3D目标检测的鲁棒性,实验表明其在K-Radar基准上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 50%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

1706.00178 2026-04-08 cs.SI cs.IR physics.soc-ph 78%

Network Capacity Bound for Personalized PageRank in Multimodal Networks

多模网络中个性化PageRank的网络容量界

M. A. Kłopotek, S. T. Wierzchoń, R. A. Kłopotek

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文研究多模网络中个性化PageRank的容量界限,提出适用于超图的PageRank扩展模型,并证明了不同阻尼因子情况下权威流极限的定理。

Comments 21 pages. 2 tables, 30 bibliography positions

Journal ref Fundamenta Informaticae, Volume 189, Issue 1 (July 1, 2023) fi:10214

详情

展开后加载摘要…

URL PDF HTML 收藏