arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-27 至 2026-07-27 共收录 34 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2607.22293 2026-07-27 cs.CV 新提交 83%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21970 2026-07-27 cs.CV cs.AI 新提交 73%

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

TextSLIP:用于医学报告生成的文本自监督CLIP

Haoyu Jiang, Ziping Cong

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有CLIP方法在医学报告生成中语义监督不足问题,提出TextSLIP框架,通过模态内文本对比学习增强CLIP,经实验验证其在报告生成指标上有改进,表明文本级对比学习对改善医学视觉-文本对齐有潜力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 57%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2607.21944 2026-07-27 cs.HC 新提交 50%

VisionPulse: A Virtual Reality System Enabling Accessible Discovery and Navigation for Blind and Low Vision Users

VisionPulse:一个为盲人和低视力用户实现无障碍发现与导航的虚拟现实系统

Samuel Martin, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对盲人和低视力用户在VR中自由探索受限的问题,提出VisionPulse系统,让用户通过自然动作和多模态反馈探索虚拟环境,经实验验证该系统受用户青睐,为包容性VR设计提供了参考。

Comments accepted to ACM ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 1 篇

2607.22264 2026-07-27 cs.LG 新提交 78%

Autoregressive EHR Foundation Models with Multimodal Inputs

具有多模态输入的自回归电子健康记录基础模型

Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 研究在自回归电子健康记录基础模型中纳入多模态的方法,通过特定模态潜在压缩和门控交叉注意力框架,研究压缩单模态序列及预训练编码器选择对性能的影响,实验表明精心设计架构及临床评估的必要性。

Comments 5 pages excluding references and supplements, 2 figures and 2 tables, Proceedings of the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning, Seoul, South Korea

Journal ref ICML2026 workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2607.22067 2026-07-27 cs.CL cs.AI 新提交 81%

Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2607.21908 2026-07-27 cs.MM 新提交 92%

Unsupervised Multimodal Intent Discovery via MLLM-Guided Concept Generation and Semantic Propagation

通过MLLM引导的概念生成和语义传播进行无监督多模态意图发现

Yunjin Gu, Qianrui Zhou, Hua Xu

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.MM

AI总结 该研究针对无监督多模态意图发现缺乏语义监督及可解释性差的问题,提出MCSP方法,通过MLLM引导的对比推理获取语义概念,再经语义传播生成伪标签,实验证明其性能优于现有方法且能产生可解释的簇。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22531 2026-07-27 cs.CV 新提交 57%

Twins: Learn to Predict Unified Representations with Focal Loss

Twins:使用焦点损失学习预测统一表示

Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

机构 * Tencent-Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。

Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21661 2026-07-27 cs.RO 新提交 50%

GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation

GRACE:通过组合扩散-MPPI后验均值估计实现无梯度机器人动作生成

Leesai Park, Jiho HOng, Sanghyun Kim

机构 * School of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程学院) Advanced Institute of Convergence Technology (AICT)(融合技术高级研究院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究提出GRACE方法,通过组合扩散-MPPI后验均值估计,仅用前向成本评估引导预训练扩散策略,构建成本条件引导后验并估计均值,在模拟和真实机器人上验证,比基线方法成功率高,能避免部署时障碍物。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2607.22014 2026-07-27 cs.AI cs.CL cs.CV cs.RO 新提交 82%

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

用于空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22352 2026-07-27 cs.CV cs.AI eess.IV 新提交 81%

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

时间反转成像:用于重建过去人类与环境交互的多模态基准和框架

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出时间反转成像范式,通过TRACE-HEI数据集及多模态推理方法,从热、紫外和可见光谱中残余物理印记推断过去人类与环境交互,为时间反转成像奠定基础,开辟场景理解新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21998 2026-07-27 cs.CV 新提交 79%

Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models

医学检查表:评估多模态模型对医学图像的理解

Bannapol Limanond, Masanori Suganuma, Takayuki Okatani

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍医学检查表这一基准测试,通过给模型一张图像及一正一误两个标题进行二元测试,可统一评估不同多模态模型,验证其对医学概念的理解,评估其处理分布外输入的能力,用其评估四个先进模型发现它们理解图像能力待提升。

Comments Accepted for publication in IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22006 2026-07-27 cs.CY econ.GN q-fin.EC stat.AP 新提交 78%

Unfit for stranding assessment: a panel-scale multimodal-LLM audit of building-decarbonisation disclosure (BeDA)

不适用于搁浅评估:建筑脱碳披露(BeDA)的面板规模多模态大语言模型审计

Jingyi Xu, Minghui Cheng, Anchen Sun

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究建筑脱碳披露情况,引入多模态大语言模型工具BeDA审计全球公司面板。发现多数披露不适用,存在报告差距,BeDA分数可靠,可监测该差距,为可执行的建筑搁浅法规提供支持,是筛选工具非预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21986 2026-07-27 cs.RO 新提交 78%

Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping

Mag4D-SLAM数据集:用于定位和映射的重复遍历多模态4D地磁数据集

Bibhutibhusan Nayak, Hyoseok Ju, Giseop Kim

机构 * Department of Robotics and Mechatronics Engineering, DGIST(大邱庆北科学技术院机器人与机电工程系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 该研究提出Mag4D-SLAM这一首个大规模室外地磁SLAM数据集,含多传感器同步测量与地面真值姿态。通过重复遍历实验分析磁场重复性等特性,支持偏航漂移缓解等研究,还能开启地磁传感补充其他模态及应对特殊情况的新研究。

Comments Accepted to IROS 2026. 8 pages, 8 figures. *Bibhutibhusan Nayak and Hyoseok Ju contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21780 2026-07-27 cs.CL cs.AI cs.CV 新提交 78%

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Khondo:孟加拉语表格文档分组拆分的多模态基准测试

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) CCDS, Independent University, Bangladesh(孟加拉国独立大学计算与通信科学系) Amazon GenAI(亚马逊生成式人工智能)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对孟加拉语表格文档分组拆分难的问题,引入多模态基准测试Khondo,涵盖多种拼接方案和行政领域。通过对语言模型零样本评估及对照分析,发现页面排列是主要挑战,语言有影响,确立页面顺序重建问题并提供基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 62%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21964 2026-07-27 cs.RO cs.AI 新提交 57%

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

ACME:一个多文化、多实体的社会导航数据集

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对现有社会导航数据集缺乏文化等多样性的问题,引入ACME数据集,通过多国多地多机器人实体大规模收集数据,提供多种数据便于学习与预测,经分析其能捕捉更具挑战场景及更广泛行人行为。

Comments 24 Pages, 19 Figures, Submitted to IJRR on June 29th 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21611 2026-07-27 cs.HC cs.AI 新提交 57%

A Systematic Survey on Image Description Techniques for STEM Domains

关于STEM领域图像描述技术的系统综述

Marco Cardia, Letizia Angileri, Marina Buzzi, Giulio Galesi, Barbara Leporini

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 综述20项关于AI描述STEM视觉的研究,关注可及性和人机交互。分析目标视觉类型等多方面内容,指出从静态转向交互式多模态系统,同时存在事实不准确等挑战,最后概述人机交互关键研究方向。

Comments This is the Author's Original Manuscript of an article accepted for publication in International Journal of Human-Computer Interaction, published by Taylor and Francis. The Version of Record is available at DOI 10.1080/10447318.2026.2668031

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22118 2026-07-27 cs.HC 新提交 50%

An AI-Driven Virtual Patient for Breaking Bad News: An Expert Formative Study on Facial Expression Intensity

用于传达坏消息的人工智能驱动虚拟患者:面部表情强度的专家形成性研究

Steffen Hauck, Theresa Schell, Sophie Jörg, Jens Grubert

专题命中 多模态评测 :multi-modal(abstract)

AI总结 研究探讨大语言模型驱动的虚拟患者情感表达设计难题,提出结合大语言模型对话与实时面部动画的框架,通过对七位医学专家评估,发现专家通过多渠道评估情感真实感,为未来医学培训模拟器提出需同步多模态管道的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 1 篇

2607.21653 2026-07-27 cs.LG cs.CL cs.DC 新提交 57%

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt:用于智能体强化学习的可扩展原生 PyTorch 训练框架

Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

机构 * NVIDIA(英伟达)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 研究针对智能体强化学习中算法修改成本高的问题,提出原生 PyTorch 训练框架 Molt,其代码简洁,智能体是普通程序,通过异步循环训练策略,在全异步协议下性能与先进堆栈相当,且开源提供资源。

Comments tech report for Molt

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 13 篇

2607.22043 2026-07-27 cs.CL cs.CV 新提交 86%

Scaling Native Multimodal Pre-Training From Scratch

从零开始扩展原生多模态预训练

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯大语言模型部)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22013 2026-07-27 cs.CV cs.AI 新提交 84%

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

用于多模态思维链推理的视觉显著性引导蒸馏

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21600 2026-07-27 cs.AI 新提交 83%

Securing Multimodal AI through Internal Information Decomposition

通过内部信息分解保护多模态人工智能

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。

Comments Accepted as Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22408 2026-07-27 cs.LG 新提交 82%

LunarFM: A Shared Multimodal Representation of the Moon's Surface

LunarFM:月球表面的共享多模态表示

Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán

机构 * University of Cambridge(剑桥大学) German Aerospace Center (DLR)(德国航空航天中心) SPAIDER SPACE(斯派德太空公司) Mines Paris - PSL University(巴黎矿业学院 - 巴黎文理研究大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) European Space Resources Innovation Center (ESRIC)(欧洲空间资源创新中心) Universidad de Antioquia(安蒂奥基亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract)

AI总结 因月球探索需求,针对多源观测致月球表面分析碎片化问题,提出LunarFM多模态基础模型,融合多仪器观测学习通用表示,支持多种下游应用,还提供相关数据集、预训练模型等,助力月球表面高效分析。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22035 2026-07-27 cs.LG 新提交 82%

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

DCS:用于跨模态版权侵权检测的统一条件敏感度框架

Xiafeng Man

机构 * Fudan University(复旦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 研究针对基础模型版权侵权检测问题,提出统一的DCS框架,将侵权证据视为反事实条件分布转移,通过条件差分隐私形式化,创建双分支并结合多种因素界定敏感度,还定义校准统计量,适用于多种模型并以不同方式评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22422 2026-07-27 physics.flu-dyn cs.AI 新提交 79%

PRIMS: Physics-guided Representation for Fluid Identification in Multimodal Sensing

PRIMS:多模态传感中用于流体识别的物理引导表示

Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le

机构 * University of Twente(特文特大学) Nagoya University(名古屋大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对微流体应用中流体识别挑战,提出PRIMS物理感知多模态Transformer,通过三个模块集成物理知识于表示学习和注意力机制,实现可解释、数据高效的流体分类,实验显示其性能优越且鲁棒性强。

Comments 2026 European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21660 2026-07-27 cond-mat.mtrl-sci cs.AI cs.LG 新提交 79%

Generative and multimodal AI for materials prediction and design: Progress, challenges, and perspectives

用于材料预测和设计的生成式和多模态人工智能:进展、挑战与展望

Xianyuan Liu, Charles Anjah, Benjamin E. Jolly, Jonathon F. S. Markanday, Joshua Berry, Haolin Wang, Nicola A. Morley, Robert D. J. Oliver, Alexandra J. Ramadan, Delvin Ce Zhang, Katerina A. Christofidou, Haiping Lu

机构 * School of Computer Science, University of Sheffield, Sheffield, UK(计算机科学学院,谢菲尔德大学) Centre for Machine Intelligence, University of Sheffield, Sheffield, UK(智能机器研究中心,谢菲尔德大学) School of Chemical, Materials and Biological Engineering, University of Sheffield, Sheffield, UK(化学、材料与生物工程学院,谢菲尔德大学) Henry Royce Institute, Royce Discovery Centre, University of Sheffield, Sheffield, UK(亨利·罗伊奇研究所,谢菲尔德大学) Materials Nexus Ltd., Salisbury House, Cambridge, UK(材料 nexus 有限公司,剑桥,英国) School of Mathematical and Physical Sciences, University of Sheffield, Sheffield, UK(数学与物理科学学院,谢菲尔德大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨生成式和多模态人工智能在材料预测与设计中的应用,引入材料属性层次结构框架,指出当前证据局限,强调需全社区标准支持多模态相关建模与基准测试,以设计具科学和实际新颖性、可实验实现的材料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22147 2026-07-27 cs.CV 新提交 57%

Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis

通过新视图合成在别名和低纹理环境中从稀疏视图进行视觉重定位

Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato

机构 * University of Zaragoza(萨拉戈萨大学) German Aerospace Center (DLR)(德国航空航天中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对类行星地形中视觉定位难题,提出基于 3D 高斯溅射构建可微地图表示估计相机姿态的方法,采用结合光度与几何损失的几何感知训练策略,经实验验证能有效提升定位准确性与姿态估计鲁棒性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22078 2026-07-27 cs.CV 新提交 57%

CommandLM: Data driven behavior level descriptor for ego vehicles

CommandLM:用于自动驾驶车辆的数据驱动行为级描述符

Boris Tokic, Constantin Selzer, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对自动驾驶系统中可解释行为级决策需求,提出多模态大语言模型CommandLM,通过融合多传感器数据生成行为描述,经特定训练和适配器处理,实验表现优于基线,人工评估显示其输出可助力行为审计,实现高效透明的行为级理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21624 2026-07-27 cs.AI cs.DC cs.LG 新提交 57%

FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs

FBLayout:为在移动GPU上高效微调大语言模型优化内存布局

Kahou Tam, Wei Niu, Yu Bao, Xiaomin Ouyang, Chengzhong Xu, Li Li

机构 * University of Macau(澳门大学) University of Georgia(佐治亚大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 研究针对移动GPU上Transformer模型微调内存低效问题,提出FBLayout框架,通过统一布局、索引转换及激活引导选择等方法,在多手机多模型测试中实现加速,提高缓存效率并减少内存占用,助力设备上大模型微调。

Comments 13 pages, 21 figures, Mobisys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏