arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-09 至 2026-06-09 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 15 篇

2606.08464 2026-06-09 cs.CV 新提交 83%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09301 2026-06-09 cs.LG 新提交 82%

PRISM: Topology-Aware Cross-Modal Imputation for Modality-Deficient Federated Graph Learning

PRISM: 面向模态缺失联邦图学习的拓扑感知跨模态插补

Zekai Chen, Miao Zhang, Jiayang Xing, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract)

AI总结 针对联邦图学习中客户端级模态缺失问题,提出拓扑感知跨模态插补框架PRISM,通过联邦检索缺失模态语义并利用拓扑控制注入局部图传播,在六个多模态图数据集上平均提升4.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07801 2026-06-09 cs.AI 新提交 79%

Improving Multimodal Reasoning via Worst Dimension Optimization

通过最差维度优化改进多模态推理

Haocheng Lv, Huaping Zhang, Qiuchi Li, Lei Li, Chunxiao Gao

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出最差维度优化方法,通过识别并优先优化推理路径中最差的约束维度,提升多模态推理的整体有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01880 2026-06-09 cs.RO 78%

Multimodal Large Language Models for Real-Time Situated Reasoning

多模态大语言模型用于实时情境推理

Giulio Antonio Abbo, Senne Lenaerts, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文探讨多模态大语言模型如何支持实时情境和价值感知决策,结合GPT-4o与模拟智能扫地机器人平台,展示其在家庭活动、社会规范和用户偏好推理中的能力,以及在清洁、舒适和安全等价值上的细致决策。

Comments Submitted to the interactivity track of the 21st ACM/IEEE International Conference on Human-Robot Interaction on December 2025, accepted January 2026

Journal ref HRI Companion 2026: Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21788 2026-06-09 cs.DC cs.LG 版本更新 67%

Efficient Scaling of LLM Training with Flexible Context Parallelism

利用灵活上下文并行实现LLM训练的高效扩展

Yifan Niu, Han Xiao, Dongyi Liu, Wei Zhou, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他多模态 :MLLM(abstract,abstract_cn)

AI总结 针对数据异构导致负载不均和通信冗余问题,提出自适应重配置通信组和上下文并行度的FCP策略,实现近线性加速比,最高达1.46倍吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09643 2026-06-09 cs.DC cs.AI cs.LG cs.OS 新提交 57%

FMplex: Model Virtualization for Serving Extensible Foundation Models

FMplex: 用于服务可扩展基础模型的模型虚拟化

Hetvi Shastri, Pragya Sharma, Walid A. Hanafy, David Irwin, Mani Srivastava, Prashant Shenoy

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出FMplex系统,通过将基础模型作为虚拟化层实现多任务共享,结合批感知公平队列调度器,在7个基础模型和92个下游任务上降低延迟达80%,提升任务容量6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08440 2026-06-09 cs.RO cs.CV 新提交 57%

GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors

GraspFoM:基于3D基础先验的重建驱动机器人抓取

Dongli Wu, Xiaobao Wei, Hao Wang, Qiaochu Dong, Ying Li, Qingpo Wuwu, Ming Lu, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出GraspFoM框架,利用3D基础先验(SAM3D)构建共享3D物体潜变量,联合优化重建与抓取姿态预测,通过锚点初始化的截断姿态推理扩散器生成连续多模态抓取,实现高保真重建与最优抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08218 2026-06-09 cs.LG cs.AI math.ST stat.ML stat.TH 新提交 57%

How Deep Are Deep GPs, Really? A Sharp Threshold and a Non-Gaussian Limit for Compositional GPs

深度高斯过程到底有多深?组合高斯过程的尖锐阈值与非高斯极限

Mark Kozdoba, Shie Mannor

机构 * Technion, IIT(以色列理工学院) NVIDIA(英伟达)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了深度高斯过程先验在深度增长时的极限行为,识别出RBF核带宽的尖锐阈值,低于该阈值时先验收敛到非退化非高斯分布,具有非零坐标依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07658 2026-06-09 cs.CV cs.LG 新提交 57%

What neurosurgeons need to see: synthetic intra-operative MRI from ultrasound for brain-shift compensation in brain tumour surgery

神经外科医生需要看到的:用于脑肿瘤手术中脑移位补偿的超声合成术中MRI

Santiago Cepeda, Olga Esteban-Sinovas, Ignacio Arrese, Rosario Sarabia

机构 * Department of Neurosurgery, Neurovascular Unit, Río Hortega University Hospital, Valladolid, Spain(西班牙巴利亚多利德里奥·奥尔特加大学医院神经外科神经血管科) Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC), Instituto de Investigación Biosanitaria de Valladolid (IBioVALL), Valladolid, Spain(西班牙巴利亚多利德生物医学研究与计算分析专业组(GEIBAC),巴利亚多利德生物健康研究所(IBioVALL))

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种端到端流水线,通过融合术前MRI、术中超声生成的合成MRI及锚定该合成图像的可变形配准,生成术前成像空间中的全脑MRI体积,以补偿脑移位,为神经导航提供类似MRI的术中视野更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22766 2026-06-09 cs.CL 版本更新 57%

Imagination Helps Visual Reasoning, But Not Yet in Latent Space

想象力有助于视觉推理,但尚未在潜在空间中实现

You Li, Chi Chen, Yanghao Li, Fanhu Zeng, Kaiyu Huang, Jinan Xu, Maosong Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 通过因果中介分析发现,多模态大语言模型中的潜在推理存在输入-潜在和潜在-答案两个关键断连,表明其有效性有限,并提出显式想象方法CapImagine,在视觉推理任务中表现更优。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08233 2026-06-09 physics.app-ph 新提交 50%

Analysis of Multi-Tone, Multi-Conductor, Spatially Discrete Traveling-Wave Modulated Loop Networks

多音、多导体、空间离散行波调制环路网络分析

Amirhossein Babaee, Zachary Fritts, Steve M. Young, Anthony Grbic

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出基于Interpath Relation的半解析框架,通过单胞分析周期性多音、多导体环路网络,高效计算空间格林函数,用于优化多功能非互易电磁系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03258 2026-06-09 physics.flu-dyn 版本更新 50%

Linear Stability Analysis of convective flows in Rotating Baroclinic Annulus with Localized Peripheral Heating: A Floquet-BiGlobal Approach

旋转斜压环流中局部周边加热的对流流动的线性稳定性分析:一种Floquet-BiGlobal方法

Jaya Nandan, Ayan Kumar Banerjee

专题命中 其他多模态 :cross-modal(abstract)

AI总结 本文采用Floquet-Bloch理论与BiGlobal特征值方法,分析了局部加热下旋转流体环的非轴对称基态线性稳定性,揭示了交叉模态斜压能量释放和剪切产生的不稳定机制。

Comments The article has been submitted to Proceedings of the Innovations in Engineering for Sustainable Transformations (InnoVEST) 2026 and is Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09813 2026-06-09 cs.NI cs.DC cs.LG cs.SY eess.SY 50%

Optimizing Server Placement for Vertical Federated Learning in Dynamic Edge/Fog Networks

优化动态边缘/雾网络中垂直联邦学习的服务器部署

Su Wang, Mung Chiang, H. Vincent Poor

机构 * Department of Electrical and Computer Engineering, Purdue University(普洛威斯顿大学电子工程与计算机科学系)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文研究动态边缘/雾网络中垂直联邦学习的控制与优化,提出SC-DN方法,通过联合优化服务器部署、传输功率、处理器频率和本地训练迭代数,提升模型性能与资源利用率。

Comments Under revision at IEEE/ACM transactions on networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12320 2026-06-09 cs.RO 版本更新 50%

Programmable Deformation Design of Porous Soft Actuator through Volumetric-Pattern-Induced Anisotropy

通过体积图案诱导各向异性的多孔软体执行器可编程变形设计

Canqi Meng, Weibang Bai

机构 * ShanghaiTech Automation and Robotics (STAR) Center, School of Information Science and Technology, ShanghaiTech University(上海科技大学自动化与机器人(STAR)中心,信息科学与技术学院,上海科技大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出一种在多孔泡沫中切割图案实现软体执行器可编程变形的方法,通过有限元分析研究机制,实验展示弯曲、倾斜、扭转等变形,并应用于仿生软体手。

Comments Accepted to 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16102 2026-06-09 cs.LG 版本更新 50%

BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching

BlendServe: 利用资源感知批处理优化自回归大模型的离线推理

Yilong Zhao, Shuo Yang, Kan Zhu, Lianmin Zheng, Baris Kasikci, Yang Zhou, Jiarong Xing, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Davis(加州大学戴维斯分校) Rice University(里士满大学)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对离线批处理中资源重叠与前缀共享的冲突,提出资源感知前缀树来最大化资源利用率,相比vLLM和SGLang吞吐量提升1.44倍。

详情

展开后加载摘要…

URL PDF HTML 收藏