arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-18 至 2026-05-18 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4 篇

2605.16022 2026-05-18 cs.CV 89%

EndoGSim: Physics-Aware 4D Dynamic Endoscopic Scene Simulations via MLLM-Guided Gaussian Splatting

EndoGSim: 基于多模态大语言模型的物理感知4D动态内窥镜场景模拟

Changjing Liu, Yiming Huang, Long Bai, Beilei Cui, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong (CUHK)(香港中文大学电子工程系)

专题命中 其他多模态 :MLLM(title,summary_cn);multi-modal(abstract);分类 cs.CV

AI总结 本文提出EndoGSim框架,通过MLLM引导的高斯点散布实现内窥镜场景的物理感知重建与模拟,结合预训练分割和深度估计,提升手术模拟的真实性和准确性。

Comments Early Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15558 2026-05-18 eess.IV cs.CV 57%

Text-RSIR: A Text-Guided Framework for Efficient Remote Sensing Image Transmission and Reconstruction

Text-RSIR: 一种基于文本的高效遥感图像传输与重建框架

Hao Yang, Xianping Ma, Peifeng Ma, Man-On Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与工程学院) Institute of Space and Earth Information Science and the Department of Geography and Resource Management, The Chinese University of Hong Kong(香港中文大学空间与地球信息科学研究所及地理与资源管理系)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于文本的遥感图像传输系统,通过低分辨率图像与紧凑文本描述替代高分辨率数据,提升传输效率。引入文本条件图像恢复模型,实现细粒度细节恢复与语义一致性保持。

Comments 15 pages, 8 figures, submitted to ISPRS JPRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15507 2026-05-18 cs.IT cs.AI cs.LG math.IT 57%

PrismQuant: Rate-Distortion-Optimal Vector Quantization for Gaussian-Mixture Sources

PrismQuant: 为高斯混合源优化的率失真向量量化

Bumsu Park, Chanho Park, Youngmok Park, Namyoon Lee

机构 * Department of Electrical Engineering(电气工程系)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对高斯混合源,PrismQuant通过组件标签传输和组件匹配KLT实现率失真优化,结合EM驱动学习和熵约束量化,有效逼近理论边界并优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09994 2026-05-18 cs.DC cs.LG 50%

BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

BatchWeave: 一种用于大规模基础模型训练的一致对象存储原生数据平面

Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

机构 * Lionrock AI Lab, China Merchants Group, Hong Kong, China(狮岩人工智能实验室,中国商人集团,香港,中国) Wuhan University, Wuhan, China(武汉大学,武汉,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 其他多模态 :multimodal(abstract)

AI总结 BatchWeave通过版本化清单和条件对象写入协调批量发布、恢复和生命周期管理,提供一致的分布式基础模型训练数据平面,支持事务全局批量、去中心化适应提交算法,提升吞吐量和故障隔离能力。

详情

展开后加载摘要…

URL PDF HTML 收藏