arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 135 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 23 篇

2607.16326 2026-07-21 cs.CV 新提交 57%

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP:用于高效LVLM推理的预LLM文本驱动视觉令牌剪枝

Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型推理开销大的问题,提出CRISP框架,通过文本驱动在预LLM阶段剪枝视觉令牌,分两阶段工作,实验表明其在激进剪枝率下能保持高性能,降低推理成本和延迟,是高效LVLM推理的实用方案。

Comments Accepted by the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026) as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12071 2026-07-21 cs.CL 版本更新 57%

Beyond Parallel Tracking: Interactive Multi-Feature Fusion Drives Semantic Reconstruction from Non-invasive Brain Recordings

超越并行跟踪:交互式多特征融合驱动非侵入性脑记录的语义重建

Boda Xiao, Xiran Xu, Songyi Li, Yujie Yan, Xihong Wu, Heping Cheng, Jing Chen

机构 * Center for BioMed-X Research, Academy for Advanced Interdisciplinary Studies,Peking University(北京大学生物医学前沿创新中心、前沿交叉学科研究院) Speech and Hearing Research Center, School of Intelligence Science and Technology,Peking University(北京大学智能科学与技术学院言语听觉研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University(国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究所、北京大学生命科学联合中心、未来技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 研究针对非侵入性脑记录语义重建中表征不匹配问题,引入多特征融合框架,通过交互式门控机制结合静态与动态表征,经实验对比线性连接和非线性交叉注意力等方法,证明交叉注意力融合性能最佳,提供了新的脑到文本解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 57%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03614 2026-07-21 cs.LG cs.AI 版本更新 57%

Neural Global Optimization via Iterative Refinement from Noisy Samples

通过噪声样本迭代细化的神经全局优化

Qusay Muzaffar, David Levin, Michael Werman

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种神经方法,通过迭代细化从噪声样本中寻找全局极小值,实验表明其在多模态测试函数上比传统方法有显著提升。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19504 2026-07-21 cs.CV 版本更新 57%

FusionNet: Physics-Aware Representation Learning for Multi-Spectral and Thermal Data via Trainable Signal-Processing Priors

FusionNet:通过可训练信号处理先验对多光谱和热数据进行物理感知表示学习

Georgios Voulgaris

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对水泥生产设施监测难题,提出FusionNet框架,通过整合多光谱数据,嵌入信号处理先验,经消融研究等实验验证,该框架能结合物理感知特征选择与深度学习架构,高精度检测水泥生产设施,为工业监测提供可靠框架。

Comments Accepted for publication in the IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03826 2026-07-21 q-bio.QM cs.AI 版本更新 57%

CORE -- A Cell-Level Coarse-to-Fine Image Registration Engine for Multi-stain Image Alignment

CORE——用于多染色图像对齐的细胞级粗到细图像配准引擎

Esha Sadia Nasir, Behnaz Elhaminia, Mark Eastwood, Catherine King, Owen Cain, Lorraine Harper, Paul Moss, Dimitrios Chanouzas, David Snead, Nasir Rajpoot, Adam Shephard, Shan E Ahmed Raza

机构 * Tissue Image Analytics (TIA) Centre, Department of Computer Science, University of Warwick, UK(tissue image analytics (TIA) 中心,计算机科学系,沃里克大学,英国) Department of Immunology and Immunotherapy, College of Medicine and Health, University of Birmingham, UK(免疫学与免疫治疗系,医学院与健康学院,伯明翰大学,英国) Department of Cellular Pathology, Queen Elizabeth Hospital Birmingham, UK(细胞病理学系,伯明翰女王医院,英国) Renal Unit, Queen Elizabeth Hospital Birmingham, University Hospitals Birmingham NHS Foundation Trust, UK(肾病科,伯明翰女王医院,伯明翰大学医院 NHS 基础信托,英国) Department of Applied Health Sciences, College of Medicine and Health, University of Birmingham, UK(应用健康科学系,医学院与健康学院,伯明翰大学,英国) Histofy Ltd, Coventry, UK(Histofy 有限公司,考文垂,英国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对多染色组织切片细胞核水平分析,提出CORE粗到细框架,粗配准利用组织掩码提取等,细粒度用形状感知模型,细胞水平用CPD估计位移场,经多数据集评估,CORE在多方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 50%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2607.18153 2026-07-21 cs.CV 新提交 79%

Robust Multimodal Dynamic Object Segmentation

鲁棒多模态动态目标分割

Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang

机构 * Meituan UAV(美团无人机) University of Delaware(特拉华大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对动态目标分割难题,提出整合多模态线索的框架,设计结合Transformer与特征聚类模块的网络进行分类,引入新后处理方法,在动态目标分割和静态场景重建任务中取得最优性能。

Comments Accepted by IEEE International Conference on Robotics & Automation ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17262 2026-07-21 cs.CL 新提交 79%

Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?

多模态情感分析中缺失模态总是需要修复吗?

Yubo Gao, Haotian Wu, Xiaoyu Xu, Yibo Yan, Hong Chen, Ruoshui Peng, Fei Pan, Puay Siew Tan, Zhuoran Gao, Yonghua Hei, Jie Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) Singapore Institute of Manufacturing Technology, A*STAR(新加坡制造技术研究所,新加坡科技研究局) Lingnan University(岭南大学)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 研究多模态情感分析中缺失模态是否总需修复,提出SIEVE方法,通过比较直接预测与修复分支,从样本损失差距得经验充分性信号,经证据门路由输入,与修复无关,实验证明其能改进修复主干并接近最优值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18059 2026-07-21 cond-mat.mtrl-sci physics.ins-det quant-ph 新提交 78%

Foundry CMOS platform for multimodal quantum materials characterization

用于多模态量子材料表征的代工CMOS平台

Sharad Kumar Yadav, Luca Nessi, Ondrej Dyck, Jinchen Wang, Bogdan Dryzhakov, Alex Melendez, Huan Zhao, Qian Song, Doha Amer, Cole Brabec, Saleh Alqazlan, Ruonan Han, Riccardo Comin, Stephen Jesse, Dirk Englund, Jawaher Almutlaq

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究利用65纳米CMOS工艺,通过功能划分金属堆栈构建多模态量子材料表征平台,可进行低温磁化率测量、NV中心光探测磁共振,降低功率需求且兼容原位电子束成像,建立了可扩展、可代工制造的平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 67%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract)

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17185 2026-07-21 cs.HC cs.CY 新提交 50%

PocketPPD: Screening for Postpartum Depression Risk Using Passive Smartphone Sensing

PocketPPD:使用被动式智能手机传感技术筛查产后抑郁风险

Jia Tang, Helinyi Peng, Akihito Taya, Kaoru Sezaki, Daisuke Nishi, Anind K Dey, Yuuki Nishiyama

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究针对产后抑郁筛查难题,提出基于被动智能手机传感的PocketPPD方法,利用产妇情境特征检测风险。通过对61名产后女性的四周可行性研究,给出不同模型AUC结果,发现重要数字生物标志物,为低负担筛查及围产期心理健康监测提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09237 2026-07-21 stat.AP 版本更新 50%

Demand-side decarbonisation at scale via MaaS-integrated carbon incentives

通过出行即服务集成碳激励措施实现大规模需求侧脱碳

Bing Liu, Yuan Liao, Sonia Yeh, Oded Cats, Kristian S. Nielsen, Zhenning Dong, Yong Wang, Yi Li, Yanli Liu, Zirui Ni, Xiaolei Ma

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究评估北京出行即服务平台碳激励计划,利用48.2亿次出行数据及匹配面板,发现注册使低碳出行份额增20.3个百分点,汽油车出行量降1.8%,年减碳94353吨,表明碳市场资助数字激励可推动城市低碳出行。

Comments 22 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01875 2026-07-21 stat.ME 版本更新 50%

Bayesian computation for high-dimensional Gaussian Graphical Models with spike-and-slab priors

具有尖峰和平板先验的高维高斯图形模型的贝叶斯计算

Deborah Sulem, Jack Jewson, David Rossell

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究高维高斯图形模型的贝叶斯计算,提出完全贝叶斯算法,包括块内吉布斯 - 梅特罗波利斯 - 黑斯廷斯算法和全局提议,可扩展到高维,给出混合边界和成本边界,扩展了精确贝叶斯推断的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05524 2026-07-21 eess.SP 版本更新 50%

Revisiting Beamforming Design for Stable Millimeter-Wave Communications Under Blockages

重新审视毫米波通信在阻塞环境下的稳定波束成形设计

Kanta Terui, Kabuto Arai, Koji Ishibashi

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究毫米波通信在阻塞下的波束成形设计,提出利用LoS和NLoS路径的多波束设计,推导相关理论表达式,制定面板分配问题,通过算法求解,经仿真验证有效性,降低中断概率实现稳定通信。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏