arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2601.14044 2026-04-23 cs.CV 79%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20755 2026-04-23 cs.AI cs.LG 79%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16879 2026-04-23 cs.CV 77%

Adaptive Forensic Feature Refinement via Intrinsic Importance Perception

通过内在重要性感知实现自适应的 forensic 特征细化

Jiazhen Yang, Junjun Zheng, Kejia Chen, Xiangheng Kong, Jie Lei, Zunlei Feng, Bingde Hu, Yang Gao

机构 * Zhejiang University(浙江大学) Alibaba Inc(阿里巴巴公司) Zhejiang University of Technology(浙江工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出I2P框架,通过自适应识别关键层表示并约束任务驱动的参数更新,提升SID任务的特定性同时保留预训练表示的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI 62%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12910 2026-04-23 cs.CL cs.AI 62%

SciCoQA: Quality Assurance for Scientific Paper--Code Alignment

SciCoQA:科学论文与代码对齐的质量保障

Tim Baumgärtner, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、德累斯顿技术大学和应用网络安全国家研究中心ATHENE)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciCoQA数据集,用于评估LLM在科学论文与代码对齐任务中的表现,揭示自动化科学质量保障的关键差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20398 2026-04-23 cs.CL cs.LG cs.SE 57%

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站

Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo Li, Yue Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Electronics and Telecommunications Research Institute(电子电信研究院) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 57%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19591 2026-04-23 cs.CV 57%

Structure-Semantic Decoupled Modulation of Global Geospatial Embeddings for High-Resolution Remote Sensing Mapping

全局地理嵌入的结构-语义解耦调制用于高分辨率遥感制图

Jienan Lyu, Miao Yang, Jinchen Cai, Yiwen Hu, Guanyi Lu, Junhao Qiu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SSDM框架,通过解耦全局地理表示为两个互补的跨模态注入路径,提升高分辨率遥感制图的结构和语义一致性,实现更准确的土地覆盖分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20621 2026-04-23 cs.CR 50%

SoK: The Next Frontier in AV Security: Systematizing Perception Attacks and the Emerging Threat of Multi-Sensor Fusion

SoK:自动驾驶安全的下一个前沿:系统化感知攻击与多传感器融合的新兴威胁

Shahriar Rahman Khan, Tariqul Islam, Raiful Hasan

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文系统化分析了48篇关于自动驾驶感知层攻击的研究,揭示了从单传感器攻击到多传感器融合威胁的发展趋势,指出现有研究在现实测试、短期评估偏见及跨传感器一致性防御方面的不足,并提出融合感知安全的设计方向。

Comments 20 Pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 7 篇

2604.20705 2026-04-23 cs.CV 85%

SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

SSL-R1: 多模态大语言模型的自监督视觉强化后训练

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 SSL-R1通过自监督学习生成可验证奖励,提升多模态大语言模型的推理能力,无需人工或外部监督,有效增强视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22175 2026-04-23 eess.SP 78%

Algorithm Unrolling-based Denoising of Multimodal Graph Signals

基于算法展开的多模态图信号去噪

Hayate Kojima, Keigo Takanami, Junya Hara, Yukihiro Bandoh, Seishi Takamura, Hiroshi Higashi, Yuichi Tanaka

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种基于交替最小化方案的多模态图信号去噪方法,通过同时学习图结构和信号恢复,利用深度算法展开学习参数,实验表明优于现有模型和深度学习方法。

Comments Submitted to IEEE TSIPN

Journal ref IEEE Transactions on Signal and Information Processing over Networks, 13 April 2026 (Early Access)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17571 2026-04-23 physics.optics physics.app-ph 78%

Leaky-Wave Antenna Analysis using Multi-Modal Network Theory with Open Periodic Boundaries

基于开放周期边界的多模网络理论的泄漏波天线分析

Oscar Senlis, John N. Le, Anthony Grbic, Mauro Ettorre, Vincent Laquerbe, David González-Ovejero

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出两种方法,利用多模网络理论与开放周期边界分析泄漏波天线的色散特性,通过全波求解器和解析方法结合,验证了单位元的色散关系和接收性能。

Comments 9 pages, 11 figures, submitted to IEEE TAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05687 2026-04-23 cs.CV 74%

3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models

由多模态大语言模型视觉先验引导的3D烟雾场景重建

Xinye Zheng, Fei Wang, Yiqi Nie, Kun Li, Junjie Chen, Jiaqi Zhao, Yanyan Wei, Zhiliang Wu

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Nanyang Technological University(南洋理工大学)

专题命中 其他多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出整合视觉先验与高效3D场景建模的框架,通过增强烟雾退化图像和开发Smoke-GS框架,提升烟雾场景重建与视图合成的鲁棒性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09591 2026-04-23 cs.CV cs.AI 62%

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

变分视觉问答用于不确定性感知的选择性预测

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。

Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20161 2026-04-23 cs.LG stat.ME stat.ML 50%

SMART: A Spectral Transfer Approach to Multi-Task Learning

SMART:一种用于多任务学习的谱转移方法

Boxin Zhao, Mladen Kolar, Jinchi Lv

机构 * University of Chicago(芝加哥大学) University of Southern California(南加州大学)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 SMART通过假设目标左右奇异子空间在源子空间内并稀疏对齐源奇异基,改进了多任务线性回归的转移学习,提升了小样本下的性能和鲁棒性。

Comments 53 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19919 2026-04-23 astro-ph.SR astro-ph.GA astro-ph.IM 50%

Neural Simulation-based Inference with Hierarchical Priors for Detached Eclipsing Binaries

基于分层先验的神经模拟推理用于分离双星系统

Jacqueline Blaum Hough, Joshua S. Bloom

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种基于分层先验的神经模拟推理方法,用于分离双星系统的参数估计,结合光变曲线、宽波段辐射特性及Gaia视差,实现高效且精确的参数推断。

详情

展开后加载摘要…

URL PDF HTML 收藏