arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-03 至 2026-08-03 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2607.27017 2026-08-03 cs.LG cs.RO 版本更新 78%

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29527 2026-08-03 cs.LG cs.AI cs.CY econ.EM stat.ML 新提交 57%

TerraNova: A Foundation Model for the Anthropocene

TerraNova:人类世的基础模型

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano(米兰理工大学) RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。

Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29370 2026-08-03 cs.CV 新提交 57%

VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection

VFAD:变分语义提示与频率自适应表示学习结合的零样本异常检测

Peng Chen, Kaige Li, Wei Wang, Mingbo Yang, Wenqiang Wang, Li Shen, Fangjun Huang, Chao Huang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出VFAD框架,结合变分语义提示与频率自适应表示学习,在13个工业和医学基准上,其零样本异常检测性能优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29100 2026-08-03 cs.LG cs.CR cs.CV 新提交 57%

StraightDP: Geometry-Aware Differential Privacy for Rectified-Flow Transformers

StraightDP:面向整流流Transformer的几何感知差分隐私

Xujun Che, Depeng Xu, Xintao Wu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 StraightDP利用整流流的几何异质性,通过释放类条件矩结合DP-SGD,在强差分隐私约束下提升文本条件生成模型的下游准确率与生成质量,且可迁移到SD3-medium。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 50%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19683 2026-08-03 cs.RO 版本更新 50%

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba

Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 9 篇

2607.28652 2026-08-03 q-bio.OT cs.AI stat.AP 新提交 79%

HenTwin: A Multimodal Digital Twin Framework for Longitudinal Biological State Monitoring in Laying Hens

HenTwin:用于蛋鸡纵向生物状态监测的多模态数字孪生框架

Yashan Dhaliwal, Shreya Rao, Suresh Neethirajan

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出HenTwin多模态数字孪生框架,通过五层物联网架构整合多模态数据构建蛋鸡生物状态模型,验证了其稳定性与跨房间适用性,为精准畜牧养殖提供了状态感知的数字孪生解决方案。

Comments 24 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29404 2026-08-03 math.DS 新提交 67%

Decomposition-based Energy-based Dual-Phase Dynamics Identification for Nonlinear MDOF Systems

基于分解的非线性多自由度系统能量双相动力学辨识方法

Sayantan Ghosh, Cristian López, Aryan Singh, Keegan J. Moore

专题命中 其他多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 本研究将能量双相动力学辨识(EDDI)扩展至多自由度系统,提出基于分解的EDDI方法,经两层塔结构实验验证,可有效辨识复杂多模态非线性结构动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16639 2026-08-03 cs.LG 版本更新 67%

SPICE: Synergy and Partial Information Based Curriculum Evolution

SPICE: 基于协同与部分信息的课程演化

Ankush Pratap Singh, Houwei Cao, Yong Liu

机构 * New York Institute of Technology(纽约理工学院) New York University(纽约大学)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出SPICE框架,利用部分信息分解理论动态量化样本复杂度,设计渐进式课程使模型从学习共享跨模态线索过渡到模态特定模式再到复杂协同交互,在多个多模态基准上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29278 2026-08-03 cs.CV 新提交 57%

Training-Free Entity-Level Few-Shot Segmentation of Remote Sensing Images with Advection Refinement

基于平流优化的遥感图像无训练实体级小样本分割

Xueting Bai, Huan Ni

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 该研究针对现有跨域小样本分割方法训练成本高、预测结果碎片化的问题,提出一种基于平流优化的无训练实体级遥感图像小样本分割框架,可提升 SAM3 的相关适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00177 2026-08-03 cs.GR cs.CV 版本更新 57%

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法

Qianfan Shen, Ningxiao Tao, Qiyu Dai, Tianle Chen, Minghan Qin, Yongjie Zhang, Mengyu Chu, Wenzheng Chen, Baoquan Chen

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) ByteDance Seed(字节跳动种子) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29675 2026-08-03 math.ST cs.LG stat.ME stat.ML stat.TH 新提交 50%

Differentially Private Nonparametric Modal Learning with Applications to Regression and Clustering

差分隐私非参数模态学习及其在回归与聚类中的应用

Arkajyoti Bhattacharjee, Arnab Auddy

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究提出差分隐私非参数模态学习方法DP-GRAMS,实现多峰分布密度模态的高概率恢复,扩展出DP-PMS回归与DP-GRAMS-C聚类方法,在合成及真实数据上展现良好隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28850 2026-08-03 astro-ph.EP astro-ph.IM 新提交 50%

Optical and acoustic ground effects simulations from terminal defense asteroid disruption via the PI method

利用PI方法进行终端防御小行星破碎产生的光学与声学地面效应模拟

Brin Bailey, Alexander N. Cohen, Philip Lubin, Darrel K. Robertson, Mark Boslough, Sasha Egan, Elizabeth A. Silber, Dharv Patel

专题命中 其他多模态 :multi-modal(abstract)

AI总结 该研究通过模拟验证,NASA的PI方法可在数小时至数年预警内破碎小行星,将2023 PDC这类威胁破碎为100万个碎片时,能大幅降低地面光学与声学效应,实现行星防御。

Journal ref Acta Astronautica (2024), vol. 221, pp. 230-239

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11711 2026-08-03 cs.LG stat.ML 版本更新 50%

Reinforced sequential Monte Carlo for amortised sampling

强化序贯蒙特卡洛用于摊销采样

Sanghyeok Choi, Sarthak Mittal, Víctor Elvira, Jinkyoo Park, Esmeralda S. Whitammer

机构 * University of Edinburgh Mila -- Qu\'ebec AI Institute CIFAR Fellow

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出一种摊销方法与粒子方法相结合的采样框架,通过最大熵强化学习训练序贯蒙特卡洛采样器,并利用离线策略学习提高目标分布探索效率,在合成多模态目标和丙氨酸二肽构象玻尔兹曼分布上验证了改进的近似精度与训练稳定性。

Comments ICML 2026. Code: https://github.com/hyeok9855/ReinforcedSMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13112 2026-08-03 astro-ph.EP 版本更新 50%

Evaluating Short-Warning Mitigation via Intentional Robust Disruption of a Hypothetical Impact of Asteroid 2023 NT1

通过故意鲁棒性中断2023 NT1小行星假想撞击事件评估短预警 mitigation方案

Brin Bailey, Alexander N. Cohen, Sasha Egan, Philip Lubin, Ruitao Xu, Mark Boslough, Darrel K. Robertson, Elizabeth A. Silber, Irina Sagert, Oleg Korobkin, Glenn Sjoden

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文针对假想的2023 NT1小行星撞击事件,采用Pulverize It模型模拟分析,发现该类威胁可在撞击前1天内拦截,实现有效 mitigation。

Journal ref The Astrophysical Journal (2025), vol. 981, pp. 181-197

详情

展开后加载摘要…

URL PDF HTML 收藏