arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 197 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 41 篇

2607.23193 2026-08-04 cs.CV 版本更新 57%

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

OmniScope:用于全模态大语言模型的模态解耦令牌压缩

Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiawu Zheng

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对全模态大语言模型令牌压缩问题,提出无需训练的OmniScope框架,以查询为语义锚点分别估计音频和视频相关性,分配特定模态预算并采用相应策略处理,在多基准和模型规模上效果佳,实现加速和内存减少,提出跨模态推理设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11025 2026-08-04 cs.CV 版本更新 57%

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00368 2026-08-04 eess.SP 新提交 50%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 50%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 50%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 12 篇

2608.01922 2026-08-04 cs.CL 新提交 83%

TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

TRAM:利用轨迹衍生辅助记忆增强多模态推理

Kang Liu, Zijing Wang, Yongkang Liu, Mengjie Zhao, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02955 2026-08-04 cs.CV 80%

Multimodal image registration for effective thermographic fever screening

C. Y. N. Dwith, Pejhman Ghassemi, Joshua Pfefer, Jon Casamento, Quanzeng Wang

专题命中 其他多模态 :multimodal(title,journal_ref);multi-modal(abstract);分类 cs.CV

Journal ref Proceedings Volume 10057, Multimodal Biomedical Imaging XII 100570S, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01238 2026-08-04 cs.CL cs.MM 新提交 76%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.MM

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09935 2026-08-04 cs.CL cs.AI 版本更新 62%

Unpacking Hateful Memes: Presupposed Context and False Claims

解析仇恨表情包:预设语境与虚假主张

Weibin Cai, Jiayu Li, Reza Zafarani

机构 * Syracuse University(Syracuse大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对仇恨表情包检测中忽略仇恨本质的问题,提出含PCM与FACT模块的SHIELD框架,实验显示其检测性能优于现有最优方法,且可用于假新闻检测等任务。

Comments Accepted to SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01112 2026-08-04 cs.AI 新提交 57%

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究

Tobias Braun, Jonas Grebe, Louis Rethfeld, Marcus Rohrbach

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00743 2026-08-04 cs.CV 新提交 57%

LUT: Latent Utility Training for Visual Reasoning

LUT:用于视觉推理的隐式效用训练

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 57%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00690 2026-08-04 cs.NI 新提交 50%

LLM-Assisted Coalition Formation for Cooperative Perception in Autonomous Driving

大语言模型辅助的自动驾驶协同感知联盟形成

Ahmad Sarlak, Hao Wang, Rahul Amin, Abolfazl Razi

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对现有协同感知方法未优化车辆选择的问题,提出LLM辅助的联盟形成框架,结合DPP与ADMM优化,在OPV2V等数据集上实现更优性能与网络效率。

Comments Accepted for presentation at IEEE Global Communications Conference (GLOBECOM 2026), Cognitive Radio and AI-Enabled Networks Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02531 2026-08-04 cond-mat.mtrl-sci 新提交 50%

Revealing Intrinsic Anisotropy of Collective Magnetic Excitations in Twinned Crystals of a Kitaev-Heisenberg Quantum Magnet

揭示Kitaev-Heisenberg量子磁体孪晶中集体磁激发的本征各向异性

Naipeng Zhang, Nikolai Simonov, Mykhaylo Ozerov, Sumedh Rathi, Nolan Heffner, Sara Huszar, Long Chen, Haidong Zhou, Guangxin Ni, Chaebin Kim, Martin Mourigal, Stephen M. Winter, Zhigang Jiang, Dmitry Smirnov

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究结合多模态光学探针,分离Kitaev-Heisenberg量子磁体Na₃Co₂SbO₆孪晶的单畴磁振子响应,揭示其本征二重面内磁振子各向异性,建立通用的多畴量子磁体自旋动力学研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01163 2026-08-04 astro-ph.CO astro-ph.GA astro-ph.IM 新提交 50%

AGN Reverberation Mapping with LITMUS: Fundamental Limits on lag Recovery Rates

基于LITMUS的活动星系核反响映射:滞后恢复率的基本极限

Hugh McDougall, Tamara M. Davis, Benjamin J. S. Pope, Paul Martini, Zhefu Yu, Chris Lidman, Geraint F. Lewis

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究开发了新的滞后测量包LITMUS,利用贝叶斯证据识别假阳性滞后,分析OzDES样本发现以往RM研究高估了滞后置信度,不同发射线的AGN反响百分比存在显著差异。

Comments 32 Pages, 21 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22402 2026-08-04 physics.flu-dyn physics.comp-ph 版本更新 50%

Neural Differential Equations for Oscillatory Flows in Aeroelasticity Applied to Transonic Buffet

用于气动弹性中振荡流的神经常微分方程及其在跨声速抖振中的应用

Michael Candon, Pier Marzocca, Earl Dowell

专题命中 其他多模态 :cross-modal(abstract)

AI总结 针对自激气动流引发的气弹不稳定性预测难题,提出结合非线性流体振荡器等的神经微分方程降阶模型,经单个CFD模拟识别后与结构方程耦合,用于跨声速抖振预测,结果与全阶解吻合良好,为多模态气弹不稳定性提供新见解。

Comments Under Review: AIAA Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21659 2026-08-04 stat.CO 版本更新 50%

Adaptive Generalized Elliptical Slice Sampling

自适应广义椭圆切片采样

Nicholas Marco, Surya T. Tokdar

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对无梯度MCMC中手动调参、维度扩展和局部几何适应性的挑战,提出自适应广义椭圆切片采样(AGESS),通过结合椭圆切片采样与衰减自适应,实现从慢混合到快混合的自校正,并保持遍历性。

详情

展开后加载摘要…

URL PDF HTML 收藏