arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 12 篇

2608.01922 2026-08-04 cs.CL 新提交 83%

TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

TRAM:利用轨迹衍生辅助记忆增强多模态推理

Kang Liu, Zijing Wang, Yongkang Liu, Mengjie Zhao, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02955 2026-08-04 cs.CV 80%

Multimodal image registration for effective thermographic fever screening

C. Y. N. Dwith, Pejhman Ghassemi, Joshua Pfefer, Jon Casamento, Quanzeng Wang

专题命中 其他多模态 :multimodal(title,journal_ref);multi-modal(abstract);分类 cs.CV

Journal ref Proceedings Volume 10057, Multimodal Biomedical Imaging XII 100570S, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01238 2026-08-04 cs.CL cs.MM 新提交 76%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 其他多模态 :multimodal(title);分类 cs.CL、cs.MM

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09935 2026-08-04 cs.CL cs.AI 版本更新 62%

Unpacking Hateful Memes: Presupposed Context and False Claims

解析仇恨表情包:预设语境与虚假主张

Weibin Cai, Jiayu Li, Reza Zafarani

机构 * Syracuse University(Syracuse大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对仇恨表情包检测中忽略仇恨本质的问题,提出含PCM与FACT模块的SHIELD框架,实验显示其检测性能优于现有最优方法,且可用于假新闻检测等任务。

Comments Accepted to SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01112 2026-08-04 cs.AI 新提交 57%

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究

Tobias Braun, Jonas Grebe, Louis Rethfeld, Marcus Rohrbach

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00743 2026-08-04 cs.CV 新提交 57%

LUT: Latent Utility Training for Visual Reasoning

LUT:用于视觉推理的隐式效用训练

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新 57%

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00690 2026-08-04 cs.NI 新提交 50%

LLM-Assisted Coalition Formation for Cooperative Perception in Autonomous Driving

大语言模型辅助的自动驾驶协同感知联盟形成

Ahmad Sarlak, Hao Wang, Rahul Amin, Abolfazl Razi

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对现有协同感知方法未优化车辆选择的问题,提出LLM辅助的联盟形成框架,结合DPP与ADMM优化,在OPV2V等数据集上实现更优性能与网络效率。

Comments Accepted for presentation at IEEE Global Communications Conference (GLOBECOM 2026), Cognitive Radio and AI-Enabled Networks Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02531 2026-08-04 cond-mat.mtrl-sci 新提交 50%

Revealing Intrinsic Anisotropy of Collective Magnetic Excitations in Twinned Crystals of a Kitaev-Heisenberg Quantum Magnet

揭示Kitaev-Heisenberg量子磁体孪晶中集体磁激发的本征各向异性

Naipeng Zhang, Nikolai Simonov, Mykhaylo Ozerov, Sumedh Rathi, Nolan Heffner, Sara Huszar, Long Chen, Haidong Zhou, Guangxin Ni, Chaebin Kim, Martin Mourigal, Stephen M. Winter, Zhigang Jiang, Dmitry Smirnov

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究结合多模态光学探针,分离Kitaev-Heisenberg量子磁体Na₃Co₂SbO₆孪晶的单畴磁振子响应,揭示其本征二重面内磁振子各向异性,建立通用的多畴量子磁体自旋动力学研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01163 2026-08-04 astro-ph.CO astro-ph.GA astro-ph.IM 新提交 50%

AGN Reverberation Mapping with LITMUS: Fundamental Limits on lag Recovery Rates

基于LITMUS的活动星系核反响映射:滞后恢复率的基本极限

Hugh McDougall, Tamara M. Davis, Benjamin J. S. Pope, Paul Martini, Zhefu Yu, Chris Lidman, Geraint F. Lewis

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究开发了新的滞后测量包LITMUS,利用贝叶斯证据识别假阳性滞后,分析OzDES样本发现以往RM研究高估了滞后置信度,不同发射线的AGN反响百分比存在显著差异。

Comments 32 Pages, 21 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22402 2026-08-04 physics.flu-dyn physics.comp-ph 版本更新 50%

Neural Differential Equations for Oscillatory Flows in Aeroelasticity Applied to Transonic Buffet

用于气动弹性中振荡流的神经常微分方程及其在跨声速抖振中的应用

Michael Candon, Pier Marzocca, Earl Dowell

专题命中 其他多模态 :cross-modal(abstract)

AI总结 针对自激气动流引发的气弹不稳定性预测难题,提出结合非线性流体振荡器等的神经微分方程降阶模型,经单个CFD模拟识别后与结构方程耦合,用于跨声速抖振预测,结果与全阶解吻合良好,为多模态气弹不稳定性提供新见解。

Comments Under Review: AIAA Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21659 2026-08-04 stat.CO 版本更新 50%

Adaptive Generalized Elliptical Slice Sampling

自适应广义椭圆切片采样

Nicholas Marco, Surya T. Tokdar

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对无梯度MCMC中手动调参、维度扩展和局部几何适应性的挑战,提出自适应广义椭圆切片采样(AGESS),通过结合椭圆切片采样与衰减自适应,实现从慢混合到快混合的自校正,并保持遍历性。

详情

展开后加载摘要…

URL PDF HTML 收藏