arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-06 至 2026-08-06 共收录 87 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 7 篇

2608.05013 2026-08-06 cs.CL cs.AI cs.HC cs.LG cs.MA 新提交 62%

OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

OneDayAgent:面向自主智能体的长程管控框架

Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 OneDayAgent是一种长程管控框架,可将开放式请求分解为子任务,在不同后端LLMs上实现最优性能,解决智能体的多类失效模式。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 57%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04530 2026-08-06 cs.CV 新提交 57%

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

FocusMem:对潜在GUI记忆中的内容、读出和信任进行因子分解

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 FocusMem将潜在GUI记忆的内容、读出和信任因子分解,解决现有固定记忆方法的细节丢失、阶段适配差和误导问题,在五个GUI智能体基准测试中性能优于基线与现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06024 2026-08-06 q-bio.QM cs.AI 交叉投稿 57%

TourSynbio-Search: A Large Language Model Driven Agent Framework for Unified Search Method for Protein Engineering

TourSynbio-Search:一种用于蛋白质工程的统一搜索方法的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 TourSynbio-Search是TourSynbio-7B驱动的双模块搜索智能体框架,可跨多平台检索文献与蛋白质数据,降低技术门槛,提升蛋白质工程研究的信息检索效率与生产力

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 17 篇

2608.04548 2026-08-06 cs.LG cs.AI 新提交 91%

A Model Merging Approach for Continual MLLM Unlearning

面向持续多模态大语言模型(MLLM)遗忘的模型合并方法

Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 针对现有MLLM遗忘方法无法应对持续场景的问题,本文提出MCU方法,通过动态合并遗忘适配器缓解跨任务依赖的干扰,在多个基准测试中实现了更优的遗忘效果与知识保留。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04949 2026-08-06 cs.CV cs.CL cs.IT cs.MM math.IT 新提交 87%

UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction

UG-UMRE:面向统一多模态关系抽取的不确定性引导模态增强与分布校准

Bo Kong, Liruiz Jia, Yi Liang, Chao Liu, Dongfang Han, Tianwei Yan, Yuan Liu, Shengquan Liu

机构 * Xinjiang University(新疆大学) Chongqing Jiaotong University(重庆交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 针对统一多模态关系抽取的噪声传播与模态分布异质性问题,提出含UDUA和JAUA模块的UG-UMRE网络,在UMRE等三个基准数据集上实现最优性能,模块可插拔且有效。

Comments Accepted at ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00513 2026-08-06 cs.LG cs.AI cs.CV cs.IR 版本更新 86%

MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding

MOON3.0: 基于推理的多模态表示学习用于电商产品理解

Junxian Wu, Chenghan Fu, Zhanheng Nie, Daoze Zhang, Bowen Wan, Wanxian Guan, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04013 2026-08-06 cs.LG cs.AI 新提交 85%

C$^2$MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

C²MOE:面向不完整多模态情感学习的一致性与互补性引导的混合专家模型

Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

机构 * Central South University of Forestry and Technology(中南林业科技大学) State University of New York, New Paltz(纽约州立大学新帕尔茨分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态情感识别中模态缺失导致性能下降的问题,本文提出C²MOE框架,通过分解多模态知识为一致性与互补性分量、引入双分支预测机制及可学习重加权模块,在多个基准上实现了优于现有方法的性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04054 2026-08-06 cs.MM cs.AI cs.CL cs.LG 新提交 85%

Modality Agreement- and Conflict-Aware Prototype Hypergraph Learning for Multimodal Intent Understanding

面向多模态意图理解的模态一致与冲突感知原型超图学习

Mohnish Raj, Suraj Kumar, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 针对多模态意图理解中分歧信息被多数融合方法忽略的问题,提出MACH框架,通过分层一致与冲突原型超图及自适应仲裁机制,在基准数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08324 2026-08-06 cs.NE cs.AI 版本更新 83%

Multi-Modal Learning meets Genetic Programming: Analyzing Alignment in Latent Space Optimization

多模态学习遇见遗传编程:分析潜在空间优化中的对齐

Benjamin Léger, Kazem Meidani, Christian Gagné

机构 * Mila, Université Laval(Mila,拉瓦尔大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学) Canada-CIFAR AI Chair(加拿大-卡内基梅隆人工智能主席)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文研究SNIP方法在符号回归中多模态潜在空间优化的对齐效果,发现跨模态对齐在优化过程中未改善且过于粗糙,导致有效对齐引导的优化尚未实现。

Comments Accepted at PPSN 2026 (Trento, Italy). To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02778 2026-08-06 cs.CL 版本更新 83%

When Modalities Remember: Continual Learning for Multimodal Knowledge Graphs

当模态记住:多模态知识图谱的持续学习

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Haoran Duan, Gadeng Luosang, Nyima Tashi

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, Zhejiang University(浙江大学计算机科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院) School of Information Science and Technology, Tibet University(西藏大学信息科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MRCKG模型,通过多模态-结构协同课程和跨模态知识保存机制,解决多模态知识图谱的持续学习问题,提升新知识学习能力。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 82%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04234 2026-08-06 math.ST cs.LG stat.ML stat.TH 新提交 82%

Multimodal Alignment Through Joint Kernel Entropic Gromov--Wasserstein Optimal Transport

基于联合核熵 gromov-wasserstein 最优传输的多模态对齐

Yixuan Florence Wu, Yilun Zhu, Naichen Shi

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对跨模态配对数据稀缺的场景,提出 JK-EGW 框架实现多模态对齐,理论样本复杂度匹配标准最优传输,实验中在数据稀缺的预训练编码器嵌入对齐任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04016 2026-08-06 cs.CY cs.AI cs.LG stat.AP 新提交 79%

AI-driven Multimodal Representation Learning for Latent Mediation Structure Discovery of Socioeconomic Disadvantage, Psychosocial Factors, and Cardiometabolic Multimorbidity: Insights from the All of Us Research Program

人工智能驱动的多模态表征学习用于发现社会经济劣势、心理社会因素与心脏代谢共病的潜在中介结构:来自All of Us研究计划的见解

Cong Cao, Shuangge Ma

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究基于All of Us研究计划数据,开发AI驱动的多模态中介框架,通过变分自编码器推导潜在表征,发现心理社会脆弱性是连接社会经济劣势与心脏代谢共病的关键中介通路,为探究健康相关复杂关系提供了新方法。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 79%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 62%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04833 2026-08-06 cs.CV 新提交 57%

RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection

RegisterBridgeMM:一种以寄存器为核心的RGB-红外目标检测框架

Zian Wang, Hangchuan Liang, Yuehua Chen, Changchun Li, Chaoyi Guo, Mingzhe Liu, Fangming Gu

机构 * Jilin University(吉林大学) Taiyuan University of Technology(太原理工大学) Shenzhen University(深圳大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对RGB-红外目标检测的跨模态融合难题,提出以寄存器为核心的RegisterBridgeMM框架,通过三阶段寄存器生命周期实现高效融合,在四个基准数据集上取得最高mAP50-95性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 57%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 57%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20113 2026-08-06 cs.CV eess.IV 版本更新 57%

Attention Fusion for Bridge Deck Delamination Detection

多传感器注意力网络用于混凝土桥面亚表面脱层自动检测

Alireza Moayedikia, Amirhossein Moayedikia

机构 * Department of Business Technology and Entrepreneurship, Swinburne University of Technology(斯winburne技术大学商业技术与创业系) Swinburne University of Technology(斯winburne技术大学) University of Sydney(悉尼大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出多传感器注意力网络用于混凝土桥面亚表面脱层检测,通过整合GPR和IRT数据,提升自动化检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22874 2026-08-06 cs.CV 版本更新 57%

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

基于KAN的隐式神经表示的可变形医学图像配准

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。

Comments Accepted at Machine Learning and Knowledge Extraction

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 5 篇

2608.04348 2026-08-06 cs.CV cs.AI cs.LG stat.ML 新提交 81%

iStructTab: Structured Feature Sequencing for Multimodal Learning of Image and Tabular Data

iStructTab:面向图像与表格数据多模态学习的结构化特征排序

Al Zadid Sultan Bin Habib, Md Younus Ahamed, Prashnna Gyawali, Gianfranco Doretto, Donald A. Adjeroh

机构 * West Virginia University(西弗吉尼亚大学) The University of Utah(犹他大学) Scientific Computing and Imaging Institute(科学计算与成像研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 iStructTab基于图增强描述子排序算法(GEDS),将其融入感知顺序的高效Transformer框架,在多模态基准上有效减少特征分散,提升了图像与表格数据多模态学习的预测性能及鲁棒性。

Comments This paper has been accepted for presentation at the 28th International Conference on Pattern Recognition (ICPR 2026) in Lyon, France Code: https://github.com/zadid6pretam/iStructTab PyPI: pip install istructtab

Journal ref International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04910 2026-08-06 cs.HC 新提交 78%

AutoCue: Multimodal LLM-Assisted Externalization of Implicit Inputs as Instructional Visual Cues in Screencast Tutorials

AutoCue:多模态大语言模型辅助将隐式输入外部化为录屏教程中的教学视觉提示

Shengyang Luo, Shengyao Luo, Xiaolei Guo, Fengze Zhang, James Liang, Yingjie Victor Chen

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 AutoCue是多模态大语言模型辅助的教程增强流水线,可将录屏教程中隐式输入外部化为视觉提示,在Autodesk Maya上的评估显示其能缩短任务时间、减少交互中断并提升学习者体验

Comments Accepted to Graphics Interface 2026 (GI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04154 2026-08-06 cs.CV cs.AI 新提交 76%

TRNet: Topography-Guided Frequency Rectification and Structure-Aware Decoding for Multimodal Paddy Rice Segmentation

TRNet:用于多模态水稻分割的地形引导频率校正与结构感知解码

Kaiwen Xiao, Chunlong Fu, Liping Zheng, Yanfeng Su

机构 * School of Computer Science, Sichuan University Jinjiang College(四川大学锦江学院计算机学院)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 TRNet模型针对山区丘陵水稻分割难题,采用双编码器与地形引导解码,在A、B区域水稻IoU较双编码器U-Net显著提升,验证了地形作为上下文先验的有效性。

Comments 16 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04033 2026-08-06 cs.CR 新提交 67%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04930 2026-08-06 cs.LG cs.AI 新提交 57%

SVI-DAG: A Structured Variational Inference Approach to Bayesian Causal Discovery

SVI-DAG:一种用于贝叶斯因果发现的结构化变分推断方法

Shrenik Zinage

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 SVI-DAG是一种贝叶斯因果发现的结构化变分推断方法,用归一化流建模边依赖、斯坦变分梯度下降优化,在不确定性量化上优于5种现有方法,结构准确性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏