arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-07 至 2026-08-07 共收录 36 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2604.11402 2026-08-07 cs.CV 版本更新 79%

SCD4VPR: Multi-modal Scene Change Detection for Long-term Visual Place Recognition Database Update

基于视觉-语言表示学习的场景变化检测

Diwei Sheng, Vijayraj Gohil, Satyam Gaba, Zihan Liu, Giles Hamilton-Fletcher, John-Ross Rizzo, Yongqing Liang, Chen Feng

机构 * New York University(纽约大学)

专题命中 图文多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 50%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2601.21124 2026-08-07 cs.SD cs.AI eess.AS 版本更新 81%

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解

Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

机构 * Google DeepMind(谷歌DeepMind) Media Lab, MIT(媒体实验室,麻省理工学院) Google AR(谷歌AR)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03964 2026-08-07 eess.AS 版本更新 79%

Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE

基于QIANGDA与VOXBLINK2-AVSE的身份保真视听目标说话人提取

Peijun Yang, Zhan Jin, Xiaoyi Qin, Ruiyi Gan, Hao Wang, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出QIANGDA普通话AV-TSE基准与VOXBLINK2-AVSE数据集,采用含AV-HuBERT等的提取器,通过双指标评估,取得了视听目标说话人提取的良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02183 2026-08-07 cs.AI 版本更新 79%

TRU: Targeted Reverse Update for Efficient Multimodal Recommendation Unlearning

TRU:面向高效多模态推荐去学习的定向反向更新

Zhanting Zhou, KaHou Tam, Ziqiang Zheng, Zeyu Ma, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Macau(澳门大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态推荐系统中数据删除影响不均匀的问题,提出TRU框架,通过层级化干预实现更高效的去学习,提升保留与遗忘的平衡。

Comments Author Accepted Manuscript. Accepted for publication in the Proceedings of the 34th ACM International Conference on Multimedia (ACM MM '26). This author-created manuscript is not the ACM Version of Record

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24445 2026-08-07 cs.RO 版本更新 78%

Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies

可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证

Tim Schreiter, Jens V. Rüppel, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04586 2026-08-07 cs.CL cs.AI 版本更新 62%

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

通过资源感知型语音编码器混合模型打破多对多语音到文本翻译中的多语言性诅咒

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Chengpeng Fu, Yu Wang, Ming Liu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多对多语音到文本翻译中的多语言性诅咒问题,提出资源感知型MoSE框架与五阶段课程学习策略,其4B参数模型在45种语言的全方向翻译任务上实现最优性能,显著提升低资源语言表现且不损害高资源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06612 2026-08-07 cs.CV 版本更新 57%

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

从音频到视频的桥梁:音素-视素对齐让任意人脸可说多种语言

Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

机构 * Xidian University(西安电子科技大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出MuEx框架,通过PG-MoE架构和PV-Align机制,结合含12种语言的MTFD数据集,实现多语言语音驱动说话人脸合成,在MTFD全语言表现优异且可零样本泛化到未见语言。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2506.02260 2026-08-07 stat.ML cs.LG stat.AP 版本更新 82%

MoCA: Multi-modal Cross-masked Autoencoder for Time Series in Digital Health

MoCA:用于数字健康测量的多模态交叉掩码自编码器

Howon Ryu, Yuliang Chen, Yacun Wang, Andrea Z. LaCroix, Chongzhi Di, Loki Natarajan, Yu Wang, Jingjing Zou

机构 * Herbert Wertheim School of Public Health and Human Longevity Science, University of California, San Diego, San Diego, CA, USA(赫伯特·韦瑟姆公共卫生与人类长寿科学学院,加州大学圣地亚哥分校) Halıcıoğlu Data Science Institute, University of California San Diego, San Diego, CA, USA(哈利奇奥卢数据科学研究所,加州大学圣地亚哥分校) Department of Computer Science and Engineering, University of California San Diego, San Diego, CA, USA(计算机科学与工程系,加州大学圣地亚哥分校) Division of Public Health Sciences, Fred Hutchinson Cancer Center, Seattle, WA, USA(公共卫生科学部,Fred Hutchinson癌症中心)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 提出MoCA自监督学习框架,结合Transformer与MAE,通过跨模态掩码提升多模态可穿戴数据的重构与分类性能,兼具理论保障,可处理缺失模态并应用于数字健康领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05103 2026-08-07 cs.LG math-ph math.MP physics.ao-ph physics.flu-dyn 版本更新 71%

Multimodal Spatiotemporal Atmospheric Data Assimilation with Latent Video Flow-matching

基于潜在流匹配的多模态时空大气数据同化

Dibyajyoti Chakraborty, Romit Maulik

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Purdue University(普渡大学)

专题命中 视频多模态 :multimodal(title)

AI总结 该研究提出基于潜在流匹配的多模态时空大气数据同化方法,利用ERA5再分析数据训练先验,结合后验采样同化真实观测,可完成多种DA任务,从稀疏观测生成的集合预报性能达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16284 2026-08-07 cs.CV cs.MM 版本更新 62%

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

MAC 2026:推动微动作分析迈向细粒度理解

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

机构 * United Arab Emirates University(阿联酋大学) Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) University of Oulu(奥卢大学) CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。

Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08199 2026-08-07 cs.NI 版本更新 50%

Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation

超越静态预测:利用世界模型进行移动交通外推

Xiaoqian Qi, Haoye Chai, Yue Wang, Yong Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2604.20269 2026-08-07 cs.CR cs.AI 版本更新 79%

Text Steganography with Dynamic Codebook and Multimodal Large Language Model

基于动态代码本和多模态大语言模型的文本隐写术

Jianxin Gao, Ruohan Lei, Wanli Peng

机构 * China Agricultural University(中国农业大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于动态代码本和多模态大语言模型的文本隐写术,通过共享会话配置和多模态模型构建动态代码本,设计加密隐写映射并引入反馈优化机制,提升隐写术的安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01280 2026-08-07 cs.CV cs.AI cs.CL 版本更新 67%

Look Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question Answering

二次审视:多模态大语言模型中的免训练证据高亮

Marco Morini, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Look Twice框架,通过模型注意力模式识别相关视觉区域和文本证据,提升预训练MLLMs在多模态证据利用中的表现,实验显示在多个VQA基准上效果显著。

Comments Project Page: https://aimagelab.github.io/LoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 57%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2606.21138 2026-08-07 cs.CV 版本更新 81%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 78%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 62%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08652 2026-08-07 cs.AI 版本更新 57%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06800 2026-08-07 stat.ML cs.LG math.PR 版本更新 50%

A Reverse-BSDE Diffusion Sampler

反向倒向随机微分方程扩散采样器

Jairon H. N. Batista, Flávio B. Gonçalves, Yuri F. Saporito, Rodrigo S. Targino

机构 * FGV EMAp

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究将反向时间扩散采样器重新表述为前向-后向随机微分方程,证明其与原方法等价并分解近似误差,经合成目标实验验证,该方法对复杂全局结构目标的采样具有良好前景。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 6 篇

2608.04514 2026-08-07 cs.CL 版本更新 79%

RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

RESPClinBench:呼吸专科医疗中的多模态临床决策与纵向疾病管理基准测试

Mouxiao Bian, Zhi Chen, Ruiyao Chen, Lu Lu, Hengrui Liang, Chaoyi Huang, Yiluo Lin, Jingru Ding, Yun Zhong, Yueming Su, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Macau University of Science and Technology(澳门科技大学) First Affiliated Hospital of Guangzhou Medical University(广州医科大学附属第一医院) Guangzhou Institute of Respiratory Health(广州呼吸健康研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究开发了呼吸专科多模态临床决策与纵向疾病管理基准RESPClinBench,在两个数据集上评估7种大模型,识别模型在肺结节评估和COPD管理的局限,为模型选择提供临床依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20247 2026-08-07 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE:一致性保留的混合专家用于持续学习

Yang Liu, Toan Nguyen, Flora D. Salim

机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28247 2026-08-07 cs.CV 版本更新 57%

Space2Ground 2.0: A Multi-Source Dataset and Framework for Agricultural Monitoring through Fusion of Street-Level and Satellite Imagery

Space2Ground 2.0:结合街景与卫星影像的农业监测多源数据集及框架

Iason Tsardanidis, Alkiviadis Koukos, George Choumos, Vasileios Sitokonstantinou, Charalampos Kontoes

机构 * Operational Unit BEYOND Centre, IAASARS, National Observatory of Athens(雅典国家天文台IAASARS研究所BEYOND中心业务单元) DHI Water & Environment(DHI水环境公司) Artificial Intelligence Group, Wageningen University & Research(瓦赫宁根大学及研究中心人工智能组)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出Space2Ground 2.0多源框架,整合卫星与街景影像构建农业监测基准数据集,实验证实街景影像可提升作物分类效果,为多模态农业监测提供了可复现方法。

Comments This paper has been accepted for presentation at the 45th EARSeL Symposium, Athens, Greece. The Space2Ground 2.0 dataset, is publicly available through Zenodo at: https://doi.org/10.5281/zenodo.21219542

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10217 2026-08-07 cs.CV 版本更新 57%

Are Pretrained Image Matchers Good Enough for SAR-Optical Satellite Registration?

预训练图像匹配器在SAR-光学卫星配准中表现如何?

Isaac Corley, Alex Stoken, Gabriele Berton

机构 * Taylor Geospatial(泰勒地理空间公司) Independent Researcher(独立研究者)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文评估了24种预训练匹配器在跨模态卫星配准中的表现,发现显式跨模态训练并非必然提升性能,且部署协议对精度影响显著。

Comments CVPR 2026 Image Matching Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05416 2026-08-07 cs.MM 版本更新 57%

Meaning over Motion: A Semantic-First Approach to 360° Viewport Prediction

基于意义而非运动:一种以语义为先的360度视口预测方法

Arman Nik Khah, Arvin Bahreini, Ravi Prakash

专题命中 多模态评测 :multi-modal(abstract);分类 cs.MM

AI总结 本文提出了一种基于语义的360度视口预测方法,通过整合认知意图和关联前瞻机制,有效缓解了眼跳陷阱问题,提升了视频流媒体的效率和用户体验。

Comments Following an internal verification, the authors identified an inconsistency in the experimental data pipeline that requires the reported results to be recomputed. We are withdrawing this version while we re-run the analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 57%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 3 篇

2608.03571 2026-08-07 cs.CV 版本更新 79%

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

超越单纯的环境规模扩展:为多模态智能体学习设计有效的环境分布

Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao, Kang Liu, Jun Zhao

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态智能体学习中单纯扩展环境数量无效的问题,提出AES与HDC两种方法优化环境分布,提升了智能体训练效果。

Comments Code: https://github.com/GaryStack/Beyond-MMEnv-Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03327 2026-08-07 cs.AI 版本更新 74%

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文

Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 57%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 7 篇

2603.05997 2026-08-07 cs.CV cs.AI 版本更新 86%

MM-ISTS: Cooperating Irregularly Sampled Time Series Forecasting with Multimodal Vision-Text LLMs

MM-ISTS: 基于多模态视觉-文本大语言模型的不规则采样时间序列预测

Zhi Lei, Chenxi Liu, Hao Miao, Wanghui Qiu, Bin Yang, Chenjuan Guo

机构 * East China Normal University Shanghai China Centre for Artificial Intelligence Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Hong Kong China Department of Computing, The Hong Kong Polytechnic University Hong Kong China East China Normal University Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Department of Computing, The Hong Kong Polytechnic University

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MM-ISTS利用多模态视觉-文本大语言模型,通过双阶段编码机制提升不规则采样时间序列预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏