arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 140 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 14 篇

2607.24313 2026-07-28 cs.IR cs.CV cs.MA cs.RO 新提交 57%

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG

通过局部多智能体RAG实现能量受限的分层水下监测

Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对海洋生物监测受能量等限制的问题,提出结合边缘传感与局部推理的低功耗水下监测架构,采用分层设计,利用特定嵌入、识别层及多智能体框架,经案例研究评估,实现低功耗连续传感与局部多模态智能结合,减少能耗与通信开销。

Comments Contains 25 pages, 11 figures. To be submitted to Elsevier Ocean Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24259 2026-07-28 cs.AI 新提交 57%

Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach

生成式人工智能(GenAI)将排队网络图像转换为可验证的仿真模型:一种开放权重的大语言模型工作流方法

Thomas Monks, Alison Harper, Amy Heather, Navonil Mustafee

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究提出Sketch2DES工作流,利用开放权重LLMs将排队网络图像转换为可验证仿真模型,经多阶段处理,在多图表评估中各阶段可靠性高,相比直接代码生成提升多项性能,证明结构化工作流模型生成对LLM辅助仿真建模的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23910 2026-07-28 cs.CV cs.LG cs.MA cs.RO 新提交 57%

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception

SimBEV2X:用于多任务车联网协同感知的大规模数据集与数据生成工具

Goodarz Mehr, Sepideh Gohari, Montasir Abbas, Azim Eskandarian

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 研究针对V2X协同感知算法发展受限问题,介绍基于CARLA模拟器的SimBEV2X数据生成工具及数据集,通过它建立基线并提出CoBEVFusion架构,实现上下文感知多智能体特征聚合,性能优越。

Comments Submitted to IEEE for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 57%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23511 2026-07-28 cs.CV 新提交 57%

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

MOJITO:用于统一端到端自动驾驶的模态联合学习

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(理想汽车) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 研究针对端到端自动驾驶系统问题,提出基于模态联合学习的MOJITO框架,去除级联接口,执行逐块模态联合注意力更新多模态特征,在数据集上取得新的最优成绩,展现出强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22689 2026-07-28 cs.AI 新提交 57%

Beyond Sequential Interaction: Benchmarking Parallel Execution and Coordination for GUI Agents

超越顺序交互:GUI 智能体并行执行与协调的基准测试

Zedong Yu, Qianxing Li, Zhi Gao, Liuyu Xiang, Chenrui Shi, Yang Liu, Huiming Wu, Yujie Wei, Yuhao Fei, Yubo Fu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) China University of Geosciences (Beijing)(中国地质大学(北京)) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究 GUI 智能体长周期任务扩展性差的问题,引入 ParaGUIBench 基准测试及 ParaGUI 智能体,通过实验证明并行执行能提升可分解长周期 GUI 任务的成功率与效率。

Comments 15 pages, 5 figures. Project page: https://github.com/pkgunboat/ParaGUIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22651 2026-07-28 cs.AI 新提交 57%

ARdena: Scenario-driven control of real-time LLM agents

ARdena:实时大语言模型智能体的场景驱动控制

Luka Borozan, Domagoj Matijević

机构 * Faculty of Applied Mathematics and Informatics, University of Osijek Croatia(奥西耶克大学应用数学与信息学院,克罗地亚) Meet Intelligent Innovations LLC(Meet智能创新有限责任公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究如何在实时交互环境中控制大语言模型智能体行为,提出分层场景驱动的LLM控制框架,通过结构化提示实现运行时行为控制,在ARDena中实现该框架并评估,结果显示场景驱动提示能有效控制LLM智能体。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05147 2026-07-28 cs.CV cs.RO 版本更新 57%

Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models

行动、思考或退缩:面向视觉-语言-动作模型的复杂度感知自适应推理

Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种复杂度感知的自适应推理框架,通过动态路由视觉-语言-动作模型的执行,提升任务复杂性检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23176 2026-07-28 eess.SY cs.SY 新提交 50%

An Adjoint-Based Differentiable Physics Framework for Online Parameter Inversion in Closed-Brayton Gas-Cooled Reactor Digital Twins

用于闭式布雷顿气冷反应堆数字孪生体在线参数反演的基于伴随的可微物理框架

Chengyuan Li, Shanfang Huang, Jian Deng

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究先进反应堆数字孪生体在线参数反演问题,提出基于伴随的可微物理框架,通过隐式微分代数模型传播反向模式自动微分,驱动AD - 海森增量4D - Var估计器,在多工况下与多种基线对比,展现出不同优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10397 2026-07-28 cs.IR 版本更新 50%

RecoWorld: Building Simulated Environments for Agentic Recommender Systems

RecoWorld:为代理推荐系统构建模拟环境

Fei Liu, Xinyu Lin, Hanchao Yu, Mingyuan Wu, Jianyu Wang, Qiang Zhang, Zhuokai Zhao, Yinglong Xia, Yao Zhang, Weiwei Li, Mingze Gao, Qifan Wang, Lizhu Zhang, Benyu Zhang, Xiangjun Fan

专题命中 多模态Agent :multimodal(abstract)

AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。

Comments HCRS @ WWW 2026, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 28 篇

2607.23493 2026-07-28 cs.CV cs.AI 新提交 84%

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

用于多模态情感解释的令牌-区域引导交叉注意力融合

Musa Tur Farazi, Nufayer Jahan Reza

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对孟加拉语模因政治意图检测难题,引入多模态交叉注意力融合框架,利用视觉语言模型提取文本,经跨模态多头注意力机制合成特征,还整合政治词汇表,实验表明该方法显著优于基线,Macro-F1达0.94,有效实现文本语义基于视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23451 2026-07-28 cs.CV 新提交 83%

Multi-Modal Object Re-Identification with Prompt-S6 and Semantic-Aware Knowledge Guidance

基于Prompt-S6和语义感知知识引导的多模态目标重识别

Weixiang Zhou, Jiabei Zuo, Yuhao Wang, Cong Wang, Huchuan Lu, Zhixun Su

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态目标重识别问题,提出基于Prompt-S6和语义感知知识引导的PRISM框架,设计语义驱动令牌剪枝和渐进融合网络两个关键组件,有效抑制背景干扰,实现三模态对齐,提升多模态目标重识别的有效性和效率。

Comments Accepted by IEEE TIP 2026. The version of record may differ slightly

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06882 2026-07-28 cs.RO cs.AI 版本更新 83%

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

GemNav:使用多模态大语言模型的离散令牌视觉机器人导航

Peter Bohm, Saimunur Rahman, Abdelwahed Khamis, Sagun Man Singh Shrestha, Chris McCool, Peyman Moghadam

机构 * CSIRO Technology(联邦科学与工业研究组织)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究探索基于大型预训练模型的视觉机器人导航策略新方法,提出GemNav,仅对语言塔用LoRA适配冻结的多模态大语言模型用于中短程航点导航,无辅助视觉编码器等,在小语料库上零样本转移到未见环境,提供了数据高效、可部署的导航替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22709 2026-07-28 cs.CV cs.AI cs.CL 新提交 83%

RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus

RMS@CC-MMD 2026:通过几何交互和多视图共识进行多模态厌女症检测

Md. Ajwad Hossain

机构 * Chittagong University of Engineering & Technology (CUET)(吉大港工程技术大学)

专题命中 多模态训练与对齐 :multimodal(title,comments);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对多模态厌女症检测问题,提出GeoMVC方法,通过几何交互层建模跨模态对齐,用多视图共识策略减轻分布偏移,在相关挑战中取得一定排名成绩,凸显特定文化背景下建模的挑战。

Comments Accepted for the CC-MMD Grand Challenge at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15928 2026-07-28 cs.LG 版本更新 82%

Knowledge-Guided Cross-Modal Fusion for Adult-to-Pediatric ECG Transfer via Label-Conditioned Contrastive Alignment

通过标签条件对比对齐实现成人到儿科心电图转换的知识引导跨模态融合

Xinran Liu, Yuwen Li, Hongxiang Gao, Heyang Xu, Jianqing Li, Zongmin Wang, Chengyu Liu

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) Nanjing Medical University(南京医科大学) Zhengzhou University(郑州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 研究针对成人与儿科心电图转换问题,提出知识引导的跨模态融合框架PEACE,通过标签条件对比对齐等方法,在有限监督下实现更好的儿科心电图解释,消融实验证明标签条件知识对齐是关键驱动因素。

Comments This article was accidentally submitted as a new arXiv paper instead of a replacement of arXiv:2605.00647. Please refer to arXiv:2605.00647 for the correct and updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24683 2026-07-28 cs.CV cs.AI cs.LG 新提交 81%

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

多模态分类中用于缺失任意模态的协同学习

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

机构 * GFZ Helmholtz Center for Geosciences(德国波茨坦地学研究中心亥姆霍兹中心) INRAE, UMR TETIS, University of Montpellier(法国蒙彼利埃大学农业环境与生态研究院、蒙彼利埃大学TETIS联合研究单位) INRIA, EVERGREEN, University of Montpellier(法国蒙彼利埃大学信息与自动化研究所、EVERGREEN实验室) CIRAD, UMR TETIS, University of Montpellier(法国蒙彼利埃大学国际农业研究磋商组织、蒙彼利埃大学TETIS联合研究单位)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态分类中因操作约束导致训练和推理时模态可用性不一致、存在缺失任意模态的问题,提出多模态协同学习框架,引入特征和决策层面利用信息的两种方法,实验证明在不同缺失模态条件下有显著鲁棒性提升。

Comments Accepted at Discovery Science 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24447 2026-07-28 cs.CV 新提交 79%

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

RP - OPSD:用于多模态大语言模型的分辨率特权在线自蒸馏

Qihui Zhu, Yuchen Wang, Zijian Wen, Tao Zhang, Mengjie Zhang, Yang Liu, Shuangwu Chen, Siying Wu, Jian Yang, Xiaofeng Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在线自蒸馏问题,利用同一图像高低分辨率视图信息差提出RP - OPSD,学生策略用低分辨率图像生成轨迹,教师策略用原始分辨率图像监督,实验表明该方法能提升性能并加快训练速度,为在线自蒸馏提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23658 2026-07-28 cs.CV 新提交 79%

XMatchAD: A Cross-Modal Matching Perspective on Reconstruction-based Anomaly Detection

XMatchAD:基于重建的异常检测的跨模态匹配视角

Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai

机构 * Northeastern University(东北大学) State Key Laboratory of Synthetical Automation for Process Industries(流程工业综合自动化国家重点实验室)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对基于重建的无监督异常检测方法难以捕捉细微异常、异常边界模糊的问题,提出XMatchAD框架,从伪跨模态匹配视角利用输入与重建图像的匹配关系,通过多步骤提升异常检测和定位精度,性能优于现有方法。

Comments accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23245 2026-07-28 cs.MM cs.LG 新提交 79%

FedTaste: Topology-Aware Structural Transfer for Multimodal Federated Learning with Missing Modalities

FedTaste:用于具有缺失模态的多模态联邦学习的拓扑感知结构转移

Haochen Liang, Jie Zhang, Hideya Ochiai

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态联邦学习中模态缺失和数据分布问题,提出FedTaste框架,利用冻结基础模型提取联合多模态拓扑,结合模态自适应结构提示等方法,避免显式模态插补,在多数据集和非IID设置下性能优越且通信开销低。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22779 2026-07-28 cs.LG cs.AI 新提交 79%

Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control

使用基于查询的变压器进行多模态表面肌电手势识别以用于假肢控制

Federico Del Pup, Elisa Tentori, Manfredo Atzori

机构 * Department of Information Engineering, University of Padua(帕多瓦大学信息工程系) Padova Neuroscience Center, University of Padua(帕多瓦大学帕多瓦神经科学中心) Department of Biomedical Sciences, University of Padua(帕多瓦大学生物医学科学系) Department of Neuroscience, University of Padua(帕多瓦大学神经科学系) Information Systems Institute, University of Applied Sciences Western Switzerland (HES-SO Valais)(瑞士西部应用科学大学(HES-SO瓦莱州)信息系统研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对表面肌电手势识别用于假肢控制时当前架构的局限,提出EMG-CrossFormer,通过级联交叉注意力融合层组合单模态编码器表示,经实验验证该方法能提升仅sEMG解码及多模态融合下的手势识别性能。

Comments GitHub repository: see https://github.com/deepPNClab/emg-crossformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22702 2026-07-28 cs.CV cs.LG 新提交 79%

MIME: Multimodal Interactive Motion Encoder

MIME:多模态交互式运动编码器

Addison Zucek, Prerit Gupta, Kamila Kuatova, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对动画、AR/VR等场景中多人交互的文本-运动表示学习问题,提出多模态交互式运动编码器MIME,通过特定方法捕捉结构并训练,在文本-运动检索任务中表现出色,还能跨数据集支持下游运动生成。

Comments Under review at WACV 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16170 2026-07-28 cs.IR cs.AI 版本更新 79%

EGRA:Toward Enhanced Behavior Graphs and Representation Alignment for Multimodal Recommendation

EGRA:迈向用于多模态推荐的增强行为图和表示对齐

Xiaoxiong Zhang, Xin Zhou, Zhiwei Zeng, Yongjie Wang, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态推荐现有方法不足,EGRA通过纳入预训练模型生成表示构建的项-项图减轻稀疏性,引入双层动态对齐加权机制提升模态-行为表示对齐,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23445 2026-07-28 cs.CV cs.CL 新提交 79%

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models

Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝

Yiming Zhong, Chang Nie, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。

Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24607 2026-07-28 cs.IR 新提交 78%

One Graph, Multiple Gains: Single High-Quality Item-Item Graph for Multimodal Recommendation

一图多益:用于多模态推荐的单个高质量物品-物品图

Jinfeng Xu, Zheyu Chen, Ziyue Peng, Shuo Yang, Jinze Li, Zewei Liu, Shujie Li, Yipeng Du, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究多模态推荐中物品-物品图构建及应用,提出IIMRec框架构建高质量图,通过融合信号和NCER优化,并在推荐三阶段重用,以RIG、内容引导UI图扩展、INA三种方式使用,实验证明其性能优于基线,冷启动等条件下效果更佳。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23370 2026-07-28 cs.LG cs.CE econ.EM stat.CO 新提交 78%

Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

通过社会情绪与技术特征的状态感知多模态融合预测比特币价格走势

Muhammad Abdullah Haroon

机构 * FAST National University of Computer and Emerging Sciences (FAST-NUCES)(快速国立计算机与新兴科学大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 研究比特币亚日价格预测难题,提出状态感知多模态学习(RAML)方法,依据市场状态动态融合社会情绪与技术特征,实验表明该方法在预测中表现良好,确立状态条件自适应融合为多模态金融预测的必要原则。

Comments 19 pages, 15 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29452 2026-07-28 cs.RO 版本更新 78%

CReF: Cross-modal and Recurrent Fusion for Depth-conditioned Humanoid Locomotion

CReF:跨模态与递归融合用于基于深度的人形机器人运动

Yuan Hao, Ruiqi Yu, Shixin Luo, Guoteng Zhang, Jun Wu, Qiuguo Zhu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制科学与工程学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出CReF框架,通过直接从原始前方深度数据学习运动相关特征,实现稳定复杂地形行走,改进了传统依赖几何抽象的方法,展示了在模拟和真实环境中鲁棒的地形穿越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07407 2026-07-28 cs.LG 版本更新 71%

Emergent Symbolic Structure in Health Foundation Models: Extraction, Alignment, and Cross-Modal Transfer

健康基础模型中的涌现符号结构:提取、对齐与跨模态迁移

Gajendra Katuwal, Advait Koparkar, Salar Abbaspourazad, Anshuman Mishra, Sarvesh Kirthivasan

机构 * Apple(苹果公司)

专题命中 多模态训练与对齐 :cross-modal(title)

AI总结 本文提出一种训练后框架,通过分解冻结嵌入以提取可解释的符号,用于对齐嵌入空间。在PPG和加速度计数据上验证,发现符号能选择性关联健康状况和生理属性,并支持跨模态迁移。

Comments 8 pages, Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, 4 main figures

Journal ref Mechanistic Interpretability Workshop at the 43 rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23181 2026-07-28 cs.CV 新提交 70%

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

迈向视觉语言导航的双脑最小充分表示

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) University of Zurich(苏黎世大学) University of Exeter(埃克塞特大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 70%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏