arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2759 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2759 篇

2607.27145 2026-07-30 cs.CV 新提交 85%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11433 2026-07-14 cs.AI 新提交 85%

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

全决策:一种用于全模态问答的渐进式证据状态智能体系统

Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态Agent :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究全模态问答中证据分散问题,提出全决策系统,将问答转化为证据闭合过程,维护结构化证据状态,通过确定性状态更新处理异构观察,提升了准确率,验证了证据状态控制在多步证据寻求中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03435 2026-06-03 cs.AI 85%

CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations

CP-Agent: 化学扰动下细胞形态学轮廓的上下文感知多模态推理

Yuxin Zhang, Yiyao Li, Ping Shu Ho, Simon See, Zhenqin Wu, Kevin Tsia

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Biomedical Engineering, The University of Hong Kong(香港大学生物医学工程学院) Nvidia AI Technology Center(NVIDIA人工智能技术中心) Advanced Biomedical Instrumentation Centre(先进生物医学仪器中心)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CP-Agent,一种基于上下文感知对齐模块CP-CLIP的多模态大语言模型,用于生成药物扰动下细胞形态变化的可解释机制性解释,实现高精度处理与机制区分(最大F1分数0.896),并整合工具使用与推理生成结构化报告以加速药物发现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31075 2026-06-01 cs.CV 85%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26256 2026-05-27 cs.AI 85%

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

个性化具身多模态大语言模型代理在长期用户交互中的应用

Jeongeun Lee, Chanyoung Park, Dongha Lee

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出POLAR框架,通过多模态知识图谱记忆机制增强具身代理在长期交互中的个性化能力,显著提升多步推理和用户上下文跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18758 2026-05-20 cs.HC cs.AI 85%

OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments

OmniGUI: 评估多模态智能手机环境中的GUI代理的基准测试

Felix Henry, Xiaochen Lin, Jiangyou Zhu, Yangfan, Bingqian Zhang, Min Chen, Shiyu Huang

机构 * XPeng Motors(小鹏汽车)

专题命中 多模态Agent :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出OmniGUI基准测试,用于评估在多模态智能手机环境中GUI代理的能力,通过连续的多模态输入(包括静态图像、同步音频和视频片段)来模拟真实世界交互,发现当前模型在需要同步时间和听觉信号的环境中表现下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01594 2026-04-08 cs.RO cs.CV 85%

MARS: Multi-Agent Robotic System with Multimodal Large Language Models for Assistive Intelligence

MARS:基于多模态大语言模型的多智能体机器人系统用于辅助智能

Renjun Gao

机构 * School of Computer Science and Engineering, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 MARS系统利用多模态大语言模型实现风险感知和个性化辅助,通过多智能体决策框架提升智能家庭机器人在动态环境中的表现。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20776 2026-01-06 cs.CV 85%

RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning

RingMo-Agent: 多平台多模态遥感基础模型

Huiyang Hu, Peijin Wang, Yingchao Feng, Kaiwen Wei, Wenxin Yin, Wenhui Diao, Mengyu Wang, Hanbo Bi, Kaiyue Kang, Tong Ling, Kun Fu, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)

专题命中 多模态Agent :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 RingMo-Agent是一种多平台多模态遥感基础模型,通过大规模数据集和任务特定标记提升遥感图像的感知与推理能力。

Comments 23 pages, 6 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04513 2025-12-05 cs.AI 85%

BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models

BiTAgent: 一种面向任务的模块化框架,用于多模态大语言模型与世界模型之间的双向耦合

Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI

AI总结 BiTAgent通过双向耦合多模态大语言模型与世界模型,实现任务感知的动态联合学习,提升多任务和跨环境的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13055 2025-10-09 cs.RO cs.AI 85%

Mitigating Cross-Modal Distraction and Ensuring Geometric Feasibility via Affordance-Guided and Self-Consistent MLLMs for Task Planning in Instruction-Following Manipulation

Yu-Hong Shen, Chuan-Yu Wu, Yi-Ru Yang, Yen-Ling Tai, Yi-Ting Chen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学) Department of Computer Science and Information Engineering, National Taiwan University(计算机科学与信息工程系,台湾大学)

专题命中 多模态Agent :cross-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20429 2025-07-11 cs.RO cs.AI 85%

Multi-Scenario Reasoning: Unlocking Cognitive Autonomy in Humanoid Robots for Multimodal Understanding

Libo Wang

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.AI

Comments https://github.com/brucewang123456789/GeniusTrail/tree/main/Multi-Scenario%20Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10387 2025-06-13 cs.AI 85%

Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills

Yuquan Xie, Zaijing Li, Rui Shao, Gongwei Chen, Kaiwen Zhou, Yinchuan Li, Dongmei Jiang, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.AI

Comments 20 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新 85%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 85%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07108 2026-07-09 cs.IR 新提交 85%

Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation

视觉与反思:用于推荐的多模态记忆增强智能体协作

Hao Cong, Huizu Lin, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 针对基于LLM的推荐系统局限,提出MMEACR框架,采用双轨记忆架构,通过属性引导机制更新记忆,构建多模态嵌入记忆,经加权倒数排名融合两轨道,实验证明其在多领域表现出色,尤其视觉推荐场景有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 85%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29456 2026-06-04 cs.SE cs.HC 85%

Usability Analysis of Configurator User Interfaces with Multimodal Large Language Models

配置器用户界面的可用性分析:基于多模态大语言模型

Sebastian Lubos, Alexander Felfernig, Damian Garber, Adnan Kraljić, Tarik Kraljić, Viet-Man Le, Thi Ngoc Trang Tran, Gerhard Leitner, Julian Schwazer, Doris Suppan, Reinhard Willfort, Ivan Dukic, Jeremias Fuchs, Manuel Henrich

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文通过合成18个配置器特定可用性标准,利用多模态大语言模型对16个实际配置器进行半自动化可用性分析,验证了MLLMs能可靠识别问题并提供领域感知改进建议。

Comments Accepted for publication at the International Conference on Software and Systems Reuse, Product Lines, and Configuration (VARIABILITY 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 85%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11858 2026-02-17 cs.CV cs.AI cs.CL cs.LG 85%

Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

无需缩放:用于细粒度多模态感知的区域到图像蒸馏

Lai Wei, Liangbo He, Jun Lan, Lingzhong Dong, Yutong Cai, Siyuan Li, Huijia Zhu, Weiqiang Wang, Linghe Kong, Yue Wang, Zhuosheng Zhang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10991 2025-10-14 cs.CV cs.AI cs.CL 85%

A Survey on Agentic Multimodal Large Language Models

Huanjin Yao, Ruifei Zhang, Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Research Institute of Big Data, China(大数据研究 institute) Sun Yat-sen University, China(中山大学) City University of Hong Kong, China(香港城市大学) Communication University of China, China(通信大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09560 2025-06-06 cs.AI cs.CL cs.CV 85%

EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents

Rui Yang, Hanyang Chen, Junyu Zhang, Mark Zhao, Cheng Qian, Kangrui Wang, Qineng Wang, Teja Venkat Koripella, Marziyeh Movahedi, Manling Li, Heng Ji, Huan Zhang, Tong Zhang

专题命中 多模态Agent :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09530 2024-03-25 cs.CV cs.AI cs.CL cs.GR 85%

VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding

Chris Kelly, Luhui Hu, Jiayin Hu, Yu Tian, Deshun Yang, Bang Yang, Cindy Yang, Zihao Li, Zaoshan Huang, Yuexian Zou

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 12 pages, 7 figures, pending conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15527 2024-02-27 cs.CL cs.AI cs.CV 85%

PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain

Liang Chen, Yichi Zhang, Shuhuai Ren, Haozhe Zhao, Zefan Cai, Yuchi Wang, Peiyi Wang, Xiangdi Meng, Tianyu Liu, Baobao Chang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Code and Data released at https://github.com/pkunlp-icler/PCA-EVAL. Leaderboard at: https://docs.qq.com/sheet/DVUd4WUpGRHRqUnNV. This article supersedes its workshop version arxiv: 2310.02071. arXiv admin note: text overlap with arXiv:2310.02071

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02071 2023-11-29 cs.AI cs.CL cs.CV cs.RO 85%

Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond

Liang Chen, Yichi Zhang, Shuhuai Ren, Haozhe Zhao, Zefan Cai, Yuchi Wang, Peiyi Wang, Tianyu Liu, Baobao Chang

专题命中 多模态Agent :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments FMDM@NeurIPS2023, Code and data: https://github.com/pkunlp-icler/PCA-EVAL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04385 2023-08-04 cs.CV cs.AI cs.CL cs.RO 85%

BEVBert: Multimodal Map Pre-training for Language-guided Navigation

Dong An, Yuankai Qi, Yangguang Li, Yan Huang, Liang Wang, Tieniu Tan, Jing Shao

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICCV 2023, project page: https://github.com/MarSaKi/VLN-BEVBert

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交 84%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03474 2026-05-27 cs.CV 84%

AD-H: Language-guided Autonomous Driving with Hierarchical Agents

AD-H:基于分层智能体的语言引导自动驾驶

Zaibin Zhang, Talas Fu, Shiyu Tang, Yuanhang Zhang, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出AD-H分层多智能体框架,上层MLLM规划器生成中层驾驶指令,下层轻量控制器执行连续动作,通过规则重建1.15M中层指令对,以3B+350M参数超越7B模型,实现长时域泛化与指令遵循。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12620 2026-05-14 cs.AI 84%

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

再思一次,行动一次:验证引导的动作选择用于具身智能体

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆斯塔特技术大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出验证引导的动作选择框架,通过显式验证步骤提升基于MLLM的具身智能体的鲁棒性,实验证明在复杂任务中性能提升达36%。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17190 2026-04-21 cs.CV 84%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 84%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏