arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2604.00061 2026-04-02 cs.RO cs.SY eess.SP eess.SY 82%

Advancing Multi-Robot Networks via MLLM-Driven Sensing, Communication, and Computation: A Comprehensive Survey

通过MLLM驱动的感知、通信与计算推进多机器人网络:综述

Hyun Jong Yang, Howon Lee, Kyuhong Shim, Jeongho Kwak, Hyunsoo Kim, Donghoon Kim, Khoa Anh Ngo, Sehyun Ryu, Jaehyun Choi, Youbin Kim, Chanjun Moon, Michael Ryoo, Byonghyo Shim

机构 * Seoul National University(首尔大学) Ajou University(亚洲大学) Sungkyunkwan University(成均馆大学) Korea University(高丽大学) POSTECH(浦项科技大学) Stony Brook University(石溪大学)

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract)

AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM 81%

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV 74%

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

专题命中 多模态Agent :MLLM(title);分类 cs.CV

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01221 2026-04-02 cs.AI cs.CV 73%

HippoCamp: Benchmarking Contextual Agents on Personal Computers

HippoCamp:在个人电脑上对上下文代理进行基准测试

Zhe Yang, Shulin Tian, Kairui Hu, Shuai Liu, Hoang-Nhat Nguyen, Yichi Zhang, Zujin Guo, Mengying Yu, Zinan Zhang, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S-Lab)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 HippoCamp是一个新的基准,用于评估代理在多模态文件管理中的能力,通过用户为中心的环境建模个体用户档案并搜索大规模个人文件进行上下文感知推理,揭示了当前代理在真实环境中的局限性。

Comments Project Page: https://hippocamp-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00977 2026-04-02 cs.LG cs.AI 57%

Flow-based Policy With Distributional Reinforcement Learning in Trajectory Optimization

基于分布强化学习的流式策略在轨迹优化中的应用

Ruijie Hao, Longfei Zhang, Yang Dai, Yang Ma, Xingxing Liang, Guangquan Cheng

机构 * College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Aviation University of Air Force(空军航空大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种流式策略与分布强化学习结合的算法,以解决传统策略在多模态分布建模中的局限性,提升多解问题中的策略更新效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00699 2026-04-02 physics.soc-ph 50%

Public transport in the 15-minute city

15分钟城市的公共交通

Zsófia Zádor, Gergő Pintér, Máté Mizsák, Bence Kovács, Imre Felde, Balázs Lengyel

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出将公共交通纳入15分钟城市模型的框架,通过比较赫尔辛基、马德里和布达佩斯,展示多模式交通如何提升对设施的可达性并增强社会空间整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00628 2026-04-02 cs.RO cs.HC 50%

StretchBot: A Neuro-Symbolic Framework for Adaptive Guidance with Assistive Robots

StretchBot:一种用于辅助机器人自适应指导的神经符号框架

Luca Vogelgesang, Ahmed Mehdi Soltani, Mohammadhossein Khojasteh, Xinrui Zu, Stefano De Giorgis, Madalina Croitoru, Filip Ilievski

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Montpellier(蒙彼利埃大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出StretchBot,结合多模态感知与知识图谱引导的大语言模型推理,实现短时间伸展指导中的情境感知调整,同时保持结构化流程。实验显示自适应指导在适应性和相关性上更优,而脚本指导在流畅性和可预测性上仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11062 2026-04-02 cs.HC cs.MA 50%

Auto-Slides: An Interactive Multi-Agent System for Creating and Customizing Research Presentations

Auto-Slides:一个用于创建和定制研究演示的交互式多智能体系统

Yuheng Yang, Wenjia Jiang, Yang Wang, Yi Song, Yiwei Wang, Chi Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Auto-Slides系统,利用大语言模型将学术论文转化为结构化的多模态幻灯片,通过交互式编辑器实现个性化学习,提升学习者对复杂概念的理解与参与度。

Comments Project Homepage: https://auto-slides.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏