arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-03 至 2026-06-03 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 15 篇

2605.18740 2026-06-03 cs.CV cs.AI cs.CL cs.LG 87%

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Vision-OPD:通过在线策略自蒸馏学习多模态大语言模型的精细细节

Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu

机构 * Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Vision-OPD框架,通过在线策略自蒸馏将模型自身的局部区域感知能力迁移到全局图像策略,提升多模态大语言模型对细粒度视觉理解的准确性。

Comments Project page: https://github.com/VisionOPD/Vision-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03435 2026-06-03 cs.AI 85%

CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations

CP-Agent: 化学扰动下细胞形态学轮廓的上下文感知多模态推理

Yuxin Zhang, Yiyao Li, Ping Shu Ho, Simon See, Zhenqin Wu, Kevin Tsia

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Biomedical Engineering, The University of Hong Kong(香港大学生物医学工程学院) Nvidia AI Technology Center(NVIDIA人工智能技术中心) Advanced Biomedical Instrumentation Centre(先进生物医学仪器中心)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出CP-Agent,一种基于上下文感知对齐模块CP-CLIP的多模态大语言模型,用于生成药物扰动下细胞形态变化的可解释机制性解释,实现高精度处理与机制区分(最大F1分数0.896),并整合工具使用与推理生成结构化报告以加速药物发现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03951 2026-06-03 cs.CV 83%

Demo2Tutorial: From Human Experience to Multimodal Software Tutorials

Demo2Tutorial:从人类经验到多模态软件教程

Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao, Xiangwu Guo, Xin Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 多模态Agent :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出Demo2Tutorial框架,通过屏幕录制和交互日志将人类经验解析为结构化多模态教程,用于人类学习和GUI智能体训练,实验证明其生成质量超越人工教程并提升任务效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03005 2026-06-03 cs.CV cs.AI 79%

MUSE: A Unified Agentic Harness for MLLMs

MUSE: 多模态大语言模型的统一智能体框架

Jianglin Lu, Hailing Wang, Xu Ma, Qihua Dong, Mingyuan Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MUSE框架,通过可组合模块(任务表示、视觉处理、感知工具、结构化解析、确定性验证和验证器引导修复)提升冻结多模态大语言模型性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02977 2026-06-03 cs.HC cs.SE 78%

A Benchmarking Framework for Multimodal User Interface Toolkits: Comparing Modality Coverage, Developer Workflow, and Experimental Support

多模态用户界面工具包的基准测试框架:比较模态覆盖、开发者工作流和实验支持

Ariton Verush

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一个基于文档分析、技术比较和未来开发者评估的结构化基准框架,从模态覆盖、开发者体验和实验支持三个维度比较多模态用户界面工具包。

Comments 13 pages, 3 tables, 1 figure. Benchmarking framework paper revised and expanded from an HCI seminar draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03223 2026-06-03 cs.RO cs.AI 74%

BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal Interactions

BotDirector:跨对称现实的多模态交互机器人讲故事

Zhe Sun, Meng Wang, Lei Wang, Yuxi Wang, Wanxin Li, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室,BIGAI,北京,中国) Peking University, Beijing, China(北京大学,北京,中国)

专题命中 多模态Agent :multi-modal(title);分类 cs.AI

AI总结 提出一个结合具身交互和自然语言交互的机器人讲故事系统,利用LLM代理将儿童创建的叙事转化为自导航群体机器人的运动序列,支持灵活场景和日常物品。

Journal ref 2026 IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops (VRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02812 2026-06-03 cs.AI cs.CL 62%

Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection

Traj-Evolve:用于肺癌早期检测中患者轨迹建模的自进化多智能体系统

Sihang Zeng, Matthew Thompson, Ruth Etzioni, Meliha Yetisgen

机构 * University of Washington(华盛顿大学) Fred Hutch Cancer Center(Fred Hutch癌症中心) Google(谷歌)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出Traj-Evolve,一种结合经验池和多智能体强化学习的自进化多智能体系统,通过检索相似患者和参数优化,在肺癌早期检测中优于9个强基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03876 2026-06-03 cs.HC cs.AI cs.MA 57%

From 'What' to 'How' and 'Why': Sharing LLM-Generated Retrospective Summaries of Older Adults' Passive Tracking Data with Remote Family Members

从“是什么”到“怎么样”和“为什么”:与远程家庭成员共享老年人被动追踪数据的LLM生成回顾性摘要

Jiachen Li, Reina Szeyi Chan, Akshat Choube, Xiang Zhi Tan, Elizabeth Mynatt, Varun Mishra

机构 * Northeastern University(东北大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本研究利用大型语言模型(LLM)从多模态追踪数据生成回顾性摘要,通过技术探针和访谈重新设计系统,显著提升了远程家庭成员对摘要的满意度、帮助性、信任和接收意愿,并提出了支持其从“是什么”到“怎么样”和“为什么”的认知转变的设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03557 2026-06-03 cs.AI cs.HC 57%

From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Worlds

从提示到服务:基于SLM的AI驱动虚拟世界代理编排网关

Louis Nisiotis, Aimilios Hadjiliasi

机构 * University of Cambridge(剑桥大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于小语言模型的代理编排网关,通过意图驱动的服务路由解耦虚拟世界客户端与异构AI后端,并在虚拟博物馆测试床中验证了其可行性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02915 2026-06-03 cs.CV 57%

Any2Poster: Any-Source Poster Generation Across Modalities and Domains

Any2Poster: 跨模态和领域的任意源海报生成

Amogh Vinaykumar, Aiden Li, Suozhi Huang, Shilong Liu

机构 * Flower Mound High School(弗洛拉穆恩高中) University College London(伦敦大学学院) Princeton University(普林斯顿大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出Any2Poster Bench基准和Any2Poster Agent智能体,实现从多种输入模态和领域生成海报,并通过基于测验和视觉评估的方法验证信息保真度和视觉传达效果。

Comments Project Page: https://github.com/Any2Poster/Any2Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27762 2026-06-03 cs.AI 57%

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM: 通过经验对比内化的参数化具身智能体记忆在Minecraft中的应用

Yuchen Guo, Junli Gong, Weicheng Wang, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出PEAM框架,通过对比内化失败-纠正轨迹对,将经验转化为参数化技能,实现Minecraft中具身智能体的持续学习与高效执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10169 2026-06-03 cs.AI cs.LG 57%

MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

MAVEN-T:用于实时多智能体轨迹预测的强化异构蒸馏

Wenchang Duan, Zhenguo Gao, Jinguo Xian, Yi Shi

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Bio-X Institutes, Key Laboratory for the Genetics of Developmental and Neuropsychiatric Disorders, Shanghai Jiao Tong University(上海交通大学Bio-X研究院、发育与神经精神疾病遗传学重点实验室) Shanghai Key Laboratory of Psychotic Disorders, Brain Science and Technology Research Center, Shanghai Jiao Tong University(上海精神疾病重点实验室、脑科学与技术研究中心,上海交通大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出MAVEN-T框架,通过高容量教师模型和紧凑学生模型的异构蒸馏,结合强化学习优化,实现实时多智能体轨迹预测,在多个数据集上达到高精度与低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08173 2026-06-03 cs.AI 57%

The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios

Agent 的第一天:在工作场景中基准测试学习、探索和调度

Daocheng Fu, Jianbiao Mei, Rong Wu, Xuemeng Yang, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在动态工作场景中面临的任务调度、主动探索和持续学习三大挑战,提出动态评估环境 EvoEnv,实验表明现有 agent 在这些方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03392 2026-06-03 cs.RO 50%

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform

OpenEAI-Platform: 一个开源具身人工智能硬件-软件统一平台

Jinyuan Zhang, Luoyi Fan, Leiyu Wang, Yeqiang Wang, Yicheng Zhu, Cewu Lu, Nanyang Ye

机构 * Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出OpenEAI-Platform,集成低成本6+1自由度机械臂和可复现VLA模型,通过开源设计和两阶段训练在真实操作任务中超越商业臂,性能媲美大规模预训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
1302.7096 2026-06-03 cs.NE cs.SY eess.SY 50%

Using Artificial Intelligence Models in System Identification

使用人工智能模型进行系统辨识

Wesam Elshamy

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究修改遗传算法和粒子群优化算法以适应系统辨识的多模态问题,并应用于感应电机参数辨识,结果表明粒子群优化算法在多模态问题上优于遗传算法。

Comments MSc. Thesis, Electrical Power and Machines Dept. Cairo University, Egypt, May 2007

详情

展开后加载摘要…

URL PDF HTML 收藏