arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 112 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 112 篇

2501.00826 2026-06-17 q-fin.TR cs.AI 版本更新 57%

LLM-Powered Multi-Agent System for Automated Crypto Portfolio Management

基于LLM的多智能体系统实现自动化加密货币投资组合管理

Yichen Luo, Yebo Feng, Jiahua Xu, Paolo Tasca, Yang Liu

机构 * University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Exponential Science(指数科学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出一个三智能体系统(市场、新闻、交易),通过分层、协作和辩论架构融合多模态信号,在2025年回测中实现133.52%累计收益和1.502夏普比率,优于单智能体和深度学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06637 2026-06-16 cs.CV 版本更新 57%

CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning

CLAD: 面向视觉-语言程序规划的约束潜在动作扩散模型

Lei Shi, Andreas Bulling

机构 * Machine Perception and Interaction group, Örebro University(机器感知与交互组,奥雷布罗大学) Collaborative Artificial Intelligence group, University of Stuttgart(协作人工智能组,斯图加特大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 提出CLAD模型,利用变分自编码器学习动作和观测的潜在表示作为约束,引导扩散模型生成动作,在三个数据集上大幅超越现有方法。

Comments Accepted at RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 57%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10401 2026-06-11 cs.CV 版本更新 57%

CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence

CoCoSI: 面向空间智能的协作认知地图构建

Yiming Zhang, Ruoxuan Cao, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Cornell University(康奈尔大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出一种即插即用的多智能体框架,通过协作构建结构化认知地图作为空间记忆,无需修改架构或额外训练即可增强预训练多模态大模型的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10120 2026-06-11 cs.IR cs.AI cs.HC 版本更新 57%

MetaPlate: Counterfactual-Guided RAG-LLM Tool for Personalized Food Recommendation and Hyperglycemia Prevention

MetaPlate: 反事实引导的RAG-LLM工具用于个性化食物推荐和高血糖预防

Asiful Arefeen, Carol Johnston, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出MetaPlate框架,结合反事实解释、机器学习预测和RAG-LLM,生成个性化膳食建议以预防餐后高血糖,经注册营养师评估证明其可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08982 2026-06-10 cs.AI 版本更新 57%

Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care

Baichuan-M4:面向持续照护的临床级医疗智能体系统

Aiyuan Yang, Canbin Piao, Chengfeng Dou, Da Pan, Dian Wang, Fan Yang, Fei Deng, Fei Li, Guangwei Ai, Hui Liu, Hongda Zhang, Jinyang Tai, Kai Lu, Lijun Liu, Linwei Chen, Linyu Li, Meiqing Guo, Peidong Guo, Qiang Ju, Rihui Xin, Shuai Wang, XinKai Ma, Xudong Chen, Yichuan Mo, Yijie Zhou, Leyi Pan, Yihe Luo, Zian Wang

机构 * Baichuan AI(百川智能) THUBPM Group, Tsinghua University(清华大学THUBPM课题组)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14289 2026-06-08 cs.AI 版本更新 57%

EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks

EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法

Yijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。

Comments Accepted by

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13357 2026-07-24 cs.HC 版本更新 56%

TANDE: Disentangling Verbal and Nonverbal Backchannels in Emotional AI-Avatar Conversations with Young Adults

TANDE:在与年轻人的情感人工智能-虚拟化身对话中区分言语和非言语反馈渠道

Ann-Kareen Gedeus, Jack Good, Nadine Wagener, Angelique Taylor

专题命中 多模态Agent :multimodal(abstract,comments)

AI总结 研究在与年轻人的情感人工智能-虚拟化身对话中反馈渠道模式的影响,引入TANDE这个由LLM驱动的ECA,通过实验探讨其对融洽关系、同理心和参与度的作用及性别差异,得出相关设计启示。

Comments This paper has been accepted for publication at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新 50%

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

专题命中 多模态Agent :multi-modal(abstract)

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18060 2026-07-29 cs.RO 版本更新 50%

RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning

RoboHarness:用于长期规划的异构机器人策略的内存驱动编排

Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Zhanguang Zhang, Mark Coates, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University of British Columbia(英属哥伦比亚大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学) Labs(2012实验室)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 针对长期机器人任务需多种能力、异构策略编排难的问题,提出RoboHarness框架,通过多模态执行内存等表征策略能力边界,经内存桥接稳定策略交接,实验验证其在长期规划和分布外鲁棒性上有显著提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10397 2026-07-28 cs.IR 版本更新 50%

RecoWorld: Building Simulated Environments for Agentic Recommender Systems

RecoWorld:为代理推荐系统构建模拟环境

Fei Liu, Xinyu Lin, Hanchao Yu, Mingyuan Wu, Jianyu Wang, Qiang Zhang, Zhuokai Zhao, Yinglong Xia, Yao Zhang, Weiwei Li, Mingze Gao, Qifan Wang, Lizhu Zhang, Benyu Zhang, Xiangjun Fan

专题命中 多模态Agent :multimodal(abstract)

AI总结 RecoWorld通过双视角架构和多轮强化学习,构建了代理推荐系统的模拟环境,旨在提升用户留存和参与度。

Comments HCRS @ WWW 2026, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17049 2026-07-22 cs.SE cs.RO 版本更新 50%

Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots

评估具有视觉语言动作能力的机器人的不确定性和质量

Pablo Valle, Chengjie Lu, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09540 2026-07-21 cs.IR 版本更新 50%

From Raw IDs to Semantic Planning: How Recommender Systems Utilize Information at Scale

从原始ID到语义规划:推荐系统如何大规模利用信息

Changhong Jin, Shiqiu Yang, Roger Zhe Li, Yingjie Niu, Aghiles Salah, Mete Sertkan, Zheng Ju, Xingsheng Guo, Huifeng Guo, Ruihai Dong, Barry Smyth

专题命中 多模态Agent :multimodal(abstract)

AI总结 探讨推荐系统如何利用信息,分析原始ID主导早期发展及语义信息封装于ID的原因,引入语义规划为未来方向,指出转变需在模型设计、评估及协调多方目标等方面做出改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 50%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04103 2026-07-17 q-fin.RM cs.LG 版本更新 50%

Governing Generative AI Across Financial Institutions: A Framework for Generative AI Risk Control

跨金融机构治理生成式AI:符合SR 26-2要求的生成式AI风险控制框架

Dennis Mao, Alessandra Lin, Yixin Kang, Yiqing Wang

机构 * Citigroup(摩根大通) Florida State University(佛罗里达州立大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对SR 26-2未覆盖生成式AI的治理难题,本文提出兼容该监管规则的GAICF框架,将模型风险管理原则转化为分层控制结构,助力金融机构合规管控生成式AI应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21477 2026-07-15 cs.CR 版本更新 50%

MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks

MCP陷阱实验室:在多向攻击下暴露MCP工具服务器安全漏洞的开发人员陷阱

Run Hao, Zhuoran Tan

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出MCP Pitfall Lab框架,通过可复现的场景验证开发人员陷阱,评估MCP工具服务器在多向攻击下的安全性和修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10407 2026-07-14 cs.RO 版本更新 50%

Rethinking Gaussian Trajectory Predictors: Calibrated Uncertainty for Safe Planning

重新思考高斯轨迹预测器:为安全规划校准不确定性

Fatemeh Cheraghi Pouria, Mahsa Golchoubian, Katherine Driggs-Campbell

机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出了一种新的损失函数,通过核密度估计校准高斯轨迹预测器的不确定性,以提高安全规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12144 2026-07-03 cs.MA 版本更新 50%

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing

VERITAS:通过智能系统进行图像派生假设检验的可验证认知推理

Lucas Stoffl, Benedikt Wiestler, Johannes C. Paetzold

专题命中 多模态Agent :multimodal(abstract)

AI总结 VERITAS通过多智能体系统自主测试自然语言假设,生成可审计的证据链,通过四阶段工作流和认知证据标签框架提升医学影像研究的可验证性,达到81.4%的准确率。

Comments 43 pages, 5 figures. Code available at https://github.com/LucZot/veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04949 2026-06-26 cs.RO 版本更新 50%

Monte Carlo Tree Search with Tensor Factorization for Optimization Problems in Robotics

基于张量分解的蒙特卡洛树搜索用于机器人优化问题

Teng Xue, Yan Zhang, Amirreza Razmjoo, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出TTTS算法,利用张量分解压缩决策树分支间的隐式相关性,以线性复杂度降低MCTS的计算和存储开销,在逆运动学、运动规划、多阶段操作等任务中实现高效全局优化。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12542 2026-06-12 astro-ph.IM astro-ph.EP cs.LG 版本更新 50%

Earth Science Foundation Models: From Perception to Reasoning and Discovery

地球科学基础模型:从感知到推理与发现

Xiangyu Zhao, Bo Liu, Yuehan Zhang, Zelin Song, Wanghan Xu, Feng Liu, Fengxiang Wang, Ben Fei, Fenghua Ling, Wangxu Wei, Wenlong Zhang, Xiao-Ming Wu

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文综述了地球科学基础模型,探讨了其从感知到多模态推理及科学发现的能力演进,并总结了其在大气、水圈、岩石圈等领域的广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18343 2026-06-10 physics.optics 版本更新 50%

Super-Resolution Structured-Illumination X-Ray Microscopy based on Fourier Decomposition

基于傅里叶分解的超分辨结构照明X射线显微镜

Stefan Schwaiger, Lennart Forster, Martin Dierolf, Franz Pfeiffer, Benedikt Günther

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种超分辨X射线显微镜方法,通过结构照明编码高频信息,利用傅里叶分解解码,实现2.2倍分辨率提升,并扩展至显微断层成像,同时获取相位衬度和暗场图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04266 2026-06-09 cs.CR cs.LG 版本更新 50%

State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space

状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击

Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li

机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏