arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-26 至 2026-06-26 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2606.26552 2026-06-26 cs.CV cs.AI 新提交 79%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26567 2026-06-26 eess.SP 新提交 78%

Multi-Modal Environment-Aware Beam Management for Massive MIMO: A Geometry-Driven Virtual Base Station Framework

大规模MIMO的多模态环境感知波束管理:一种几何驱动的虚拟基站框架

Yijie Bian, Wei Guo, Jie Yang, Shenghui Song, Jun Zhang, Shi Jin, Khaled B. Letaief

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 提出几何驱动框架,利用3D LiDAR点云和位置信息构建虚拟基站数据库,通过镜像对称建模主导反射路径,实现粗信道重建和低开销波束训练,并采用双智能体深度强化学习协调波束选择,提升波束管理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 77%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27330 2026-06-26 cs.CL cs.AI cs.CV cs.LG 新提交 75%

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning

通过自主经验探索与事后经验利用赋能GUI智能体任务规划

Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PEEU方法,通过自主探索环境发现经验并利用事后经验合成严格对齐的高层训练数据,提升小型多模态大语言模型在GUI任务中的规划与跨网站泛化能力。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27251 2026-06-26 cs.RO cs.AI 新提交 57%

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

推进全模态具身智能体:从孤立技能到日常物理自主

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26722 2026-06-26 cs.AI physics.optics 新提交 57%

Socratic agents for autonomous scientific discovery in high-dimensional physical systems

用于高维物理系统中自主科学发现的苏格拉底式智能体

Xianrui Zeng, Pengfei Liu, Yirui Zang, Yang Shen, Fei Yu, Chunlei Yu, Minghao Liu, Yang Du

机构 * Hangzhou Institute for Advanced Study(杭州高等研究 institute) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Department of Thoracic Surgery(胸外科部门) Shanghai Pulmonary Hospital(上海 pulmonary 医院) School of Medicine(医学院) Tongji University(同济大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 提出多智能体AI科学家AHOIS,通过苏格拉底式诘问实现闭环实验中的自主科学发现,在高维多模光纤平台上自主验证随机干涉编码假设、发现自适应稀疏测量策略并诊断故障模式。

Comments 27 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24649 2026-06-26 cs.CV 新提交 57%

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

零样本3D理解的智能体协作认知

Wenxin Wang, Bo Zhang, Feng Chen, Zixuan Wang, Wen Li, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 提出协作多智能体框架,通过规划智能体补充视角和感知智能体构建结构化认知地图,实现零样本3D理解,在6个基准上达到最优性能。

Comments Accepted by ECCV 2026. Project page: https://zhangbo135.github.io/agentic-collaborative-cognition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04949 2026-06-26 cs.RO 版本更新 50%

Monte Carlo Tree Search with Tensor Factorization for Optimization Problems in Robotics

基于张量分解的蒙特卡洛树搜索用于机器人优化问题

Teng Xue, Yan Zhang, Amirreza Razmjoo, Sylvain Calinon

机构 * Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出TTTS算法,利用张量分解压缩决策树分支间的隐式相关性,以线性复杂度降低MCTS的计算和存储开销,在逆运动学、运动规划、多阶段操作等任务中实现高效全局优化。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏