arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2506.02955 2026-01-15 cs.RO cs.AI cs.LG 57%

UniConFlow: A Unified Constrained Flow-Matching Framework for Certified Motion Planning

UniConFlow: 一种统一的约束流匹配框架用于认证运动规划

Zewen Yang, Xiaobing Dai, Dian Yu, Zhijun Li, Majid Khadiv, Sandra Hirche, Sami Haddadin

机构 * Technical University of Munich (TUM)(技术大学慕尼黑) School of Mechanical Engineering, Translational Research Center, Tongji University(机械工程学院、转化研究中心,同济大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 UniConFlow提出一种统一约束流匹配框架,通过整合等式和不等式约束,提升轨迹生成在安全性和动态一致性上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 57%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11773 2026-01-15 cs.CL 57%

AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents

AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08665 2026-01-14 cs.RO cs.CV 57%

VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory

VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航

Shaoan Wang, Yuanfei Luo, Xingyu Chen, Aocheng Luo, Dongyue Li, Chang Liu, Sheng Chen, Yangang Zhang, Junzhi Yu

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。

Comments Project page: https://wsakobe.github.io/VLingNav-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08308 2026-01-14 cs.CL 57%

AgriAgent: Contract-Driven Planning and Capability-Aware Tool Orchestration in Real-World Agriculture

AgriAgent:面向现实农业的合同驱动规划与能力感知工具编排

Bo Yang, Yu Zhang, Yunkui Chen, Lanfei Feng, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * State Key Laboratory of Brain–Machine Intelligence(脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 AgriAgent通过合同驱动规划和能力感知工具编排,提升现实农业中复杂任务的执行成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01705 2026-01-13 cs.RO cs.AI 57%

Explicit World Models for Reliable Human-Robot Collaboration

显式世界模型以实现可靠的人机协作

Kenneth Kwok, Basura Fernando, Qianli Xu, Vigneshwaran Subbaraju, Dongkyu Choi, Boon Kiat Quek

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出通过构建显式世界模型来实现可靠的显式人机协作,强调动态模糊的人机交互需求。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 57%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07278 2026-01-13 cs.AI 57%

Lifelong Learning of Large Language Model based Agents: A Roadmap

基于大语言模型代理的终身学习:路线图

Junhao Zheng, Chengming Shi, Xidi Cai, Qiuke Li, Duzhen Zhang, Chenxing Li, Dong Yu, Qianli Ma

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05243 2026-01-09 cs.RO cs.CV 57%

Generate, Transfer, Adapt: Learning Functional Dexterous Grasping from a Single Human Demonstration

生成、迁移、适应:从单个人示范学习功能性灵巧抓取

Xingyi He, Adhitya Polavaram, Yunhao Cao, Om Deshmukh, Tianrui Wang, Xiaowei Zhou, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 CorDex通过单个人示范生成合成数据,结合多模态预测网络和局部-全局融合模块,实现对新型物体的灵巧抓取学习。

Comments Project Page: https://cordex-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21799 2026-01-08 cs.AI 57%

D-Artemis: A Deliberative Cognitive Framework for Mobile GUI Multi-Agents

D-Artemis:一种用于移动GUI多智能体的 deliberative 认知框架

Hongze Mi, Yibo Feng, Wenjie Lu, Yuqi Wang, Jinyuan Li, Song Cao, He Cui, Tengfei Tian, Xuelin Zhang, Haotian Luo, Di Sun, Jun Fang, Hua Chai, Naiqiang Tan, Gang Pan

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 D-Artemis通过引入细粒度提示检索和主动对齐机制,提升移动GUI多智能体任务的执行成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03073 2026-01-07 cs.CV 57%

Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA

通过大型语言模型理解多智能体推理用于漫画视觉问答

Tong Wu, Thanet Markchom

机构 * University of Reading(阅读大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02732 2026-01-07 cs.SE cs.AI 57%

Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices

基于代理记忆的递归推理用于微服务根因定位

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Leyi Pan, Chiming Duan, Minghua He, Mengxi Jia, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Institute of Artificial Intelligence(人工智能研究院)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。

Comments accepted by ICSE-SEIP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01743 2026-01-06 cs.AI 57%

AI Agent Systems: Architectures, Applications, and Evaluation

AI代理系统:架构、应用与评估

Bin Xu

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24404 2026-01-01 cs.LG cs.CV 57%

Lifting Vision: Ground to Aerial Localization with Reasoning Guided Planning

提升视觉:基于推理引导的地面到空中定位

Soham Pahari, M. Srinivas

机构 * School of Computer Science, UPES(UPES计算机科学学院) Department of CS&E, NIT Warangal(NIT Warangal计算机科学与工程系)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出ViReLoc框架,通过视觉推理实现地面到空中定位,无需依赖GPS数据,提升空间推理和跨视角检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17821 2026-01-01 cs.RO cs.AI cs.LG 57%

CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems

CAML: 多智能体系统中的协同辅助模态学习

Rui Liu, Yu Shen, Peng Gao, Pratap Tokekar, Ming Lin

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Adobe Research(Adobe 研究院) North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 CAML通过多智能体协作和共享多模态数据,提升多模态学习在资源受限环境下的性能,实现事故检测和语义分割的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23424 2025-12-30 cs.AI cs.LG 57%

AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis

AKG核代理:跨平台核合成的多智能体框架

Jinye Du, Quan Yuan, Zuyao Zhang, Yanzhi Yi, Jiahui Hu, Wangyi Chen, Yiyang Zhu, Qishui Zheng, Wenxiang Zou, Xiangyu Chang, Zuohe Zheng, Zichun Ye, Chao Liu, Shanni Li, Renwei Zhang, Yiping Deng, Xinwei Hu, Xuefeng Jin, Jie Zhao

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Hunan University(湖南大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 AKG核代理是一种多智能体系统,通过自动化核生成、迁移和性能调优,提升跨平台核开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23217 2025-12-30 cs.AI 57%

TCEval: Using Thermal Comfort to Assess Cognitive and Perceptual Abilities of AI

TCEval:利用热舒适性评估人工智能的认知与感知能力

Jingming Li

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 TCEval通过热舒适性场景评估AI的跨模态推理、因果关联和适应性决策能力,揭示当前LLM在热舒适性领域存在基础推理能力但缺乏精确因果理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22207 2025-12-30 cs.AI 57%

GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks

GamiBench: 通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力

Ryan Spencer, Roey Yaari, Ritvik Vemavarapu, Joyce Yang, Steven Ngo, Utkarsh Sharma

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 GamiBench通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力,引入新指标并揭示模型在复杂折叠任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00336 2025-12-30 cs.RO cs.AI 57%

Never-Ending Behavior-Cloning Agent for Robotic Manipulation

永不终止的行为克隆代理用于机器人操作

Wenqi Liang, Gan Sun, Yao He, Yu Ren, Jiahua Dong, Yang Cong

机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21598 2025-12-29 cs.CV 57%

From Shallow Humor to Metaphor: Towards Label-Free Harmful Meme Detection via LMM Agent Self-Improvement

从浅层幽默到隐喻:通过LMM代理自我改进实现无标签有害迷因检测

Jian Lang, Rongpei Hong, Ting Zhong, Leiting Chen, Qiang Gao, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Southwestern University of Finance and Economics(西南财经大学) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ALARM通过LMM代理自我改进实现无标签有害迷因检测,利用浅层迷因信息提升对复杂迷因的识别能力。

Comments 12 pages. Accepted by KDD 2026 research track. Codes are released at https://github.com/Jian-Lang/ALARM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO 57%

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20206 2025-12-24 cs.AI 57%

TongSIM: A General Platform for Simulating Intelligent Machines

TongSIM: 一个用于模拟智能机器的通用平台

Zhe Sun, Kunlun Wu, Chuanjian Fu, Zeming Song, Langyong Shi, Zihe Xue, Bohan Jing, Ying Yang, Xiaomeng Gao, Aijia Li, Tianyu Guo, Huiying Li, Xueyuan Yang, Rongkai Liu, Xinyi He, Yuxi Wang, Yue Li, Mingyuan Liu, Yujie Lu, Hongzhao Xie, Shiyun Zhao, Bo Dai, Wei Wang, Tao Yuan, Song-Chun Zhu, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Beijing, China(中国北京)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08674 2025-12-24 cs.AI cs.MA 57%

Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology

多智能体智能在胃肠肿瘤多学科决策中的应用

Rongzhao Zhang, Junqiao Wang, Shuyun Yang, Mouxiao Bian, Chihao Zhang, Dongyang Wang, Qiujuan Yan, Yun Zhong, Yuwei Bai, Guanxu Zhu, Kangkun Mao, Miao Wang, Chao Ding, Renjie Lu, Lei Wang, Lei Zheng, Tao Zheng, Xi Wang, Zhuo Fan, Bing Han, Meiling Liu, Luyi Jiang, Dongming Shan, Wenzhong Jin, Jiwei Yu, Zheng Wang, Jie Xu, Meng Luo

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海第九人民医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院) Shanghai Institute of Infectious Disease and Biosecurity, Fudan University(上海市传染病防治研究所暨生物安全研究所,复旦大学) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海市卫生健康发展研究中心(上海市医疗信息中心)) Shanghai Kupas Technology Co., Ltd.(上海库帕斯科技有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于多智能体的框架,用于提升胃肠肿瘤多学科决策的自动化支持,通过模拟多学科团队协作,提高推理逻辑和医疗准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15109 2025-12-23 eess.SP cs.AI cs.IT math.IT 57%

Large Model Enabled Embodied Intelligence for 6G Integrated Perception, Communication, and Computation Network

大模型赋能的具身智能用于6G集成感知、通信与计算网络

Zhuoran Li, Zhen Gao, Xinhua Liu, Zheng Wang, Xiaotian Zhou, Lei Liu, Yongpeng Wu, Wei Feng, Yongming Huang

机构 * School of Information and Electronics(信息与电子学院) School of Interdisciplinary Science(交叉科学学院) State Key Laboratory of CNS/ATM(CNS/ATM国家重点实验室) Beijing Institute of Technology(北京理工大学) Advanced Technology Research Institute(先进技术研究院) Yangtze Delta Region Academy(长江三角洲地区学院) School of School of Information Science and Engineering(信息科学与工程学院) Institute of Intelligent Communication Technologies(智能通信技术研究院) Shandong Key Laboratory of Intelligent Communication and Sensing-Computing Integration(智能通信与传感-计算集成山东省重点实验室) Zhejiang Provincial Key Laboratory of Information Processing, Communication and Networking(信息处理、通信与网络浙江省重点实验室) Department of Electronic Engineering(电子工程系) State Key Laboratory of Space Network and Communications(空间网络与通信国家重点实验室) National Mobile Communications Research Laboratory(移动通信研究中心) Purple Mountain Laboratories(紫金山实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出利用大模型赋能基站实现感知、通信和计算一体化,为6G系统提供安全关键的智能解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15431 2025-12-22 cs.CV 57%

Step-GUI Technical Report

Step-GUI 技术报告

Haolong Yan, Jia Wang, Xin Huang, Yeqing Shen, Ziyang Meng, Zhimin Fan, Kaijun Tan, Jin Gao, Lieyu Shi, Mi Yang, Shiliang Yang, Zhirui Wang, Brian Li, Kang An, Chenyang Li, Lei Lei, Mengmeng Duan, Danxun Liang, Guodong Liu, Hang Cheng, Hao Wu, Jie Dong, Junhao Huang, Mei Chen, Renjie Yu, Shunshan Li, Xu Zhou, Yiting Dai, Yineng Deng, Yingdan Liang, Zelin Chen, Wen Sun, Chengxu Yan, Chunqin Xu, Dong Li, Fengqiong Xiao, Guanghao Fan, Guopeng Li, Guozhen Peng, Hongbing Li, Hang Li, Hongming Chen, Jingjing Xie, Jianyong Li, Jingyang Zhang, Jiaju Ren, Jiayu Yuan, Jianpeng Yin, Kai Cao, Liang Zhao, Liguo Tan, Liying Shi, Mengqiang Ren, Min Xu, Manjiao Liu, Mao Luo, Mingxin Wan, Na Wang, Nan Wu, Ning Wang, Peiyao Ma, Qingzhou Zhang, Qiao Wang, Qinlin Zeng, Qiong Gao, Qiongyao Li, Shangwu Zhong, Shuli Gao, Shaofan Liu, Shisi Gao, Shuang Luo, Xingbin Liu, Xiaojia Liu, Xiaojie Hou, Xin Liu, Xuanti Feng, Xuedan Cai, Xuan Wen, Xianwei Zhu, Xin Liang, Xin Liu, Xin Zhou, Yifan Sui, Yingxiu Zhao, Yukang Shi, Yunfang Xu, Yuqing Zeng, Yixun Zhang, Zejia Weng, Zhonghao Yan, Zhiguo Huang, Zhuoyu Wang, Zihan Yan, Zheng Ge, Jing Li, Yibo Zhu, Binxing Jiao, Xiangyu Zhang, Daxin Jiang

机构 * GELab-Team(GELab团队)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 Step-GUI 是一种先进的 GUI 代理,通过自我进化训练管道和 GUI-MCP 协议,在保持高准确率的同时实现高效隐私保护的 GUI 自动化。

Comments 41 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07475 2025-12-22 eess.IV cs.CV 57%

Text-guided multi-stage cross-perception network for medical image segmentation

基于文本引导的多阶段跨感知网络用于医学图像分割

Gaoyu Chen, Haixia Pan

机构 * college of software(软件学院) Beihang University(北京航空航天大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出文本引导的多阶段跨感知网络TMC,通过多阶段跨注意力模块和多阶段对齐损失提升医学图像分割的跨模态交互和语义一致性,实验表明其在多个数据集上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04460 2025-12-19 cs.CV 57%

V-Thinker: Interactive Thinking with Images

V-Thinker: 图像交互式思考

Runqi Qiao, Qiuna Tan, Minghan Yang, Guanting Dong, Peiqing Yang, Shiqiang Lang, Enhui Wan, Xiaowan Wang, Yida Xu, Lan Yang, Chong Sun, Chen Li, Jing Lyu, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 V-Thinker通过端到端强化学习实现图像交互式思考,提升多模态模型的视觉推理能力。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG 57%

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17116 2025-12-17 cs.AI 57%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12921 2025-12-16 cs.CR cs.AI 57%

Cisco Integrated AI Security and Safety Framework Report

思科集成AI安全与安全框架报告

Amy Chang, Tiffany Saade, Sanket Mendapara, Adam Swanda, Ankit Garg

机构 * Cisco AI Threat and Security Research(思科人工智能威胁与安全研究)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出思科集成AI安全与安全框架,旨在统一分类和操作化AI风险,涵盖安全与安全,适用于威胁识别、风险优先级排序等,具有全面性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏