arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2773 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2773 篇

2601.05508 2026-04-21 cs.CV cs.CL 62%

Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors

无需语言特定先验知识实现象形文字脚本级别的结构分析

Fuwen Luo, Zihao Wan, Ziyue Wang, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang, Peng Li, Yang Liu

机构 * THUNLP-MT(清华大学自然语言处理实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HieroSA框架,使多模态大语言模型能自动从字符位图中提取脚本级结构,无需人工数据,实现跨语言通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15715 2026-04-20 cs.CL cs.AI 62%

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

GTA-2: 从原子工具使用到开放性工作流的通用工具代理基准测试

Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTA-2基准测试,涵盖原子工具使用和开放性工作流,通过递归检查点机制评估模型能力和执行框架,揭示了前沿模型在复杂任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23304 2026-04-20 cs.CV cs.AI 62%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12102 2026-04-16 cs.AI cs.CV cs.LG 62%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-04-15 cs.AI cs.MM 62%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05295 2026-04-15 cs.AI cs.CV 62%

WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces

WebChain:一个大规模的人工标注的真实世界网页交互轨迹数据集

Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong

机构 * Fudan University(复旦大学) IMean AI WebAgentLab

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WebChain数据集,包含31,725条轨迹和318k步,通过视觉、结构和动作数据的三元对齐提供多模态监督,提出双中层训练方法,实现了WebChainBench等公开GUI基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI 62%

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09197 2026-04-13 cs.CV cs.AI 62%

Vision Transformers for Preoperative CT-Based Prediction of Histopathologic Chemotherapy Response Score in High-Grade Serous Ovarian Carcinoma

用于高阶浆液性卵巢癌术前CT基预测组织病理学化疗反应评分的视觉变换器

Francesca Fati, Felipe Coutinho, Marika Reinius, Marina Rosanu, Gabriel Funingana, Luigi De Vitis, Gabriella Schivardi, Hannah Clayton, Alice Traversa, Zeyu Gao, Guilherme Penteado, Shangqi Gao, Francesco Pastori, Ramona Woitek, Maria Cristina Ghioni, Giovanni Damiano Aletti, Mercedes Jimenez-Linan, Sarah Burge, Nicoletta Colombo, Evis Sala, Maria Francesca Spadea, Timothy L. Kline, James D. Brenton, Jaime Cardoso, Francesco Multinu, Elena De Momi, Mireia Crispin-Ortuzar, Ines P. Machado

机构 * European Institute of Oncology, IEO, IRCCS(欧洲肿瘤研究所) Politecnico di Milano(米兰理工大学) INESC TEC, Faculty of Engineering, University of Porto(波尔图大学工程学院INESC TEC) University of Cambridge(剑桥大学) Cancer Research UK Cambridge Centre(英国癌症研究中心剑桥中心) Cancer Research UK Cambridge Institute(英国癌症研究中心剑桥研究所) Cambridge University Hospitals NHS Foundation Trust(剑桥大学医院NHS基金会信托) Mayo Clinic(梅奥诊所) Early Cancer Institute, University of Cambridge(剑桥大学早期癌症研究所) Danube Private University(多瑙私立大学) University of Milan(米兰大学) Università Cattolica del Sacro Cuore(圣心天主教大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用视觉变换器构建多模态模型,通过术前CT影像与临床数据预测高阶浆液性卵巢癌的化疗反应评分,初步验证了深度学习在术前预测治疗反应中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04901 2026-04-07 cs.CV cs.AI 62%

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

FileGram:基于文件系统行为轨迹的智能体个性化研究

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FileGram框架,通过文件系统行为轨迹实现智能体记忆与个性化,包含数据引擎、基准测试和内存架构,解决数据限制和多模态轨迹收集难题。

Comments Project Page: https://filegram.choiszt.com, Code: https://github.com/synvo-ai/FileGram

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 62%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29828 2026-04-01 cs.AI cs.CL 62%

Owl-AuraID 1.0: An Intelligent System for Autonomous Scientific Instrumentation and Scientific Data Analysis

Owl-AuraID 1.0:自主科学仪器与科学数据分析的智能系统

Han Deng, Anqi Zou, Hanling Zhang, Ben Fei, Chengyu Zhang, Haobo Wang, Xinru Guo, Zhenyu Li, Xuzhu Wang, Peng Yang, Fujian Zhang, Weiyu Guo, Xiaohong Shao, Zhaoyang Liu, Shixiang Tang, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong(香港中文大学) Dalian University of Technology(大连理工大学) Suzhou Laboratory(苏州实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Owl-AuraID 1.0通过GUI原生范式实现科学仪器自动化,整合类型1(仪器操作)和类型2(数据分析)技能,支持FTIR、NMR等多种分析模态,为自主实验室提供可扩展的基础框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26741 2026-03-31 cs.CV cs.AI cs.RO 62%

Language-Conditioned World Modeling for Visual Navigation

基于语言的视觉导航世界建模

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Clemson University(克莱姆森大学) Drexel University(德雷塞尔大学) Microsoft Research(微软研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。

Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25091 2026-03-27 cs.CV cs.AI 62%

Pixelis: Reasoning in Pixels, from Seeing to Acting

Pixelis:在像素中推理,从看见到行动

Yunpeng Zhou

机构 * University of Reading(雷丁大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。

Comments 28pages, 16figures, 18tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24533 2026-03-26 cs.LG cs.AI cs.CV 62%

UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience

UI-Voyager:一种通过失败经验自我进化的GUI代理学习

Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu, Zhicong Lu, Yangbin Yu, Mingyu Yang, Junyou Li, Deheng Ye, Jie Jiang

机构 * Tencent(腾讯)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UI-Voyager,一种两阶段自我进化的移动GUI代理,通过拒绝微调和组相对自蒸馏提升GUI任务的效率和性能,实验显示其在AndroidWorld上达到81.0%的Pass@1成功率。

Comments Code and models are available at https://github.com/ui-voyager/UI-Voyager

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO 62%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08713 2026-03-24 cs.AI cs.CV cs.RO 62%

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight

通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型

Yifei Dong, Fengyi Wu, Guangyu Chen, Lingdong Kong, Xu Zhu, Qiyu Hu, Yuxuan Zhou, Jingdong Sun, Jun-Yan He, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Apple(苹果公司) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。

Comments 21 pages, 12 figures, code: https://github.com/F1y1113/UniWM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20200 2026-03-24 cs.RO cs.AI cs.CV 62%

Your Robot Will Feel You Now: Empathy in Robots and Embodied Agents

你的机器人将能感知你:机器人与具身代理中的共情

Angelica Lim, Ö. Nilay Yalçin

机构 * School of Computing Science, Simon Fraser University(计算科学学院,西蒙弗雷泽大学) School of Interactive Arts and Technology, Simon Fraser University(交互艺术与技术学院,西蒙弗雷泽大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了人类机器人交互和具身对话代理领域中共情行为和模型的研究,探讨如何将这些经验应用于当今基于语言的代理系统。

Comments Accepted manuscript. Chapter in "Empathy and Artificial Intelligence: Challenges, Advances and Ethical Considerations" edited by Anat Perry; C. Daryl Cameron

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16664 2026-03-18 cs.CV cs.AI 62%

Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation

Kestrel: 为降低LVLM幻觉而引入自反思

Jiawei Mao, Hardy Chen, Haoqin Tu, Yuhan Wang, Letian Zhang, Zeyu Zheng, Huaxiu Yao, Zirui Wang, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Kestrel提出一种无需训练的框架,通过显式视觉 grounding 与证据验证自反思机制减少LVLM幻觉,实验显示在POPE和MME-Hallucination基准上性能提升,同时提供透明的验证轨迹。

Comments 16 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11975 2026-03-16 cs.CV cs.AI cs.CR 62%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12823 2026-03-16 cs.CL cs.CV 62%

Adaptive Vision-Language Model Routing for Computer Use Agents

自适应视觉-语言模型路由用于计算机使用代理

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11545 2026-03-16 cs.CL cs.AI cs.LG 62%

One Supervisor, Many Modalities: Adaptive Tool Orchestration for Autonomous Queries

一个监督者,多种模态:面向自主查询的自适应工具协调

Mayank Saini, Arit Kumar Bishwas

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个代理AI框架,通过动态分解用户查询并分配任务给不同模态的工具,提升多模态查询处理效率,实验显示在15类任务中准确回答时间减少72%,对话重做减少85%,成本降低67%。

Comments 19 pages, 3 figures; v2: corrected author metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10220 2026-03-12 cs.CV cs.AI cs.RO 62%

Robotic Ultrasound Makes CBCT Alive

机器人超声使CBCT活起来

Feng Li, Ziyuan Li, Zhongliang Jiang, Nassir Navab, Yuan Bi

机构 * Chair for Computer-Aided Medical Procedures and Augmented Reality, Technical University of Munich(计算机辅助医学程序与增强现实 chair,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) The University of Hong Kong(香港大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 利用机器人超声实现动态CBCT更新,通过实时估计组织变形提升手术导航精度

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14482 2026-03-12 cs.CV cs.AI 62%

TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning

TikArt: 通过强化学习稳定引导孔细粒度视觉推理

Hao Ding, Zhichuan Yang, Weijie Ge, Ziqin Gao, Chaoyi Lu, Lei Zhao

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 TikArt通过强化学习引导孔机制提升细粒度视觉推理,结合语言推理与Zoom、Segment操作,实现多模态证据获取与持久记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14899 2026-03-10 cs.AI cs.CV 62%

InsightX Agent: An LMM-based Agentic Framework with Integrated Tools for Reliable X-ray NDT Analysis

InsightX Agent: 一种基于LMM的智能框架,集成工具用于可靠X射线无损检测分析

Jiale Liu, Huan Wang, Yue Zhang, Xiaoyu Luo, Jiaxiang Hu, Zhiliang Liu, Min Xie

机构 * School of Physics and Astronomy, The University of Edinburgh(物理学与天文学学院,爱丁堡大学) Glasgow College, University of Electronic Science and Technology of China(电子科技大学成都学院) School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(机械与电子工程学院,电子科技大学) Department of Systems Engineering, City University of Hong Kong(系统工程系,香港城市大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 InsightX Agent基于LMM构建智能框架,集成工具提升X射线检测的可靠性与可解释性,实现主动推理与高质量分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00123 2026-03-03 cs.CV cs.AI 62%

CT-Flow: Orchestrating CT Interpretation Workflow with Model Context Protocol Servers

CT-Flow: 通过模型上下文协议服务器协调CT解释工作流

Yannian Gu, Xizhuo Zhang, Linjie Mu, Yongrui Yu, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University, Shanghai, China(清元研究院,上海交通大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Sensetime Research, Shanghai, China(senseTime研究院,上海,中国)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CT-Flow通过模型上下文协议实现3D CT解释工作流的动态协调,提升诊断准确性和工具调用效率。

Comments submitting to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14234 2026-02-17 cs.AI cs.CL 62%

REDSearcher: A Scalable and Cost-Efficient Framework for Long-Horizon Search Agents

REDSearcher: 一种可扩展且成本效益高的长周期搜索智能体框架

Zheng Chu, Xiao Wang, Jack Hong, Huiming Fan, Yuqi Huang, Yue Yang, Guohai Xu, Chenxiao Zhao, Cheng Xiang, Shengchao Hu, Dongdong Kuang, Ming Liu, Bing Qin, Xing Yu

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 REDSearcher提出一种统一框架,通过任务合成、中期训练和后期训练优化长周期搜索智能体,实现高效且低成本的搜索任务解决。

Comments https://redsearchagent.github.io/index/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03320 2026-02-04 cs.CV cs.AI 62%

MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning

MedSAM-Agent: 通过多轮代理强化学习赋能交互式医学图像分割

Shengyuan Liu, Liuxin Bao, Qi Yang, Wanting Geng, Boyun Zheng, Chenxin Li, Wenting Chen, Houwen Peng, Yixuan Yuan

机构 * Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hunyuan Group, Tencent(腾讯洪音集团) Institute of Automation, the Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Dalian University of Technology, Dalian, China(大连理工大学) Stanford University, Stanford, USA(斯坦福大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM-Agent通过多轮代理强化学习提升医学图像分割的交互效率与准确性

Comments 23 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02559 2026-02-04 cs.AI cs.CV cs.LG cs.MA 62%

Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers

基于经验的多智能体系统是无需训练的上下文感知地球观测者

Pengyu Dai, Weihao Xuan, Junjue Wang, Hongruixuan Chen, Jian Song, Yafei Ou, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Hokkaido University(北海道大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GeoEvolver通过结构化交互使LLM代理无需训练即可获得地球观测专业知识,提升复杂任务的成功率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00197 2026-02-04 q-bio.QM cs.AI cs.CL 62%

Rank-and-Reason: Multi-Agent Collaboration Accelerates Zero-Shot Protein Mutation Prediction

Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测

Yang Tan, Yuanxi Yu, Can Wu, Bozitao Zhong, Mingchen Li, Guisheng Fan, Jiankang Zhu, Yafeng Liang, Nanqing Dong, Liang Hong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science(南方大学(科学)) East China University of Science and Technology(东中国科学与技术大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。

Comments 22 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22041 2026-01-30 cs.MA cs.AI cs.CV cs.LG 62%

Learning to Communicate Across Modalities: Perceptual Heterogeneity in Multi-Agent Systems

在多智能体系统中学习跨模态交流:感知异质性

Naomi Pitzer, Daniela Mihai

机构 * University of Southampton(索姆塞特大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究通过异质多模态交流游戏探讨智能体在感知异质性下的交流机制,发现单模态系统更高效,多模态系统需更多信息交换,位扰动实验揭示了意义的分布编码特性。

Comments To be published in EvoLang XVI proceedings. 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏