arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2605.09005 2026-05-12 cs.RO cs.AI 57%

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06226 2026-05-12 cs.AI q-bio.GN 57%

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

一种多功能AI代理用于罕见病诊断和风险基因优先级排序

Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Genetics, Yale University(耶鲁大学遗传学系) Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05714 2026-05-08 cs.CV cs.RO 57%

TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation

TriRelVLA:三元关系结构用于可迁移的具身操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 TriRelVLA通过构建三元关系结构,解决视觉语言动作模型在未见场景和物体上的泛化问题,提升具身操作的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01245 2026-05-05 cs.HC cs.AI 57%

The Garden of Forking Paths: Narrative Arc-Conditioned Gameplay Planning

分叉花园:叙事弧条件下的游戏玩法规划

Yunge Wen, Chenliang Huang, Hangyu Zhou, Zhuo Zeng, Chun Ming Louis Po, Julian Togelius, Timothy Merino, Sam Earle

机构 * New York University(纽约大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Forking Garden框架,通过用户提供的故事情节生成分支游戏,采用弧引导约束算法构建 dungeon 图,实现游戏元素的多模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27267 2026-05-01 cs.CR cs.AI cs.RO 57%

From Prompt to Physical Actuation: Holistic Threat Modeling of LLM-Enabled Robotic Systems

从提示到物理执行:LLM赋能机器人系统的整体威胁建模

Neha Nagaraja, Hayretdin Bahsi, Carlo R. da Cunha

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(信息学、计算与网络系统学院,北亚利桑那大学) Department of Software Science, Tallinn University of Technology(软件科学系,塔林技术大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于数据流图的LLM赋能机器人系统威胁分析方法,揭示了传统威胁、对抗威胁和对话威胁在感知-规划-执行流程中的交互与传播,首次完整分析了三个威胁类别在全系统中的跨边界攻击链。

Comments Submitted to 23rd Annual International Conference on Privacy, Security, and Trust (PST2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27253 2026-05-01 cs.AI 57%

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

AutoSurfer -- 通过全面浏览、学习和建模教学网络代理

Fazle Elahi Faisal, Qianhui Wu, Baolin Peng, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 AutoSurfer通过系统性广度优先探索策略、任务合成引导和轨迹优化,实现全面覆盖网站操作空间,提升网络代理轨迹生成的准确性和多样性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27151 2026-05-01 cs.AI 57%

Step-level Optimization for Efficient Computer-use Agents

面向高效计算机使用代理的步骤级优化

Jinbiao Wei, Kangqi Ni, Yilun Zhao, Guo Gan, Arman Cohan

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种事件驱动的步骤级级联框架,通过动态分配计算资源提升计算机使用代理的效率,减少冗余计算并增强任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26781 2026-04-30 cs.CV 57%

Virtual-reality based patient-specific simulation of spine surgical procedures: A fast, highly automated and high-fidelity system for surgical education and planning

基于虚拟现实的患者特异性脊柱手术模拟:一种快速、高度自动化和高保真的系统,用于手术教育和规划

Raj Kumar Ranabhat, Tayler D Ross, Tony Jiao, Jeremie Larouche, Joel Finkelstein, Michael Hardisty

机构 * Holland Bone and Joint Program, Sunnybrook Research Institute(霍尔德骨科与关节程序,圣布鲁诺研究学院) Division of Spine Surgery, Sunnybrook Health Sciences Centre(脊柱外科部,圣布鲁诺健康科学中心) Division of Orthopaedic Surgery, Department of Surgery, University of Toronto(骨科部,外科部,多伦多大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用AI和计算机视觉生成患者特异性脊柱减压模拟,通过多模态融合和分割技术提高建模精度,提升手术教育和规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26637 2026-04-30 cs.RO cs.AI 57%

ATLAS: An Annotation Tool for Long-horizon Robotic Action Segmentation

ATLAS:一种用于长时程机器人动作分割的标注工具

Sergej Stanovcic, Daniel Sliwowski, Dongheui Lee

机构 * Autonomous Systems Lab, Technische Universität Wien (TU Wien)(自主系统实验室,维也纳技术大学) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电研究所,德国航空航天中心)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出ATLAS,一种专为长时程机器人动作分割设计的标注工具,支持多模态数据同步可视化和多种数据集格式,提升了标注效率和时间对齐精度。

Comments 7 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17736 2026-04-28 cs.HC cs.AI 57%

From Static to Interactive: Authoring Interactive Visualizations via Natural Language

从静态到交互:通过自然语言实现交互式可视化

Can Liu, Jaeuk Lee, Tianhe Chen, Zhibang Jiang, Xiaolin Wen, Yong Wang

机构 * Nanyang Technological University(南洋理工大学) Ajou University(阿乔大学) Providence Health & Services(普罗维登斯健康与服务)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Athanor方法,利用多模态大语言模型和自然语言指令将静态可视化转为交互式,通过三种创新设计提升用户交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21489 2026-04-24 cs.RO cs.AI 57%

MISTY: High-Throughput Motion Planning via Mixer-based Single-step Drifting

MISTY:基于混合器的单步漂移高吞吐量运动规划

Yining Xing, Zehong Ke, Yiqian Tu, Zhiyuan Liu, Wenhao Yu, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动系统国家重点实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 MISTY通过混合器单步漂移方法实现高吞吐量运动规划,利用变分自编码器和轻量级MLP-Mixer解码器,结合隐空间漂移损失,提升轨迹生成效率与鲁棒性。

Comments 8 pages, 4 figures, 3 tables. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM 57%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV 57%

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06812 2026-04-21 cs.AI cs.CY cs.LG 57%

Generative midtended cognition and Artificial Intelligence. Thinging with thinging things

生成性中介认知与人工智能。思考与思考之物

Xabier E. Barandiaran, Marta Pérez-Verdugo

机构 * IAS-Research Centre for Life, Mind and Society, Dept. Philosophy, UPV/EHU, University of the Basque Country, Donostia, Gipuzkoa (Spain)(生命、心智与社会研究中心,哲学系,巴斯克大学,Donostia, Gipuzkoa (西班牙))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文探讨生成性中介认知概念,分析生成AI与人类认知的结合,提出该认知类型更接近社会认知而非传统扩展认知,并定义了生成性中介认知的两个维度:宽度和深度。

Comments 16 pages, 2 figures. Post-print of article published in Synthese. The final published version is available open access at https://doi.org/10.1007/s11229-025-04961-4

Journal ref Synthese 205 (2025) 137

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV 57%

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV 57%

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10096 2026-04-20 cs.CV 57%

ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents

ABot-Claw:持久、协作和自演化机器人代理的基础

Dongjie Huo, Haoyun Liu, Guoqing Liu, Dekang Qi, Zhiming Sun, Maoguo Gao, Jianxin He, Yandan Yang, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

机构 * AMAP CV Lab(AMAP CV 实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ABot-Claw通过统一的具身接口、视觉导向的多模态记忆和基于批评者的闭环反馈机制,实现了持久上下文保留、在线进度评估和自演化能力,支持开放动态环境中的机器人代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20633 2026-04-20 cs.AI 57%

Seed1.8 Model Card: Towards Generalized Real-World Agency

Seed1.8 模型卡:迈向通用的现实世界代理

Bytedance Seed

机构 * Bytedance Seed(字节跳动Seed)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14661 2026-04-17 cs.SE cs.AI cs.LG 57%

AIPC: Agent-Based Automation for AI Model Deployment with Qualcomm AI Runtime

AIPC:基于代理的AI模型部署自动化方法

Jianhao Su, Zhanwei Wu, ShengTing Huang, Weidong Feng

机构 * Qualcomm Technologies, Inc(高通技术公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出AIPC,一种基于代理的AI模型部署自动化方法,通过标准化阶段和验证循环减少部署难度,适用于Qualcomm AI Runtime的AI模型部署。

Comments 19 pages, 1 figure, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05541 2026-04-17 cs.CV 57%

EchoAgent: Towards Reliable Echocardiography Interpretation with "Eyes","Hands" and "Minds"

EchoAgent:迈向可靠超声心动图解读的“眼、手、脑”系统

Qin Wang, Zhiqing He, Yu Liu, Bowen Guo, Zeju Li, Miao Zhao, Wenhao Ju, Zhiling Luo, Xianhong Shu, Yi Guo, Yuanyuan Wang

机构 * Fudan University(复旦大学) Fudan Zhongshan Hospital(复旦中山医院) Fuwai Yunnan Hospital(阜外云南医院) Fuwai Beijing Hospital(阜外北京医院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EchoAgent,通过整合视觉、手动操作与专家知识,实现端到端的超声心动图解读,提升临床可靠性与实用性。

Comments Accepted by CVPR 2026 CV4Clinical, 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09581 2026-04-16 cs.AI cs.CY cs.HC 57%

Avenir-UX: Automated UX Evaluation via Simulated Human Web Interaction with GUI Grounding

Avenir-UX:通过模拟人类网络交互进行自动用户体验评估

Wee Joe Tan, Zi Rui Lucas Lim, Shashank Durgad, Karim Obegi, Aiden Yiliu Li

机构 * University College London(伦敦大学学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Avenir-UX通过模拟人类交互行为,提供标准化的可用性评估,结合GUI接地技术,提升用户体验评估的效率和准确性,支持持续、可扩展的数据驱动测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14234 2026-04-16 cs.CV 57%

ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body

ViBES:一个具有行为智能的3D虚拟身体对话代理

Juze Zhang, Changan Chen, Xin Chen, Heng Yu, Tiange Xiang, Ali Sartaz Khan, Shrinidhi K. Lakshmikanth, Ehsan Adeli

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ViBES通过联合规划语言和运动,实现对话条件下的身体动作生成,提升了多轮对话中的社会交互能力。

Comments Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06477 2026-04-16 cs.AI 57%

MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents

MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试

Pengxiang Zhao, Guangyi Liu, YaoZhen Liang, Weiqing He, Zhengxi Lu, WenHao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu

机构 * Zhejiang University(浙江大学) vivo AI Lab(vivo AI实验室) Peking University(北京大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.AI

AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG 57%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24168 2026-04-15 cs.AI 57%

MGA: Memory-Driven GUI Agent for Observation-Centric Interaction

MGA:基于记忆的GUI代理用于以观察为中心的交互

Weihua Cheng, Junming Liu, Yifei Sun, Botian Shi, Yirong Chen, Ding Wang

机构 * Shanghai Tech University(上海科技大学) Tongji University(同济大学) East China University of Science and Technology(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 MGA通过解耦长周期轨迹和结构化状态记忆机制,减少认知负担和系统复杂度,实现高效的GUI自动化。

Comments Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 57%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12639 2026-04-14 cs.CV 57%

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

RoboStereo: 双塔4D具身世界模型用于统一策略优化

Ruicheng Zhang, Guangyu Chen, Zunnan Xu, Zihao Liu, Zhizhou Zhong, Mingyang Zhang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot HKUST(香港科技大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RoboStereo,通过双塔4D具身世界模型实现统一策略优化,解决几何幻觉和缺乏统一优化框架的问题,实验显示在细粒度操作任务中平均相对提升超过97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI 57%

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10332 2026-04-14 cs.AI 57%

From GPT-3 to GPT-5: Mapping their capabilities, scope, limitations, and consequences

从GPT-3到GPT-5:映射其能力、范围、限制及后果

Hina Afridi, Habib Ullah, Sultan Daud Khan, Mohib Ullah

机构 * University of Bergen(卑尔根大学) Norwegian University of Life Sciences(挪威生命科学大学) Sohar University(苏哈尔大学) Norwegian University of Science and Technology(挪威科技大学) Kristiania University of Applied Sciences(克里斯蒂安尼亚应用科学大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文比较分析GPT系列从GPT-3到GPT-5的发展,探讨技术演进、能力变化、部署转变、持续限制及下游影响,强调后续版本不仅是更大更准的模型,而是更复杂的系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09308 2026-04-13 cs.AI 57%

Constraint-Aware Corrective Memory for Language-Based Drug Discovery Agents

基于约束的纠正记忆:用于基于语言的药物发现代理

Maochen Sun, Youzhi Zhang, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出CACM框架,通过精确的集合级诊断和简洁的记忆写回机制,提升语言基药物发现代理的可靠性,实验表明其在目标级成功率提升36.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏