arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-25 至 2026-03-25 共收录 109 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 7 篇

2603.22367 2026-03-25 cs.IR cs.AI 83%

Reasoner-Executor-Synthesizer: Scalable Agentic Architecture with Static O(1) Context Window

推理-执行-合成器:具有静态O(1)上下文窗口的可扩展代理架构

Ivan Dobrovolskyi

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 工具调用 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出RES架构,通过分离意图解析、确定性数据检索与叙事生成,实现O(1)的token复杂度,有效解决LLM代理中上下文窗口过大导致的幻觉风险和token成本问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 81%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23079 2026-03-25 cs.RO 75%

AirSimAG: A High-Fidelity Simulation Platform for Air-Ground Collaborative Robotics

AirSimAG:一种高保真空地协同机器人仿真平台

Yangjie Cui, Xin Dong, Boyang Gao, Jinwu Xiang, Daochun Li, Zhan Tu

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)

专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18788 2026-03-25 cs.CL cs.AI 73%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 70%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 工具调用 :tool-use(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23152 2026-03-25 cs.RO 67%

PHANTOM Hand

PHANTOM手

Teng Yan, Jiongxu Chen, Qixiang Hua, Yue Yu, Zihang Wang, Yaohua Liu, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 工具调用 :tool-use(abstract);planning(abstract)

AI总结 PHANTOM手通过结合精确分析形状与鲁棒合规抓取,实现自由运动规划的亚度精度和连续可预测力输出,提升欠驱动手的负载与灵活性。

Comments 8 pages. Submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22341 2026-03-25 cs.CR cs.AI cs.CL 62%

T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search

T-MAP: 通过轨迹感知的进化搜索实现红队攻击LLM代理

Hyomin Lee, Sangwoo Park, Yumin Choi, Sohyun An, Seanie Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出T-MAP方法,通过轨迹感知的进化搜索发现对抗性提示,有效突破安全防护并实现有害目标,实验显示其在攻击实现率上优于基线方法,适用于多步骤工具执行的LLM代理安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 37 篇

2512.06796 2026-03-25 cs.RO 85%

db-LaCAM: Fast and Scalable Multi-Robot Kinodynamic Motion Planning with Discontinuity-Bounded Search and Lightweight MAPF

db-LaCAM:基于断点有界的快速可扩展多机器人运动规划与轻量级MAPF

Akmaral Moldagalieva, Keisuke Okumura, Amanda Prorok, Wolfgang Hönig

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文提出db-LaCAM,结合现代MAPF算法的高效性和 kinodynamic 规划器的动态感知能力,通过预计算的运动原语生成运动序列,实现高效多机器人运动规划,实验表明其在50个机器人场景中运行速度提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23278 2026-03-25 cs.RO 83%

Learning Multi-Agent Local Collision-Avoidance for Collaborative Carrying tasks with Coupled Quadrupedal Robots

学习多智能体局部避障以实现协作搬运任务 with 耦合四足机器人

Francesca Bray, Simone Tolomei, Andrei Cramariuc, Cesar Cadena, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(埃因斯坦理工大学机器人系统实验室)

专题命中 规划决策 :agent(title);multi-agent(title)

AI总结 本文提出基于强化学习的策略,使两台连接物体的四足机器人在未知环境中自主避障,无需预设路径或地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22076 2026-03-25 cs.AI 83%

Hybrid Stackelberg Game and Diffusion-based Auction for Two-tier Agentic AI Task Offloading in Internet of Agents

混合斯塔克伯格博弈与基于扩散的拍卖用于互联网代理中两层代理AI任务卸载

Yue Zhong, Yongju Tong, Jiawen Kang, Minghui Dai, Hong-Ning Dai, Zhou Su, Dusit Niyato

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种两层优化方法,通过多领导者多跟随者斯塔克伯格博弈和双荷兰拍卖模型,解决智能体任务卸载问题,提升资源利用效率。

Comments Revisions are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22866 2026-03-25 cs.IT math.IT 82%

Aerial Agentic AI: Synergizing LLM and SLM for Low-Altitude Wireless Networks

空域代理AI:融合LLM和SLM用于低空无线网络

Li Dong, Feibo Jiang, Kezhi Wang, Cunhua Pan, Dong In Kim, Ekram Hossain

专题命中 规划决策 :agentic(title,abstract);agent(abstract)

AI总结 本文提出空域代理AI框架,通过融合小型语言模型和大型语言模型,解决低空无线网络中的计算、通信和实时性冲突问题,实现高效协同与决策优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23245 2026-03-25 cs.LG cs.AI 81%

Neural ODE and SDE Models for Adaptation and Planning in Model-Based Reinforcement Learning

神经ODE和SDE模型用于基于模型的强化学习中的适应与规划

Chao Han, Stefanos Ioannou, Luca Manneschi, T. J. Hayward, Michael Mangan, Aditya Gilra, Eleni Vasilaki

机构 * School of Computer Science, The University of Sheffield, UK(谢菲尔德大学计算机科学学院,英国) Cancer Research UK National Biomarker Centre, The University of Manchester, UK(英国曼彻斯特大学癌症研究UK国家生物标志物中心) School of Chemical, Materials and Biological Engineering, The University of Sheffield, UK(谢菲尔德大学化学、材料和生物工程学院,英国) Machine Learning group, Centrum Wiskunde & Informatica, Amsterdam, Netherlands(荷兰阿姆斯特丹Centrum Wiskunde & Informatica机器学习组) Institute for Ecological Economics, Vienna University of Economics and Business, Austria(奥地利维也纳经济与商业大学生态经济研究所)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文利用神经ODE和SDE建模随机动力学,通过实验展示SDE在复杂场景中提升策略样本效率的效果,并引入隐式SDE模型应对部分可观测性问题。

Journal ref Transactions on Machine Learning Research (10/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22904 2026-03-25 cs.AI 79%

Separating Diagnosis from Control: Auditable Policy Adaptation in Agent-Based Simulations with LLM-Based Diagnostics

区分诊断与控制:基于LLM诊断的代理仿真中可审计的政策适应

Shaoxin Zhong, Yuchen Su, Michael Witbrock

机构 * University of Auckland, Auckland, New Zealand(奥克兰大学,新西兰奥克兰)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出三层框架,通过分离诊断与控制实现政策适应性和可审计性。LLM作为诊断工具评估群体状态并生成风险评估,确定性公式转化为可追溯的参数更新。实验显示显式控制规则在老年护理仿真中比黑盒LLM方法更高效且保持可审计性。

Comments This paper has been accepted at AAMAS 2026 Workshop MABS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14824 2026-03-25 cs.AI 79%

Planning as Goal Recognition: Deriving Heuristics from Intention Models -- Extended Version

规划作为目标识别:从意图模型中推导启发式方法 -- 延伸版本

Giacomo Rosa, Jean Honorio, Nir Lipovetzky, Sebastian Sardina

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出基于分歧的目标意图评估框架,推导出高效可计算的启发式方法,并展示其在经典规划问题求解中的改进效果。

Comments Extended version of our paper accepted at ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI 79%

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13719 2026-03-25 cs.CV cs.AI cs.IR 79%

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22998 2026-03-25 cs.CV 79%

VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought

VQ-Jarvis:具备锐利视觉与快速思考的检索增强视频修复代理

Xuanyu Zhang, Weiqi Li, Qunliang Xing, Jingfen Xie, Bin Chen, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院,深圳,中国) ByteDance Inc., Shenzhen, China(字节跳动公司,深圳,中国)

专题命中 规划决策 :agent(title,abstract)

AI总结 本文提出VQ-Jarvis,一种具备锐利视觉与快速思考的视频修复代理,通过构建大规模视频配对增强数据集和分层操作调度策略,提升视频修复的准确性和效率。

Comments Video restoration, Agent-based restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23295 2026-03-25 cs.CV 78%

Mamba-driven MRI-to-CT Synthesis for MRI-only Radiotherapy Planning

基于Mamba的MRI到CT合成用于仅MRI的放疗计划

Konstantinos Barmpounakis, Theodoros P. Vagenas, Maria Vakalopoulou, George K. Matsopoulos

机构 * School of Electrical Computer Engineering, National Technical University of Athens Archimedes, Athena Research Center CentraleSup\'elec, University of Paris-Saclay

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出基于Mamba架构的MRI到CT合成方法,以提高跨模态翻译的准确性与效率,通过3D Mamba架构捕捉复杂体积特征和长距离依赖,实现快速且精确的CT合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23182 2026-03-25 cs.RO cs.SY eess.SY 78%

Path Planning and Reinforcement Learning-Driven Control of On-Orbit Free-Flying Multi-Arm Robots

轨道自由飞行多臂机器人的路径规划与强化学习驱动控制

Álvaro Belmonte-Baeza, José Luis Ramón, Leonard Felicetti, Miguel Cazorla, Jorge Pomares

机构 * University of Alicante(阿利坎特大学) Cranfield University(克兰菲尔德大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种结合轨迹优化与强化学习的混合方法,用于自由飞行多臂机器人在在轨服务场景中的路径规划与控制。通过实验验证,该方法在表面运动和自由浮动场景中均优于传统策略,提升了运动平滑度、安全性和效率。

Comments Accepted for publication in The International Journal of Robotics Research (23-Mar-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22856 2026-03-25 eess.IV 78%

Retrieval-Guided Photovoltaic Inventory Estimation from Satellite Imagery for Distribution Grid Planning

基于卫星图像的检索引导光伏库存估计用于配电网规划

Muhao Guo, Lihao Mai, Erik Blasch, Jafarali Parol, Turki Rakan, Yang Weng

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出Solar-RAG框架,通过图像检索与多模态视觉语言推理结合,提升光伏部署估计的鲁棒性,减少配电网规划中的电压偏差和承载能力误差。

Comments 38 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14315 2026-03-25 cs.GR cs.CV 78%

ImmerseGen: Agent-Guided Immersive World Generation with Alpha-Textured Proxies

ImmerseGen:基于代理的沉浸式世界生成与Alpha纹理代理

Jinyan Yuan, Bangbang Yang, Keke Wang, Panwang Pan, Lin Ma, Xuehai Zhang, Xiao Liu, Zhaopeng Cui, Yuewen Ma

机构 * Bytedance(字节跳动) Zhejiang University(浙江大学)

专题命中 规划决策 :agent(title,abstract)

AI总结 ImmerseGen通过轻量级几何代理和合成RGBA纹理实现高效沉浸式VR场景生成,结合地形条件纹理和上下文感知纹理生成多样且视觉一致的世界,提升真实感和渲染效率。

Comments Accepted by IEEE VR 2026 and TVCG Special Issue. Project webpage: https://immersegen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02395 2026-03-25 cs.RO cs.SY eess.SY 78%

A Real-Time Control Barrier Function-Based Safety Filter for Motion Planning with Arbitrary Road Boundary Constraints

基于控制屏障函数的实时安全过滤器:用于具有任意道路边界约束的运动规划

Jianye Xu, Chang Che, Bassam Alrifaee

机构 * Department of Computer Science, RWTH Aachen University(鲁尔大学计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种基于控制屏障函数的实时安全过滤器,用于在复杂道路边界条件下保证运动规划的安全性,通过直接整合任意形状的道路几何信息,实现高效且可靠的碰撞避免。

Comments Published version, see https://doi.org/10.1109/ITSC60802.2025.11423203

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22528 2026-03-25 cs.IR cs.AI 77%

GraphRAG for Engineering Diagrams: ChatP&ID Enables LLM Interaction with P&IDs

GraphRAG用于工程图纸:ChatP&ID实现LLM与P&IDs的交互

Achmad Anggawirya Alimin, Artur M. Schweidtmann

机构 * Process Intelligence Research Group(过程智能研究组) Department of Chemical Engineering(化学工程系) Delft University of Technology(代尔夫特理工大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出ChatP&ID框架,通过GraphRAG实现高效、低成本的P&IDs自然语言交互,提升准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14967 2026-03-25 cs.CL cs.AI cs.LG 75%

Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents

基于信息增益的策略优化:一种用于多轮搜索代理的简单而有效的方法

Guoqing Wang, Sunhao Dai, Guangze Ye, Zeyu Gan, Wei Yao, Yong Deng, Xiaofeng Wu, Zhenzhe Ying

机构 * Venus Team, Ant Group(蚂蚁集团 Venus 团队) Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于信息增益的策略优化框架,通过密集内在监督提升多轮代理训练效果,实验表明其在多轮场景中优于现有方法,准确性和数据效率更高。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 74%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 73%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23447 2026-03-25 cs.CV cs.AI 57%

3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding

3DCity-LLM:赋能多模态大语言模型进行3D城市级感知与理解

Yiping Chen, Jinpeng Li, Wenyu Ke, Yang Luo, Jie Ouyang, Zhongjie He, Li Liu, Hongchao Fan, Hao Wu

机构 * School of Geospatial Engineering and Science(测绘工程与科学学院) Sun Yat-sen University(中山大学) College of Electronic Science(电子科学学院) National University of Defense Technology(国防科技大学) Department of Civil and Environmental Engineering(土木与环境工程系) Norwegian University of Science and Technology(挪威科技大学) National Geomatics Center of China(中国国家测绘地理信息中心)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出3DCity-LLM框架,通过粗到细的特征编码策略和120万高质量数据集,提升城市级多模态感知与理解能力,实验表明其在空间推理和城市智能方面优于现有方法。

Comments 24 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23173 2026-03-25 cs.LG math.OC 57%

A Schrödinger Eigenfunction Method for Long-Horizon Stochastic Optimal Control

一个用于长horizon随机最优控制的Schrödinger特征函数方法

Louis Claeys, Artur Goldman, Zebang Shen, Niao He

机构 * ETH Zürich(苏黎世联邦理工学院) Department of Mathematics(数学系) ETH AI Center(ETH人工智能中心) Institute for Machine Learning(机器学习研究所)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出一种基于Schrödinger算子的特征函数方法,用于解决长horizon随机最优控制问题,通过将Hamilton-Jacobi-Bellman方程转化为线性PDE,并利用其特征函数系统高效描述控制问题。

Comments Accepted to ICLR 2026, code available in https://github.com/lclaeys/eigenfunction-solver

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22813 2026-03-25 cs.AI 57%

Learning What Matters Now: Dynamic Preference Inference under Contextual Shifts

学习当下重要的事物:在情境变化下的动态偏好推断

Xianwei Cao, Dou Quan, Zhenliang Zhang, Shuang Wang

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究了在偏好权重随情境变化而变化的情况下,动态偏好推断(DPI)框架如何通过维护概率信念并更新信念来提高决策性能,展示了其在队列、迷宫和多目标连续控制环境中的有效性。

Comments 10 pages, ICLR 2026 poster paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO 57%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏