arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-12 至 2026-06-12 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 27 篇

2606.12821 2026-06-12 cs.AI cs.ET 新提交 57%

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试

Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者) Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。

Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12747 2026-06-12 cs.AI 新提交 57%

Prefill Awareness in Large Language Models

大型语言模型中的预填充感知

Andy Wang, Parv Mahajan, David Demitri Africa, Alexandra Souly, Jordan Taylor, Robert Kirk

机构 * Constellation University of Wisconsin-Madison(威斯康星大学麦迪逊分校星座研究所) Constellation Georgia Institute of Technology(佐治亚理工学院星座研究所) UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究大型语言模型能否识别并响应其助手消息被预填充或篡改,发现前沿模型具有显著预填充感知能力,可能影响安全评估方法。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12420 2026-06-12 cs.CY cs.AI 新提交 57%

Eigenism: Ethics for a Human-AI Future

Eigenism:人类与人工智能未来的伦理学

Dan Hendrycks

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Eigenism伦理框架,将身份视为分级分布的信息模式,通过加权求和评估AI的福祉,并推广至人类,为AI对齐提供“身份工程”新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13640 2026-06-12 cs.SD 新提交 50%

The Moving Drone: Negotiating Agency Between the Voice and the Virtual

移动的无人机:在声音与虚拟之间协商能动性

Nithya Shikarpur, Victor Arul, Anna Huang

机构 * Massachusettes Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract)

AI总结 基于印度斯坦音乐,通过Max/MSP循环器和生成式AI模型GaMaDHaNi,将传统静态无人机变为动态、主动的虚拟音乐代理,探讨人机协作中的能动性。

Comments Published in NIME music track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13332 2026-06-12 cs.CV 新提交 50%

OR-Action: Multi-Role Video Understanding with Fine-Grained Actions

OR-Action: 细粒度动作的多角色视频理解

Felix Tristram, Ege Özsoy, Christian Benz, Marcel Walch, Ghazal Ghazaei, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carl Zeiss AG(卡尔蔡司股份公司)

专题命中 Agent评测 :workflow(abstract)

AI总结 针对手术室活动理解中场景图方法缺乏时间建模的问题,提出基于公开数据集的细粒度多角色动作基准,并引入纯视觉时序模型,显著优于图方法,同时提出多视角到单视角特征对齐策略提升单视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13057 2026-06-12 cs.GT 新提交 50%

Approximate Maximin Share with Subjective Divisibility: Beating the 1/2 Barrier

主观可分割性下的近似最大最小份额:突破1/2障碍

Xiaohui Bei, Ke Ding, Bo Li, Fangxiao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 针对主观可分割性下的公平分配问题,本文证明一元估值下最优近似比为2/3,并设计算法将一般情形的近似保证从1/2提升至5/9,对至多四个智能体给出紧的2/3近似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13431 2026-06-12 physics.soc-ph q-fin.RM 新提交 50%

Adaptive rerouting reshapes impacts of maritime chokepoint disruptions

自适应重新路由重塑海上咽喉点中断的影响

Mitja Devetak, Jasper Verschuur, Peter Klimek

专题命中 Agent评测 :agent(abstract)

AI总结 通过全球商船队基于主体的模型,量化自适应重新路由在咽喉点关闭下对到达损失的影响,揭示损失动态取决于路由、时间和区域暴露,而非静态网络拓扑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19652 2026-06-12 cs.CV 版本更新 50%

Navigating Gigapixel Pathology Images with Large Multimodal Models

利用大型多模态模型导航千兆像素病理图像

Thomas A. Buckley, Kian R. Weihrauch, Katherine Latham, Andrew Z. Zhou, Padmini A. Manrai, Arjun K. Manrai

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Pathology, Massachusetts General Hospital(麻省总医院病理学系) Department of Pathology and Laboratory Medicine, Brown University(布朗大学病理学与实验室医学系)

专题命中 Agent评测 :agent(abstract)

AI总结 提出GIANT方法,无需训练即可让通用多模态模型自主导航WSI,通过迭代选择多放大倍数裁剪并聚合证据,在MultiPathQA基准上实现SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 50%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15768 2026-06-12 eess.SY cs.SY 50%

Distributed model predictive control without terminal cost under inexact distributed optimization

不精确分布式优化下无终端代价的分布式模型预测控制

Xiaoyu Liu, Dimos V. Dimarogonas, Changxin Liu, Azita Dabiri, Bart De Schutter

专题命中 Agent评测 :agent(abstract)

AI总结 针对具有耦合约束的分布式线性离散时间系统,提出一种无终端代价的分布式模型预测控制(MPC)方案,通过松弛动态规划引入显式稳定性条件,并开发无违例分布式优化方法求解,确保闭环稳定性。

Comments 9 pages, 3 figures, submitted to Automatica

Journal ref Automatica 190 (2026) 113050

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2606.12788 2026-06-12 cs.SI cs.CY cs.DC cs.SY econ.GN eess.SY q-fin.EC 新提交 80%

To Share or Not to Share: Orchestrating Trustworthy Data in Global Value Chains

共享还是不共享:协调全球价值链中的可信数据

Han-Teng Liao, Chang-Yi Kao

专题命中 其他Agent :agentic(summary_cn,abstract)

AI总结 针对欧盟CBAM带来的监管透明与数据主权矛盾,提出基于IDSA框架的RegTech参考架构,通过主权数据交换实现数字产品护照,驱动全球商业服务能力需求,并集成Agentic AI与绿色金融,为全球产业集群提供可扩展蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏