arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-05 至 2026-06-05 共收录 185 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 18 篇

2606.05296 2026-06-05 cs.LG cs.AI 89%

Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

智能体蒙特卡洛:黑盒智能体的强化学习模拟

Dae Yon Hwang, Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh Ross

机构 * University of Cambridge(剑桥大学)

专题命中 工具调用 :agentic(title,summary_cn);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛从最优策略后验中采样,无需参数级优化即可对黑盒LLM智能体进行强化学习式优化,在AgentGym基准上超越提示基线并随测试时计算扩展优于GRPO。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06054 2026-06-05 cs.AI 87%

Beyond Similarity: Trustworthy Memory Search for Personal AI Agents

超越相似性:面向个人AI代理的可信记忆搜索

Jiawen Zhang, Kejia Chen, Jiachen Ma, Yangfan Hu, Lipeng He, Yechao Zhang, Jian Liu, Xiaohu Yang, Tianwei Zhang, Ruoxi Jia

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 针对个人AI代理中基于语义相似性的记忆检索存在的信任漏洞,提出轻量级记忆插件MemGate,通过查询条件神经门控实现可信记忆搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05449 2026-06-05 cs.AI cs.GT econ.EM 83%

Insurance of Agentic AI

代理型人工智能的保险

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, New York University, Tandon School of Engineering(电气与计算机工程系,纽约大学,工程学院)

专题命中 工具调用 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文分析了代理型AI带来的新型风险,提出了承保、定价、再保险和产品设计的框架,并构建了整合多种保险覆盖的协调架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06140 2026-06-05 cs.CR 78%

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing

RedEdit: 基于MCTS引导的照片编辑的图像安全分类器智能红队测试

Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

专题命中 工具调用 :agentic(title);agent(abstract)

AI总结 提出RedEdit,一种基于视觉语言模型提议和蒙特卡洛树搜索规划的黑盒红队代理,通过组合编辑工具序列使不安全图像逃避检测,平均不到两次编辑即可使76.2%的不安全图像绕过分类器,同时保留93.0%的恶意语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05728 2026-06-05 cs.AI cs.CL 76%

DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion Guidance

DiG-Plan:通过扩散引导缓解工具图规划中的早期承诺问题

Yansi Li, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 工具调用 :planning(title);分类 cs.AI、cs.CL

AI总结 针对工具图规划中自回归解码的早期承诺问题,提出基于扩散生成器与自回归精炼器解耦的DiG-Plan框架,显著提升组合搜索覆盖率和任务性能。

Comments Accepted at IJCAI-ECAI 2026. This is an author preprint; the final version will appear in the IJCAI Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06387 2026-06-05 cs.CR 67%

WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents

WebMCP工具表面投毒:针对LLM智能体的运行时操纵攻击

Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

专题命中 工具调用 :agent(abstract);AI agent(abstract)

AI总结 本文提出一种新的威胁——会话中工具注入(MSTI),通过第三方脚本在活跃会话中注入恶意工具,并细分为工具劫持和工具框架两类,实验证明可破坏WebMCP功能,最后给出缓解方向和安全设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05186 2026-06-05 cs.LG cs.CL 62%

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

预算受限的微预训练中的分阶段因子筛选

Felipe Chavarro Polania

机构 * Hewlett Packard Enterprise(惠普企业)

专题命中 工具调用 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 针对预算受限的微预训练,提出分阶段分数因子设计方法,通过短时筛选识别高惩罚方向并确认有效锚点,在共享加速器上实现高效配方筛选。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06284 2026-06-05 cs.AI 57%

ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

ToolChoiceConfusion: 因果最小工具过滤实现可靠LLM智能体

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 提出因果最小工具过滤(CMTF)方法,通过因果充分性选择工具,减少错误工具调用和令牌成本,在102个任务、100个工具、4个LLM后端的基准测试中,将可见工具从100个减少到每步1个,令牌使用降低约90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05784 2026-06-05 cs.AI 57%

TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents

TAPO: 通过信用转移实现工具感知策略优化用于多模态搜索代理

Chengqi Dong, Chuhuai Yue, Hang He, yandong liu, Fenghe Tang, S Kevin Zhou, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 针对GRPO在多模态搜索代理中信用误分配问题,提出TAPO方法,利用工具参数确定性构建反事实证人进行保守优势校正,无需额外标注或采样,在多个基准上持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05559 2026-06-05 cs.LG 57%

CLaaS: Continual learning as a service for sample efficient online learning

CLaaS: 作为服务的持续学习,用于样本高效的在线学习

Kion Fallah, Silen Naihin, Barak Widawsky, Qingqing Mao

机构 * Resolute Labs(Resolute实验室) Incept Labs(Incept实验室)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 提出CLaaS系统,通过经验回放缓冲区实现异步训练中的梯度复用,在对抗性任务中展示参数更新优于上下文学习的前向迁移和遗忘减少。

Comments 4 pages main content, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05411 2026-06-05 cs.AI cs.HC 57%

A Motivational Architecture for Conversational AGI

对话式通用人工智能的动机架构

Anna Mikeda, Ben Goertzel

机构 * Glass Umbrella(玻璃伞) SingularityNet

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出一种对话式动机架构,将OpenPsi动机谱系重新解释为对话原生术语,并耦合MetaMo的高层动机支架,通过十阶段动机处理流水线、双决策策略以及行动前感受与行动后情绪的功能区分,实现对话智能体的能力调节、不确定性减少、亲和力等动机管理。

Comments 16 pages. Accepted for AGI-26 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05253 2026-06-05 cs.LG 57%

Alpha-RTL: Test-Time Training for RTL Hardware Optimization

Alpha-RTL: 面向RTL硬件优化的测试时训练

Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院) University of the Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉学科学院)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 提出TTT-RTL框架,通过测试时强化学习结合EDA反馈(语法检查、仿真和PPA奖励)优化LLM生成的RTL设计,在RTLLM v2.0和工业级C910 FPU单元上分别降低PPA乘积65.1%和ADP 59.4%。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05104 2026-06-05 cs.AI 57%

Knowledge Index of Noah's Ark

诺亚方舟的知识索引

Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang

机构 * M-A-P Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) Waseda University(早稻田大学) The University of Tokyo(东京大学) Massachusetts Institute of Technology(麻省理工学院) University of Arizona(亚利桑那大学) Northwestern University(西北大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 针对LLM知识基准的代表性、注释质量和排名稳定性问题,提出KINA基准,通过贪婪近似实现学科代表性,并证明奖金锦标赛机制优于固定支付,实验显示顶级模型性能远未饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23809 2026-06-05 eess.SY cs.LG cs.SY 57%

Advanced AI Service Provisioning in O-RAN through LLM Engine Integration

通过LLM引擎集成在O-RAN中的高级AI服务提供

Seyed Bagher Hashemi Natanzi, Pranshav Gajjar, Bo Tang, Vijay K. Shah

机构 * Department of Electrical and Computer Engineering, Worcester Polytechnic Institute(电气与计算机工程系,沃斯特理工学院) Department of Electrical and Computer Engineering, North Carolina State University(电气与计算机工程系,北卡罗来纳州立大学)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出一种双脑架构,结合LLM的推理能力和轻量级ML引擎的实时性,实现O-RAN中AI服务的自动化部署与配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06125 2026-06-05 cs.GT 50%

Regret Minimization in Single-Dimensional Contract-Design with Binary Actions

二元行动单维契约设计中的遗憾最小化

Riccardo Poiani, Martino Bernasconi, Andrea Celli

专题命中 工具调用 :agent(abstract)

AI总结 针对在线主-代理问题中代理类型对抗性序列,提出基于非均匀离散化的阈值优化方法,实现与结果数量无关的Θ(T^{2/3})遗憾界;对于固定隐藏类型,采用探索后提交策略达到Θ̃(√T)遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06106 2026-06-05 cs.IR 50%

WebKnoGraph: GNN-Powered Internal Linking

WebKnoGraph: 基于GNN的内部链接优化

Emilija Gjorgjevska, Georgina Mirceva, Miroslav Mirchev

专题命中 工具调用 :workflow(abstract)

AI总结 提出WebKnoGraph框架,利用GraphSAGE对网站爬取数据建模为有向图,通过PageRank和语义一致性评估自动与专家辅助链接选择策略,发现自动选择带来更强权威重分配但语义成本更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06063 2026-06-05 cs.DC 50%

LLM-Based Porting of Optimized C++ to CUDA Through Deoptimization and Reoptimization

基于LLM的通过去优化和再优化将优化C++移植到CUDA

Daichi Mukunoki, Ryo Mikasa, Shunichiro Hayashi, Tetsuya Hoshino, Takahiro Katagiri

专题命中 工具调用 :workflow(abstract)

AI总结 提出Deopt-Reopt工作流,通过先简化CPU优化代码再重新翻译优化为CUDA,利用LLM提升移植性能,实验表明该方法在部分内核上有效但非普遍适用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27489 2026-06-05 cs.CY 50%

Auditing LLM Editorial Bias in News Media Exposure

审查新闻媒体曝光中的LLM编辑偏见

Marco Minici, Cristian Consonni, Federico Cinus, Giuseppe Manco

专题命中 工具调用 :agentic(abstract)

AI总结 本文研究了LLM在新闻聚合中的编辑偏见问题,通过比较三种领先的LLM与Google News,发现LLM在媒体多样性、意识形态和可靠性方面存在显著差异。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 56 篇

2606.05414 2026-06-05 cs.CL cs.AI cs.HC cs.LG 91%

When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories

当证据稀疏时:对话和LLM-Agent轨迹中的弱监督早期失败预警

Avinash Baidya, Xinran Liang, Ruocheng Guo, Xiang Gao, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究院) Princeton University(普林斯顿大学)

专题命中 规划决策 :agent(title,title_cn);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对对话和LLM-Agent轨迹中早期失败预警问题,提出一种两阶段方法,通过注意力机制从稀疏的轨迹级标签中学习回合级失败证据,并结合α-STOP策略实现可控的早期预警,在多个基准上显著提升帕累托前沿质量并降低训练成本。

Comments 9 pages, 14 figures, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05275 2026-06-05 cs.CV cs.AI 91%

Personal AI Agent for Camera Roll VQA

个人AI代理用于相机胶卷VQA

Thao Nguyen, Krishna Kumar Singh, Donghyun Kim, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Korea University(韩国大学) Adobe Research(Adobe研究院)

专题命中 规划决策 :agent(title,summary_cn);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出camroll数据集和camroll-agent代理,通过层次化记忆和工具集解决个人相机胶卷中的长程、高度个性化的视觉问答问题。

Comments Project page, code, and demo: https://thaoshibe.github.io/camroll

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06448 2026-06-05 cs.AI 91%

Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads

Agent记忆:有状态长时任务工作负载的表征与系统影响

Yasmine Omri, Ziyu Gan, Zachary Broveak, Robin Geens, Zexue He, Alex Pentland, Marian Verhelst, Tsachy Weissman, Thierry Tambe

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 规划决策 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 本文首次对LLM agent记忆系统进行系统级表征,提出四轴分类法,通过阶段感知分析框架评估10种代表性系统,并给出10条系统设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00555 2026-06-05 cs.AI cs.CL cs.SE 88%

Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agents

企业智能体系统中的本体约束神经推理:一种面向领域 grounded AI 智能体的神经符号架构

Thanh Luong Tuan, Abhijit Sanyal

机构 * Golden Gate University, San Francisco Foundation(金门大学,旧金山基金会) AgenticOS (FAOS)(AgenticOS(FAOS)) Associate Director, Data, Digital & IT Novartis Healthcare Pvt. Ltd.(数据、数字与IT部门,诺华健康有限公司) Novartis Healthcare Pvt. Ltd., Hyderabad, India(诺华健康有限公司,海得拉巴,印度)

专题命中 规划决策 :AI agent(title);agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出了一种神经符号架构,通过本体约束神经推理解决企业大语言模型在幻觉、领域漂移和无法在推理层面强制执行监管合规性方面的限制,展示了该架构在提升智能体的指标准确性和角色一致性方面的显著效果。

Comments 24 pages, 6 tables, 6 figures, 1 algorithm, 65 references. Replication study: 1,800 runs (600 per model) across 5 regulated industries (3 English, 2 Vietnamese) and 3 LLMs (Claude Sonnet 4, Qwen 2.5 72B, Gemma 4 26B). v3 changes: deep-review trim from 34pp. Code and data: https://github.com/frank-luongt/faos-research/tree/main/RA-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20613 2026-06-05 cs.LG cs.AI cs.MA 86%

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现

Panayiotis Danassis, Naman Goel

机构 * University of Southampton(苏塞克斯大学) University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05699 2026-06-05 cs.RO 85%

DexFuture: Hierarchical Future-State Visuomotor Targeting for Bimanual Dexterous Tool Use

DexFuture: 用于双手灵巧工具使用的分层未来状态视觉运动目标

Runfa Blark Li, Kuang-Ting Tu, Nikola Raicevic, Dwait Bhatt, Xinshuang Liu, Keito Suzuki, Ki Myung Brian Lee, Nikolay Atanasov, Truong Nguyen

机构 * UC San Diego(圣迭戈大学)

专题命中 规划决策 :tool use(title,abstract);tool-use(abstract);planning(abstract)

AI总结 提出DexFuture分层系统,通过高层未来状态视觉运动目标预测器和低层目标条件结构化灵巧策略,实现双手灵巧工具使用,达到90%的特权oracle性能,运行速度60Hz,比DexWM式CEM规划快约250倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05744 2026-06-05 cs.CL 83%

PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models

PlanBench-V: 面向视觉语言模型的空间规划地图基准

Minxin Chen, He Zhu, Junyou Su, Wen Wang, Yijie Deng, Wenjia Zhang

机构 * Behavioral and Spatial AI Lab(行为与空间人工智能实验室) Tongji University(同济大学) Peking University(北京大学) College of Architecture and Urban Planning(建筑与城市规划学院)

专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.CL

AI总结 为评估视觉语言模型在空间规划地图解读中的能力,构建了专家标注数据集SPMD,并提出基于感知、推理、关联、实施四阶段认知框架的基准PlanBench-V,实验表明当前模型在实施类任务上存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09706 2026-06-05 cs.LG 83%

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

通过强化学习训练一个模型以掌握跨层级的代理行为

Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。

Comments Accepted to CVPR 2026 as a Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06476 2026-06-05 cs.CV 82%

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

思考与想象:基于世界模拟器的智能视觉空间推理

Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Beihang University(北航大学)

专题命中 规划决策 :agentic(title,abstract);tool-use(abstract)

AI总结 提出Astra框架,通过强化学习训练VLM策略与Bagel世界模拟器交互,在推理中生成想象视觉证据,解决空间推理中的未观察布局、跨视角一致性和替代视角推理问题。

Comments Project page: https://zcmax.github.io/projects/Thinking-With-Imagination

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06416 2026-06-05 cs.AI cs.CL cs.LG cs.MA 82%

Unsupervised Skill Discovery for Agentic Data Analysis

面向智能体数据分析的无监督技能发现

Zhisong Qiu, Kangqi Song, Shengwei Tang, Shuofei Qiao, Lei Liang, Huajun Chen, Shumin Deng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出DataCOPE框架,通过无监督验证器引导从探索轨迹中发现可复用的数据分析技能,在报告式和推理式分析任务上分别提升平均得分9.71%和32.30%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05843 2026-06-05 cs.CL 81%

OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions

OdysseyArena: 为长视界、主动和归纳交互评估大型语言模型

Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Lin

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出OdysseyArena,通过长视界、主动和归纳交互评估大型语言模型,提供120个任务测量归纳效率和长视界发现,并通过OdysseyArena-Challenge测试极端交互视界下的模型稳定性,揭示前沿模型在复杂环境中的归纳能力瓶颈。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05774 2026-06-05 cs.CV cs.AI cs.CL 81%

Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding

主动视频感知:用于代理长视频理解的迭代证据寻求

Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种主动视频感知框架AVP,通过迭代计划-观察-反思过程,主动决定视频内容的观察目标和时间,以提高长视频理解的准确性和效率。

Comments Website: https://activevideoperception.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏