arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-24 至 2026-06-24 共收录 163 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 13 篇

2606.23690 2026-06-24 cs.SE cs.AI 新提交 62%

Beyond the Autoregressive Horizon: A Comprehensive Survey of Diffusion Models, World Modelling, and State Space Models for Code

超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述

Kishan Maharaj, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。

Comments 14 Pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 57%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24026 2026-06-24 cs.AI 新提交 57%

Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?

语言模型代理能否成为机械可解释性中有用的电路解释器?

Ayan Antik Khan, Harsh Kohli, Yuekun Yao, Huan Sun, Ziyu Yao

机构 * George Mason University(乔治梅森大学) The Ohio State University(俄亥俄州立大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 研究语言模型代理在机械可解释性中自动解释已定位电路的能力,提出HyVE方法,通过迭代观察、假设生成和因果验证生成组件级解释,实验表明代理有潜力但可靠验证仍是关键障碍。

Comments 23 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23752 2026-06-24 cs.SE 新提交 57%

ESAA-Conversational: An Event-Sourced Memory Layer for Continuity, Handoff, and Curation Across Heterogeneous LLM Coding Agents

ESAA-Conversational:一种用于异构LLM编码智能体之间连续性、交接和策管的事件溯源记忆层

Elzo Brito dos Santos Filho

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出ESAA-Conversational架构,通过事件溯源实现跨多个LLM编码智能体的共享会话记忆,解决会话状态漂移问题,支持连续性、交接和策管。

Comments 11 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24867 2026-06-24 econ.EM 新提交 50%

Bounds for Standard Errors in Combined Data

组合数据中标准误差的界限

Jooyoung Cha, Yuya Sasaki, Nelson Matthew P. Tan

专题命中 软件智能体 :agent(abstract)

AI总结 提出从不同样本的矩条件估计参数时,标准误差下界的构造方法,利用几何不等式推导无跨样本相关性信息的显式界限,并通过半定规划得到一般情况下的计算可行界限,最后通过三个实证案例展示实用性。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21652 2026-06-24 gr-qc astro-ph.HE 版本更新 50%

A User-Friendly Python Interface for the Numerical Relativity Code AMSS-NCKU

数值相对论代码AMSS-NCKU的用户友好型Python接口

Chen-Kai Qiao, Yi Zheng, Zhou-Jian Cao

专题命中 软件智能体 :workflow(abstract)

AI总结 为数值相对论代码AMSS-NCKU开发用户友好的Python接口,实现模拟初始化、执行和输出数据可视化的自动化,降低技术门槛,并通过双黑洞和三黑洞并合示例验证其有效性。

Comments 14 pages, 4 figures, 1 appendix. V2: minor revisions; V3: formulas used to exact gravitational waves were added; V4: modifying some background discussions and figures; V5: published version

Journal ref Astronomy and Computing 55 (2026) 101093

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 4 篇

2606.24870 2026-06-24 cs.HC 新提交 78%

"Zooming In" on Agentic Web Browsers as Assistive Technologies: A Case Study with a Low-Vision Technology Expert

“放大”代理型网络浏览器作为辅助技术:一项低视力技术专家的案例研究

Laura Colazzo, Giuseppe Anzillotti

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 通过低视力专家案例研究,探讨基于大语言模型的代理型网络浏览器如何以对话方式辅助视障用户导航网页,发现其虽有限制但体验流畅灵活,有望提升无障碍性并减少交互障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24551 2026-06-24 cs.AI 新提交 70%

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

GUI vs. CLI:纯屏幕与技能中介计算机使用代理的执行瓶颈

Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(上海纽约大学) Yale NLP Lab(耶鲁大学自然语言处理实验室)

专题命中 GUI与网页智能体 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 通过匹配基准测试,发现GUI代理在长流程任务中表现优于CLI代理,但CLI代理通过技能增强可超越GUI,揭示两者执行瓶颈分别在于可靠交互与技能覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08766 2026-06-24 physics.flu-dyn 版本更新 50%

Optimal navigation in two-dimensional flows: Control theory and reinforcement learning

二维流动中的最优导航:控制理论与强化学习

Vladimir Parfenyev

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究在二维流动中,受平流和自推进的智能体(如漂浮无人机)的最小时间路径问题,利用最优控制理论求解,并应用强化学习(Q学习和演员-评论家算法)设计鲁棒导航策略,在规则流中接近最优解,在湍流中偏差增大,且粗粒化训练可泛化至全流场。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 9 篇

2606.24775 2026-06-24 cs.CL cs.DB cs.IR 新提交 80%

Are We Ready For An Agent-Native Memory System?

我们准备好构建原生智能体记忆系统了吗?

Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MemTensor (Shanghai) Technology Co., Ltd(MemTensor(上海)科技有限公司)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 从数据管理视角系统研究智能体记忆,提出四模块分析框架,评估12种记忆系统,发现无单一架构占优,并揭示成本-性能权衡。

Comments Paper list available at: https://github.com/OpenDataBox/awesome-agent-memory. Source code available at: https://github.com/OpenDataBox/MemoryData

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24595 2026-06-24 cs.CL 新提交 79%

MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery

MEMPROBE:通过隐藏用户状态恢复探测长期智能体记忆

Enze Ma, Yufan Zhou, Wei-Chieh Huang, Jie Yang, Huanhuan Ma, Zixuan Wang, Chengze Li, Chunyu Miao, Philip S. Yu, Zhen Wang

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) KU Leuven(库尔勒大学) UC San Diego(圣地亚哥大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 提出MEMPROBE基准,通过从智能体记忆重建隐藏用户状态来直接评估长期记忆,发现任务完成与记忆可恢复性是不同的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24322 2026-06-24 cs.CR 新提交 78%

Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees

保护LLM智能体长期记忆免受投毒:具有机器验证保证的不可延展、源绑定权限

Yedidel Louck

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 针对LLM智能体长期记忆投毒攻击,提出不可延展信息流控制(IFC)方案TMA-NM,通过源绑定和防Sybil确认门控实现0%攻击成功率。

Comments Index Terms: LLM agents, long-term memory, memory poisoning, information-flow control, capability security, prompt injection, formal verification, benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24424 2026-06-24 eess.SP 新提交 67%

Explainable AI for Next-Generation Wireless Physical Layer: Basics, State-of-the-Art, and Open Challenges

下一代无线物理层的可解释人工智能:基础、最新进展与开放挑战

Bingnan Xiao, Shuyan Hu, Xiaojing Chen, Zhiyuan Zhai, Bingcong Li, Wei Ni, Xin Wang, Ekram Hossain

专题命中 记忆与上下文管理 :agentic(abstract,abstract_cn)

AI总结 本文综述了无线物理层中可解释人工智能(XAI)的应用,提出了面向责任的目标,建立了系统分类法,并讨论了可解释性-性能权衡等开放挑战。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03867 2026-06-24 cs.CL cs.AI 版本更新 62%

A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs and Knowledge Graphs

一种基于LLM和知识图谱的无训练混合智能体框架用于多文档摘要

Cuong Vuong Tuan, Trang Mai Xuan, Tien-Cuong Nguyen, Vu-Duc Ngo, Thien Van Luong

机构 * Faculty of Artificial Intelligence and Data Science, Phenikaa University(人工智能与数据科学学院,泛尼克大学) VNPT AI, VNPT Group(VNPT AI,VNPT集团) MobiFone Research and Development Center, MobiFone Corporation(MobiFone研发与开发中心,MobiFone公司) Business AI Lab, Faculty of Data Science and Artificial Intelligence, National Economics University, College of Technology(商业人工智能实验室,数据科学与人工智能学院,国家经济大学,技术学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种无需训练、结合大语言模型和知识图谱的混合智能体框架,通过分解摘要任务为专用智能体(抽取、知识感知抽象、迭代精炼)并利用多视角一致性机制,在英文和越南语数据集上取得领先性能。

Comments Accepted by Neural Computing and Applications

Journal ref Neural Comput & Applic 38, 538 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23961 2026-06-24 cs.LG 新提交 57%

Forget Without Compromise: Nexus Sampling for Streaming KV-Cache Eviction Under Fixed Budgets

无需妥协的遗忘:固定预算下流式KV缓存驱逐的Nexus采样

Duc Duong, Hoang Anh Duy Le, Jianwen Xie, Anshumali Shrivastava, Zhaozhuo Xu

机构 * Department of Computer Science, Grinnell College(格林内尔学院计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Lambda, Inc(Lambda公司) Workato(Workato公司)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 提出Nexus采样方法,通过迭代注意力计算和加权水库采样替代确定性top-K选择,在固定预算下保留微妙重要令牌,理论证明其长期优势,实验在80%驱逐率下性能接近密集注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17473 2026-06-24 cs.CV cs.AI 版本更新 57%

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

双锚定:解决视觉语言导航中的状态漂移问题

Kangyi Wu, Pengna Li, Kailin Lyu, Xi Lin, Lin Zhao, Qingrong He, Jinjun Wang, Jianyi Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Johns Hopkins University(约翰霍普金斯大学) Joy Future Academy, JD(京东探索研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07884 2026-06-24 quant-ph cs.LG 版本更新 57%

Reinforcement Learning to Disentangle Multiqubit Quantum States from Partial Observations

基于部分观测的多量子比特态纠缠消除的强化学习

Pavel Tashev, Stefan Petrov, Matthew T. Diaz, Friederike Metz, Alaina M. Green, Norbert M. Linke, Marin Bukov

机构 * Department of Mathematics and Informatics(数学与信息学系) St. Kliment Ohridski University of Sofia(索菲亚圣克莱门特·欧赫里迪斯大学) Joint Quantum Institute(联合量子研究所) Department of Physics(物理系) University of Maryland(马里兰大学) National Quantum Laboratory (QLab)(国家量子实验室(QLab)) Institute of Physics(物理研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院(EPFL)) Center for Quantum Science and Engineering(量子科学与工程中心) Quantum Systems Unit(量子系统单元) OIST Graduate University(OIST研究生大学) Duke Quantum Center(杜克量子中心) Max Planck Institute for the Physics of Complex Systems(复杂系统物理研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 提出使用演员-评论家深度强化学习算法,仅基于两量子比特约化密度矩阵,为最多16量子比特态构建短纠缠消除电路,并在离子阱量子计算机上实验验证。

Comments The source code as well as a demo in the form of an interactive Jupyter notebook are available on Github: https://github.com/mgbukov/RL_disentangle

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24332 2026-06-24 physics.chem-ph quant-ph 新提交 50%

Enhancing quantum-classical configuration interaction methods using a neural-network classifier

使用神经网络分类器增强量子-经典组态相互作用方法

Severino Zeni, Giovanni Varutti, Jacopo Nespolo, Dimitrios Trypogeorgos

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 提出数据驱动选择框架,将行列式重要性视为二分类任务,通过主动学习集成神经网络分类器到迭代CI工作流,在经典和量子CI方法中实现约5倍内存和每迭代成本降低,并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 23 篇

2606.24855 2026-06-24 cs.AI 新提交 91%

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11363 2026-06-24 cs.CL cs.AI cs.MA 版本更新 86%

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

CORE-Bench:通过计算可重复性智能体基准提升已发表研究的可信度

Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

机构 * Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出CORE-Bench基准,包含270个基于90篇论文的任务,评估AI智能体在计算可重复性上的准确性,最佳智能体在最难任务上准确率仅21%,表明自动化科学任务仍有巨大提升空间。

Comments Benchmark harness and code available at http://github.com/siegelz/core-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14117 2026-06-24 cs.NI cs.AI 版本更新 83%

Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management

迈向自主O-RAN:一种用于实时网络控制与管理的多尺度智能体AI框架

Hojjat Navidan, Mohammad Cheraghinia, Jaron Fontaine, Mohamed Seif, Eli De Poorter, H. Vincent Poor, Ingrid Moerman, Adnan Shahid

机构 * IDLab, Department of Information Technology at Ghent University - imec(IDLab,格鲁特大学信息科技系 - imec) Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出一种多尺度智能体AI框架,通过非实时、近实时和实时控制环的协调层次结构,实现O-RAN的自主网络控制与管理,并在非平稳条件下和意图驱动的切片资源控制场景中验证了其有效性。

Comments Accepted for publication in the IEEE Network magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01822 2026-06-24 cs.CR cs.CY 83%

Firewalls to Secure Dynamic LLM Agentic Networks

为动态LLM代理网络设计防火墙

Sahar Abdelnabi, Amr Gomaa, Eugene Bagdasarian, Per Ola Kristensson, Reza Shokri

专题命中 Agent评测 :agentic(title,comments);agent(abstract);AI agent(abstract)

AI总结 本文提出双防火墙架构,通过任务上下文投影过滤通信内容,有效降低隐私和安全攻击成功率,同时保持任务完成质量。

Comments TMLR 2026. Our code and transcripts can be found at: https://github.com/amrgomaaelhady/Firewall-Agentic-Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09768 2026-06-24 cs.MA 82%

SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

SAGE: 可扩展的代理基于地面评估用于作物疾病诊断

Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen, Dinakaran Elango, Shivani Chiranjeevi, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Arti Singh, Soumik Sarkar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。

Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10044 2026-06-24 cs.AI cs.CL cs.CY cs.LG 80%

Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety

脚手架下的安全性:评估条件如何影响测量的安全性

David Gringras

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究通过62,808次盲法预注册评估,测试了六种前沿模型在四种部署配置下的安全性,发现脚手架架构对安全性影响较小,而格式转换(如选择题与开放式问题)可导致5-20个百分点的测量差异,且模型-脚手架间存在显著异质性,质疑了单一综合安全性分数的实用性。

Comments 74 pages including appendices. 6 frontier models, 62,808 primary observations (~89k total). Pre-registered: OSF DOI 10.17605/OSF.IO/CJW92. Code and data: https://github.com/davidgringras/safety-under-scaffolding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24597 2026-06-24 cs.CL 新提交 77%

Qwen-AgentWorld: Language World Models for General Agents

Qwen-AgentWorld: 通用智能体的语言世界模型

Yuxin Zuo, Zikai Xiao, Li Sheng, Fei Huang, Jianhong Tu, Yuxuan Liu, Tianyi Tang, Xiaomeng Hu, Yang Su, Qingfeng Lan, Yantao Liu, Qin Zhu, Yinger Zhang, Bowen Yu, Haiquan Zhao, Haiyang Xu, Jianxin Yang, Jiayang Cheng, Junyang Wang, Lianghao Deng, Mingfeng Xue, Tianyi Bai, Yang Fan, Yubo Ma, Yucheng Li, Zeyu Cui, Zhihai Wang, Zhihui Xie, Zhuorui Ye, An Yang, Dayiheng Liu, Jingren Zhou, Ning Ding

机构 * Qwen Team(Qwen团队)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 提出基于语言模型的世界模型Qwen-AgentWorld,通过三阶段训练(CPT、SFT、RL)模拟7个领域的智能体环境,并构建AgentWorldBench基准,实验表明其显著优于现有模型,且能作为环境模拟器和智能体基础模型提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 70%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 70%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 62%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26144 2026-06-24 cs.SE cs.AI cs.CV 版本更新 62%

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

VISTA:面向视觉规格到网页应用编码智能体的端到端基准

JunJia Guo, Yuhang Yao, Jiawei, Zhou, Jingdi Chen

机构 * University of Arizona(亚利桑那大学) Zoom Stony Brook University(石溪大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。

Comments Project page: https://kaboider.github.io/VIS_APP/

详情

展开后加载摘要…

URL PDF HTML 收藏