arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-09 至 2026-06-09 共收录 314 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 56 篇

2606.08106 2026-06-09 cs.AI cs.MA 新提交 57%

PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents

PACE: 自演化智能体的任意有效接受测试

Zayx Shawn

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11238 2026-06-09 cs.CL 版本更新 57%

SurveyLens: A Discipline-Aware Benchmark for Automatic Survey Generation

SurveyLens:一个学科感知的自动综述生成基准

Beichen Guo, Zhiyuan Wen, Jia Gu, Haochen Shi, Jian Wang, Senzhang Wang, Haoyang Li, Ruosong Yang, Shuaiqi Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Central South University(中南大学) Alibaba Cloud(阿里巴巴云)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 提出SurveyLens,首个学科感知的自动综述生成基准,包含跨10个学科的1000篇人工撰写综述数据集和双视角评估框架,发现深度研究智能体在跨学科鲁棒性上最优,而所有范式在参考文献质量上仍薄弱。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06307 2026-06-09 cs.CL 版本更新 57%

Lost in Speech: Benchmarking, Evaluation, and Parsing of Spoken Bilingual Conversational Language Beyond Standard UD Assumptions

迷失在语音中:超越标准UD假设的口语双语会话的基准测试、评估与解析

Nemika Tyagi, Olga Kellert, Holly Hendrix, Nelvin Licona-Guevara, Justin Mackie, Phanos Kareen, Megan Michelle Smith, Tatiana Gallego Hernande, Samhitha Harish, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 针对口语双语会话中的不流利和话语驱动结构,提出SpokeBench基准、Flex-UD评估指标和DECAP解析框架,显著提升依赖解析性能。

Comments 17 pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15617 2026-06-09 cs.CY cs.AI 57%

Why can't Epidemiology be automated (yet)?

为何流行病学无法被自动化(至今仍无法)

David Bann, Ed Lowther, Liam Wright, Yevgeniya Kovalchuk

机构 * Centre for Longitudinal Studies, University College London(伦敦大学学院长期研究所在) Centre for Advanced Research Computing, University College London(伦敦大学学院先进计算研究中心)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文探讨流行病学研究中人工智能应用的潜力与限制,指出尽管生成式AI提供了机遇,但现有工具和人类系统限制了其效能,需流行病学家与工程师的协同合作。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08957 2026-06-09 cs.RO cs.AI cs.HC 57%

I Was Blind but Now I See: Implementing Vision-Enabled Dialogue in Social Robots

我曾盲目但如今我看见:在社交机器人中实现视觉增强的对话

Giulio Antonio Abbo, Tony Belpaeme

机构 * IDLab-AIRO – Ghent University – imec(IDLab-AIRO – 布鲁塞尔自由大学 – imec)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型提升社交机器人对话能力的系统,通过整合视觉输入增强上下文感知,展示六次与Furhat机器人的交互结果,探讨视觉与文本模态融合的未来对话可能性。

Comments 8 pages, 3 figures

Journal ref HRI '25: Proceedings of the 2025 ACM/IEEE International Conference on Human-Robot Interaction. Pages 1176 - 1180

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09176 2026-06-09 cs.MA cs.IT math.IT 新提交 50%

Performance Evaluation of Social Learning

社会学习的性能评估

Felice Scala, Marco Carpentiero, Vincenzo Matta, Ali H. Sayed

专题命中 Agent评测 :agent(abstract)

AI总结 针对社会学习中错误信念消失率作为性能指标的悖论,提出错误概率作为替代度量,并在二元高斯问题中推导出分散与集中错误概率之间的不可约差距。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08568 2026-06-09 cs.CY 新提交 50%

Regulating the AI Tutor: Intentions, Help-Seeking, and Self-Regulated Learning in Adolescent GenAI Use

调控AI导师:青少年使用生成式AI时的意图、求助行为与自我调节学习

Rania Abdelghani, Peter Kaiser, Kou Murayama

专题命中 Agent评测 :agentic(abstract)

AI总结 研究通过98名九年级学生的对话数据,分析青少年使用生成式AI学习时的自我调节学习和求助行为,发现学生主要进行工具性请求而缺乏监控评估,且后测成绩显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01751 2026-06-09 cs.PF 50%

SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving

SparseX: 面向交错式LLM服务的高效段级KV缓存共享

Quqing Zhang, Kai Chen, Ning Liao, Zehao Lin, Bo Tang, Feiyu Xiong, Zhiyu Li, Xiaoxing Wang

专题命中 Agent评测 :agent(abstract)

AI总结 针对长上下文LLM服务中非前缀重复内容导致的缓存效率低问题,提出SparseX,一种基于稀疏Q索引的段级KV缓存共享方法,通过单次前向传播中的稀疏KV重计算恢复跨段上下文交互,实现无额外模型或预处理的缓存复用。

Comments Corrected author metadata only; no changes to the paper content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02720 2026-06-09 cs.CY 版本更新 50%

Cognitive Comparability and the Limits of Governance: Evaluating Authority Under Radical Capability Asymmetry

认知可比性与治理的局限:在极端能力不对称下评估权威

Tony Rost

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过六维框架探讨治理中权威的评估问题,发现极端能力不对称下存在结构性失效,部分维度需新规范理论而非制度设计。

Comments 20 pages, 2 tables. Interdisciplinary paper on AI governance and political theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06613 2026-06-09 econ.GN q-fin.EC 版本更新 50%

Some economics of artificial superintelligence

超级人工智能的经济学

Henry A. Thompson

专题命中 Agent评测 :agent(abstract)

AI总结 本文运用经济学逻辑分析超级人工智能(ASI)的威胁,指出在竞争、全面利益和信用交易条件下,ASI可能不会完全掠夺人类,为超级智能未来提供乐观视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04401 2026-06-09 quant-ph hep-ph 版本更新 50%

Cross-platform hardware benchmark of style-based quantum GANs for data augmentation on superconducting and trapped-ion processors

基于风格的量子生成对抗网络在超导和离子阱处理器上的跨平台硬件基准测试

Julien Baglio

专题命中 Agent评测 :workflow(abstract)

AI总结 在超导(IBM)和离子阱(IonQ)量子处理器上,对基于风格的qGAN进行高能物理数据增强任务的基准测试,比较质量与运行时,发现IonQ质量略优但IBM速度更快。

Comments 28 pages, 11 figures, 2 tables. v2: Major revision including change of title to reflect better scope; added affiliation; matches published version

Journal ref AIP Advances 16, 065008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2606.09563 2026-06-09 cs.AI cs.LG 新提交 62%

PRISM: Recovering Instruction Sets from Language Model Activations

PRISM:从语言模型激活中恢复指令集

Gilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) Microsoft(微软) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21754 2026-06-09 cs.AI 版本更新 57%

Language-based Trial and Error Falls Behind in the Era of Experience

基于语言的试错在经验时代落后了

Haoyu Wang, Guozheng Ma, Shugang Cui, Yilun Kong, Haotian Luo, Li Shen, Mengya Gao, Yichao Wu, Xiaogang Wang, Dacheng Tao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 针对LLM在非语言环境中探索成本高的问题,提出SCOUT框架,用轻量级模型探索环境,通过SFT和RL激活LLM的世界知识,显著提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08914 2026-06-09 cs.HC 新提交 50%

Vibe Visualizing: How Visualization Novices Try (and Fail) to Generate and Interpret Visualizations with Conversational AI

Vibe 可视化:可视化新手如何尝试(并失败)使用对话式 AI 生成和解读可视化

Sam Yu-Te Lee, Yun-Hsin Kuo, Chifang Chou, Matthew Ward, Xiwei Xuan, Kwan-Liu Ma

专题命中 其他Agent :agentic(abstract)

AI总结 通过用户研究发现,可视化新手在使用 ChatGPT 等对话式 AI 生成和解读可视化时面临执行错误、误解和信任问题,并提出了改进 AI 辅助可视化系统的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏