PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents
PACE: 自演化智能体的任意有效接受测试
机构 * Independent Researcher(独立研究员)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
PACE: 自演化智能体的任意有效接受测试
机构 * Independent Researcher(独立研究员)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。
SurveyLens:一个学科感知的自动综述生成基准
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Sichuan University(四川大学) ; Central South University(中南大学) ; Alibaba Cloud(阿里巴巴云)
专题命中 Agent评测 :planning(abstract);分类 cs.CL
AI总结 提出SurveyLens,首个学科感知的自动综述生成基准,包含跨10个学科的1000篇人工撰写综述数据集和双视角评估框架,发现深度研究智能体在跨学科鲁棒性上最优,而所有范式在参考文献质量上仍薄弱。
Comments 8 pages, 9 figures
迷失在语音中:超越标准UD假设的口语双语会话的基准测试、评估与解析
机构 * Arizona State University(亚利桑那州立大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.CL
AI总结 针对口语双语会话中的不流利和话语驱动结构,提出SpokeBench基准、Flex-UD评估指标和DECAP解析框架,显著提升依赖解析性能。
Comments 17 pages, 4 Figures
为何流行病学无法被自动化(至今仍无法)
机构 * Centre for Longitudinal Studies, University College London(伦敦大学学院长期研究所在) ; Centre for Advanced Research Computing, University College London(伦敦大学学院先进计算研究中心)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本文探讨流行病学研究中人工智能应用的潜力与限制,指出尽管生成式AI提供了机遇,但现有工具和人类系统限制了其效能,需流行病学家与工程师的协同合作。
Comments 9 pages, 2 figures, 1 table
我曾盲目但如今我看见:在社交机器人中实现视觉增强的对话
机构 * IDLab-AIRO – Ghent University – imec(IDLab-AIRO – 布鲁塞尔自由大学 – imec)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出一种利用大语言模型提升社交机器人对话能力的系统,通过整合视觉输入增强上下文感知,展示六次与Furhat机器人的交互结果,探讨视觉与文本模态融合的未来对话可能性。
Comments 8 pages, 3 figures
Journal ref HRI '25: Proceedings of the 2025 ACM/IEEE International Conference on Human-Robot Interaction. Pages 1176 - 1180
社会学习的性能评估
专题命中 Agent评测 :agent(abstract)
AI总结 针对社会学习中错误信念消失率作为性能指标的悖论,提出错误概率作为替代度量,并在二元高斯问题中推导出分散与集中错误概率之间的不可约差距。
Comments This work has been submitted to the IEEE for possible publication
调控AI导师:青少年使用生成式AI时的意图、求助行为与自我调节学习
专题命中 Agent评测 :agentic(abstract)
AI总结 研究通过98名九年级学生的对话数据,分析青少年使用生成式AI学习时的自我调节学习和求助行为,发现学生主要进行工具性请求而缺乏监控评估,且后测成绩显著下降。
SparseX: 面向交错式LLM服务的高效段级KV缓存共享
专题命中 Agent评测 :agent(abstract)
AI总结 针对长上下文LLM服务中非前缀重复内容导致的缓存效率低问题,提出SparseX,一种基于稀疏Q索引的段级KV缓存共享方法,通过单次前向传播中的稀疏KV重计算恢复跨段上下文交互,实现无额外模型或预处理的缓存复用。
Comments Corrected author metadata only; no changes to the paper content
认知可比性与治理的局限:在极端能力不对称下评估权威
专题命中 Agent评测 :agent(abstract)
AI总结 本文通过六维框架探讨治理中权威的评估问题,发现极端能力不对称下存在结构性失效,部分维度需新规范理论而非制度设计。
Comments 20 pages, 2 tables. Interdisciplinary paper on AI governance and political theory
超级人工智能的经济学
专题命中 Agent评测 :agent(abstract)
AI总结 本文运用经济学逻辑分析超级人工智能(ASI)的威胁,指出在竞争、全面利益和信用交易条件下,ASI可能不会完全掠夺人类,为超级智能未来提供乐观视角。
基于风格的量子生成对抗网络在超导和离子阱处理器上的跨平台硬件基准测试
专题命中 Agent评测 :workflow(abstract)
AI总结 在超导(IBM)和离子阱(IonQ)量子处理器上,对基于风格的qGAN进行高能物理数据增强任务的基准测试,比较质量与运行时,发现IonQ质量略优但IBM速度更快。
Comments 28 pages, 11 figures, 2 tables. v2: Major revision including change of title to reflect better scope; added affiliation; matches published version
Journal ref AIP Advances 16, 065008 (2026)
PRISM:从语言模型激活中恢复指令集
机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) ; Microsoft(微软) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。
Comments Under Review
基于语言的试错在经验时代落后了
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 针对LLM在非语言环境中探索成本高的问题,提出SCOUT框架,用轻量级模型探索环境,通过SFT和RL激活LLM的世界知识,显著提升性能并降低计算开销。
Vibe 可视化:可视化新手如何尝试(并失败)使用对话式 AI 生成和解读可视化
专题命中 其他Agent :agentic(abstract)
AI总结 通过用户研究发现,可视化新手在使用 ChatGPT 等对话式 AI 生成和解读可视化时面临执行错误、误解和信任问题,并提出了改进 AI 辅助可视化系统的设计建议。