Machine-Learned Leftmost Hessian Eigenvectors for Robust Transition State Finding
基于机器学习的左最Hessian特征向量用于鲁棒的过渡态寻找
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 本文提出一种基于机器学习的过渡态优化器,通过预测左最Hessian特征向量提高鲁棒性,减少计算成本,提升效率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于机器学习的左最Hessian特征向量用于鲁棒的过渡态寻找
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 本文提出一种基于机器学习的过渡态优化器,通过预测左最Hessian特征向量提高鲁棒性,减少计算成本,提升效率。
LLM中的产科艺术:为大型语言模型作为道德助手优化角色人格
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出将AI作为道德助手,通过'产科艺术'促进用户道德成长,而非替代人类判断。通过六个道德场景对话,发现不同人格类型在不同情境下表现各异,引入'建设性分歧'概念。
TrEnv-X:跨不同函数和节点透明共享无服务器执行环境
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 TrEnv-X通过整合无服务器平台与操作系统及CXL/RDMA远程内存池,实现跨函数的可重用沙箱和内存模板,降低创建开销并提升内存弹性,实验表明其在P99延迟和内存使用上均有显著提升。
Comments Accepted by ACM Transactions on Computer Systems (TOCS)
并行的渐近最优算法用于移动目标旅行商问题
机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Mechanical and Aerospace Engineering at Michigan Technological University(密歇根技术大学机械与航空航天工程) ; Global College at Shanghai Jiao Tong University(上海交通大学全球学院) ; Department of Mechanical Engineering and Department of Computer Science and Engineering at Texas A&M University(得克萨斯阿姆斯特朗大学机械工程系和计算机科学与工程系)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出并行算法解决移动目标旅行商问题,通过交替随机采样和求解广义旅行商问题,渐近收敛于最优解,实验验证了算法在不同场景下的有效性。
为何智能体缓存失效及如何修复:基于少样本学习的结构化意图规范化
专题命中 Agent评测 :agent(title);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出结构化意图分解框架W5H2,通过少样本学习显著提升缓存效率,实验显示在多个基准测试中性能优于现有方法,同时实现成本降低。
Comments Added github repo and Hugging Face dataset link
AI代理合谋的脆弱性
机构 * National University of Singapore(新加坡国立大学) ; Boston University(波士顿大学)
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI
AI总结 本文研究了AI代理合谋的脆弱性,发现异质性会减少合谋均衡。实验显示,耐心异质性和数据访问异质性削弱合谋,而模型大小差异反而稳定合谋,讨论了反垄断政策。
Comments 48 pages, 7 figures, 8 tables (including appendix)
提升系统优化代理AI的连贯性与持续性
机构 * MIT(麻省理工学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Engram架构,通过解耦长周期探索与单一上下文窗口约束,提升代理AI在多领域系统优化中的连贯性和持续性。
从人机界面到代理界面:在AI原生系统时代重新思考软件设计
机构 * Victoria University of Wellington, New Zealand(维多利亚大学惠灵顿分校) ; Independent Researcher(独立研究员) ; Dalian University of Technology, China(大连理工大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 本文探讨了软件设计从以人为中心的界面转向以代理为中心的调用系统,提出了代理接口的概念和设计原则,为AI原生软件设计提供理论基础。
Comments 4 pages, 1 figure, 1 table
在工具调用之前:自主AI代理的确定性预行动授权
机构 * APort Technologies Inc.(APort技术公司)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。
AI代理能否回答您的数据问题?一个数据代理的基准测试
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 本文提出数据代理基准测试(DAB),旨在评估多数据库系统中数据整合、转换和分析的全流程能力,通过12个数据集、9个领域和4种数据库管理系统中的54个查询,测试了前沿模型在数据代理任务中的表现。
Comments 22 pages, 7 figures, 9 tables
SciNav:一种通用的科学编码任务代理框架
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出SciNav框架,用于科学编码任务,通过相对判断指导的top-K搜索提升解决方案探索效率,优于直接提示和现有代理。
Comments Accepted by ICLR 2026
通过代理驱动的标注和评估自动评估代码代理
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE;autonomous agent(journal_ref)
AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。
Comments Accepted by AAMAS 2026
Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026
DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成
机构 * Lancaster University(兰卡斯特大学) ; University of Bristol(布里斯托大学) ; Adobe Research(Adobe研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。
Comments CVPR
WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准
专题命中 Agent评测 :agent(title,abstract)
AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。
Comments This paper is submitted to a possiable journal for publication
在人工智能认知代理中构建信任
机构 * Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。
间接提示注入:防火墙足够吗,还是需要更强的基准?
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)
AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。
面向大语言模型的语义工具发现:基于向量的方法用于MCP工具选择
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出基于向量检索的语义工具发现架构,通过语义索引和动态选择机制,显著降低工具调用的token消耗,提升效率和准确性。
人类或大语言模型作为标准化患者?医学教育中的比较研究
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Freedom AI
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。
Comments 24 pages, 13 figures, 10 table
AgentComm-Bench: 在延迟、丢包和带宽崩溃下压力测试协作具身AI
机构 * Synthetic Sciences(合成科学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 AgentComm-Bench通过六个通信退化维度系统性压力测试协作具身AI,揭示通信依赖任务在延迟、丢包和带宽崩溃下的性能急剧下降,提出基于冗余消息编码的轻量通信策略。
大型语言模型的知识边界发现
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出KBD框架,通过强化学习探索LLM的知识边界,通过自动生成可答与不可答问题识别边界,验证了方法的有效性。
Comments 9 pages,4 figures
EnterpriseLab:企业中开发和部署代理的全栈平台
机构 * Fujitsu Research India(富士通印度研究)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 本文提出EnterpriseLab,一个统一开发和部署企业代理的全栈平台,通过模块化环境、自动化数据生成和集成训练管道,提升企业代理的能力与隐私保护。
解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Cloud Computing(阿里云计算) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 Agent评测 :agentic(abstract);分类 cs.CL
AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。
Comments Under review. This version updates the relevant works released before 15 March, 2026
基于大语言模型的教育代理自适应支架理论
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出结合证据中心设计与社会认知理论的自适应支架框架,开发出Inquizzitor评估代理,通过人机混合智能提供基于认知科学的反馈,验证了理论驱动的大语言模型在教育中的应用潜力。
Comments Published in the proceedings of AAAI 2026 (main technical track)
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(3), 1757-1765. 2026
Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。
Comments 12 pages
无参数最优收敛速率的非线性半范数收缩方法及其在Q学习中的应用
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出通过将平均误差转化为线性递推并结合半范数收缩与诱导范数单调性,实现了Q学习在平均回报和指数折扣设置中无参数的最优收敛速率。
渐近最优和最小最大最优的多臂老虎机问题中的弃权后悔界
机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) ; National University of Singapore(新加坡国立大学) ; Department of Electrical and Computer Engineering(电子与计算机工程系) ; Department of Mathematics(数学系)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出多臂老虎机问题的新扩展,引入弃权策略,探讨在该设定下计算高效且渐近最优的算法设计,通过理论分析和实验验证弃权选项的实用价值。
Comments 36 pages
Omni-WorldBench:迈向全面的交互导向的世界模型评估
机构 * School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室) ; AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出Omni-WorldBench,一个针对4D世界模型交互响应能力的综合评估基准,通过Omni-WorldSuite和Omni-Metrics评估交互动作对状态转移的影响,分析现有模型的局限性。
受限享乐博弈中的个体理性:可加性和分数偏好
专题命中 Agent评测 :agent(abstract)
AI总结 研究受限享乐博弈中个体理性的存在性,探讨可加性和分数偏好下的计算复杂性,揭示其可计算与不可计算的边界。
Comments A preliminary version appeared in AAMAS '26
跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准
机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) ; School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; The University of Hong Kong(香港大学)
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。
Comments Accepted by CVPR 2026 main track
强化学习增强的MPC用于非步态腿部和混合运动
机构 * Humanoids and Human-Centred Mechatronics (HHCM) lab, Istituto Italiano di Tecnologia (IIT)(人机协同机电一体化实验室,意大利技术研究院)
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一种结合强化学习和模型预测控制的分层架构,通过模拟中学习无环步态实现接触时间的卸载,验证了在不同机器人平台上的有效性及非平坦地形的扩展性。