arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-17 至 2026-07-17 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 7 篇

2607.14468 2026-07-17 cs.RO cs.MA cs.SY eess.SY 新提交 78%

Mixed-Agent Museum Tour Guide Design Improves Gendered Learning Outcomes and Visitor Preferences

混合智能体博物馆导游设计提升性别化学习成果及游客偏好

Annette M. Masterson, Wonse Jo, Helena C. Sieh, Lionel P. Robert,, Dawn Tilbury

机构 * University of Michigan(密歇根大学) Incheon National University(仁川国立大学)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 研究博物馆中机器人导游,提出结合实体与虚拟智能体的混合导游系统,经30人受试者内研究验证,发现其提升女性学习表现,各条件下参与度和体验质量一致,且无论性别参与者都更偏好混合智能体团队。

Comments Accepted on IROS 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14548 2026-07-17 cs.CV 新提交 67%

HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

HyMobileAgent:用于高效GUI代理的数据-环境协同扩展

Hy Vision Team, Huawen Shen, Zhengyang Tang, Shangpin Peng, Liang Wu, Anran Zhang, Weinong Wang, Yiduo Guo, Chenxin Li, Zhengyao Fang, Yang Ding, Junyi Li, Fei Tang, Zheng Ruan, Yi Zhang, Xingran Zhou, Dingchen Yang, Sunqi Fan, Zhiyi Wan, Han Hu, Xin Lai, Pengyuan Lyu, Chengquan Zhang

机构 * PhoneWorld Mock App Factory(手机世界模拟应用工厂)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 研究移动GUI代理在数字环境中的运行,基于Hy3.0-VL-A3B构建HyMobileAgent,开发数据和环境协同扩展框架,集成多种机制和管道,提出渐进式训练方法,解决移动交互关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25170 2026-07-17 cs.LG cs.AI cs.ET cs.RO 版本更新 62%

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation

生长-剪枝-冻结网络:用于嗅觉导航的自适应与持续学习技术

Kordel K. France, Ovidiu Daescu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出生长-剪枝-冻结(GPF)网络框架,通过动态调整策略网络层数实现持续学习,在湍流羽流导航任务中达到94%成功率,并推广到其他机器学习任务。

Comments Accepted as poster to the Reinforcement Learning in Big Worlds Workshop at the 2026 Reinforcement Learning Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14443 2026-07-17 cs.AI 新提交 57%

Tactile: Giving Computer-Using Agents Hands and Feet

触觉:赋予使用计算机的智能体双手和双脚

Yong Liu, Zhenyi Zhong, Zhanpeng Shi

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究针对计算机使用智能体操作层脆弱的问题,提出开源工具Tactile,将异构UI证据转换为基于动作的接口状态,通过特定循环操作。在相关任务中能提升Codex Success@100,证明可靠计算机使用需更强模型及可重用执行基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18300 2026-07-17 cs.LG 57%

Deep Reinforcement Learning Based Navigation with Macro Actions and Topological Maps

基于宏观动作和拓扑地图的深度强化学习导航

Simon Hakenes, Tobias Glasmachers

机构 * Institute for Neural Computation, Faculty of Computer Science, Ruhr University Bochum, Germany(神经计算研究所,计算机科学学院,博德姆鲁尔大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于拓扑地图和宏观动作的深度强化学习导航方法,通过简化问题复杂度实现高效的样本学习。

Comments 14 pages, 6 figures

Journal ref Machine Learning, Optimization, and Data Science. LOD 2025. Lecture Notes in Computer Science, vol 16467

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14586 2026-07-17 cs.RO 新提交 50%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 7 篇

2607.14611 2026-07-17 cs.CR cs.AI cs.MA 新提交 83%

Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems

糟糕的记忆:评估智能体系统中内存引发的提示注入风险

Soham Gadgil, David Alexander, Sai Sunku, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究基于内存的智能体系统中提示注入攻击,利用沙盒合成工作区评估两个系统四个模型,发现虽难用外部内容重写内存文件,但已植入的有效载荷可攻击当前及未来会话,揭示持久内存改变威胁模型并推动相关防御研究。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14390 2026-07-17 cs.SE cs.AI cs.IR 新提交 81%

Why Git Is the Memory Solution for the Agentic Development Lifecycle

为什么Git是智能开发生命周期的记忆解决方案

Frank Guo

机构 * MIT(麻省理工学院)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 研究智能开发生命周期中代码变更推理过程的记忆问题,提出将记忆与Git绑定的方法,通过解决种子供应和答案组装问题,实现低令牌数回答且结果可复制。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22030 2026-07-17 cs.AI cs.CL cs.IR cs.LG 版本更新 78%

When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense

Nous:一种用于长期智能体记忆的预测世界模型

Pranav Singh

机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。

Comments Preprint. 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14396 2026-07-17 cs.AI cs.LG 新提交 73%

CatalogAgent: A Supervisor-mediated Self-Learning System Enabling Context Engineering for GenAI Models

CatalogAgent:一种由监督者介导的自学习系统,实现生成式人工智能模型的上下文工程

Zhu Cheng, Zhenming Wang, Yu, Tang, Dan Liu, Bryan Zhang, Athanasios N. Nikolakopoulos, Pranav Souri Itabada, Jing Zhang, Chih-Chi Chou, Peng Gao, Fatemeh Mansoori, Bharat Bojja, Sarath Chander, Sameer Thombare, Umit Batur, Tarik Arici

机构 * Amazon(亚马逊)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究电商产品目录结构化属性缺失值预测问题,提出CatalogAgent系统,通过监督者调解冲突、记忆库和汇总器实现自学习,经上下文工程将监督者能力转移到生成器和评估器,有效提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14651 2026-07-17 cs.CR cs.AI 新提交 57%

MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents

MemPoison:揭示大语言模型智能体中持久内存威胁和结构盲点

Jifeng Gao, Kang Xia, Yi Zhang, Xiaobin Hong, Mingkai Lin, Xingshen Wei, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) NARI Group Corporation/State Grid Electric Power Research Institute, China(国网电力研究院/国电电力集团)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体持久内存安全漏洞,提出MemPoison框架,含1227个案例,涵盖多种攻击类型等并评估多个模型系列。引入分类法,揭示防御边界及盲点,主张转向自适应、上下文敏感的内存防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14393 2026-07-17 cs.RO cs.AI 新提交 57%

An offline approach to fNIRS-guided reinforcement learning for robot behavior

一种用于机器人行为的基于fNIRS引导的强化学习的离线方法

Julia Santaniello, Madelaine Brower, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究利用fNIRS脑信号调节机器人模拟学习的可行性,比较不同交互任务训练的智能体,测试多种增强强化学习算法的方法,发现该框架能有效利用神经信号增强学习,还可离线学习,为特定场景提供替代方案。

Comments Preliminary results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19844 2026-07-17 cs.GT 版本更新 50%

Perpetual Fully-Online Approximate Fairness

持续全在线近似公平性

Ido Kahana, Erel Segal-Halevi, Noam Hazon

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对持续时间未知的在线决策问题,提出基于赤字的一般性在线公平框架,并证明一个简单全在线规则在每轮后所有跟踪需求满足的松弛度仅以√t阶增长,且该增长不可避免。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 24 篇

2607.14541 2026-07-17 cs.AI 新提交 88%

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理

Lingyun Yang, Yuxiao Wang, Shenghao Liang, Linfeng Yang, Daocheng Ying, Chunbo You, Rui Zhang, Luping Wang, Yinghao Yu, Guodong Yang, Liping Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI

AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。

Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 86%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 85%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15001 2026-07-17 hep-lat cs.AI hep-ph 新提交 85%

LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research

LQCDMaster:用于格点量子色动力学研究的智能科学计算

Haofei Gao, Tingjia Miao, Wenkai Jin, Muhua Zhang, Hanzhang Wang, Jie Ran, Jinxin Tan, Zhentao Zhang, Bo Tang, Leiyi Li, Jun Hua, Xiangyu Jiang, Qi-An Zhang, Siheng Chen, Wei Wang

机构 * School of Physics and Astronomy(物理与天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics(物理学院) SciLand Institute of Quantum Matter(量子物质研究所) Department of Physics(物理系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对格点量子色动力学研究实际应用受限问题,提出LQCDMaster智能体,结合智能规划等技术将自然语言任务转化为计算工作流程。经实验评估,其能精确再现多数任务,大幅缩短实现时间,开创智能科学计算范式,促进相关研究。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 84%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 Agent评测 :AI agent(title);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14336 2026-07-17 cs.SE cs.AI 新提交 81%

Copy-on-Write Scoring: Application-Specific Agent Evaluations

写时复制评分:特定应用代理评估

Joanna Roy, Sven Hoelzel

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。

Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14159 2026-07-17 cs.AI cs.CL 新提交 81%

MemoHarness: Agent Harnesses That Learn from Experience

MemoHarness:从经验中学习的智能体控制层

Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对智能体控制层设计影响行为但改进方法窄且多重用单一全局控制层的问题,提出自适应框架MemoHarness,通过分解控制层、存储经验并检索应用,在多基准测试中优于固定控制层,证明执行经验可构建更具适应性的控制层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10079 2026-07-17 cs.AI cs.CL 版本更新 81%

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包

Chengguang Gan, Hanjun Wei, Yunhao Liang, Zhixi Cai, Qinghao Zhang, Shiwen Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学) Monash University(莫纳什大学) Pusan National University(釜山国立大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。

Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15053 2026-07-17 cs.NI cs.AI 新提交 79%

ANet Patu-1: The Value of Connection in the Agent Network

ANet Patu-1:智能体网络中连接的价值

Mu Yuan, Jinke Song, Zhaomeng Zhou, Lan Zhang

机构 * Agent Network Research(代理网络研究) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体网络连接价值,通过建模推导最优协作协议属性,引入ANet Patu-1协议。结果表明,异构便宜模型集体价值能超同构强模型,且异构网络能自收敛重构连接价值规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15272 2026-07-17 cs.CL cs.AI 新提交 79%

SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions

SciDiagramEdit:从论文修订中学习编辑科学图表

Yasheng Sun, Zezi Zeng, Yifan Yang, Chong Luo, Wenyi Wang, Ziwei Liu, Jürgen Schmidhuber

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对科学论文图表编辑自动化的挑战,提出SciDiagramEdit框架,通过从arXiv版本历史挖掘数据,采用技能进化的智能体学习,能从自然论文修订中学习,提升编辑准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14386 2026-07-17 cs.AI 新提交 70%

CIPHER: A Decoupled Exploration-Selection Framework for Test-Time Scaling of Data Science Agents

CIPHER:用于数据科学智能体测试时扩展的解耦探索-选择框架

Maxime Heuillet, Sharadind Peddiraju

机构 * Amazon Web Services(亚马逊网络服务公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究针对数据科学任务自动化挑战,提出CIPHER智能体,通过生成和选择多初始状态实现测试时扩展,解耦生成与选择过程。经实验验证其性能超越现有技术,刻画DES框架设计空间并给出设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14673 2026-07-17 cs.AI cs.HC 新提交 57%

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

万花筒计划:面向现实世界人工智能应用的情境化、符合人类需求的评估

Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

机构 * GovTech(新加坡政府科技局) National University of Singapore(新加坡国立大学) University of British Columbia(英属哥伦比亚大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 该项目旨在解决现实世界AI应用评估瓶颈,提出万花筒计划,通过集成基于角色的测试生成、情境化评分标准和人工审查,实现可靠性门控自动评分,经试点和实验验证了其在端到端可靠自动评分方面的有用特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11624 2026-07-17 cs.RO cs.LG 版本更新 57%

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning

SKooP:用于强化学习的更快、更通用的有腿机器人运动的对称库普曼预测

Evelyn D'Elia, Weishu Zhan, Giulio Turrisi, Giulio Romualdi, Giuseppe L'Erario, Raffaello Camoriano, Wei Pan, Daniele Pucci

机构 * Italian Institute of Technology (IIT)(意大利理工学院) University of Manchester(曼彻斯特大学) Dynamic Legged Systems Laboratory, IIT(意大利理工学院动态腿式系统实验室) Generative Bionics S.R.L(生成仿生学有限公司) DAUIN, Politecnico di Torino(都灵理工大学DAUIN) Rehab Technologies Lab, IIT(意大利理工学院康复技术实验室) Newcastle University(纽卡斯尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对强化学习样本效率低问题展开,提出SKooP方法,结合形态对称与库普曼模型优势,在学习策略时学习系统动力学模型,将其预测用于评论家,还纳入群对称,验证了该方法能减少收敛时间并增加学习奖励,且策略可转移。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17930 2026-07-17 cs.AI 版本更新 57%

How Inference Compute Shapes Frontier LLM Evaluation

推理计算如何塑造前沿LLM评估

Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 通过控制推理计算量(如token预算、上下文压缩和重复提交)评估12个前沿语言模型,发现更大计算量显著提升性能,固定预算评估低估模型能力,且不同基准对推理扩展方法敏感。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15948 2026-07-17 cs.AI q-bio.NC 版本更新 57%

Subjective functions

主观函数

Samuel J. Gershman

机构 * Harvard University(哈佛大学) Department of Psychology(心理学系) Center for Brain Science(脑科学中心) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了主观函数的概念,通过预期预测误差作为例子,提出了一种赋予人工系统自主设定目标能力的方法,连接了心理学、神经科学和机器学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08423 2026-07-17 cond-mat.mtrl-sci cs.LG physics.ins-det 57%

Mic-hackathon 2024: Hackathon on Machine Learning for Electron and Scanning Probe Microscopy

Mic-hackathon 2024: 机器学习在电子显微镜和扫描探针显微镜上的黑客马拉松

Utkarsh Pratiush, Austin Houston, Kamyar Barakati, Aditya Raghavan, Dasol Yoon, Harikrishnan KP, Zhaslan Baraissov, Desheng Ma, Samuel S. Welborn, Mikolaj Jakowski, Shawn-Patrick Barhorst, Alexander J. Pattison, Panayotis Manganaris, Sita Sirisha Madugula, Sai Venkata Gayathri Ayyagari, Vishal Kennedy, Ralph Bulanadi, Michelle Wang, Kieran J. Pang, Ian Addison-Smith, Willy Menacho, Horacio V. Guzman, Alexander Kiefer, Nicholas Furth, Nikola L. Kolev, Mikhail Petrov, Viktoriia Liu, Sergey Ilyev, Srikar Rairao, Tommaso Rodani, Ivan Pinto-Huguet, Xuli Chen, Josep Cruañes, Marta Torrens, Jovan Pomar, Fanzhi Su, Pawan Vedanti, Zhiheng Lyu, Xingzhi Wang, Lehan Yao, Amir Taqieddin, Forrest Laskowski, Xiangyu Yin, Yu-Tsun Shao, Benjamin Fein-Ashley, Yi Jiang, Vineet Kumar, Himanshu Mishra, Yogesh Paul, Adib Bazgir, Rama chandra Praneeth Madugula, Yuwen Zhang, Pravan Omprakash, Jian Huang, Eric Montufar-Morales, Vivek Chawla, Harshit Sethi, Jie Huang, Lauri Kurki, Grace Guinan, Addison Salvador, Arman Ter-Petrosyan, Madeline Van Winkle, Steven R. Spurgeon, Ganesh Narasimha, Zijie Wu, Richard Liu, Yongtao Liu, Boris Slautin, Andrew R Lupini, Rama Vasudevan, Gerd Duscher, Sergei V. Kalinin

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本次黑客马拉松旨在通过促进机器学习与显微镜领域的合作,推动机器学习在电子显微镜和扫描探针显微镜中的应用,产生基准数据集和数字孪生以支持标准化工作流程。

Journal ref Mach. Learn.: Sci. Technol. 6 (2025) 040701

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02255 2026-07-17 cs.LG 版本更新 57%

SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems

SafeOR-Gym:用于实际运筹学问题的安全强化学习算法的基准套件

Asha Ramanujam, Adam Elyoumi, Hao Chen, Sai Madhukiran Kompalli, Akshdeep Singh Ahluwalia, Shraman Pal, Dimitri J. Papageorgiou, Can Li

机构 * Davidson School of Chemical Engineering, Purdue University(普渡大学化学工程学院) Energy Sciences, ExxonMobil Technology and Engineering Company(埃克森美孚技术与工程公司能源科学部)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 针对现有安全强化学习基准与高风险领域相关性有限的问题,提出SafeOR-Gym基准套件,含九个运筹学环境,集成CMDP接口,评估多种算法,揭示性能差异,为安全强化学习研究提供实用测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏