Large Language Model Based Agent for Automated Discovery in Computational Physics
基于大语言模型的自动化计算物理发现智能体
专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)
AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于大语言模型的自动化计算物理发现智能体
专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)
AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。
EurekAgent:自主科学发现中,智能体环境工程即一切
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Zhipu AI(智谱AI)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。
CacheRL: 通过缓存轨迹和混合奖励实现多轮工具调用智能体
机构 * Center for Advanced AI Accenture(埃森哲高级人工智能中心)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 提出CacheRL系统,通过混合思维轨迹流水线、三级模糊缓存和缓存层级感知奖励,以100倍更少计算量实现92%的多步工具调用准确率,接近GPT-5的94%。
SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。
Comments 20 pages, 5 figures
后训练能否使LLM成为优秀的医学编码员?生成式ICD编码的实证研究
机构 * Northwestern University(西北大学)
专题命中 工具调用 :tool use(abstract);分类 cs.CL
AI总结 通过对比提示、监督微调和强化学习(GRPO及新提出的PHI课程)在ICD编码任务上的表现,发现后训练(尤其是SFT和GRPO)能显著提升生成式LLM的编码性能,提示评估瓶颈在于模型适应而非生成范式本身。
通过进化搜索和不确定性感知学习发现分布外处理协议的闭环方法
机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville(田纳西大学材料科学与工程系) ; Materials Science and Engineering Department, Materials Research Institute, the Pennsylvania State University(宾夕法尼亚州立大学材料研究学院材料科学与工程系) ; Department of Materials Science and NanoEngineering, Rice University(Rice大学材料科学与纳米工程系) ; Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) ; Department of Materials Science and Engineering, University of California, Berkeley(加州大学伯克利分校材料科学与工程系) ; Departments of Chemistry and Physics and Astronomy, Rice University(Rice大学化学与天文物理系) ; Physical Sciences Division, Pacific Northwest National Laboratory(太平洋西北国家实验室物理科学部)
专题命中 工具调用 :workflow(abstract);分类 cs.LG
AI总结 提出一种闭环工作流,结合紧凑波形表示的进化搜索与不确定性感知深度核学习,自动发现提升铁电薄膜非线性响应的分布外处理协议,并通过实验验证其机制。
面向搜索与推荐系统的可验证用户模拟
专题命中 工具调用 :agent(abstract)
AI总结 提出一个七组件可审计框架,将用户模拟器视为可验证工程制品,通过动手实验检查模拟器行为、诊断差异并检测人口偏差。
Comments Presented as a half-day tutorial at SIGIR 2026, 4 pages
Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)
面向LLM-Agent工作流中并行分支的直接潜在空间合成
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Meta
专题命中 规划决策 :agent(title,title_cn);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。
EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) ; Alibaba Group(阿里巴巴集团) ; SUAT(深圳大学)
专题命中 规划决策 :agentic(title,abstract);autonomous agent(title);分类 cs.AI
AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。
用于蒙特卡洛树搜索规划的因果对象中心模型
机构 * MIRAI ; CogAILab
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出COMET算法,结合无监督对象中心编码器和Transformer世界模型,通过动作-槽融合机制和对象因果注意力实现高效规划,在多个基准上优于基线方法。
UP-NRPA:基于用户画像的嵌套 rollout 策略自适应,用于目标导向对话系统中与大语言模型的规划
机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence, Anhui University(安徽大学安徽省安全人工智能重点实验室) ; Pengcheng Laboratory(鹏城实验室)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL
AI总结 提出 UP-NRPA 在线框架,利用大语言模型和用户画像实时自适应调整对话策略,无需离线强化学习,在协作与非协作对话基准中实现 100% 任务成功率,谈判任务销售列表比提升 56.41%。
计划在哪里?通过轻量级机制干预定位语言模型中的潜在规划
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 通过押韵对句补全任务,使用线性探针和激活修补方法,研究语言模型在生成过程中是否形成并因果依赖未来约束的潜在规划,发现仅Gemma-3-27B模型存在因果依赖,并定位到五个注意力头。
Comments 13 pages, 20 figures, 3 tables. Accepted to Workshop on Mechanistic Interpretability @ ICML 2026
AgentSpec: 通过受控组合理解具身智能体脚手架
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Washington(华盛顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划决策 :agent(title,abstract);分类 cs.CL
AI总结 提出AgentSpec模块化规范框架,将具身智能体表示为可复用策略组件的类型化组合,通过标准化接口实现受控组件替换与重组,揭示脚手架兼容性和交互效应对性能的主导作用。
回顾性进度感知的LLM智能体训练自我精炼
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
专题命中 规划决策 :agent(title,abstract);分类 cs.CL
AI总结 提出RePro框架,通过前向-反思滚动范式训练智能体自我生成进度信号,无需持续外部监督,在WebShop等任务上提升Qwen系列性能高达12%。
边界框作为目标:通过神经符号规划实现语言条件抓取
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。
Comments Project website: https://allisonandreyev.github.io/grasp.github.io/
通过合成语义信息增益奖励优化基于检索的智能推理
机构 * Hong Kong JC STEM Lab of Smart City.(香港JC STEM实验室) ; City University of Hong Kong.(香港城市大学) ; Lingnan University(岭南大学) ; Fudan University.(复旦大学) ; Huazhong University of Science and Technology.(华中科技大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 提出InfoReasoner框架,利用合成语义信息增益奖励优化检索过程,通过GRPO训练策略,在七个问答基准上平均准确率提升5.4%。
Comments Accepted by ICML'26
无碰撞运动规划的半定松弛
机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系)
专题命中 规划决策 :planning(title,abstract)
AI总结 研究点机器人通过球形障碍物的无碰撞运动规划,提出半定松弛方法,理论分析其紧性并利用对称性降低计算复杂度,比直接非线性规划快10-100倍。
Doctor-RAG:面向智能检索增强生成的故障感知修复框架
专题命中 规划决策 :agentic(title,abstract)
AI总结 提出Doctor-RAG框架,通过显式错误定位和前缀复用,在智能RAG中实现高效诊断与局部修复,显著提升多跳问答准确率。
利用切线交点引导算法(TIG)增强的无人机路径规划
机构 * Journal of Automation, Mobile Robotics and Intelligent Systems(自动化、移动机器人与智能系统杂志)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出TIG算法,通过椭圆切线交点方法生成可行路径,结合启发式规则和二次贝塞尔曲线平滑技术,在静态和动态环境中实现高效安全的无人机路径规划。
Comments Accepted for publication in JAMRIS Journal
Journal ref Journal of Automation, Mobile Robotics and Intelligent Systems, 20(2), 30-52 (2026)
AGORA: 审议与治理门能否吸收公交规划中的参与偏差?
机构 * Department of Civil and Environmental Engineering and Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(土木与环境工程系和信息与决策系统实验室,麻省理工学院) ; Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院)
专题命中 规划决策 :planning(title);分类 cs.LG
AI总结 提出AGORA框架,通过固定网络、需求和求解器,系统变化会议组成、结构化审议和治理门,发现审议是参与影响结果的关键机制,治理门可压缩跨剖面方差,将参与偏差从不可控输入重构为过程设计问题。
调控机器贡献者:开源中的治理与政策对齐
机构 * Faculty of Sciences of Tunis (FST), University of Tunis El Manar(突尼斯科学学院(FST),突尼斯El Manar大学) ; National Institute of Applied Science and Technology (INSAT), University of Carthage(应用科学和技术国家研究所(INSAT),卡塔赫季大学)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 针对AI代理在开源中引发治理问题,通过比较六个组织的政策,提出六维分类法、政策成熟度评分,并映射代理事件,识别监管框架与政策间的缺口,勾勒分层框架。
SANA:大规模数据湖上的问答代理关键因素是什么?
机构 * Columbia University(哥伦比亚大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 提出SANA诊断框架,通过消融实验分析数据湖探索式问答中搜索、规划、数据分析及行动策略的失败原因,揭示数据分析是主要瓶颈。
Comments 9 pages, 7 figures
有道德的AI是存在性风险
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。
基于高性能计算的RTO规模资源充裕度规划中的发电机重要性评估
专题命中 规划决策 :planning(title)
AI总结 提出高性能计算框架,快速评估发电机重要性并排序,使分钟级完成传统计算密集型评估成为可能,支持更广泛的发电组合场景分析。
SpheriCity:为可持续发展决策支持设计可信赖的对话式AI
机构 * Department of Computer Science, Colby College(科里尔学院计算机科学系) ; Circularity Informatics Lab, University of Georgia(佐治亚大学循环信息实验室)
专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 提出SpheriCity,一种基于来源的对话式AI原型,通过结构化合成和交互支架,支持从城市循环性评估报告中可信地获取知识,解决大语言模型在可持续性高风险领域中的透明度与信任问题。
Comments Accepted to ACM SIGCAS/SIGCHI Conference on Computing and Sustainable Societies (COMPASS '26)
GAGPO:通用优势分组策略优化
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Meituan(美团)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 GAGPO提出一种无需价值模型的强化学习方法,通过分组价值代理和动作重要性比,实现多轮任务中精确的时间信用分配,实验表明其在ALFWorld和WebShop上优于现有基线。
当工具决定时:LLM代理盲目服从图神经网络工具,更强的骨干网络服从更多
机构 * raptorX.ai
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM代理在使用GNN工具时是否真正判断而非盲目服从,发现代理在97.6-99.2%的情况下完全采纳GNN输出,且更强的骨干网络服从更多,选择性调用设计受限。
Comments 9 pages, 2 figures. Under review at TMLR
通过逆最优传输从起点-终点流中学习城市访问成本
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出逆最优传输模型从学校间入学流中恢复潜在选择成本,应用于菲律宾283,016条学生流动数据,估计补贴等效距离以优化城市服务分配。
Comments Oral Presentation. 2026 International Conference on Urban AI
无皱鲁棒性:并行仿真与鲁棒MPC实现可认证的变形体操作
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出CORD-SLS实时控制方法,通过GPU并行可微仿真与接触平滑实现高效梯度规划,结合鲁棒模型预测控制与共形预测校准,在绳索和布料操作中达到毫秒级规划与高安全性。
全双工口语对话语言模型中的时间顺序思考
机构 * Nanyang Technological University(南洋理工大学) ; StepFun ; Mila
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。
Comments Accepted by SIGDIAL 2026