Scalable Generation and Validation of Isomorphic Physics Problems with GenAI
基于生成式AI的可扩展等价物理问题生成与验证
专题命中 工具调用 :tool use(abstract)
AI总结 本文提出利用生成式AI生成和验证大规模等价物理问题库的框架,以实现异步多尝试评估。通过提示链和工具使用,精确控制结构和上下文变化,验证结果显示73%的问题库难度一致,且语言模型与学生表现高度相关。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于生成式AI的可扩展等价物理问题生成与验证
专题命中 工具调用 :tool use(abstract)
AI总结 本文提出利用生成式AI生成和验证大规模等价物理问题库的框架,以实现异步多尝试评估。通过提示链和工具使用,精确控制结构和上下文变化,验证结果显示73%的问题库难度一致,且语言模型与学生表现高度相关。
MAGE-HEP:高能物理中的蒙特卡洛分析与图形界面
专题命中 工具调用 :workflow(abstract)
AI总结 本文提出MAGE-HEP,一种用于高能物理中基于蒙特卡洛方法的可重复分析工作流环境,通过项目-研究-运行层次结构组织分析流程,并提供节点API用于定义生成器配置、可观测量、选择、输出规则和生成的C++/ROOT分析代码。
Comments 11 pages, 9 captioned figures. Comments and suggestions are welcome
具有知识蒸馏的代理成本感知查询规划用于大数据分析
机构 * Research Division, BrightMind AI(BrightMind AI 研究部) ; Texas Tech University(德克萨斯理工大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 规划决策 :agentic(title,abstract);planning(title,abstract);分类 cs.LG
AI总结 本文提出了一种结合规则基教师规划器、UCB1老虎机探索、成本感知预测和知识蒸馏的轻量级学生规划器,以解决大数据分析中查询优化计算成本高且资源受限环境下的内存和延迟约束问题,实验结果显示在纽约出租车和IMDB数据集上相比默认规划器降低了23%的延迟并保持了94%的约束满足率。
Comments 8 pages, preprint, code at https://github.com/mahdinaser/agentic-kd-planner
DecoupleSearch: 通过分层奖励建模解耦规划与搜索
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 规划决策 :planning(title,abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出DecoupleSearch框架,通过双值模型解耦规划与搜索过程,利用蒙特卡洛树搜索评估每一步的质量,并通过分层束搜索迭代优化规划和搜索候选,验证了方法的有效性。
Comments EMNLP 2025 Main Conference
观看、推理与搜索:一个面向开放网络的视频深度研究基准,用于代理视频推理
机构 * LZU(兰州大学) ; HKUST(GZ)(香港科技大学(广州)) ; UBC(不列颠哥伦比亚大学) ; FDU(福建大学) ; PKU(北京大学) ; USC(美国南加州大学) ; NUS(新加坡国立大学) ; UCAS(中国科学院大学) ; HKUST(香港科技大学) ; QuantaAlpha(量子Alpha)
专题命中 规划决策 :agentic(title,abstract);workflow(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出VideoDR基准,用于研究开放网络环境下视频代理推理,通过跨帧视觉锚点提取、交互式网络检索和多跳推理验证,揭示了长检索链中维持初始视频锚点、目标漂移和长时程一致性等关键挑战。
EndoCogniAgent: 闭环代理推理与自我一致性验证用于内窥镜诊断
机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) ; Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室) ; State Key Laboratory of Digital Medical Engineering, Southeast University(国家数字医学工程重点实验室) ; The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) ; Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Jiangsu Provincial Joint International Research Laboratory of Medical Information Processing(江苏省联合国际医学信息处理联合实验室) ; Laboratory of Image Science and Technology, the School of Computer Science and Engineering, Southeast University(图像科学与技术实验室,东南大学计算机科学与工程学院)
专题命中 规划决策 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出EndoCogniAgent框架,通过闭环代理推理和自我一致性验证提升内窥镜诊断的准确性与可靠性,其核心方法是将诊断过程建模为受控状态更新过程,并引入EndoAgentBench基准进行评估。
Comments 10 pages, 8 figures, 2 tables. Revised version with major updates on methodology and extended evaluation on EndoAgentBench. Code and data are available at https://github.com/Tyyds-ai/EndoCogniAgent
先规划,后扩散:用于长视距扩散规划的外在图引导
机构 * Technion(技术Ion大学) ; Harvard(哈佛大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种外在搜索引导的扩散模型(XDiffuser),通过在状态空间图上先规划再引导扩散过程,以提高长视距规划的效率和效果,尤其在低质量数据和未见任务中表现优异。
通过提示强化实现大语言模型的长期规划
机构 * Heinrich-Heine-Universität Düsseldorf(杜伊斯堡-埃森大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种基于强化学习的提示优化框架,通过修改LLM代理的任务指令提示来实现长期规划,提升了多轮交互任务如文本到SQL和任务导向对话的表现,并能泛化到不同LLM代理和多种LLM作为元提示代理。
位置:一种三层概率性假设-保证架构在安全LLM代理部署中是结构上必需的
机构 * CSX-AI ; University of Liverpool(利物浦大学) ; Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) ; Austrian Institute of Technology(奥地利技术研究院) ; Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)
专题命中 规划决策 :agent(title,abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出,单层抽象层内强制LLM代理安全并非仅仅是次优,而是结构性上不足以满足部署的LLM代理需求。安全操作的三个维度——语义意图和政策合规性、环境有效性以及动态可行性——各自依赖于在执行不同阶段才变得可用的信息集。没有单一的防护措施可以保证这三个维度。我们主张社区必须采用基于合同的架构,其中每个安全维度由独立认证的层强制执行,其概率保证满足下一层的假设。我们勾勒了这样的架构,并通过概率链规则推导出其允许的系统级安全界限。三个开放性问题阻碍着这一标准的实现:从非独立同分布轨迹中估计界限、在部署漂移下合同的渐进退化,以及向多代理设置的扩展——LLM代理运行时保证中最关键的未完成任务。
评估交互式AI代理的认知年龄对齐
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Shenzhen Children's Hospital(深圳儿童医院) ; Peking University(北京大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 规划决策 :AI agent(title,abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出ChildAgentEval,首个基于心理测量的交互式基准,用于评估基于多模态大语言模型的代理的认知年龄对齐,通过与年龄特定的人类发展阶段进行系统比较,揭示当前代理在模拟年龄特定认知行为方面的优劣。
通过大型语言模型的图引导动作生成进行具身任务规划
机构 * Purdue University(普渡大学) ; Futurewei Technologies(未来科技)
专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL
AI总结 本文提出GiG框架,通过图神经网络编码环境状态并构建动作连接执行轨迹图,结合有限前瞻性模块提升具身代理的规划能力,在三个具身规划基准测试中取得显著性能提升。
Comments Accepted by ICML 2026
医疗领域代理AI治理与生命周期管理
机构 * School of Computer Information Sciences(计算机信息科学学院) ; University of the Cumberlands(坎伯兰大学) ; Williamsburg(威廉斯堡)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出了一种统一的代理生命周期管理框架,旨在解决医疗领域中代理蔓延问题,通过五个控制层实现可审计的监督,同时支持本地创新和安全扩展。
Comments 21 Pages, 9 figures
面向行人的LLM驱动行为规划用于自动驾驶车辆
机构 * The University of Osaka, Japan(大阪大学,日本) ; RIKEN Center for Computational Science, Japan(日本计算科学研究中心) ; Tanta University, Egypt(埃及塔塔大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于大型语言模型的决策框架,用于自动驾驶车辆在复杂城市环境中考虑行人行为,通过自然语言推理提示将结构化场景观测转换为语言推理,从而生成安全的驾驶决策。
Comments This paper has been accepted for presentation at the 29th IEEE International Conference on Intelligent Transportation Systems (ITSC)
当机器人做家务:一个基准和代理用于长期家庭任务执行
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。
BioProAgent:用于受限科学规划的神经符号接地
机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) ; School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ; School of Computer Science, Peking University(计算机科学学院,北京大学)
专题命中 规划决策 :planning(title,abstract);workflow(abstract);分类 cs.AI
AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。
超越策略优化:一种数据整理飞轮用于稀疏奖励长周期规划
机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; School of Computing, National University of Singapore(新加坡国立大学计算机科学学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
专题命中 规划决策 :planning(title,abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出BPO框架,通过自改进的数据飞轮开发鲁棒推理模型,解决多轮代理规划中稀疏奖励长周期问题,实现高效推理和显著的token效率。
视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解
机构 * University College London(伦敦大学学院)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。
训练培训者——一种基于同伴的AI框架,用于战场环境中的同伴心理支持
机构 * McDonald Army Health Center(麦克唐纳陆军健康中心) ; Old Dominion University(老 Dominion 大学) ; Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) ; Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) ; University of Virginia School of Medicine(弗吉尼亚大学医学院) ; Florida International University(佛罗里达国际大学) ; Accenture Technology Labs(埃森哲技术实验室)
专题命中 规划决策 :agentic(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出一种基于同伴的AI框架,利用AI代理提升战场环境下心理支持的效率,减少撤离需求并提高持续护理质量。
基于模式的思考:通过模式诱导突破视觉规划中的感知瓶颈
机构 * State Key Lab of CAD& CG(CAD与CG国家重点实验室)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出通过模式诱导的方法,利用模式推理和模式诱导策略,使视觉语言模型在视觉规划任务中实现更高效和准确的感知与推理,解决传统模型在复杂输入下的感知瓶颈问题。
供应链协调机制设计:共识规划协议与维克利-克劳斯-格罗斯机制的结合
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出将共识规划协议与维克利-克劳斯-格罗斯机制结合,以实现零售商与供应商之间的诚实高效协作,降低总服务成本。
线性规划方法用于具有目标选择的欺骗路径规划游戏
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文研究了移动代理在选择私有目标时如何通过路径规划影响对手对其意图的推断,提出了一种结合线性规划与双Oracle算法的解决方案,评估了欺骗风险与效果。
Comments Accepted to American Control Conference 2026
Qumus: 一种具身人工智能量子材料实验家的实现
专题命中 规划决策 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文提出Qumus,首个能够进行真实世界科学发现的具身人工智能量子材料实验家,通过机器人微型实验室实现了原子薄二维材料和范德瓦耳斯结构的制备与纳米加工,首次实现了AI生成石墨烯和原子薄场效应晶体管的AI制造。
Comments 29 Pages in total. Supplementary Demo Videos are available at https://qumus.ai
基于属性的LLM程序合成用于规划
机构 * Federal University of Rio Grande do Sul(里约格朗德杜斯尔大学) ; University of Oxford(牛津大学) ; Linköping University(林奈大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了一种基于属性的LLM程序合成方法,通过检查候选程序是否满足形式定义的属性来指导LLM生成更高质量的程序,从而减少生成和评估成本。
Speech-Hands: 一种基于自我反思的语音代理方法用于语音识别和多感知音频推理
机构 * NVIDIA ; Kyoto University(京都大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出Speech-Hands框架,通过自我反思决策机制解决语音识别和外部声音理解任务中的信任问题,提升了模型在多任务音频推理中的准确性和鲁棒性。
Comments Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073
自然语言代理Harness
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出自然语言代理Harness(NLAH)作为一种可执行的自然语言对象,用于描述任务运行的Harness策略,并引入Intelligent Harness Runtime(IHR)作为共享运行时,能够将这些文档解释为代理调用、交接、状态更新、验证门和成果合同。实验表明,NLAH在编码、终端使用和计算机使用基准测试中表现与代码和提示实现相当,同时暴露了更短的静态Harness策略。
Comments revise paper
在联合嵌入预测世界模型中成功因素是什么?
机构 * Meta FAIR ; Inria Paris(巴黎理工院) ; Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) ; New York University(纽约大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。
Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR
动态技能生命周期管理用于代理强化学习
机构 * Database Group, The Chinese University of Hong Kong(香港中文大学数据库组) ; Lanzhou University(兰州大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出SLIM框架,通过动态优化变量管理代理强化学习中的外部技能集,提升任务性能。
Comments Implementation code is available at https://github.com/ejhshen/SLIM
通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力
机构 * Sun Yat-sen University(中山大学) ; Xiaomi Corporation(小米公司) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。
Comments 18 pages, 12 figures, 6 tables. Preprint
大语言模型代理系统中技能的扩展规律
机构 * Evolvent AI Team(Evolvent AI团队)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 研究揭示了大规模代理系统中技能扩展的双重规律:路由准确性随库大小对数衰减,执行准确性通过联合路由乘法提升下游任务表现,二者通过路由衰减斜率参数耦合,优化后显著提升性能。
Comments Technical Report
帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基于LLM的AI分流代理,通过多轮对话和提问提高客户问题分类准确性,提升银行客户服务效率。