HEARTS: Benchmarking LLM Reasoning on Health Time Series
HEARTS:基于健康时间序列的LLM推理基准测试
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 HEARTS是一个统一的基准测试,用于评估LLM在一般健康时间序列上的分层推理能力,包含16个真实世界数据集和110个任务,揭示了LLM在多步时间推理上的不足。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
HEARTS:基于健康时间序列的LLM推理基准测试
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 HEARTS是一个统一的基准测试,用于评估LLM在一般健康时间序列上的分层推理能力,包含16个真实世界数据集和110个任务,揭示了LLM在多步时间推理上的不足。
在不完全图证据下 grounding LLM 推理
机构 * Tianjin Normal University, College of Computer and Information Engineering(天津师范大学计算机与信息工程学院) ; Harbin Institute of Technology, School of Mathematics(哈尔滨工业大学数学学院)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出在不完全知识图谱证据下,通过KL正则化变形LLM先验实现软grounding,并给出稳定性界限,适用于GraphRAG、KGQA等场景。
Comments A theoretical perspective about Grounding LLM Reasoning
AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理
机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) ; Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) ; Newcastle University(纽卡斯尔大学)
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。
注意力-only变换器中间接对象识别最小电路的涌现
机构 * Saarland University(萨尔大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过从头训练小型注意力-only变换器,在符号化的间接对象识别任务中发现,单层模型仅需两个注意力头即可实现完美准确率,揭示了任务特定训练如何诱导可解释的最小电路。
Comments Published at ACL (Volume 4: Student Research Workshop) ISBN: 979-8-89176-393-7 URL: https://aclanthology.org/2026.acl-srw.4
覆盖驱动的KV缓存淘汰策略用于高效且改进的大语言模型推理
机构 * RBC Borealis(RBC 培生)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型推理中KV缓存内存开销大、现有淘汰策略导致长上下文任务性能下降的问题,提出覆盖感知的K-VEC策略,通过跨头跨层覆盖模块提升token保留,在LongBench上最高提升10.35点。
CRISTAL方法:来自AI合成世界模型的神经符号分析
机构 * GAIA Lab(GAIA实验室) ; South Westphalia University of Applied Sciences(西南弗里西亚应用科学大学) ; Technical University Dresden(德累斯顿技术大学) ; Primordia Co.(Primordia公司)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 提出CRISTAL神经符号框架,通过贝叶斯推理、主动学习和持续学习自动化复杂分析,在合成股票分类任务中仅用5个样本和5秒达到贝叶斯最优精度,远超LLM。
EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架
专题命中 逻辑推理 :reasoning(abstract)
AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。
未来是代理的:多代理推荐系统定义、视角和开放挑战
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。
Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts
LLM引导的规划:多模态核监管文档的多跳推理
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI
AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。
Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm
ReasonRec: 一种用于统一推荐的推理增强多模态智能体
机构 * Meta AI ; Michigan State University(密歇根州立大学) ; The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.AI
AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。
Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
CoSPlan: 通过场景图增量更新实现纠正式序列规划
机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学(UCF)人工智能研究所)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 CoSPlan基准测试要求视觉语言模型在初始场景到目标场景间规划视觉动作序列,通过引入错误动作检测与纠正机制,评估模型在复杂视觉任务中的能力。
Comments The 19th European Conference on Computer Vision (ECCV)
面向LLM智能体规划的自我进化世界模型
机构 * National University of Singapore(国立新加坡大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。
CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。
混合检索器演化:面向多模态文档推理代理
机构 * ServiceNow ; University of Washington(华盛顿大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出失败驱动的演化框架,让元代理自动学习任务代理如何协调多种检索器进行多步文档问答,实现自适应检索路由,在MMLongBench-Doc和DocBench上提升高达19.6分。
Comments 17 pages, 3 figures
自进化智能体图像恢复:通过深思熟虑的规划与直觉执行
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Life Sciences, Tsinghua University(清华大学生命科学学院) ; Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。
两阶段提示优化用于少样本关系抽取:从推理引导搜索到梯度引导精炼
机构 * University of Arizona(亚利桑那大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出两阶段框架,结合推理和梯度优化自动优化提示,在少样本关系抽取任务中取得最优性能。
流推理模型:通过迭代自我精炼扩展推理能力
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出流推理模型(FRMs),利用去噪动态的稳定性作为验证器,通过测试时缩放和训练改进,高效解决数独和斑马谜题等结构化推理任务。
世界模型中预测的路径空间表述:从单一动作到预测、规划和不可逆性
机构 * Department of Physics, Sejong University, Seoul 05006, Republic of Korea(首尔大学物理系,首尔05006,韩国)
专题命中 规划推理 :planning(title,abstract);分类 cs.LG
AI总结 提出世界模型中预测的路径空间表述,将预测、规划和不确定性统一为作用泛函上的操作,并发现注意力不对称性编码了数据的不可逆性。
Comments 13 pages, 3 figures
一个在生物医学工具宇宙中进行治疗推理的AI智能体
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; The Ivan and Francesca Berkowitz Family Living Laboratory Collaboration at Harvard Medical School and Clalit Research Institute(哈佛医学院伊万和弗朗西斯卡·伯科维茨家族生活实验室合作与克莱利研究所) ; Cardiovascular Division, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院心脏病学部,布里格姆和妇女医院) ; The Windreich Department of Artificial Intelligence and Human Health, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院人工智能与人类健康系) ; The Hasso Plattner Institute for Digital Health at Mount Sinai, Icahn School of Medicine at Mount Sinai and Mount Sinai Health System(西奈山伊坎医学院和西奈山医疗系统数字健康研究所) ; Mindich Child Health and Development Institute and the Departments of Pediatrics and Genetics & Genomic Sciences, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院Mindich儿童健康与发展研究所及儿科学和遗传学与基因组科学系) ; Mount Sinai Fuster Heart Hospital, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院Fuster心脏医院) ; Mount Sinai AI Assurance Lab, Mount Sinai Health System(西奈山医疗系统AI保证实验室) ; Institute for Critical Care Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院重症监护医学研究所) ; Department of Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院医学系) ; ATHENA-R1 Evaluation Group(ATHENA-R1评估组)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ATHENA-R1智能体,通过强化学习在212种生物医学工具上训练,实现迭代证据收集的治疗推理,在多个基准上超越现有模型,准确率达94.7%。
Comments Project page: https://athena.openscientist.ai Code: https://github.com/mims-harvard/ATHENA
基于锚定机器人关键点的顺序规划
机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) ; Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)
专题命中 规划推理 :planning(title,abstract)
AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。
Comments 29 pages, 14 figures
坏公司败坏好道德:理解与衡量叙事引发的LLM道德推理退化
专题命中 规划推理 :reasoning(title,abstract)
AI总结 本研究提出BreakingBad框架,系统衡量负面叙事沉浸对LLM道德推理、行为及部署风险的影响,发现叙事暴露导致道德准确率下降12%-31%,且退化具有结构性,第一人称叙事影响更强,并传播至实际部署场景。
R$^2$-Searcher:校准智能搜索中的检索与推理边界
专题命中 规划推理 :reasoning(title,abstract)
AI总结 提出R$^2$-Searcher框架,通过细粒度查询令牌引导的证据建模和检索后反思,校准检索与推理边界,在多跳问答基准上显著优于现有方法。
数百个浮动机器人的运动规划
机构 * Institute for Dynamic Systems and Control, ETH Zürich(苏黎世联邦理工学院动态系统与控制研究所)
专题命中 规划推理 :planning(title,abstract)
AI总结 针对大型浮动机器人编队的无碰撞运动规划问题,提出一种可扩展的流水线方法,通过碰撞图分解为独立子问题并行求解,在500个机器人仿真和实际演示中验证了有效性。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
多智能体路径规划作为QUBO问题
机构 * Department of Computers and Informatics, Faculty of Electrical Engineering and Informatics, Technical University of Košice(科希策技术大学电气工程与信息学院计算机与信息学系)
专题命中 规划推理 :planning(title,abstract)
AI总结 本文将多智能体路径规划问题建模为QUBO问题,通过证明其NP难性并推导出编码路线效用奖励和配对重叠惩罚的二次无约束二进制优化公式,探讨了覆盖与重叠的权衡策略。
悲观的悖论:保守离线训练加剧推理模型在线适应中的奖励黑客行为
机构 * Horizon Research ; Apple ; Meta
专题命中 规划推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 研究发现,离线训练中越保守的DPO(高β)会压缩策略熵,降低响应多样性,反而加速在线优化中奖励模型的利用,导致更严重的奖励黑客行为。
Comments Accepted in ICML 2026 workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning
结构生成在大语言模型中的隐性成本:草案条件约束解码
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DCCD方法,通过分步解码提升结构生成的准确性与效率,实验显示在结构推理基准中,DCCD在严格结构准确性上提升了24个百分点,且在参数效率上优于传统约束解码。
AI交易的阿尔法奇点:通过智能体间自我进化实现涌现性市场推理
专题命中 规划推理 :reasoning(title);分类 cs.AI
AI总结 提出密封联合搜索(SJS)框架,通过信息流结构条件防止过拟合,并基于Agora系统在CSI 1000上实现夏普比率+1.87,验证了评分函数与搜索联合优化的有效性。
通过增量多轮交互评估LLM代理的记忆能力
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MemoryAgentBench,通过多轮交互模拟记忆代理的信息积累过程,评估准确检索、测试时学习、长程理解与选择性遗忘四项核心能力。
Comments Y. Hu and Y. Wang contribute equally
无需演示的机器人控制 via LLM 代理
机构 * independent researchers(独立研究人员)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FAEA框架,利用通用大语言模型实现无需演示的机器人操控,通过迭代推理生成操控策略,在多个基准测试中取得高成功率,展示了通用代理在任务规划中的有效性。
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
SearchSkill: 教授大语言模型使用搜索工具与演进技能库
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) ; TikTok Inc, Beijing(字节跳动北京公司)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。