Fluid Reasoning Representations
推理模型中的流体表示
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。
Comments EMNLP 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
推理模型中的流体表示
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学)
专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究揭示了推理模型通过上下文细化令牌表示提升抽象问题解决能力的机制,提出流体推理表示概念。
Comments EMNLP 2026
FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA(英伟达) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。
Comments Accepted to IEEE VTS'26
AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 逻辑推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract)
AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。
Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures
语义丰富性还是几何推理?VLM视觉不变性的脆弱性
机构 * Boston University(波士顿大学)
专题命中 逻辑推理 :reasoning(title,abstract)
AI总结 研究揭示VLM在基本几何变换下的脆弱性,指出其在空间不变性与等变性上的不足,影响物体识别的可靠性。
形式分析几何:一种基于神经符号的多模态解析几何问题生成框架
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 逻辑推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。
高效多轮LLM推理的解耦服务
专题命中 逻辑推理 :planning(abstract)
AI总结 AMPD通过自适应协调预填充和解码工作负载,提升多轮LLM推理的服务级别目标达成率。
Comments ICML 2026
RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划
机构 * UCLA(加利福尼亚大学洛杉矶分校) ; MIT(麻省理工学院) ; Amazon(亚马逊公司) ; UPenn(宾夕法尼亚大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。
Comments To appear at COLM 2026
SAGA: 场景感知、目标演化的长时域CivRealm策略规划智能体
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 针对长时域策略游戏中场景盲视、上下文溢出和跨游戏学习浅层化问题,提出SAGA多智能体框架,通过地图语义场景图、工具增强规划器和双时域反馈循环,在FreeCiv中取得最高文明评分并降低输出令牌27%。
Comments 18 pages, 4 figures. Code https://github.com/Kazecloudk/SAGA-Scene-Aware-Goal-Evolving-Agents-for-Long-Horizon-Strategy-Game-Planning
学习、推理、优化:GUI 智能体中卡尼曼双系统智能的框架
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发式智能科学技术研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Amazon(亚马逊) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance Douyin Content Group(字节跳动抖音内容部)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对 GUI 智能体存在依赖试错决策、评估指标简单等问题,提出 CogniGUI 框架,结合全解析器引擎和 GRPO 基础智能体,实现自适应学习,经实验验证其在新基准测试中优于现有方法。
Comments Withdrawn due to ongoing technical improvements. The work requires further refinement and additional experiments to meet our quality standards. A revised version will be submitted in the future
提升具身世界模型用于规划与控制
机构 * Computer Science, New York University(纽约大学计算机科学系) ; BAIR, UC Berkeley(伯克利大学BAIR)
专题命中 规划推理 :planning(title);分类 cs.AI、cs.LG
AI总结 本文提出一种轻量级策略,将高层动作映射到低层关节动作序列,结合冻结的世界模型,实现预测未来观察的提升世界模型,有效降低规划复杂度。
Comments Accepted to ECCV2026. Edited policy masking
用于肌肉骨骼护理的基于证据的人工智能
机构 * Ruijin Hospital, College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院,健康科学技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑启发智能感知与认知教育部重点实验室) ; School of Basic Medical Sciences, Intelligent Medicine Institute, Fudan University(复旦大学基础医学院智能医学研究院) ; Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对肌肉骨骼护理中证据分散问题,提出基于大语言模型的OrthoPilot系统,整合多源数据进行持续管理。该系统在诊断推理等方面超越专家,优于其他智能系统,还提升了管理成功率和病床病例数等,推动临床人工智能实现纵向管理。
Comments All co-authors have now consented to the submission and approved the authorship
迈向超越全秩动作和状态可观测性的POMDP学习
机构 * MIT Computer Science and Artificial Intelligence Lab(麻省理工学院计算机科学与人工智能实验室) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于PSR方法学习POMDP参数的方法,通过张量分解估计相似变换,实现状态划分下的转移和观察模型学习,并展示了其在不同奖励函数下的应用潜力。
Comments WAFR camera-ready
节点即智能体:图智能体网络
机构 * Rutgers University(罗格斯大学) ; University of Liverpool(利物浦大学) ; Fudan University(复旦大学)
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG
AI总结 研究针对图神经网络不能处理节点信息不平衡及忽略全局语义关系的局限,提出检索增强图智能体网络ReaGAN,赋予节点自主决策能力,通过智能体规划和局部 - 全局检索实现自适应消息传播,在少样本设置下性能优异。
Comments 11 pages, work in progress
FinSAgent:用于基于证据的美国证券交易委员会文件问答的语料库对齐多智能体框架
机构 * 1SimpleWay.AI 2McGill University 3University of Toronto 4University of California, Los Angeles 5The Chinese University of Hong Kong 6University of Manitoba 7Universit\'e de Montr\'eal 8Boston University 9Mila - Quebec AI Institute 10CG Matrix Technology Limited 11Lakehead University 12McMaster University
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 研究针对美国证券交易委员会文件问答中模型与文件不匹配问题,提出FinSAgent框架,通过角色专用智能体、数据库感知查询分解及多路径检索等方法,提升检索覆盖和答案正确性,在离线和在线实验中均优于基线。
Comments 20 pages, 14 figures, 9 tables
ViMax: 智能体视频生成
机构 * The University of Hong Kong(香港大学) ; South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。
Comments 20 pages, 13 figures
Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策
机构 * KAIST(韩国科学技术院)
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。
Comments Accepted at ICML 2026
全球自动化图谱
机构 * Imperial College London(伦敦帝国学院) ; Bocconi University(博科尼大学) ; University of Oxford(牛津大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种基于任务和国家特定的方法,用于全球范围内分类自动化暴露,以区分劳动力替代和增强自动化,相关技术渠道以及人工智能的物质作用。研究涵盖了124个国家,生成了覆盖全球99%人口和GDP的233万个任务-国家标签。
Comments 78 pages, 6 figures, 5 Extended Data figures. Substantially revised and expanded. Data and code: https://automationatlas.org/
零博士:无需训练数据的自我进化搜索智能体
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究在高质量数据难获取时智能体自我进化问题,提出零博士框架,通过自我进化反馈循环和HRPO方法,使搜索智能体无需训练数据自我进化,在问答基准测试中表现出色,证明可仅通过自我进化实现强大智能搜索和推理。
Comments COLM 2026
高速策略化:多无人机竞速的学习型模型预测博弈
机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人学系,代尔夫特理工大学)
专题命中 规划推理 :planning(abstract)
AI总结 针对多无人机竞速中策略深度与计算延迟的权衡问题,提出一种学习型模型预测博弈(LMPG)方法,通过摊销模型预测博弈计算来降低延迟,在仿真和硬件实验中优于模型预测博弈和模型预测控制。
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9056-9063, Aug. 2026
评估具有视觉语言动作能力的机器人的不确定性和质量
机构 * Mondragon University(蒙dragon大学) ; Simula Research Laboratory(Simula研究实验室)
专题命中 规划推理 :planning(abstract)
AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。
Fly0: 解耦语义定位与几何规划以实现零样本空中导航
机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) ; National University of Defense Technology(国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; Information Support Force Engineering University(信息支援力量工程大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。
基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测
机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心)
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
AI总结 本文提出RF-Deep框架,利用深度特征提升CT扫描的分布外检测性能,通过少量标注数据改进分割管道的安全性。
Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026. Code available at: https://github.com/aneesh3108/RF-Deep
通过潜在蒸馏探索大语言模型
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(人工智能通用基础理论国家重点实验室,BIGAI,北京,中国) ; School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海交通大学,上海,中国)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Exploratory Sampling方法,通过蒸馏模型引导生成过程,提升语义多样性与推理效率,在数学、科学和代码生成中表现优异。
Comments 25 pages, 5 figures. Accepted in ICML 2026
AEVAL:从轶事性到确定性的智能体技能工作流测试
机构 * nvidia(NVIDIA公司)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。
Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems
LinguistAgent: 一个用于自动化语言标注的反思多模型平台
机构 * University of Birmingham(伯明翰大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 LinguistAgent通过反思多模型架构实现自动化语言标注,采用双代理工作流程模拟同行评审,支持多种标注范式并提供实时评估。
HERAKLES:用于开放式语言模型智能体的分层技能编译
机构 * Inria(Flowers)(Inria) ; University of Bordeaux(波尔多大学) ; Sorbonne Université (ISIR)(索邦大学) ; Univ Angers (LERIA) SFR MATHSTIC(昂格斯大学)
专题命中 复杂问题求解 :planning(abstract);分类 cs.LG
AI总结 研究部分可观测、稀疏奖励且目标空间大的环境中目标条件强化学习,提出HERAKLES分层智能体,联合学习高级语言模型策略与低级控制器,通过同时训练实现可扩展技能组合,提升开放式组合环境下的效率和适应性。
Comments 42 pages
鲁棒推理基准
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出鲁棒推理基准(RRB),通过13种确定性文本扰动评估8种前沿模型,发现Claude在面对变换提示时表现出异常拒绝行为,而开放权重模型在结构噪声下出现多种失败模式,如认知冲刷、分词崩溃和推理崩溃,导致平均准确率下降高达54%。研究进一步发现由模型自身推理链引起的注意力稀释问题,并提出Intra-Query Attention Dilution概念,表明中间推理步骤会污染标准密集注意力机制,未来架构需整合显式上下文重置以实现可靠推理。
通过截断的思维链审计检测基于大语言模型的教育辅导中的答案驱动推理
机构 * Independent Researcher(独立研究员) ; Northeastern University(东北大学) ; Syracuse University(Syracuse大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究基于大语言模型的教育辅导中,模型能否利用答案信息生成答案驱动的解释,用截断推理AUC评估法在三种辅导情境下评估,发现答案信息能提升模型表现,支持截断思维链审计用于诊断。
TReB:评估大语言模型表格推理能力的综合基准
机构 * JIUTIAN Research(天研机构)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。
Comments published by SIGIR 2026
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275
跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准
机构 * University of Minnesota(明尼苏达大学)
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。