Berkeley and Heiserman as an Unexhausted Architecture for Embodied Machine Intelligence
伯克利和海斯曼作为具身机器智能的未穷尽架构
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI
AI总结 本文以伯克利的《符号逻辑与智能机器》及海斯曼的工作为研究对象,探讨其在具身机器智能方面贡献。他们将逻辑与硬件、行为等联系,超越静态逻辑形式,为具身机器人认知架构方法提供思路,不应被视为历史终点。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
伯克利和海斯曼作为具身机器智能的未穷尽架构
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI
AI总结 本文以伯克利的《符号逻辑与智能机器》及海斯曼的工作为研究对象,探讨其在具身机器智能方面贡献。他们将逻辑与硬件、行为等联系,超越静态逻辑形式,为具身机器人认知架构方法提供思路,不应被视为历史终点。
大型语言模型中思维链推理的平均场动力学
机构 * Tsinghua University(清华大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出框架,将LLM推理建模为线索图引导式发现过程,用平均场近似推导线索占比的常微分方程,实验验证所得统计规律可复现且能被该方程拟合。
PPDL:基于大语言模型的流作为概率程序
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出用于编程基于LLM的流的概率语言PPDL,可量化传播流中不确定性,无需额外代码即可尝试推理缩放技术,还通过实验及面向Rocq的定理证明智能体案例验证了其能力。
Comments Published at ICML 2026
CARE:用于执行 shell 的语言模型代理的执行前命令验证
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究 LLM 代理执行 shell 命令时的调度风险,提出 CARE 验证器,通过规范化命令、推导证据并结合 LLM 判断,实现命令级调解,降低调度边界风险,平衡良性恢复、误报负担、延迟和危害降低之间的关系。
Comments Accepted by ISSRE 2026
关于大语言模型中条件PAC有效推理不可能性的注记
机构 * Department of Statistics and Data Science(统计与数据科学系)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究证明了在无分布设定下,大语言模型无法实现条件PAC有效推理,指出任何满足此条件的算法必须依赖专家模型。
基于大语言模型的反事实分析
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文研究用GPT-3.5模型开展在线借贷反事实分析,经提示工程优化后其预测性能接近梯度提升回归,验证了LLMs用于反事实分析的潜力。
当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。
过重采样优化:大语言模型推理的测试时自校正
机构 * University of Oklahoma(俄克拉荷马大学) ; Stanford University(斯坦福大学) ; Universitat Pompeu Fabra(庞培法布拉大学) ; Air University(空军大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。
Comments Submitted to EMNLP 2026
基于智能体的多视角聚合测试断言生成
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。
如您所愿:利用LLM在精准农业中进行形式化验证的任务规划
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.AI
AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。
Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)
Afford-X:面向任务型操作的通用且轻量化的可供性推理模型
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Department of Computer Science, Tsinghua University(清华大学计算机科学系)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。
立场:是时候针对自一致性优化大型语言模型(LLMs)了
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 本文提出自一致性框架,指出LM的缺陷源于单输出对独立评估的假设,可通过一致性优化解决,为开发通用一致性LLM提供思路。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Position Paper Track
在线推理校准:测试时训练使可泛化的符合性大语言模型推理
机构 * Department of Electrical Engineering and Computer Science (MIT EECS)(麻省理工学院电气工程与计算机科学系) ; Computer Science and Artificial Intelligence Laboratory (MIT CSAIL)(麻省理工学院计算机科学与人工智能实验室) ; Laboratory for Information and Decision Systems (MIT LIDS)(麻省理工学院信息与决策系统实验室) ; Computational Science and Engineering (MIT CSE)(麻省理工学院计算科学与工程) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ORCA框架,通过测试时训练和符合性预测校准推理过程,提升大语言模型在分布变化下的效率和泛化能力,实验证明其在不同任务中具有更高的性能。
Comments Published as a conference paper at COLM 2026; 22 pages
临床输入引导前沿AI模型做出准确和有害的决策
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究评估了临床输入如何影响AI模型在诊断生成和下一步建议中的表现,发现专家上下文显著提升诊断准确性,而对抗性上下文导致诊断退化,且模型在多轮对话中表现出不同的特性。
判断-结果差距:医疗决策中的大语言模型道德推理
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。
Comments Accepted at AIES 2026
通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督
机构 * KAIST AI(KAIST人工智能研究所) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Rice University(里士满大学) ; Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Sentient Labs(Sentient实验室)
专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。
Comments COLM 2026
开箱即用的大语言模型(LLM)在法律领域能(不能)做什么?针对意大利律师、法官和公证人考试的图灵测试
专题命中 推理与问题求解 :LLM(title_cn,summary_cn)
AI总结 本研究通过意大利律师、法官、公证人考试的盲法图灵测试,评估开箱即用的主流LLM的法律能力,发现其在部分法律任务表现接近人类但公证人考试全部失败,明确了LLM法律能力的范围与边界。
上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力
专题命中 推理与问题求解 :post-training(title,abstract);language model(abstract)
AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。
开源权重大语言模型能否生成内核验证的Coq证明?一项试点研究
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究在CoqStoq的100个定理上评估6种开源权重LLMs,发现仅Gemma 4等3个模型能生成Coq内核验证的证明,总体成功率3.5%,未确立模型通用排名。
PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解
机构 * Google DeepMind(谷歌DeepMind) ; Media Lab, MIT(媒体实验室,麻省理工学院) ; Google AR(谷歌AR)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。
语言模型的分层隐式预测
机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。
基于Koopman谱分析的多智能体系统集体推理验证
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。
从痕迹中推理:分歧引导的智能体修复WebAssembly差异
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。
面向多语言数学推理的在线策略增量蒸馏
机构 * NAVER AI Lab(NAVER AI实验室)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG
AI总结 本研究针对多语言数学推理任务,提出OPD²方法,实验表明其在韩语、日语上性能提升显著,且能缩小英语与韩语的性能差距,凸显多语言数据的重要性。
Comments 9 pages, 3 figures, 10 tables
NeSy-RAG:用于可解释问答的神经符号检索增强生成框架
机构 * Heidelberg University(海德堡大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。
约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议
机构 * Tsinghua University(清华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。
Comments 53 pages, 5 figures, 36 tables
超越图书馆:用于自动形式化研究数学的智能体框架
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种基于通用编码大语言模型的智能体自动形式化框架,通过多智能体管道和辅助引理技术,成功形式化了PutnamBench和STOC论文中的主要定理,其中两个证明无需额外公理。
Comments preprint
ChronoVision:基于潜在状态重构的时序推理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。
统一智能体:管理跨设备交互
机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。
STATe-of-Thoughts:用于树状思维的结构化动作模板
机构 * Technion(以色列理工学院) ; Princeton University(普林斯顿大学) ; Independent(独立作者) ; Hebrew University(希伯来大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 STATe通过结构化动作模板提升文本生成的多样性和可控性,通过显式动作序列捕捉可解释特征,增强生成质量与可解释性。
Comments Accepted to COLM 2026. Version 3. 11 pages main, 85 pages total, 23 tables, 21 figures