Active Semantic Perception
主动语义感知
机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
主动语义感知
机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。
面向快速鲁棒机器人故障检测与恢复的目标导向通信
机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) ; Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。
Comments Submit to IEEE for potential publication
利用场景图扩展机器人模仿学习的时空上下文
机构 * University of Pennsylvania(宾夕法尼亚大学) ; RAI Institute(RAI研究院) ; University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出使用场景图作为显式结构化记忆机制,通过动态维护对象中心关系及其时间演化,解决机器人模仿学习中的部分可观测性和长时推理问题。
仅需两个样本的自一致性:CoT-PoT集成实现高效LLM推理
机构 * Carnegie Mellon University Qatar(卡内基梅隆大学(卡塔尔)) ; Qatar Computing Research Institute(卡塔尔计算研究院)
专题命中 测试时计算 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种混合集成方法,结合思维链与程序化推理两种模式,通过仅需两个样本即可实现自一致性,将采样量减少9.3倍,并在78.6%的任务上达到最优。
Comments 9 pages, 3 figures; accepted to Findings of ACL 2026
断裂链式思维推理
机构 * University of Amsterdam(阿姆斯特丹大学) ; eBay ; Microsoft(微软) ; Google Research(谷歌研究) ; Salesforce
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出断裂采样策略,通过截断推理链、调整轨迹数和解数,在推理时实现精度与成本的帕累托最优。
学习何时采样:面向高效链式思维推理的置信度感知选择性采样
机构 * Vanderbilt University(范德比尔特大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Intuit AI Research(Intuit AI研究院)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL
AI总结 提出置信度感知选择性采样框架,通过分析单条推理轨迹自适应决定是否触发多路径采样,在保持性能的同时显著降低推理成本。
努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。
消息传递实现高效推理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出消息传递语言模型(MPLM),通过线程间直接通信和抢占机制,在Sudoku、3-SAT和长上下文问答任务中实现比串行CoT和并行FJ更高效的推理。
Comments COLM 2026
ATLAS:验证器引导的自适应潜在激活引导用于高效LLM推理
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.LG
AI总结 提出ATLAS框架,通过轻量级验证器动态调整推理时潜在状态引导策略,实现每步自适应控制,在数学和编码推理任务上提升准确率并减少测试时token使用。
Comments 21 pages, 6 figures
SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架
机构 * Seoul National University(首尔国立大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI
AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。
结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡
专题命中 测试时计算 :reasoning(title,summary_cn);chain-of-thought(abstract)
AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。
Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736
AdaThink-Med:通过不确定性量化优化医学推理的推理时计算
机构 * SJTU(上海交通大学) ; SII(上海信息所) ; Shanghai AI Lab(上海人工智能实验室) ; FDU(复旦大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AdaThink-Med框架,通过不确定性引导长度校准优化医学推理的推理时计算,在六大医学基准上降低4.7-6.4倍推理token消耗且性能损失极小,无需外部分类器即可实现资源高效分配。
StructReward:用于自修正多模态推理的高效结构化过程奖励
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);self-correction(abstract)
AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。
Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally
理解并缓解过早自信以提升大语言模型推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);test-time compute(abstract);分类 cs.AI
AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。
深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量
机构 * University of Virginia(弗吉尼亚大学) ; Google(谷歌)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)
AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。
Comments Accepted to ICML 2026
ThinkBooster: 一种用于LLM推理无缝测试时扩展的统一框架
机构 * MBZUAI ; ETH Zürich(苏黎世联邦理工学院) ; Imperial College London(伦敦帝国理工学院) ; NUS(国立大学新加坡) ; Accenture(埃森哲) ; Innopolis University(因诺普里斯大学) ; Independent Researcher(独立研究者)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ThinkBooster框架,通过模块化库、联合评估基准和可部署代理服务,实现LLM推理的测试时计算扩展,在数学和编码任务上验证了性能-计算权衡。
带RL或SFT的Transformer可证明学习稀疏布尔函数,但方式不同
机构 * School of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学学院,英国) ; Independent Researcher(独立研究员)
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文通过统一分析RL(过程奖励)和SFT微调Transformer学习可递归分解的k-稀疏布尔函数的动态,证明两者都能学习k-PARITY、k-AND、k-OR等函数,但RL同时学习整个CoT链,而SFT逐步学习。
Comments ICML 2026 final version. 50 pages
GradCuit:信用分配梯度流实现鲁棒且可解释的测试时潜在推理
机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; School of Artificial Intelligence for Science, Peking University(北京大学科学人工智能学院)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 GradCuit在测试时插入可优化潜在状态,实现序列级信用分配,在多基准上准确率优于同类方法,且鲁棒性、可解释性更强,为LLM测试时推理扩展提供新方向。
如果我们在测试时动态分配计算资源呢?
机构 * Stanford University(斯坦福大学) ; University of Oklahoma(俄克拉荷马大学) ; University of California Riverside(加州大学河滨分校) ; National University of Sciences and Technology(国立科技大学)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出了一种基于验证器的自适应框架,通过迭代轨迹生成与选择提升推理效率,在多个数据集上优于传统测试时缩放方法。
Comments International Conference on Machine Learning
ConPress: 从多问题上下文压力中学习高效推理
机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; Microsoft, Beijing, China(微软) ; Tongji University, Shanghai, China(同济大学)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 提出ConPress方法,利用多问题提示诱导大推理模型自压缩推理链,通过自监督微调减少推理token使用,在保持精度的同时显著降低开销。
作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。
最优自一致性:用于大语言模型高效推理
机构 * Yale University(耶鲁大学) ; Inria(法国国家信息与自动化研究所) ; com(42.com)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文分析自一致性(SC)的缩放行为,提出动态分配样本的Blend-ASC变体,平均减少4.8倍样本量,实现最先进的样本效率。
Comments Accepted at ICML 2026
UniT:统一多模态思维链测试时扩展
机构 * Stanford University(斯坦福大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。
Comments CVPR 2026
基于无验证器共识选择的CAD生成测试时缩放
专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。
用于推理的思维级束搜索
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Meta AI
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI
AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。
Comments Add the author Jiawei Zhao in Meta Data
MentorCollab: 选择性大到小推理时指导以实现高效推理
机构 * UIUC(伊利诺伊大学香槟分校) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL
AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。
具有自适应验证器的多模态强化学习
机构 * Microsoft Research(微软研究院) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; ETH Zurich(苏黎世联邦理工学院) ; UW–Madison(威斯康星大学麦迪逊分校)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。
通过大师蒸馏实现语言模型中的接地国际象棋推理
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Queen’s University(皇后大学) ; Coolwei AI Lab(Coolwei人工智能实验室)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。
基于深度条件循环Transformer的ASR测试时计算缩放
机构 * Idiap Research Institute(Idiap研究 institute) ; EPFL(瑞士联邦理工学院) ; BUT(布拉格技术大学) ; Novartis Institute of Biomedical Research(诺华生物医学研究 institute)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.LG
AI总结 提出LARM模型,通过深度条件循环Transformer将循环编码器深度变为可控的测试时计算轴,结合稀疏CTC检查点、监督时钟嵌入、FiLM深度条件和延迟软后验反馈,在LibriSpeech上随推理循环次数增加提升WER,实现测试时计算缩放从自回归语言模型推理扩展到连续非自回归语音识别。
GLaQ:基于视觉证据的潜在查询定位用于多模态推理
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。