Auditing CoT Answer-Hijack Patches: Source-Control Certificates with Type-I Guarantees
链式思维答案劫持的选择感知诊断
专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 针对链式思维答案劫持攻击,提出选择感知诊断方法,通过激活修补定位脆弱区域,并验证恢复依赖于同问题干净源。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
链式思维答案劫持的选择感知诊断
专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 针对链式思维答案劫持攻击,提出选择感知诊断方法,通过激活修补定位脆弱区域,并验证恢复依赖于同问题干净源。
关于RL训练的语言模型的最优推理长度
机构 * University of Tokyo(东京大学)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究强化学习训练的语言模型中推理长度与准确率的非单调关系,发现存在最优中间长度,并通过模式准确率分析揭示其成因。
Comments 18 pages, 12 figures
推理的几何:有效数学推理的谱特征
机构 * Valentin Noël(瓦伦丁·诺埃尔)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过将注意力矩阵视为加权词图,提取四个无需学习的谱诊断指标(Fiedler值、高频能量比、谱熵和平滑度),有效区分有效推理与模式匹配,在多个模型上达到85-96%的分类准确率。
Comments 30 pages, 13 figures, Accepted at ICML 2026 (main track)
基于残差模型引导的偏好对齐大型语言模型
机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。
Comments Accepted at IJCAI 2026
通过数学多模态模型识别非厄密系统拓扑不变量
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。
超越语义主导:音频语言模型中的认知情感推理与共情响应对齐
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);logical reasoning(abstract)
AI总结 提出CogAudio-LLM框架,通过构建LIME-440K数据集实现声学-语义解耦,设计EIPS思维链机制进行心理推理,并采用DR-SAPO优化策略平衡逻辑严谨性与共情质量,解决音频语言模型中的语义主导和情感认知不足问题。
Comments Accepted by Interspeech2026
软件工程的终结:AI代理如何根本性地重构软件范式
机构 * Lingxi Intelligent Investment (Shenzhen) Development Co., Ltd.(灵犀智能投资(深圳)发展有限公司)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文通过第一性原理分析,论证了以LLM为推理引擎的AI代理系统正在根本性地重构软件范式,从传统软件(代码承载决策逻辑)转向代理系统(代码作为临时工具),并提出了代理工程作为新兴学科。
Comments 15 pages, 2 figures, and 3 tables
可解释ASP的XAI视角:方法、系统与展望
机构 * Institute of Logic and Computation, TU Wien, Austria(逻辑与计算研究所,维也纳技术大学,奥地利)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文从XAI视角综述回答集编程(ASP)的解释方法,分类解释类型并评估现有理论与工具的覆盖范围,指出研究空白与未来方向。
Comments 10 pages
面向移动边缘通用智能的资源感知LLM推理
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院,清华大学,深圳) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing 和数据科学学院,新加坡) ; Department of Electronic Engineering, Tsinghua University, Beijing(清华大学电子工程系,北京) ; State Key Laboratory of Space Network and Communications, Tsinghua University, Beijing(空间网络与通信国家重点实验室,清华大学,北京) ; Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing(北京信息科学与技术国家研究中心,清华大学,北京) ; Department of Electrical and Computer Engineering, Auburn University, Auburn, USA(阿伯丁大学电气与计算机工程系,阿伯丁,美国)
专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI
AI总结 提出联合优化框架,通过自适应CoT提示和分布式MoE架构协同优化推理深度、专家激活和传输功率,在资源受限的移动边缘环境中实现LLM高效推理,推理质量与资源效率平衡,额外推理时间小于1秒时准确率和延迟满足率均达90%。
时间序列中基于大语言模型的推理与智能体系统综述
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Southern California(南加州大学) ; National Yang Ming Chiao Tung University(阳明交通大学)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文定义时间序列推理问题,按推理拓扑分为直接、线性链和分支结构三类,结合传统分析、解释、因果推断和生成等目标,综述方法、系统、数据集和评估实践,并指导拓扑选择与部署权衡。
Comments Accepted to Transactions on Machine Learning Research (TMLR)
CRANE:通过空域编辑实现代码代理的约束推理注入
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; IBM Research(IBM研究院)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。
RoboGPT-R1: 通过强化学习增强机器人任务规划
机构 * Institute of Automation, CASIA(中国科学院自动化研究所) ; School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) ; Huawei Cloud Technology Co., Ltd(华为云技术有限公司)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出RoboGPT-R1两阶段微调框架,先监督学习获取基础知识,再通过强化学习提升视觉空间理解和推理能力,在EmbodiedBench上超越GPT-4o-mini 21.33%。
Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), pp. 2827-2837, IFAAMAS, 2026
MobilityBench:用于评估真实世界移动场景中路径规划智能体的基准
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; AMAP, Alibaba Group(阿里集团AMAP) ; Alibaba Group(阿里集团)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 提出MobilityBench基准,通过确定性API重放沙箱和多维评估协议,系统评估基于LLM的路径规划智能体,发现现有模型在偏好约束路径规划上表现不佳。
多模态传感器融合仪器用于测量区域人类流动性:分布式人类数据引擎(DHDE)
机构 * Headquarters for Regional Revitalization, University of Fukui, Japan(复兴地区总部,福井大学,日本)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 提出分布式人类数据引擎(DHDE),通过融合边缘AI相机、数字意图信号、行为记录和气象数据,解决外围区域人类流动性测量中传感器稀疏和行为异质性问题,验证了稀疏传感器补偿方法,并发现“低活力悖论”。
Comments 32 pages, 4 figures, 3 tables. Pre-print of a manuscript submitted for peer review (v2)
利用具身体 agent:运行时治理以实现政策约束执行
机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚校区数学与计算机科学学院) ; School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) ; Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所)
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出了一种政策约束执行框架,通过将 agent 认知与执行监督分离,增强了具身体 agent 的运行时治理能力,通过 1000 次随机模拟验证,显著提高了对未经授权动作的拦截率和系统恢复成功率。
Comments 36 pages, 3 figures, 10 tables
基于排序的随机奖品收集博弈中的序数响应策略学习
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 规划推理 :planning(abstract)
AI总结 提出随机奖品收集定向越野博弈(SPCOG),扩展团队定向越野问题至自利代理场景,利用序数排名(OR)作为强归纳偏置,并设计虚拟序数响应学习(FORL)算法实现收敛策略。
Comments Submitted to IEEE Robotics and Automation Letters
MARIC:用于图像分类的多智能体推理
机构 * Enhans, Seoul, South Korea(韩国首尔Enhans) ; Peking University, Beijing, China(中国北京北京大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出多智能体框架MARIC,通过分解图像分类为协作推理过程,利用大纲智能体、方面智能体和推理智能体进行多视角分析与综合,在四个基准数据集上显著优于基线方法。
Comments 11 pages, preprint
P3D-Bench:用于参数化3D生成与结构推理的多模态大语言模型基准
机构 * Nanjing University(南京大学) ; Envision
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出P3D-Bench基准,通过参数化3D程序评估多模态大语言模型在几何精度、语义对齐和装配一致性上的表现,涵盖文本到3D、图像到3D和装配3D三类任务。
Comments Project page: https://spatiaos.github.io/projects/P3D-Bench
从对应到动作:多模态大语言模型中类人多图像空间推理
机构 * University of Tokyo(东京大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出HATCH框架,通过补丁级空间对齐和动作-答案推理两个目标,提升多模态大模型在多图像空间推理中的性能,在三个基准上超越同规模基线。
Comments ICML 2026
PIGEON: 通过兴趣点选择的VLM驱动物体导航
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) ; Peking University(北京大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 提出PIGEON框架,将物体导航建模为基于原始观测的稀疏决策问题,通过兴趣点(PoI)作为视觉决策单元,结合VLM选择关键点,实现零样本SOTA性能并迁移至主动具身问答。
Transformer表示在层间的轨迹几何
机构 * MetriQual ; London, UK(英国伦敦) ; Athens, GR(希腊雅典)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 通过计算轨迹长度、曲率等几何指标,发现语义相关提示在中间层收敛、推理任务曲率更大、歧义token轨迹分叉,并揭示三层结构。
Comments 18 pages, 9 figures
GEAR-VLA:学习几何感知的动作表示以实现可泛化的机器人操作
机构 * Anhui University(安徽大学) ; University of Science and Technology of China(中国科学技术大学) ; iFLYTEK(科大讯飞)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出GEAR-VLA框架,通过粗到细的动作学习、语义对齐的3D集成和具身规范化,学习统一的几何感知动作表示,实现跨物体、背景和机器人的泛化操作。
PRInTS:面向长程信息检索的奖励建模
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。
Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS
AI推断的能耗:效率路径与测试时计算
机构 * Microsoft(微软)
专题命中 测试时计算 :planning(abstract);分类 cs.LG
AI总结 本文提出基于令牌吞吐量的底层方法,估算大规模大语言模型的每查询能耗,揭示测试时扩展场景下的能耗变化及效率提升潜力。
Comments A preprint version with DOI is available at Zenodo: https://doi.org/10.5281/zenodo.17188770
Journal ref Joule (2026) 102430
MentisOculi: 揭示心智图像推理的局限性
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出MentisOculi基准,通过多步推理问题测试前沿模型利用视觉表示辅助推理的能力,发现视觉策略普遍无法提升性能,且统一多模态模型存在生成错误累积和无法利用真实可视化的问题。
Comments 9 pages, 8 figures, Accepted at ICML 2026
短链深思:通过拆分-合并优化平衡推理效率与段内能力
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 提出CoSMo框架,通过拆分-合并算法动态优化推理链,结合段级预算的结构对齐强化学习,在保持准确率的同时显著减少冗余段,平均提升准确率3.3点并减少28.7%段使用。
Comments camera ready version upload
GPO:从关键步骤中学习以改进大语言模型推理
机构 * Department of Computer Science Northwestern University(计算机科学系西北大学) ; AI Foundations Capital One(人工智能基础资本 one) ; Meta AI
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 提出引导式关键优化(GPO)微调策略,通过识别推理轨迹中的关键步骤并优先学习,显著提升大语言模型的多步推理能力。
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
建模复杂行为:视觉语言模型中的多人格组合与动态切换
机构 * Xi'an Jiaotong University(西安交通大学) ; Beihang University(北京航空航天大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究在视觉语言模型中引入显式人格条件,建立包括单人格、多人格和人格切换的系统评估框架,发现人格提示可提升图像描述但损害精确推理任务,并观察到多特质组合与动态切换中的平衡与残留效应。
Comments 16 pages, 4 figures, 10 tables
MLaGA: 多模态大语言与图助手
机构 * New York University(纽约大学) ; New York University Shanghai(纽约大学上海) ; New York University Brooklyn(纽约大学布鲁克林) ; Virginia Polytechnic Institute and State University(弗吉尼亚理工大学) ; New York University Abu Dhabi(纽约大学阿布扎克)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出MLaGA模型,通过结构感知多模态编码器和指令微调,将大语言模型扩展到多模态图数据,在监督和迁移学习任务中优于基线方法。
FinTradeBench: 面向LLM的金融推理基准
机构 * University of Central Florida(佛罗里达中央大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出FinTradeBench基准,通过结合公司基本面与交易信号,评估大语言模型在金融推理中的表现,发现检索增强对数值和时间序列推理帮助有限。
Comments 9 pages main text, 31 pages total (including references and appendix). 5 figures, 16 tables. Preprint under review. Code and data will be made available upon publication