2.5-D Decomposition for LLM-Based Spatial Construction
基于2.5-D分解的LLM空间构建
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于2.5-D分解的LLM空间构建
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。
面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。
MG$^2$-RAG:多粒度图用于多模态检索增强生成
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。
HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。
NGM-RAG:基于神经图匹配的检索增强生成
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 研究针对传统RAG方法在处理复杂问题时的局限,提出基于神经图匹配的检索增强生成框架NGM-RAG,将图构建、匹配与答案生成统一,结合文本匹配和GNN,采用自适应加权策略,实验证明该模型在多跳问答等任务中性能优越。
能量演算:计算系统中能量的组合代数
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 研究针对能量缺乏形式化处理的问题,提出能量演算这一组合代数,基于能量元素及三个运算符,通过七条公理构建代数,有归约定理,不确定性可传播,运算符还能扩展到时间-能量帕累托前沿,实现节能策略组合及权衡推理。
RISKTAGGER:用于Web3中洗钱事件后法医分析的证据引导大语言模型智能体
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 针对Web3加密货币洗钱法医分析面临的挑战,提出RISKTAGGER,将大语言模型作为证据约束决策组件,从公共事件材料提取线索,递归扩展资金流图并生成报告。经多案例评估,能恢复资金路径、识别风险账户,组织证据成可验证报告。
Comments 11 pages(main text), 6 figures
有效≠必要:诊断思维链中的潜在低效率
机构 * KT Corporation(KT公司) ; Pohang University of Science and Technology(浦项科技大学)
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI
AI总结 研究思维链提示中存在的有效但低效推理问题,提出基于信息论的CAID度量,应用于PACE策略,能在保持准确率时减少令牌消耗,成功从推理链中去除冗余信息。
PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化
机构 * Tsinghua University(清华大学) ; Infinigence-AI ; Columbia University(哥伦比亚大学) ; OPPO AI Center(OPPO人工智能中心) ; Shanghai Jiaotong University(上海交通大学)
专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。
Comments Accepted by ICLR 2026. Code available at https://github.com/thu-nics/PM-KVQ
超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理
机构 * Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。
策略驱动的CT智能体:为临床一致的CT推理建模阶段感知诊断控制
机构 * University of Science and Technology of China(中国科学技术大学) ; Technical University of Munich(慕尼黑工业大学)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.LG
AI总结 研究针对CT诊断阶段选择协议差异及现有方法局限,提出策略驱动的CT智能体(PD-CTAgent)。通过临床结构抽象模块和知识引导诊断控制模型,实现阶段感知诊断推理,实验验证其在多数据集上的有效性与临床一致性。
Comments 8 pages, 4 figures
通过人类启发的推理实现稳健的语音深度伪造检测
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出HIR-SDD框架,结合大音频语言模型与人类启发推理,提升语音深度伪造检测的鲁棒性和可解释性。
大语言模型在经济因果推理中的意识形态偏见
机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) ; College of Business, KAIST(韩国科学技术院商学院) ; School of Computing, KAIST(韩国科学技术院计算机学院) ; Division of Social Science, HKUST(香港科技大学社会科学系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨LLM在经济因果推理中的意识形态偏见,通过扩展EconCausal基准测试,评估20种先进LLM在处理意识形态冲突案例时的准确性,发现LLM在意识形态冲突案例上表现更差,且存在系统性偏倚。
Comments Accepted at COLM 2026
用于改进推理和上下文修剪的结构化思维
机构 * University of Chicago(芝加哥大学) ; Capital One(第一资本金融公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。
SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Tencent(腾讯)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。
大语言模型在代理临床推理中的信息获取失败
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型在临床推理中信息获取失败问题,开发血液肿瘤学代理评估框架,发现信息利用率是诊断准确性关键指标,推理痕迹与准确性不相关,主要失败模式为搜索满足等,指出模型主要限制是不确定性下信息获取失败。
Comments 66 pages, 9 figures; includes supplementary material
PhysMRV:用于物理合理性推理的物理内存检索与验证
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。
为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预
机构 * California Institute of Technology(加州理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。
Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning
MET:基于理论和文化感知的多语言道德推理
机构 * University of Michigan(密歇根大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。
Comments Published as a conference paper at COLM 2026
OpsMem:用于故障诊断的具有跨内存共振的双内存推理
机构 * Huawei(华为)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对现代软件系统故障诊断中缺乏协调诊断状态与操作经验机制的问题,提出双内存框架OpsMem,通过跨内存共振等进行多智能体诊断,实验表明其在华为微服务故障诊断数据集上优于基线,提升了匹配度和相关性。
Comments 6 pages, 5 figures
CRiT-QA:利用反事实链和干扰陷阱评估多跳推理
机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) ; Graduate School of Advanced Imaging Sciences, Multimedia and Film, Chung-Ang University(Chung-Ang大学高级成像科学研究院,多媒体与电影)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大语言模型多跳推理能力评估难题,提出CRiT-QA数据集,通过反事实实体转换推理链、注入干扰链解决模型依赖知识和利用捷径问题,实验表明该数据集能暴露模型弱点,为评估多跳推理及开发可靠模型提供基础。
Comments Accepted to LREC 2026
通过分布匹配策略优化增强扩散大语言模型的推理能力
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出DMPO方法,通过分布匹配优化提升扩散大语言模型的推理能力,实现显著的准确率提升。
RetroHolmes:当语义合理性失效时的回顾性物理过程推理
专题命中 推理评测 :reasoning(title,abstract)
AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。
看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败
机构 * Boston University(波士顿大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理评测 :reasoning(abstract,abstract_cn)
AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。
Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident
超越莎莉-安妮任务:使用认知谢林点评估大语言模型中的心理理论
机构 * Paradigms of Intelligence Team(智能范式团队)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究旨在解决大语言模型心理理论评估问题,引入认知不对称谢林任务,通过要求模型在不同认知透明度下收敛于语义谢林点来评估其功能性ToM能力,发现能力差距及协调失败原因,指出社会推理和认知跟踪是瓶颈,为LLM评估与发展提供目标。
高效地使口语语言模型适应新加坡语境
机构 * xData Home Team Science & Technology Agency (HTX)(新加坡内政团队科技局)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对原始训练数据不可用且需多语言口语交互的情况,将开源口语语言模型适应新加坡语境。核心方法是结合LoRA微调等技术,构建多语言数据集。贡献是HT - Moonstone(5B)在多数任务表现出色,口音和性别识别佳,且原始语音问答能力损失小。
Comments 10 pages, 2 figures
帮助有害:后训练中领域依赖的中期训练同情价值观退化
机构 * Compassion Aligned Machine Learning (CaML)(同情心对齐机器学习实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究后训练数据领域对中期训练同情价值观的影响,发现帮助性训练比编程训练更显著降低动物同情和道德推理能力,但跨语言迁移存在差异。
超越简单提示:改进LLMs上下文辅助预测的策略
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。
Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI
SpurLens:多模态大语言模型中虚假线索的自动检测
机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。
阿格斯能评判一切吗?跨领域比较视觉语言模型
机构 * Bharati Vidyapeeth(巴哈提大学) ; Macquarie University(麦考瑞大学) ; DSEU-Okhla ; Vivekananda Institute of Professional Studies(维维kananda专业研究学院) ; IIIT-Delhi(德里印度理工学院) ; Center for SDGC(SDGC中心) ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。