Probabilistic Reasoning via Deep Learning: Neural Association Models
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Probabilistic reasoning, Winograd Schema Challenge, Deep learning, Neural Networks, Distributed Representation
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Probabilistic reasoning, Winograd Schema Challenge, Deep learning, Neural Networks, Distributed Representation
“你撒谎了吗?”评估不同规模模型和信念验证模型生物体的谎言检测器
机构 * AI Security Institute(AI安全研究所)
专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究通过构建13个信念可验证的推理模型生物体和多样化提示撒谎测试集,评估了四种谎言检测器在不同规模模型上的表现,发现基于激活和概率的检测器在训练模型生物体上性能显著下降,而思维链法官保持较强性能,但存在伪影。
Comments 12 pages, 6 figures
通过大语言模型进行安全代码审查的洞察:能力、障碍及影响因素
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) ; School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) ; School of Computing Technologies, RMIT University, Australia(皇家墨尔本理工学院计算技术学院)
专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文通过实证研究探讨大语言模型在安全代码审查中的潜力,比较了七种LLM与静态分析工具的性能,发现LLM在检测安全缺陷方面表现优异,且特定提示策略对性能有显著影响。
Comments 30 pages, 13 images, 10 tables, Manuscript revision submitted to a journal (2026)
从执行轨迹生成可验证的推理链
机构 * IBM Research, India(印度IBM研究院) ; IBM Research, Japan(日本IBM研究院)
专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出通过生成执行轨迹验证的推理链,提升模型在代码推理和生成中的准确性,实验显示验证质量显著提升模型性能。
专题命中 其他推理 :CoT(abstract,comments);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 37 pages, 23 figures. v1: results using InstructGPT, v2.0: added the Codex experiments, v2.1: added the missing test MedMCQA results for Codex 5-shot CoT and using k=100 samples, v3.0: added results for open source models -- ready for publication (final version)
保留、定制还是退出:大语言模型推理服务中的默认设计与代币定价
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对LLM推理服务的供需交互建立Stackelberg博弈模型,推导最优解,明确默认设置的影响条件,实验验证模型并展示均衡相关因素。
人类放弃,推理模型坚持:将难度登记与深思分配分离
机构 * The University of Hong Kong(香港大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过分离难度登记与深思分配,发现人类与大型推理模型(LRM)在问题解决中的时间/令牌分配模式相反:人类在错误问题上用时更少,而LRM在错误问题上使用更多令牌。
判断-结果差距:医疗决策中的大语言模型道德推理
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。
Comments Accepted at AIES 2026
关于大语言模型中条件PAC有效推理不可能性的注记
机构 * Department of Statistics and Data Science(统计与数据科学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究证明了在无分布设定下,大语言模型无法实现条件PAC有效推理,指出任何满足此条件的算法必须依赖专家模型。
注意输出上限:输出预算机制会改变测得的多语言推理差距
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究发现多语言推理差距受输出token预算机制影响,通过固定Qwen模型的预算峰值等实验,提出应将输出上限作为独立变量,报告不同预算机制下的准确率。
Comments 15 pages, 2 figures, 11 tables. Under review
基于拓扑的不完整知识图谱推理与图基软提示
机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) ; Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。
Comments 17 pages, 2 figures
大模型为何妥协:医学谄媚背后的对话因素与推理
机构 * Virginia Tech(弗吉尼亚理工大学) ; Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) ; Emory University(埃默里大学)
专题命中 其他推理 :reasoning(title);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。
Comments 21 pages, 7 figures, 14 tables
从‘我们’到‘我’:基于演绎推理的理论指导叙事转变
机构 * Syracuse University(苏塞克斯大学) ; Arizona State University(亚利桑那州立大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。
学会选择,而非重新学习:硬路由推理LoRA混合
机构 * Halmstad University(哈尔姆斯塔德大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。
Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora
推理还是记忆:大语言模型能理解并生成中国歇后语谜语吗?
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究通过在新歇后语游戏中测试大语言模型,用多项选择题、自由形式解释生成和新歇后语创作评估其能力,发现前沿中文模型记忆能力较强,新歇后语创作中Gemini 3.1 Pro表现出色,但LLMs整体创造力仍落后于人类专家,凸显数据污染对评估LLMs推理能力的影响。
Comments 20 pages; exp 3 is work in progress
先回答再编辑:用于保留效用的反蒸馏的推理骨架编辑
机构 * School of Computer Science and Engineering, UNSW Sydney(新南威尔士大学计算机科学与工程学院) ; School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对专有大语言模型易受知识蒸馏影响的问题,提出骨架引导推理编辑框架SGRE,通过先回答再编辑的方式,借鉴认知负荷理论对推理痕迹进行修改,在降低蒸馏效果的同时保持推理准确性和痕迹自然度。
Comments 21 pages,8 figures
O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Griffith University(格里菲斯大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。
Comments Accepted to ECCV 2026
推理前先承诺:开放权重语言模型中答案预承诺的行为再现及初步激活水平证据
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究聊天模型在简单问题上先承诺答案而非推导的现象,通过行为再现和初步激活水平证据揭示错误承诺情况,还指出方法学上问题措辞对结果的影响,强调阳性对照对解读阴性预言机结果的重要性。
Comments 8 pages. Code, data, and all reported statistics: https://github.com/JO-HEEJIN/interview_mate/tree/docs/car-wash-repro/car_wash/paper_4
追踪、排序、决断:认知工作记忆对语言智能体中的多跳推理进行衡量
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究语言智能体多跳推理链变长性能下降问题,提出SLEUTH方法通过结构化认知工作记忆提升推理,经实验优势随难度增加,还发现证据充分性问题及解决办法,表明组织推理方式是扩展多跳推理关键。
归纳推理任务中Transformer的不变学习动态
机构 * ETH Zurich(苏黎世联邦理工学院) ; Stanford(斯坦福大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出理论框架解释Transformer语言模型归纳推理能力,研究广义归纳任务,证明其训练动态可限制在低维不变流形,刻画数据统计对学习竞争的影响,探讨初始化作用并展示坐标框架用途,向Transformer学习预测理论迈进。
通过身份桥揭示Transformer中多跳推理的机制
机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) ; Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学自然科学研究院) ; Shanghai Seres Information Technology Co., Ltd, Shanghai 200040, China(上海塞瑞斯信息技术有限公司)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大型语言模型多跳推理中两跳推理诅咒现象,引入身份桥进行最小监督,使单层Transformer能实现分布外两跳泛化,通过理论和实证分析揭示其机制及效果,并扩展到主流LLMs的实际设置。
Comments Accepted by COLM 2026
通过置信度校准和增量推理实现特定任务的多模态问答代理,用于QANTA 2026
机构 * Department of Computer Science ; Engineering, Chittagong University of Engineering \& Technology, Chattogram, Bangladesh
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对QANTA 2026共享挑战,开发特定任务双代理架构,抢答代理用带置信度校准的模型及数值推理策略,加分代理用多种推理整合信息,强调仅托管环境下的高效推理与校准,系统取得高分,证明轻量级策略在资源受限问答中性能强。
Comments 10 pages, 1 figure. Accepted at the EMM-QA 2026 Workshop, ICML 2026 (Non-Archival). Rank #1 overall system in the QANTA 2026 Challenge
上下文从不够长:用于长文档集可扩展问答的结构化推理
机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SLIDERS框架,通过结构化推理解决长文档集问答问题,利用关系数据库和SQL实现可扩展推理,优于现有基准。
Comments 53 pages (10 main), preprint
当思考有害时:视觉语言模型推理链中的认知信号
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。
Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea
辩论者混合:在多智能体推理中实现架构级别的辩论学习
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。
RADIANT-PET:结合大语言模型和强化学习的推理增强型PET/CT病灶分割
机构 * Division of Hematology, The Ohio State University Comprehensive Cancer Center(血液科,俄亥俄州立大学综合癌症中心) ; Department of Radiology, Mahidol University(医学放射科,玛希多大学) ; Department of Radiology, Mettapracharak Hospital(医学放射科,Mettapracharak医院) ; Department of Radiation Oncology, The Ohio State University Comprehensive Cancer Center(放射肿瘤科,俄亥俄州立大学综合癌症中心)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出RADIANT-PET框架,通过大语言模型和强化学习对候选摄取区域进行推理分类,抑制生理性假阳性,提升PET/CT病灶分割准确性。
通过近未来指导桥接在线策略蒸馏中的推理轨迹
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对在线策略蒸馏中令牌级学习信号无法有效桥接推理轨迹的问题,提出基于近未来轨迹信息的轨迹感知在线策略蒸馏方法,显著提升大语言模型推理性能。
DiARC:区分正负样本有助于提升大型语言模型的类ARC推理能力
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出DiARC方法,通过构建偏好对(正负样本)来提升大型语言模型在类ARC任务上的推理能力,实验表明该方法在多个基准上持续改进基线模型。
ReaORE: 基于大推理模型的推理引导渐进式开放关系抽取
机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医疗大数据国家研究院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出ReaORE框架,通过粗到细的关系推理(关系过滤与关系预测)解决开放关系抽取中关系标签生成和易混淆关系区分难题,在数据集上超越现有方法。
MiniOpt: 在有限资源下推理建模与求解通用优化问题
机构 * East China Normal University(华东师范大学) ; AntGroup(蚂蚁集团) ; Southern University of Science and Technology(南方科技大学) ; Nanjing University(南京大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出MiniOpt强化学习框架,通过“推理-建模-求解”范式,结合层次化奖励函数OptReward和优化导向策略优化,使3B参数模型在多种优化问题上达到强泛化,且训练资源需求低。
Comments 20 pages, 9 figures, 11 tables, project: https://github.com/Hsiang-1/MiniOpt