OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
Comments 10 pages
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
Comments 10 pages
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments 5 pages, 2 figures
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments 11 pages
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
Comments 20 pages, 4 figures
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
Comments 17 pages, 11 figures, 5 tables
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
Comments Accepted to The ART of Safety: Workshop on Adversarial testing and Red-Teaming for generative AI (IJCNLP-AACL 2023)
专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2023 Main Conference, Camera Ready
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
Comments 14 pages, 5 figures, code and dataset: https://github.com/chenhan97/TimeLlama
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments 9 figures, 11 tables
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments *Equal contribution
专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
DiPO:解耦 perplexity 的策略优化用于细粒度探索-利用平衡
机构 * East China Normal University(东华师范大学) ; Ant Group(蚂蚁集团) ; Shanghai Innovation Institute(上海创新研究院) ; Xiamen University(厦门大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出 DiPO 方法,通过解耦 perplexity 空间来优化探索与利用的平衡,提升 LLM 在数学推理和函数调用任务中的性能。
Comments LLM Reinforce Learning
没有通用信号可预测版本更新下的样本级大语言模型退化
机构 * University of Ottawa(渥太华大学) ; Vector Institute(向量研究所)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。
思维链(CoT)何时有助、何时有害:大语言模型推理中序列深度瓶颈的实证研究
机构 * Vistula University(维斯图拉大学)
专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究通过实证发现,思维链(CoT)是带宽旁路而非通用推理增强器,在高深度推理任务中可提升大语言模型准确率,在浅层任务中冗余,其效果与任务序列深度、模型规模相关。
Comments 15 pages, 3 figures, 5 tables. Pre-registered study (OSF: https://osf.io/92jdk). Data and code: https://osf.io/hteuj
面向隐藏目标下零样本人机协作的结构化大语言模型推理
机构 * Michigan State University(密歇根州立大学) ; UC Santa Barbara(加州大学圣巴巴拉分校)
专题命中 推理与问题求解 :LLM(title,summary_cn)
AI总结 该研究针对隐藏目标下的零样本人机协作,提出结构化LLM架构,通过Dec-POMDP分解决策,实验显示其交互步骤更少、人类信任度更高,优于无ToM推理的变体和离线训练的多智能体强化学习策略。
ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架
专题命中 推理与问题求解 :LLM(title,summary_cn)
AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。
Comments Accepted at ISSTA 2026
ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架
机构 * Shenzhen University(深圳大学) ; Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。
Comments Accepted by ACM MM 2026, 21 pages, 12 figures
RepoReasoner:评估长上下文语言模型的仓库级代码推理能力
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)
AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。
Comments Published in FSE'2026
相同问题,不同答案:超越准确率评估大语言模型的可靠性
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。
人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。
Comments Under review, 47 pages, 14 figures, 22 tables
Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测
专题命中 推理与问题求解 :LLM(title,summary_cn)
AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。
基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。
Comments 28 pages, 4 figures, 3 tables
当模糊测试与理解相遇:用于RTL验证的大语言模型驱动的语义测试生成
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对硬件验证难题,提出ChipFuzzer框架,利用大语言模型语义推理能力。采用双阶段工作流程,覆盖引导阶段结合控制流分析提升覆盖率,错误引导阶段借助历史数据提高错误发现率,实验显示其显著提升验证效果。
Comments 8 figures
AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理
机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) ; School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。