Intuition-Guided Latent Reasoning for LLM-Based Recommendation
直觉引导的潜在推理用于基于LLM的推荐
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
直觉引导的潜在推理用于基于LLM的推荐
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。
当LLM推理理由面向用户时:对信任感知、决策和注视行为的影响
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究通过两项实验(在线和眼动追踪)探讨LLM推理理由的呈现方式、正确性和确定性框架对用户信任、决策和注视行为的影响,发现不正确理由降低信任并增加认知负荷,挑战了“更多推理更好”的假设。
用质量感知的形式化验证闭环LLM生成的RTL断言
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM生成RTL断言中的虚假通过、证明成本差异大和失败轨迹难解释问题,提出轻量级开源框架,通过突变引导精炼、求解器选择和因果叙事合成来提升断言质量和可解释性。
LLM介导的人机交互在搜索与救援中的应用:专业知识对注意力分配的影响
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究通过模拟搜索救援任务,比较有无大语言模型(LLM)指导的条件,结合眼动追踪和行为分析,发现LLM提升任务效率但未增加总救援人数,并揭示了注意力-指导权衡,其中专业知识调节了用户对AI的依赖模式。
Acoda:对抗性代码混淆防御基于LLM的分析
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出基于遗传算法的对抗性代码混淆框架Acoda,通过8种语义保留的混淆方法迭代优化,有效诱导LLM拒绝或误判代码分析,在7个先进LLM上攻击成功率高达70%。
RECON:一种增强LLM的逆向约束分析框架
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出RECON框架,结合LLM语义理解与静态分析,从Android字节码中提取精确执行约束,比传统符号执行快5.8倍且成功率达100%。
数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。
Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada
大语言模型在研究级数学问题上的失败模式:分类与实证刻画
机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。
通过结构不确定性量化LLM逻辑推理中的一致性
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI
AI总结 提出结构不确定性框架,通过自偏好排序的稳定性评估LLM推理一致性,在逻辑和数学任务中与答案分散度互补,提升不可靠实例识别。
Comments Published at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. Accepted as best paper
检测差异不等于理解结构:大型语言模型在图同构任务中失败
机构 * University of Ruhuna(鲁胡纳大学) ; University of Moratuwa(莫拉图瓦大学) ; University of Melbourne(墨尔本大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 本研究通过图同构检测任务揭示LLM的“虚假成功”:虽然LLM在检测同构时准确率接近完美,但面对节点标签置换的相同图时却无法识别,表明其依赖模式而非抽象结构推理。
LLM辅导器中教学式泄露的可审计发布控制
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。
Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed
承诺下的一致性:探究LLM逻辑推理中的泛化与空洞记忆
机构 * Department of Computer Science, Informatics Institute, Istanbul Technical University(伊斯坦布尔技术大学信息学研究所计算机科学系) ; School of Information Technology, Deakin University(迪肯大学信息技术学院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出双查询评估范式CUC,联合测量一致性与决断力,揭示LLM通过系统性弃权实现空洞一致性的失败模式。
用户身份影响非推理大语言模型的道德错误评级
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。
形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦
机构 * Islamic University of Technology(伊斯兰科技大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。
Comments 15 pages, 6 figures
LLMBDC:面向生物域的基因本体聚类语言模型
专题命中 推理与问题求解 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract,abstract_cn);分类 cs.AI
AI总结 该研究针对GO富集分析的术语冗余问题,提出无需训练的LLMBDC框架,利用LLM零样本推理聚类GO术语为生物域,在AD和FXS数据集上较基线方法显著提升了聚类性能。
奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。
Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation
使用证据引导推理提示减轻代码异味检测中的大语言模型谄媚现象
机构 * Institute of Information Technology(信息科技研究所) ; University of Dhaka(达卡大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究基于LLM的代码异味检测中谄媚偏差问题,通过MLCQ数据集评估不同提示框架影响,发现模型对提示变化敏感。提出证据引导去偏提示策略,降低决策不稳定性,提高鲁棒性,为解决该问题提供有效方法。
Comments 11 Pages
神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架
机构 * Texas Tech University(德克萨斯理工大学) ; Cumberland University(坎伯兰大学) ; Advanced Academic Programs Science(高级学术项目科学部) ; Johns Hopkins University(约翰·霍普金斯大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。
具体化命题提示解决大语言模型中的组合-知识二分法
机构 * Columbia University(哥伦比亚大学) ; UNIST(全南科学技术大学) ; POSCO Holdings(POSCO控股)
专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);foundation model(abstract)
AI总结 研究针对大语言模型组合-知识二分法难题,提出具体化命题提示(CPP)框架。通过明确相关命题具体化,提升推理性能,尤其在医学基准测试中表现突出,且可扩展到多种模型和参数规模,弥合两类方法差距,解决了二分法问题。
Comments 9
基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播
机构 * Emory University(埃默里大学) ; The University of Tokyo(东京大学) ; LocationMind
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);language agent(title,abstract);language model(abstract);分类 cs.AI
AI总结 提出GILP方法,结合小参数化世界模型与LLM推理,通过一致性门控减少幻觉,在规划基准上将幻觉率从0.176降至0.035,成功率从0.668提升至0.838。
Comments Under Review
LLM 生成的 VeriFast 规范实证研究
机构 * Purdue University(普渡大学) ; University of Michigan(密歇根大学) ; Meta ; Ann Arbor, Michigan, USA(美国密歇根州安阿伯) ; Menlo Park, California, USA(美国加州Menlo Park) ; West Lafayette, Indiana, USA(美国印第安纳州西拉法叶)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究评估了大型语言模型为分离逻辑验证器 VeriFast 生成规范的能力,发现虽然功能保持良好(>91%),但验证成功率仅31.4%,主要错误源于领域知识不足。
SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。
当智能体过早承诺:诊断LLM智能体中的过早承诺问题
机构 * Snowflake AI Research
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI
AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。
Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL
面向数学错误纠正的教学对齐LLM导师
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 提出两阶段对齐流程(监督微调+偏好优化),结合合成数据提升LLM在数学错误纠正中的教学质量和事实准确性,优于基线模型并与专有模型竞争。
跨语言数学问题的LLM参数:共享还是分离?
机构 * Lamarr Institute(Lamarr研究所) ; University of Bonn(波恩大学) ; Fraunhofer IAIS(弗劳恩霍夫智能分析和信息系统研究所)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过跨语言机制分析,发现多语言LLM中数学相关参数存在部分跨语言重叠,且主要集中在中间层,英语参数集最大,低资源语言参数集较小。
Comments 5 pages. Accepted at ACL Student Research Workshop (SRW) 2026. Code: https://github.com/luisavictor/math-across-languages Translated Datasets: https://huggingface.co/math-across-languages Webpage: https://math-across-languages.github.io
提取语义:从URDF自动构建机器人本体的LLM引导方法
机构 * LAAS-CNRS, Department of Robotics, Toulouse, France(法国图卢兹机器人系CNRS实验室)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出利用大语言模型从URDF文件自动生成机器人语义本体,通过多数投票和语法验证确保与现有本体对齐,初步实验表明该方法能有效桥接低层描述与高层知识表示。
Journal ref 18th International Conference on Social Robotics (ICSR 2026), University of London, Jul 2026, Londres, United Kingdom
Mental-R1:面向心理健康评估的对齐LLM推理
机构 * University of Oxford(牛津大学) ; Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出认知相对策略优化(CRPO)框架,通过阶段依赖不确定性建模和熵正则化机制,使LLM推理对齐人类认知过程,在8个心理健康数据集上加权F1平均提升10.4个百分点。
当缺失即证据:评估大语言模型中对完整性敏感的负向推理能力
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 该研究针对大语言模型的完整性敏感负向推理能力,构建CROWN-QA评估基准,发现模型存在过度闭合等问题,提示无法持续解决错误,且部分覆盖不对称性在真实文档中依然存在。
Comments 19 pages, 2 figures, 20 tables
从孤立任务到结构化能力:大语言模型的多层分类法
机构 * Fudan University(复旦大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。
Comments 34 pages, 5 figures, 20 tables
通过知识图谱基础增强小型语言模型推理
机构 * Institute of Informatics and Telecommunications, National Center for Scientific Research “Demokritos(信息与电信研究所,国家科学研究中心“德谟克利特”)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
AI总结 研究利用神经符号智能框架增强小型语言模型推理能力,通过特定工具调用转变模型,在两种场景下评估,发现虽提示提升性能,但受提取瓶颈等限制,还存在“干扰效应”,刻画了挑战并提供迭代验证路线图。
Comments Presented at the 2nd Causal Neuro-symbolic Artificial Intelligence (Causal NeSy): Toward Agentic LLMs with Neuro-Symbolic and Graph Based Reasoning Workshop @ ESWC2026