NEST: Nascent Encoded Steganographic Thoughts
NEST:新生编码隐写思想
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
NEST:新生编码隐写思想
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。
在LLM中诊断CFG解释
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) ; AISpeech Co., Ltd., Suzhou, China(上海AI语音有限公司) ; Shanghai Innovation Institution, Shanghai, China(上海创新研究所) ; Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) ; Suzhou Laboratory, Suzhou, China(苏州实验室)
专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI
AI总结 研究LLM在处理新上下文无关文法时能否生成语法正确、行为功能和语义忠实的输出,揭示LLM在语法、行为和语义层面的层次退化问题。
验证何时有效?对LLM作为解决方案验证器的深入探讨
机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。
Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop
从表格数据文档中验证声明的多智能体方法
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出多智能体框架MACE,通过规划器、执行器和验证器三个智能体,实现可解释的表格数据验证,实验显示其在多个数据集上达到SOTA性能,且在参数较少时仍表现优异。
基于DSPy的声明式学习优化大语言模型提示工程
机构 * Vasavi College of Engineering(瓦萨维工程学院) ; Amazon(亚马逊) ; Texas(德克萨斯州)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出基于DSPy的声明式学习方法,通过符号规划、无梯度优化和自动模块重写提升提示优化的可靠性、效率和泛化能力,实验显示事实准确率提升30-45%,幻觉率降低25%。
Comments Best paper Award ,IEEE International Conference on Emerging Smart Computing and Informatics (ESCI) Pune, India. Mar 11-13, 2026
EcoThink: 一种绿色自适应推理框架,用于可持续和可及的智能体
机构 * The University of Sydney(悉尼大学) ; University of Liverpool(利物浦大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出EcoThink框架,通过轻量级路由器动态评估查询复杂度,减少推理能耗40.4%,提升AI可持续性和可及性。
Comments Accepted by WWW 2026
LLM赋能机器人中的安全护栏
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。
神经符号验证在大语言模型指令遵循上的应用
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Science and Technology of China(中国科学技术大学) ; Microsoft Research(微软研究院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 本文提出NSVIF框架,通过神经符号方法验证大语言模型是否遵循指令,实验表明其在指令遵循验证中表现优异。
检测、解释、升级:面向LLM代理的可持续对话破裂管理
机构 * Department of Electrical and Computer Engineering and Ingenuity Labs Research Institute, Queen’s University(电气与计算机工程系和Ingenuity Labs研究研究所,皇后大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种可持续对话破裂管理框架,通过高效检测器和升级架构,在LLM代理中实现资源高效的对话破裂管理,提升对话AI的可靠性和成本效益。
机构 * The School of Computer and Artificial Intelligence of Zhengzhou University(郑州大学计算机与人工智能学院) ; Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能群体系统工程研究中心) ; National Supercomputing Center In Zhengzhou(郑州国家超级计算中心) ; Zhejiang University(浙江大学)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI
Comments 9 pages, 7 figures
机构 * RMIT University(皇家墨尔本理工大学) ; The University of Melbourne(墨尔本大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted to ALA Conference
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) ; Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.AI
机构 * University of Groningen(格罗宁根大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
机构 * Bill Cochran
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI
Comments 9 pages
专题命中 逻辑推理 :chain-of-thought(abstract);CoT(abstract);self-correction(abstract);分类 cs.LG
专题命中 逻辑推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL
Comments Preprint
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
Comments The data and code that support the findings of this study are openly available in Zenodo at https://doi.org/10.5281/zenodo.14171745, reference number 14171745
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments ALTA 2024 (Selected for publication)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL
Comments 23 pages, 5 figures, 4 tables, in NAACL 2024
专题命中 逻辑推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Camera-ready for EACL 2024
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI
Comments Submitted for possible journal publication
专题命中 逻辑推理 :reasoning(abstract,comments);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Large Language Models; Reasoning; Alignment
当提示忽略结构时:基于图的属性推理用于校准视觉语言模型
机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) ; TCS Research(塔塔咨询服务公司研究院)
专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。
并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉
机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)
专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI
AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。
Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026
Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统
机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)
专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG
AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。
Deliberate Evolution: 基于智能体推理的样本高效符号回归与LLM
机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) ; Beijing National Research Center for Information Science(北京信息科学国家研究中心) ; Technology (BNRist), Department of Automation, Tsinghua University, Beijing, P.R. China(技术(BNRist),自动化系,清华大学,北京,中华人民共和国) ; Lenovo Research(联想研究)
专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.LG
AI总结 提出Deliberate Evolution框架,通过解耦符号生成与搜索控制,利用自适应算子、分析工具和反思记忆,在仅用40%样本预算下超越现有LLM符号回归方法。
Comments ICML 2026