Thinking Is Not Telling: Information Disclosure in User-Service LLM Agents
思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL
AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。
Comments 26 pages, 5 figures, 7 tables
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL
AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。
Comments 26 pages, 5 figures, 7 tables
地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用
专题命中 推理与问题求解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。
Comments 34 pages, 4 figures, and 10 tables
NeurOWL:基于大语言模型的神经符号框架用于不完整OWL本体推理
机构 * The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究不完整OWL本体的包含关系推理问题,提出NeurOWL框架,通过大语言模型和本体嵌入联合执行验证和溯因,利用形式与文本语义,在多领域真实本体上评估,展现强大稳健性能。
MolSight: 一种用于统一化学图像理解的图感知视觉语言模型
机构 * Renmin University of China(中国人民大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI
AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。
利用大型语言模型的迭代个性化增强行为提示:一项关于电力和热水节约的实地实验
机构 * School of Environment, Tsinghua University(清华大学环境学院) ; Department of Applied Psychology and Human Development, University of Toronto(多伦多大学应用心理学与人类发展系) ; State Key Laboratory of Regional Environment and Sustainability, Tsinghua University(清华大学区域环境与可持续性国家重点实验室) ; Department of Psychology, Beijing Normal University at Zhuhai(北京师范大学珠海校区心理学系) ; Department of Psychology and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 本研究利用大型语言模型实现迭代个性化,通过实地实验发现其在促进节能方面效果显著,且在前两轮干预中表现更优,但热水节约效果较弱且随时间减弱。
视觉语言模型推理中的视觉访问边界
机构 * The University of Tokyo(东京大学)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 研究视觉语言模型推理中CoT提示扩展的内容,通过视觉访问扫描定义VAB,发现CoT不主要靠延长图像令牌访问提效,而是扩展语言侧计算,且CoT收益受感知读出限制,瓶颈在读出非计数。
基于结构化大语言模型代理的可审计上下文感知手足口病预测
机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) ; The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) ; Hengqin Laboratory, Zhuhai, China(横琴实验室) ; The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)
专题命中 推理与问题求解 :LLM(title,abstract);foundation model(abstract);分类 cs.LG
AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。
推理的成本:链式推理诱导视觉-语言模型的过度自信
机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) ; Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG
AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。
木马提示:通过伪造助手消息来破解对话式多模态模型
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。
Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.LG
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026
基于大语言模型生成启发式策略的后继生成器规划
机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究借助大语言模型,从规划任务中生成特定问题启发式函数并集成到搜索算法。该方法在多规划基准测试中性能优异,还能解决传统形式难表达的问题,经评估展现出有效性。
语言模型规划器无法扩展,但形式化器可以吗?
机构 * Drexel University(德雷克斯el大学) ; Allen Institute for AI(人工智能研究院)
专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 研究发现语言模型形式化器在规划问题中表现优于规划器,通过分治技术提升鲁棒性,并引入形式化挑战。
深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量
机构 * University of Virginia(弗吉尼亚大学) ; Google(谷歌)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。
Comments Accepted to ICML 2026
用自然语言提示机器人团队
机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) ; Department of Mechanical and Process Engineering, ETH Zurich(苏黎世联邦理工学院机械与过程工程系)
专题命中 推理与问题求解 :prompting(title,abstract);language model(abstract);分类 cs.LG
AI总结 提出利用语言模型将高层任务分解为子任务,并蒸馏为循环神经网络(RNN)以支持多机器人团队的去中心化实时执行,通过图神经网络控制策略实现协作。
Comments This paper has been accepted for publication at IEEE Robotics and Automation Letters. Please, when citing the paper, refer to the official version
通过大师蒸馏实现语言模型中的接地国际象棋推理
机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Queen’s University(皇后大学) ; Coolwei AI Lab(Coolwei人工智能实验室)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI
AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。
大型音频语言模型中的忠实性研究
机构 * Concordia University(康科迪亚大学) ; Mila - Quebec AI Institute(魁北克人工智能研究院) ; Université Laval(拉瓦尔大学) ; Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,皮兰尼)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 提出系统框架评估大型音频语言模型在推理链忠实性上的表现,定义三个音频忠实性标准,并通过基准测试发现模型推理与音频输入存在脱节。
Comments Accepted to Interspeech 2026
理解大语言模型在抽象摘要中的推理能力
机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。
Comments 27 pages,15 figures
语音大模型推理中的实体绑定失败:诊断与思维链干预
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(1 数据科学学院,香港中文大学(深圳)) ; ByteDance, China(2 字节跳动,中国)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文通过诊断语音大模型在逻辑推理中的实体绑定失败问题,提出实体感知思维链方法,显著提升推理准确率。
Comments INTERSPEECH 2026
CLPO:课程学习与策略优化相结合用于大语言模型推理
机构 * Peking University(北京大学) ; Qwen Applications Business Group, Alibaba Group(通义实验室,阿里巴巴集团) ; Xiamen University(厦门大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出CLPO框架,通过在线策略准确率动态调整问题难度,使课程与策略共同进化,在数学和通用推理基准上显著优于GRPO和DAPO。
基于推理的稀疏数据用户个性化生成
机构 * Vanderbilt University(范德比尔特大学) ; Adobe Research(Adobe研究) ; Yale University(耶鲁大学) ; University of Oregon(俄勒冈大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。
消息传递实现高效推理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出消息传递语言模型(MPLM),通过线程间直接通信和抢占机制,在Sudoku、3-SAT和长上下文问答任务中实现比串行CoT和并行FJ更高效的推理。
Comments COLM 2026
从‘我们’到‘我’:基于演绎推理的理论指导叙事转变
机构 * Syracuse University(苏塞克斯大学) ; Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。
适配器合并重新激活潜在推理痕迹:一种机制分析
机构 * Zjydiary Group(Zjydiary小组)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示适配器合并后推理痕迹的重新激活机制,通过几何方法减少泄漏并提升准确性。
Comments Withdrawn by the authors after identifying an implementation error in adapter coefficient scaling that materially affects the main empirical results and invalidates the current conclusions. A corrected reanalysis is in progress
Loong:通过验证器大规模合成长思维链
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。
不确定时验证:超越黑盒幻觉检测中的自一致性
机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; IBM Research(IBM研究院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。
EmoFSM:一种用于情感支持对话的有限状态机
机构 * Geely AI Lab(吉利人工智能实验室)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。
Comments 15 pages, 4 figures. PAKDD 2026
虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗
机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) ; Microsoft / Vocametrix(微软 / Vocametrix) ; IAI, TCG CREST(IAI,TCG CREST) ; Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) ; Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) ; Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) ; CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) ; GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。
Comments Under Review
推理动态与监控模态依赖性的局限性
机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) ; University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。
Comments Accepted for publication in COLM 2026
轻量语言模型在复杂计算表型任务中易出现推理错误
专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn)
AI总结 研究探讨了轻量语言模型在复杂计算表型任务中的推理错误问题,通过扩展PHEONA框架评估了不同模型的推理准确性,并发现轻量推理模型在提示修改后表现显著提升。
R$^2$PO:用于大语言模型推理的解耦展开与推理策略
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; National University of Singapore(新加坡国家大学)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究指出强化学习方法中训练轨迹与推理响应策略耦合的问题,提出R$^2$PO解耦二者,在训练时多样化展开,保持推理生成不变,实验表明其性能优于基线。