Evidence-Informed LLM Beliefs for Continual Scientific Discovery
基于证据的LLM信念用于持续科学发现
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对AutoDiscovery将惊奇视为静态量而人类惊奇是非平稳的问题,提出证据信息化的LLM信念,通过基于嵌入的检索增强生成更新先验,并修改搜索过程以避免虚假奖励,平均非平稳惊奇提高30.62%。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于证据的LLM信念用于持续科学发现
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对AutoDiscovery将惊奇视为静态量而人类惊奇是非平稳的问题,提出证据信息化的LLM信念,通过基于嵌入的检索增强生成更新先验,并修改搜索过程以避免虚假奖励,平均非平稳惊奇提高30.62%。
模糊性下的不确定性感知生成与决策
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(普遍知识处理实验室(UKP实验室),计算机科学系,达姆施塔特技术大学) ; National Research Center for Applied Cybersecurity ATHENE, Germany(应用网络安全国家研究中心ATHENE,德国)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 基于贝叶斯决策理论和风险规避决策,提出不确定性感知算法用于辅导和同行评审任务,通过共形预测提供策略和分数的保证,实验表明贝叶斯方法优于风险规避规则。
Comments Code available under https://github.com/UKPLab/arXiv2026-uncertainty-aware
LLM中的报告置信度追踪承诺而非正确性
机构 * Google DeepMind(谷歌DeepMind)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过两阶段弃权范式,发现LLM的言语置信度预测弃权决策远优于预测答案正确性,而令牌对数概率则相反,表明言语置信度是内部承诺准备状态的行为输出。
面向SAR数据生成的任务驱动与质量保障智能体框架
机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) ; Science and Technology on Electromagnetic Scattering Laboratory, Beijing Institute of Environmental Features(北京环境特征研究院电磁散射实验室)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出SAGA框架,通过模式约束规划与多维度评估器,实现面向任务的SAR数据增强,提升可靠性、可复现性及下游任务效用。
具有可变预填和解码长度的LLM服务优化
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) ; Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。
具有混合情景-程序记忆的经验演化多轮工具使用智能体
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出混合情景-程序记忆策略,通过动态重用部分重叠的成功经验,使多轮工具使用策略实现经验驱动的自我演化,提升多轮任务中的推理与执行效率。
Journal ref ICML 2026
预测影响,缺失分布:评估LLMs作为运营管理中的人类行为模拟器
机构 * Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)
专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文评估LLMs在运营管理中模拟人类行为的能力,通过九个实验发现LLMs能复制假设效应,但分布不匹配问题显著,轻量策略可缓解此问题。
LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent(腾讯) ; Wuhan University(武汉大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。
AlgoSkill: 通过调度类人技能学习设计算法
机构 * Emory University(埃默里大学) ; The University of Tokyo(东京大学) ; LocationMind
专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI
AI总结 提出AlgoSkill框架,将算法设计建模为基于类型化技能库的序列决策,通过MCTS和验证反馈调度技能,在竞赛编程和组合优化任务上优于直接生成和自优化方法。
Comments Under Review
KbSD: 面向智能体搜索中行为校准的知识边界感知自蒸馏
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 针对智能体搜索中知识边界校准的奖励稀疏问题,提出KbSD框架,通过密集令牌级监督、稀疏结果奖励和象限自适应优化,利用提示增强教师模型生成校准推理演示,显著提升任务准确率并减少幻觉。
DEEPMED Search: 一个具有内省验证功能的开源医学深度研究智能体平台
机构 * School of Computer Science and Software Engineering, Shanghai University(上海大学计算机科学与软件工程学院) ; Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出一个开源智能体平台DEEPMED Search,通过源自适应路由和内省验证模块,自动分解复杂医学查询并生成结构化报告,解决异构医疗数据检索中的推理漂移问题。
Comments 5 pages, 2 figures, 2 tables. Accepted to IJCAI-ECAI 2026 Demo Track. Project website: https://www.deepmedsearch.cloud. Demo video: https://youtu.be/4U4aok8yLpk
面向具有规划器反馈的大型语言模型的安全可靠PDDL形式化
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Industry-education Integration, University of Chinese Academy of Sciences(中国科学院大学产教融合学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出NL-PDDL-Bench基准和规划器在环框架,通过验证器诊断和偏好优化提升LLM生成PDDL规范的可执行性与可靠性。
预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; General Motors (GM)(通用汽车(GM))
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。
STEMGym: 自主电子显微镜中剂量预算下的序列决策基准测试
机构 * Dept. of Electrical & Computer Eng.(电气与计算机工程系) ; Texas A&M Univ.(德克萨斯A&M大学) ; Dept. of Prosthetics & Orthotics(假肢与矫形学系) ; College of Science & Eng.(科学与工程学院) ; Ankara Univ.(安卡拉大学) ; Hamad Bin Khalifa Univ. and Texas A&M Univ. at Qatar(哈马德·本·卡西姆大学和德克萨斯A&M大学(卡塔尔))
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 通过15个物理模拟的STEM环境基准,发现感知管道(CNN分析师)是剂量效率的主要决定因素,而非导航策略,为自主电子显微镜的机器学习投入方向提供新视角。
通过运行时监控防止多智能体AI中的错误传播
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究多智能体AI系统中推理交换与答案修订的可靠性,提出运行时监控框架,通过数值实验评估准确性提升与错误传播条件。
Agentic Abstention: 智能体知道何时停止而非行动吗?
机构 * University of Leeds(利兹大学) ; Southwest Jiaotong University(西南交通大学) ; University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 研究LLM智能体在不确定环境下何时应停止行动的问题,提出Agentic Abstention概念,通过实验分析不同模型和框架的弃权行为,并引入CONVOLVE方法提升及时弃权率。
通过反事实视觉基础不确定性检测LVLM中的临床幻觉
机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; National Institute of Healthcare Data Science at Nanjing University(南京大学医疗数据科学国家研究院) ; School of Biomedical Engineering, Nanjing University(南京大学生物医学工程学院)
专题命中 规划推理 :verifier(abstract);分类 cs.CL
AI总结 提出一种基于反事实视觉基础不确定性的框架,通过提取实体并对比正反事实定位结果计算不确定性分数,无需修改模型即可检测LVLM在临床图像中的幻觉。
Comments 10 pages, 4 figures
meta-pipe:面向端到端自动化系统评价与元分析的LLM智能体流水线
机构 * MD, PhD(医学博士,哲学博士)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出meta-pipe,一个集成文献检索、筛选、数据提取、统计分析、手稿生成和质量保证的10阶段模块化LLM智能体流水线,在关键决策点强制人工监督,并具备自动手稿生成、半自动GRADE评估、过度声明检测和双范式网络元分析等独特能力。
Comments 13 pages, 1 figure, 2 tables
商业世界模型
机构 * AI Engineering, USA TODAY Co., Inc.(AI工程,USA TODAY公司) ; School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学宾夕法尼亚州立大学) ; Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学复杂系统中心) ; Waseda Innovation Lab, Waseda University, Tokyo, Japan(早稻田大学创新实验室)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出商业世界模型(BWM)架构,将世界模型思想应用于商业环境,通过编码状态、动态、约束和目标,支持自主决策与规划。
MechRL:强化学习智能体进行电路发现以实现机械可解释性
机构 * The University of Southern Mississippi(美国密西西比州立大学)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 提出将电路发现转化为强化学习问题,使用PPO策略在GPT-2 small的144个注意力头上进行零消融和对比奖励,成功在训练任务和未见任务上恢复标准电路,验证了强化学习在机械可解释性中的有效性。
探索LLM代理在科学可视化中的交互范式
机构 * Univ. Notre Dame(诺特难大学) ; LLNL(劳伦斯利弗莫尔国家实验室)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文研究不同类型的LLM代理在科学可视化任务中的表现,通过评估八种代表性代理在15个基准任务中的可视化质量、效率、鲁棒性和计算成本,发现通用编程代理任务成功率最高但计算成本高,领域专用代理更高效稳定但灵活性差,计算机使用代理在单步任务表现良好但多步流程受限。
蒙特卡罗查询搜索:人工智能代理的主动能力评估
机构 * Arizona State University(亚利桑那州立大学) ; Indian Institute of Technology Madras(印度理工学院马德拉斯分校)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出蒙特卡罗查询合成方法,用于学习黑盒AI系统的符号随机能力模型,通过主动学习策略加速能力评估,实验表明该方法在多个系统中更高效。
AERIS: 通过编排语言模型群在运行时实现空中边缘角色驱动智能
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 规划推理 :planning(abstract)
AI总结 提出AERIS框架,通过编排专用小语言模型和轻量感知控制模块,在边缘实现空中平台的长时指令分解与实时闭环运行。
Comments 10 pages, 11 figures. Preprint version of the submitted manuscript
ECHO:基于回合信度的认知自适应语言智能体学习
专题命中 规划推理 :reasoning(abstract)
AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。
CORE Planner:面向未知环境中机器人导航的上下文记忆强化学习规划器
专题命中 规划推理 :planning(abstract)
AI总结 提出CORE规划器,结合稀疏可见图与Transformer网络,实现未知环境下的高效导航,并通过上下文记忆机制避免局部最优,支持零样本仿真到现实迁移。
Comments Accepted for publication in IEEE Transactions on Industrial Electronics
将神经符号程序蒸馏到3D多模态大语言模型中
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。
Comments To appear in ICML 2026
EVLA:一种用于物理接地驾驶推理与控制的电感知多模态助手
机构 * College of Computer Science and Technology(计算机科学与技术学院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出EVLA框架,融合视觉、文本与实时电动动力总成状态,通过统一共状态编码器和电感知结构化推理链,生成上下文感知且能量最优的驾驶决策,在驾驶问答基准上显著优于基线模型。
Comments 17 pages
面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。
具有双LLM模块的分层提示用于机器人任务和运动规划
机构 * IBM, Krakow, Poland(IBM公司,波兰克拉科夫) ; Jagiellonian University, Krakow, Poland(雅盖隆大学,波兰克拉科夫) ; AGH University, Krakow, Poland(AGH大学,波兰克拉科夫)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)
AI总结 本文提出一个分层语言驱动框架,通过双LLM模块提升服务和协助场景中人机交互的自然性和直观性,结合目标检测与运动执行实现高成功率的任务规划。
Journal ref Proc. IEEE International Conference on Advanced Robotics and its Social Impacts (ARSO), 2026, pp. 245-250
ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器
机构 * Northeastern University(东北大学) ; EmbodyX Inc.(EmbodyX公司) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。
Comments Accepted by ECCV 2026