arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2605.06040 2026-05-08 cs.AI cs.CL 90%

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

基于新颖性的树状思维搜索用于大语言模型推理与规划

Leon Hamm, Zlatan Ajanovic

机构 * RWTH Aachen(亚琛工业大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于新颖性的树状思维搜索方法,通过引入新颖性概念优化语言领域推理与规划任务,减少搜索范围和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05963 2026-05-08 cs.AI cs.CL 81%

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25907 2026-05-08 cs.LG cs.AI 81%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01327 2026-05-08 cs.AI cs.LG 81%

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

基于段落对齐的策略优化用于多模态推理

Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li

机构 * Fudan University(复旦大学) Southeast University(东南大学) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAPO方法,通过将推理步骤而非token或完整序列作为策略更新的基本单元,提升多模态推理任务的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05826 2026-05-08 cs.AI 79%

AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

AGPO:面向京东可验证推理和搜索广告相关性的非对称分组策略优化

Yang Xu, Kun Yao, Yiming Deng, Zheng Fang, Kai Ming Ting, Ming Pang

机构 * Nanjing University, Nanjing, China(南京大学) Peking University, Beijing, China(北京大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AGPO方法,通过非对称分组策略优化,抑制错误推理路径,提升模型探索能力,并在数学基准和工业应用中实现高准确率和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 62%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05329 2026-05-08 cs.AI cs.LG 62%

Understanding Annotator Safety Policy with Interpretability

通过可解释性理解标注者安全政策

Alex Oesterling, Donghao Ren, Yannick Assogba, Dominik Moritz, Sunnie S. Y. Kim, Leon Gatys, Fred Hohman

机构 * Harvard University(哈佛大学) Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Annotator Policy Models,通过学习标注行为揭示安全政策差异,解决标注分歧根源问题,提升安全政策设计的透明性和包容性。

Comments 38 pages, 13 figures, ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00742 2026-05-08 cs.AI cs.LG stat.ML 62%

Position: agentic AI orchestration should be Bayes-consistent

位置:代理AI协调应具有贝叶斯一致性

Theodore Papamarkou, Pierre Alquier, Matthias Bauer, Wray Buntine, Andrew Davison, Gintare Karolina Dziugaite, Maurizio Filippone, Andrew Y. K. Foong, Vincent Fortuin, Dimitris Fouskakis, Jes Frellsen, Eyke Hüllermeier, Theofanis Karaletsos, Mohammad Emtiyaz Khan, Nikita Kotelevskii, Salem Lahlou, Yingzhen Li, Fang Liu, Clare Lyle, Thomas Möllenhoff, Konstantina Palla, Maxim Panov, Yusuf Sale, Kajetan Schweighofer, Artem Shelmanov, Siddharth Swaroop, Martin Trapp, Willem Waegeman, Andrew Gordon Wilson, Alexey Zaytsev

机构 * ESSEC Business School(ESSEC商学院) VinUniversity(文大学) Imperial College London(伦敦帝国理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所) Technical University of Denmark(丹麦技术大学) Pyramidal Inc.(Pyramidal公司) University of Notre Dame(诺特大学) Cognizant AI Lab(Cognizant人工智能实验室) University College London(伦敦大学学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Ghent University(根特大学) New York University(纽约大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在代理AI系统中,贝叶斯原则在协调层的应用,而非LLM参数,以提升决策一致性和协作效率。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19043 2026-05-08 cs.AI 61%

Learning Lifted Action Models from Unsupervised Visual Traces

从无监督视觉轨迹中学习提升的动作模型

Kai Xi, Stephen Gould, Sylvie Thiébaux

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院)

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

AI总结 本文提出一种深度学习框架,通过无监督视觉轨迹学习状态预测、动作预测及提升的动作模型,并引入混合整数线性规划防止预测崩溃,提升模型在多领域中的全局一致性。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10729 2026-05-08 cs.AI 61%

Contestable AI needs Computational Argumentation

可争议的AI需要计算论辩

Francesco Leofante, Hamed Ayoobi, Adam Dejl, Gabriel Freedman, Deniz Gorur, Junqi Jiang, Guilherme Paulino-Passos, Antonio Rago, Anna Rapberger, Fabrizio Russo, Xiang Yin, Dekai Zhang, Francesca Toni

机构 * Computational Logic and Argumentation Group, Department of Computing, Imperial College London, UK(计算逻辑与论证组,计算系,伦敦帝国学院,英国)

专题命中 规划推理 :reasoning(abstract,journal_ref);分类 cs.AI

AI总结 本文探讨如何通过计算论辩实现可争议的AI,强调动态可解释性和决策过程的重要性,以支持机器与人类或机器间的互动和争议解决。

Comments Accepted at KR 2024

Journal ref Proceedings of the International Conference on Principles of Knowledge Representation and Reasoning, 21, 888-896. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05702 2026-05-08 cs.AI 57%

Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents

知识图谱路径作为自演化搜索代理的中间监督

Huyu Wu, Jun Liu, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过利用知识图谱路径作为中间监督,改进自演化搜索代理的提问生成和奖励塑造,解决传统方法中提问孤立和奖励信息不足的问题,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05643 2026-05-08 cs.AI cs.IR 57%

Text-Graph Synergy: A Bidirectional Verification and Completion Framework for RAG

文本-图协同:一种双向验证与完成框架用于RAG

Jiarui Zhong, Hong Cai Chen

机构 * School of Automation, Southeast University(自动化学院,东南大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TGS-RAG框架,通过双向机制融合文本与图结构,解决传统RAG中信息孤岛问题,提升多跳推理性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO 57%

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 57%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05499 2026-05-08 cs.AI 57%

FoodCHA: Multi-Modal LLM Agent for Fine-Grained Food Analysis

FoodCHA:多模态LLM代理用于细粒度食物分析

Woojin Lee, Pranav Mekkoth, Ye Tian, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出FoodCHA,一种多模态代理框架,通过分层决策过程提升食物识别的细粒度属性区分能力,实验显示其在类别和子类识别精度上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05475 2026-05-08 cs.AI 57%

Intentionality is a Design Decision: Measuring Functional Intentionality for Accountable AI Systems

意图性是一种设计决策:测量功能意图性以实现可问责的AI系统

Allessia Chiappetta, Robert Mahari

机构 * CodeX, The Stanford Center for Legal Informatics(CodeX,斯坦福法律信息学中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出功能意图性测试(FIT)框架,用于量化AI系统意图性行为,通过五维指标评估系统意图性,以实现对高自主性系统的可控问责。

Journal ref AutomationXP26 Workshop of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI 57%

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08403 2026-05-08 cs.AI 57%

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

Owen-Shapley策略优化:一种为生成搜索语言模型设计的原理性强化学习算法

Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

机构 * Amazon Science(亚马逊科学) Situated Grounding and Natural Language (SIGNAL) Lab, Colorado State University(情境 grounding 和自然语言(SIGNAL)实验室,科罗拉多州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Owen-Shapley策略优化算法,通过基于令牌边际贡献的序列优势再分配,解决生成搜索语言模型中因稀疏序列奖励导致的信用分配问题,实验表明其在Amazon ESCI和H&M Fashion数据集上表现优异。

Comments Added additional experiments, computational analysis and further revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06537 2026-05-08 cs.CV 50%

MedHorizon: Towards Long-context Medical Video Understanding in the Wild

MedHorizon:迈向真实场景下的长上下文医学视频理解

Bodong Du, Bowen Liu, Yang Yu, Xinpeng Ding, Zhiheng Wu, Shuning Wang, Shuo Nie, Naiming Liu, Qifeng Chen, Yangqiu Song, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Baidu Inc.(百度公司) Xidian University(西安电子科技大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 MedHorizon提出一个真实场景下的长上下文医学视频理解基准,通过稀疏证据和多跳临床推理评估,揭示当前系统在完整流程理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26240 2026-05-08 cs.RO cs.MA cs.NE 50%

SwarmCoDe: A Scalable Co-Design Framework for Heterogeneous Robot Swarms via Dynamic Speciation

SwarmCoDe:一种通过动态种群划分实现异构机器人群规模化协同设计的框架

Andrew Wilhelm, Josie Hughes

机构 * Department of Mechanical Engineering, École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校机械工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出SwarmCoDe框架,通过动态种群划分自动扩展机器人群异质性以匹配任务复杂度,实现大规模异构机器人群的协同设计优化。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17419 2026-05-08 cs.CV 50%

EAGLE: Expert-Augmented Attention Guidance for Tuning-Free Industrial Anomaly Detection in Multimodal Large Language Models

EAGLE:专家增强的注意力引导用于多模态大语言模型中的无调优工业异常检测

Xiaomeng Peng, Xilang Huang, Seon Han Choi

机构 * Ewha Womans University(峨山女子大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 EAGLE通过整合专家异常检测器与冻结的MLLM,提出无调优框架,提升多模态大语言模型在工业异常检测中的准确率,且在MVTec-AD和VisA数据集上达到94.4%和88.1%的异常鉴别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏