arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2608.04459 2026-08-06 cs.SE 新提交 85%

AdaptAgent: A Multi-agent, Domain-Guided Reasoning Framework for Code Adaptation

AdaptAgent:一种用于代码适配的多智能体、领域引导推理框架

Xiaokai Rong, Hridya Dhulipala, Aashish Yadavally, Tien N. Nguyen

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);verifier(abstract)

AI总结 本研究提出AdaptAgent框架,通过分工的多智能体实现代码适配,在真实数据集上的语义正确性优于强基线,各智能体对适配效果均有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21084 2026-08-06 cs.CL cs.AI 版本更新 81%

MediRec: Enhancing Chinese Medication Recommendation with Explainable Clinical Reasoning

代谢性疾病出院药物推荐中的大型语言模型应用

Juntao Li, Haobin Yuan, Ling Luo, Yuanyuan Sun, Jian Wang, Hongfei Lin

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在中文代谢性疾病出院药物推荐中的应用,评估了多种LLM家族的性能,发现监督微调虽提升效果,但仍有改进空间。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19775 2026-08-06 cs.DC cs.PF 80%

Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles

理解大语言模型的推理扩展:瓶颈、权衡与性能原则

Moiz Arif, Avinash Maurya, Sudharshan Vazhkudai, Bogdan Nicolae

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究了大语言模型推理扩展中的瓶颈、权衡和性能原则,通过在GPU集群上评估从8B到671B参数的模型,系统探讨了数据并行、张量并行和流水线并行之间的相互作用,揭示了推理工作负载中数据并行的容量陷阱以及张量并行和稀疏MoE模型的性能限制。

Comments ISCA'26: The 53rd International Symposium on Computer Architecture, Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05107 2026-08-06 cs.AI cs.MA cs.SE 新提交 79%

CoPlan: A Trustworthy Co-Intelligence Interface for Care Planning through Role-Based Contestable Argument Graphs

CoPlan:一种基于角色可争议论证图的可信协同智能照护规划界面

Hung Truong Thanh Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会) Thompson Rivers University(汤普森河大学) ISB Corporation(ISB公司) University of Northern British Columbia(北英属哥伦比亚大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究提出CoPlan界面,通过多智能体工作流结合协同智能与可争议性,实现人机协同照护规划,保留人类自主性与临床问责制,已在就地养老场景中验证其有效性。

Comments Accepted at the 2026 International Conference on Next Generation AI Systems (NGEN-AI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 79%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04265 2026-08-06 cs.MA cs.AI cs.SY eess.SY 新提交 79%

Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems

网络物理系统中大语言模型智能体规划策略的战略评估

J. de Curtò, I. de Zarzà

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究针对网络物理系统,构建含40个异构产消者的智能电网基准,评估4种LLM规划架构,发现架构影响结果,应用截止可行性可显著降低遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04309 2026-08-06 cs.RO cs.SY eess.SY 新提交 78%

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

面向隐藏目标下零样本人机协作的结构化大语言模型推理

Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

机构 * Michigan State University(密歇根州立大学) UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 规划推理 :reasoning(title);planning(abstract)

AI总结 该研究针对隐藏目标下的零样本人机协作,提出结构化LLM架构,通过Dec-POMDP分解决策,实验显示其交互步骤更少、人类信任度更高,优于无ToM推理的变体和离线训练的多智能体强化学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12735 2026-08-06 cs.CV 版本更新 78%

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

AffectAgent:协同多智能体推理用于检索增强的多模态情感识别

Zeheng Wang, Zitong Yu, Yijie Zhu, Bo Zhao, Haochen Liang, Taorui Wang, Wei Xia, Jiayu Zhang, Zhishu Liu, Hui Ma, Fei Ma, Qi Tian

机构 * Great Bay University(大湾大学) Guangming Laboratory(光明实验室)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 76%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 规划推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28566 2026-08-06 cs.AI cs.LG 版本更新 73%

Tree of Thoughts as a Classical Heuristic Search Problem: Formal Foundations and Design Patterns

思维树作为经典启发式搜索问题:形式化基础与设计模式

Guni Sharon

机构 * Guni Sharon

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过经典启发式搜索术语统一分类法,将基于LLM的推理映射到搜索组件,并识别出系统搜索和前瞻性策略两种设计模式。

Comments Extended version of the SoCS 2026 paper. Includes appendices omitted from the proceedings version

Journal ref Proceedings of the Nineteenth International Symposium on Combinatorial Search (SoCS 2026), AAAI Press, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 70%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03589 2026-08-06 cs.DB cs.LG 版本更新 70%

stratum: A System Infrastructure for Massive Agent-Centric ML Workloads

stratum: 一种支持大规模基于代理的机器学习工作负载的系统基础设施

Arnab Phani, Elias Strauss, Sebastian Schelter

机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 stratum是一种支持大规模基于代理的机器学习工作负载的系统基础设施,通过解耦流水线执行与规划推理,提升大规模代理流水线搜索效率。

Comments Accepted at PVLDB 2026 (Vol. 19, No. 11). Artifact available on GitHub

Journal ref Proc. VLDB Endow. 19(11): 3799-3806, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04170 2026-08-06 cs.CL cs.AI 新提交 62%

Visualizing Graph-to-Answer Mechanism Recovery in Materials-Science Hypothesis Generation

材料科学假说生成中从图到答案的机制恢复可视化

Shashwat Sourav, Subhadeep Pal, Markus J. Buehler, Sanjay Das, Fiona Y. Wang, Dominik Soos, Tirthankar Ghosal

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Oak Ridge National Laboratory(橡树岭国家实验室) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) UniverseTBD Massachusetts Institute of Technology(麻省理工学院) Old Dominion University(奥多明尼昂大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对适配的 Qwen3-8B 模型 Graph-PRefLexOR-8B,构建可视化诊断工作流以追踪材料科学假说生成的图到答案机制,发现机制恢复集中于后期合成及答案起始层,可助力相关人员识别假说的机制支持变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04037 2026-08-06 cs.CL cs.AI cs.GR cs.HC 新提交 62%

Reconstructing Persistent Worlds from Narratives for Narrative-Grounded Interactive Experiences

从叙事中重建持久世界以实现基于叙事的交互体验

Yi-Chun Chen

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出从叙事中重建显式持久世界的核心方法,开发原型实现可游玩环境,为AI辅助游戏创作等提供语义基础,验证了其可行性与应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27882 2026-08-06 cs.CL cs.AI 版本更新 62%

VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild

VibeSearchBench:野外长期主动搜索的基准测试

Xiaohongshu Inc

机构 * Xiaohongshu Dots Studio & Unipat AI(小红书 dots 飞 studios 与 Unipat AI)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有搜索基准中查询过于明确、单轮交互和固定模式评估导致用户体验与评估结果差距的问题,提出VibeSearch范式并构建VibeSearchBench基准,通过渐进式用户模拟和图匹配评估框架测试前沿模型,发现所有模型在长期上下文推理、主动意图激发和结构化知识构建方面仍存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04384 2026-08-06 cs.AI 新提交 57%

Improving Auto-Design of Neural PDE Solvers with a Domain-Specific Language

用领域特定语言改进神经偏微分方程求解器的自动设计

Shengxin Kong, Liwen Xu, Jingwen Fu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出ADSL-PDE领域特定语言,通过结构化搜索空间提升神经PDE求解器自动设计的搜索效率与优化稳定性,前十次迭代性能提升超52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04232 2026-08-06 cs.AI 新提交 57%

Interoceptive Attention as Dynamic Homeostatic Prioritization in a Foraging Agent

觅食智能体中作为动态稳态优先级的内感受注意力

St John Grimbly, Nicolas Kuske, Evert A. Boonstra, Bruce A. Bassett, Charel van Hoof, Rowan Hodson, Benjamin Rosman, Ryan Smith, Mark Solms, Jonathan P. Shock

机构 * Univ. of Cape Town(开普敦大学) Neuroscience Institute, Univ. of Cape Town(开普敦大学神经科学研究所) Laureate Institute for Brain Research(劳雷尔脑研究所) University of the Witwatersrand(金山大学) INRS(国家科学研究中心(加拿大)) Delft University of Technology(代尔夫特理工大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对有限感知带宽下的需求分配问题,构建主动推理觅食智能体,提出动态稳态优先级的内感受注意力机制,在AffectWorld实验中显著提升存活率,且收益同时作用于感知与规划,学习速度也更快。

Comments Accepted at SAB 2026 (From Animals to Animats 18), forthcoming in the Springer Lecture Notes in Artificial Intelligence proceedings. 20 pages, 11 numbered figures (12 graphics), 5 tables. The 12-page camera-ready paper is reproduced without alteration and followed by supplementary analyses that were not part of the proceedings paper. Code: https://github.com/sgrimbly/attention-aif-sab2026-snapshot

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04148 2026-08-06 cs.SE cs.AI cs.HC 新提交 57%

AgentForge: An Immersive Role-Playing Platform for Learning Agentic Software Engineering

AgentForge:用于学习智能体软件工程的沉浸式角色扮演平台

Zihan Fang, Yueke Zhang, Yu Huang

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出沉浸式角色扮演平台AgentForge,让新手在多智能体代码修复工作流中担任软件工程角色,经37名新手开发者测试,该平台可提升新手的软件工程技能与智能体协作理解。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03545 2026-08-06 cs.CL 版本更新 57%

Hi-TTRL: Regulating Consensus with Hints for Test-Time Reinforcement Learning

Hi-TTRL:利用提示调控测试时强化学习的共识

Kunbin Xu, Xingzuo Li, Xuefeng Bai, Kehai Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对测试时强化学习(TTRL)中共识强度不当导致的问题,提出 Hi-TTRL 框架,通过 MCMC 提示采样器调控共识强度,提升了 TTRL 的性能。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23299 2026-08-06 cs.LG 版本更新 57%

GRIMIP: A General Framework for Instance-Specific Configuration of MIP Solvers Using LLMs

GRIMIP:一种使用LLM进行MIP求解器实例特定配置的通用框架

Yidong Luo, Xuemin Chen, Chenguang Wang, Fangzhou Zhu, Tao Zhong, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 提出GRIMIP框架,结合大语言模型的语义推理与贝叶斯优化的高效搜索,为混合整数规划求解器配置超参数,在MIPLIB等基准上实现超过40%的原始对偶积分减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06708 2026-08-06 cs.CL 版本更新 57%

Signal-Driven Observation for Long-Horizon Web Agents

信号驱动观测:面向长程任务的Web智能体

Shubham Gaur, Ian Lane

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出信号驱动观测(SDO)方法,通过专用子调用读取完整DOM但仅返回任务相关元素,并由轻量信号检测器触发重新调用,解决长程Web智能体中上下文退化问题。

Comments 10 pages, 1 figure. Accepted to the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04676 2026-08-06 cs.CV 新提交 50%

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

SurgNarrator:面向手术视频理解的生成式检索框架

Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang

机构 * University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) University of Strasbourg(斯特拉斯堡大学) IHU Strasbourg(斯特拉斯堡大学医院研究所) Imperial College London(帝国理工学院)

专题命中 规划推理 :reasoning(abstract)

AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 50%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 规划推理 :planning(abstract)

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04634 2026-08-06 cs.MA 新提交 50%

HELENA:Hierarchical Sparse Coordination over a Union of Complementary Topologies for MAS

HELENA:面向多智能体系统的互补拓扑联合上的分层稀疏协调框架

Zhifang Mao, Linyao Zheng, Xuhang Shi, Xiuquan Hou

专题命中 规划推理 :reasoning(abstract)

AI总结 HELENA 是一种 MAS 框架,通过互补拓扑联合与分层稀疏协调抑制冗余噪声,在八个基准测试上实现最优结果,平均提升 3.47%,MMLU-Pro 最高提升 10.34%,难基准提升更显著且附加成本合理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04416 2026-08-06 cs.HC 新提交 50%

Preference-Driven Online Adaptation for Personalized Interaction Initiation in Proactive AI Assistants

主动式AI助手中个性化交互发起的偏好驱动在线适应

Yufeng Wang, Wei Zhang, Zhiquan Wen, Jinwu Hu, Linhui Xiao, Tianlu Pan, Qingfang Zheng, Mingkui Tan

专题命中 规划推理 :reasoning(abstract)

AI总结 本文针对主动式AI助手个性化交互时机难确定的问题,提出EOPA方法,在ProPerSim基准上较最强基线提升F1分数19.80个百分点,降低推理延迟与平均每日适应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09207 2026-08-06 cs.DC 版本更新 50%

Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training

用于解耦和异步强化学习后训练的双向资源调度

Zhiqiang Tan, Maoxin Wang, Sijie Wang, Yiming Yin, Qiang Wang, Xiaowen Chu, Shaohuai Shi

专题命中 规划推理 :reasoning(abstract)

AI总结 本文针对不同RL设置和工作负载下资源常空闲的问题,提出BiDiRL架构,通过开发热切换运行时、基于时间性能建模的规划器及双向调度器,减少资源空闲,在32-GPU测试平台上显著提高RL训练吞吐量。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏