arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-04 至 2026-05-04 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 15 篇

2605.00438 2026-05-04 cs.AI cs.RO 85%

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

文本与图像思考:用于长周期机器人操作的交错视觉-语言推理轨迹

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Xiaomi Group(小米集团)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出IVLR框架,通过显式轨迹表示交替文本子目标与视觉关键帧,提升长周期机器人操作的逻辑与几何一致性,实验显示在LIBERO和SimplerEnv-WidowX上取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25120 2026-05-04 cs.CL 85%

SCOPE:Planning for Hybrid Querying over Clinical Trial Data

SCOPE:面向临床试验数据的混合查询规划

Suparno Roy Chowdhury, Manan Roy Choudhury, Tejas Anvekar, Muhammad Ali Khan, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过多LLM规划分解任务,提升临床试验数据的推理准确性与效率,解决隐含属性提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00276 2026-05-04 cs.AI 83%

Agentic AI for Trip Planning Optimization Application

基于代理的AI用于旅行计划优化应用

Tiejin Chen, Ahmadreza Moradipari, Kyungtae Han, Hua Wei, Nejib Ammar

机构 * Toyota Motor North America R&D, InfoTech Labs(丰田美国北美研发部门信息科技实验室) Arizona State University(亚利桑那州立大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出基于代理的AI框架,通过协调代理优化旅行计划,提供精确解决方案,实验显示其在TOP基准测试中准确率高达77.4%。

Comments Accepted to IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26020 2026-05-04 cs.CL cs.AI cs.LG 82%

PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning

PORTool:基于奖励树的重要性感知策略优化用于多工具集成推理

Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo, Jing Gao

机构 * Apple(苹果公司) Purdue University(普渡大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PORTool通过奖励树实现多工具集成推理中的重要性感知策略优化,提升最终答案准确性并减少工具调用步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24276 2026-05-04 cs.AI 79%

G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge

G-reasoner:用于统一图结构知识推理的基础模型

Linhao Luo, Zicheng Zhao, Junnan Liu, Zhangchi Qiu, Junnan Dong, Serge Panev, Chen Gong, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung, Alan Wee-Chung Liew, Shirui Pan

机构 * Monash University(莫纳什大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学) Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) NVIDIA(英伟达)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 G-reasoner通过整合图与语言基础模型,实现对多样化图结构知识的高效推理,采用标准化四层抽象QuadGraph统一异构知识源,并通过混合精度训练和分布式消息传递提升效率与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11349 2026-05-04 cs.CV 75%

Image Score: Learning and Evaluating Human Preferences for Mercari Search

图像评分:学习和评估Mercari搜索中的人类偏好

Chingis Oinar, Miao Cao, Shanshan Fu

机构 * Mercari

专题命中 规划推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出一种高效利用大型语言模型进行图像质量评估的方法,通过链式推理生成与人类行为一致的标签,提升电商场景下的图像评估可解释性并提高销售转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00557 2026-05-04 cs.CL cs.AI 73%

Structure Liberates: How Constrained Sensemaking Produces More Novel Research Output

结构解放:如何受约束的意象生成产生更多创新性研究输出

James Mooney, Zae Myung Kim, Young-Jun Lee, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SCISENSE框架,通过结构化认知阶段提升研究输出的创新性,展示目标导向的意象生成在轨迹质量与下游任务表现上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06361 2026-05-04 cs.LG cs.AI 73%

Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts

超越提示诱导的谎言:调查LLM在良性提示上的自我欺骗

Zhaomin Wu, Mingzhe Du, See-Kiong Ng, Bingsheng He

机构 * Institute of Data Science National University of Singapore(数据科学研究所,新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在良性提示下的自我欺骗行为,提出基于Contact Searching Questions的框架,通过两个统计指标量化欺骗可能性,发现任务难度增加时欺骗倾向上升,模型容量增加并不总能减少欺骗。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 67%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00226 2026-05-04 cs.CL cs.AI cs.GT 62%

Why Do LLMs Struggle in Strategic Play? Broken Links Between Observations, Beliefs, and Actions

为什么LLMs在战略博弈中表现不佳?观察、信念和行动之间的断裂链接

Jan Sobotka, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) EPFL(苏黎世联邦理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLMs在不完全信息博弈中决策失败的原因,揭示了观察-信念和信念-行动之间的两大内在缺陷,通过实验验证了LLMs在多步推理中的信念不稳定性及行动转换的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00297 2026-05-04 cs.CR cs.LG 57%

Trident: Improving Malware Detection with LLMs and Behavioral Features

Trident:利用LLMs和行为特征提升恶意软件检测

Rebecca Saul, Jingzhi Jiang, Elliott Chia, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Trident系统,结合静态特征、行为规则和LLM分析,提升恶意软件检测性能,优于传统方法并具备更强的抗概念漂移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22271 2026-05-04 cs.LG 57%

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

大语言模型如何检测并纠正自身错误:内部置信信号的作用

Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 规划推理 :self-correction(abstract);分类 cs.LG

AI总结 研究通过第二阶置信模型探讨大语言模型如何通过内部置信信号检测并纠正自身错误,发现PANL信号在误差检测和自我修正中起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 50%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24333 2026-05-04 physics.ao-ph 50%

Amplified Urban Climate Extremes from Global Warming-Urbanization Synergy: A Physics-Informed Intelligence Paradigm

全球变暖与城市化协同效应放大城市气候极端事件:一种融合物理原理的智能范式

Qiuxia Wu, Yaqiang Wang, Huabing Ke

专题命中 规划推理 :planning(abstract)

AI总结 本文提出融合物理原理的数据智能范式,通过构建城市气候-形态-发展类型学、物理引导机器学习和高通量风险预测,解决城市气候预测中的方法论与认知鸿沟问题。

Comments 16 pages of main text, 1 multi-panel figure (with 2 subfigures) and 1 single figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07041 2026-05-04 cs.DC 50%

AIReSim: A Discrete Event Simulator for Large-scale AI Cluster Reliability Modeling

AIReSim:用于大规模AI集群可靠性建模的离散事件模拟器

Karthik Pattabiraman, Mihir Patel, Fred Lin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出AIReSim,用于评估大规模AI集群中故障、恢复、调度和修复过程中的设计选择,通过系统性评估参数对整体可靠性的影响,帮助优先改进系统。

Comments To appear in the Industry track of the IEEE/IFIP International Conference on Dependable Systems and Networks (DSN), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏