arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-21 至 2026-07-21 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 22 篇

2607.17047 2026-07-21 cs.LG cs.AI cs.LO 新提交 81%

Solver-Hard Is Not Model-Hard: A Hardness-Controlled Diagnostic for LLM Constraint Reasoning

求解器困难并非模型困难:一种用于大语言模型约束推理的硬度控制诊断方法

Lucky Verma

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型约束推理,在接近匹配子句密度时测试实例级转移,比较不同公式和锚点,发现求解器与模型硬度差异,以及模型对证明保留重新标记敏感,还研究了完成令牌花费与代理的关系。

Comments 13 pages, 2 figures, 5 tables. Code and aggregate reproduction data: https://github.com/lucky-verma/solver-hard-is-not-model-hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17240 2026-07-21 cs.AI 新提交 79%

Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost

受限路径推理:衡量已提交阶段何时值得付出成本

Honglin Li

机构 * ShanghaiTech University(上海科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究LLM推理管道中已提交阶段何时值得付出成本,提出受限路径推理(CPR)方法,通过源感知路径假设与阶段级核算结合,在多个实验设置下验证,可测量相关指标,为LLM推理提供新的衡量与验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23509 2026-07-21 cs.RO 版本更新 75%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16738 2026-07-21 cs.AI 新提交 74%

Supporting Autonomous Process Execution within a Multi-Perspective Constraint Frame via Numeric Planning

通过数值规划在多视角约束框架内支持自主流程执行

Paul Wittlinger, Giacomo Acitelli, Anti Alman, Fabrizio Maria Maggi, Andrea Marrella

专题命中 逻辑推理 :planning(title);分类 cs.AI

AI总结 研究在人工智能增强业务流程管理系统中,通过引入新工具,用多视角约束增强流程框架,为部分流程执行推荐最优延续,经实证评估该技术具可扩展性和有效性,能支持自主及约束感知决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15783 2026-07-21 cs.AI cs.LG 版本更新 73%

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection

迈向人工智能流行病学:一种用于前瞻性风险检测的测量标准化框架

Kit Tempest-Walters

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种测量标准化框架,用于在没有访问模型内部信息的情况下,将专家-人工智能交互压缩为结构化、可比较的领域,以进行前瞻性风险检测。该框架旨在定义其范围,包括语义和统计层面,并指定未来工作的实证测试协议。

Comments 38 pages, 3 figures, 4 tables. Accepted for publication in AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17849 2026-07-21 cs.HC cs.CL cs.CV 新提交 70%

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

AlphaOracle:通过受人工工作流程启发的深度学习进行甲骨文破译

Yuliang Liu, Haisu Guan, Pengjie Wang, Xinyu Wang, Jinpeng Wan, Kaile Zhang, Handong Zheng, Xingchen Liu, Zhebin Kuang, Huanxin Yang, Bang Li, Yongge Liu, Lianwen Jin, Xiang Bai

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Electronic Information Engineering, South China University of Technology(华南理工大学电子信息学院) Key Laboratory of Oracle Bone Inscriptions Information Processing, Anyang Normal University(安阳师范学院甲骨文信息处理重点实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 针对约3000个未破译甲骨文字符的问题,提出受人工工作流程启发的AlphaOracle框架,经多阶段管道进行甲骨文破译,与专家解读高度一致,还能减少分析时间,为甲骨文及其他未破译文字研究提供参考。

Comments Accepted by The Innovation 2026

Journal ref The Innovation 7(11), 101462, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06393 2026-07-21 cs.AI cs.CL cs.LG cs.LO 67%

Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors

冲突感知融合:通过结构化认知先验缓解大语言模型中的逻辑惯性

Qiming Bao, Xiaoxuan Fu, Michael Witbrock

机构 * Xtracta & Strong AI Lab, University of Auckland(Xtracta与强人工智能实验室,奥克兰大学) School of Humanities, China University of Political Science and Law(人文学院,中国政法大学) Strong AI Lab, University of Auckland(强人工智能实验室,奥克兰大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在规则系统结构扰动下表现脆弱的问题,提出冲突感知融合训练流程,通过验证-演绎结构先验和符号推理奖励,在多个压力测试中实现鲁棒性饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12281 2026-07-21 cs.CV 版本更新 67%

Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection

认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测

Jiahao Zhao

机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16266 2026-07-21 cs.LO cs.AI cs.LG cs.MA cs.PL 新提交 62%

Composable Verification Pipelines for Multi-Agent Systems

多智能体系统的可组合验证管道

Julian Alfredo Mendez, Andreas Brännström

机构 * Ume University, Sweden(乌梅大学,瑞典)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体系统的验证问题,基于Tiles和Soda构建模块化框架,通过可执行验证管道操作动作语言语义,以类型化函数管道表示验证过程,含可执行规范层,有开源实现及示例说明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16262 2026-07-21 cs.LG cs.AI 新提交 62%

Autonomous mechanistic discovery of colorectal cancer vulnerabilities via multi-scale AI swarms

通过多尺度人工智能群体自主进行结直肠癌脆弱性的机制发现

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang, Simon McDade

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决自动化科学发现中语言模型与生物物理的认知差距。通过多尺度自主发现引擎Octopus,结合大语言模型群体和算法物理引擎,针对结直肠癌转录组进行无监督扫描,发现IGF2是5-氟尿嘧啶耐药脆弱性,建立了可验证的生物医学发现范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16212 2026-07-21 cs.AI 新提交 57%

Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers

符号增强弥补神经事实核查器中规范等价盲点

Genpei Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 研究大语言模型总结科学文本时数字和单位幻觉问题,提出将错误检测重定义为类型验证,引入分类法和基准。用符号增强训练框架,提升规范等价鲁棒性,提高准确率,还明确了符号特征及银标签在特定情况下的作用,确定训练时增强是关键集成点。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13073 2026-07-21 cs.AI 版本更新 57%

Probabilistic Extension of Neuro-Symbolic AGI Robots based on Belnap's Typed Intensional FOL

基于贝尔纳普类型内涵一阶逻辑的神经符号通用人工智能机器人的概率扩展

Zoran Majkic

机构 * ISRST(未知(可能是某个特定名称的机构))

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究基于$IFOL_B$的神经符号人工智能,通过概率计算扩展其认知能力,引入全局和局部对称变换,利用神经网络基于香农最大信息熵计算概率密度函数$KI$,实现对未知句子概率计算及相关实时决策。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10645 2026-07-21 cs.CL cs.MA cs.SI 版本更新 57%

MafiaScope: Non-Invasive, Time-Resolved Belief Probing for LLM Agents in Social Deduction Games

MafiaScope:社交推理游戏中对大语言模型智能体的非侵入性、时间分辨信念探测

Ilia Karpov

机构 * HSE University(俄罗斯高等经济研究大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究社交推理游戏中LLM智能体信念探测问题,提出MafiaScope测试平台,通过结构化问题让智能体私下作答并自动评分,可视化呈现信念轨迹,以DeepSeek为例进行研究,得出相关校准误差等结果并开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17053 2026-07-21 cs.SE cs.AR 新提交 50%

MechMem-RTL: Reusing Verified Mechanism Memories for LLM-Based RTL Repair

MechMem-RTL:用于基于大语言模型的RTL修复的可复用验证机制存储器

Mingyu Cheng, Junjie Gao, Jinhua Cui, Kuncai Zhong

专题命中 逻辑推理 :verifier(abstract)

AI总结 研究针对大语言模型修复RTL设计时,利用任务文本相似性易误导的问题,提出MechMem-RTL框架,复用验证器确认的修复记录,通过严格匹配触发证据来注入记录,实验表明该框架在多个任务上修复效果优于标准反馈修复和任务相似性RAG。

Comments 7 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17174 2026-07-21 quant-ph math.LO 新提交 50%

QBism Logic

QB主义逻辑

Kenji Tokuo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究基于QB主义对量子理论的解释进行逻辑形式化,通过引入相关语言和证明定理,将无动态算子片段转化为一阶公式,归约有效性,还表明有限维量子理论可通过SIC等实现框架并满足相关条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22478 2026-07-21 cs.CV 版本更新 50%

DeliCIR: Memory-Guided Test-Time Deliberation via Multi-Agent Collaboration for Composed Image Retrieval

DeliCIR: 用于组合图像检索的深思型测试时进化分层多智能体

Xingtian Pei, Yukun Song, Changwei Wang, Shunpeng Chen, Rongtao Xu, Shengpeng Xu, Shibiao Xu

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算机网络与信息安全部重点实验室,教育部,山东计算机科学中心(济南国家超算中心),青岛科技大学(山东科学院)) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) School of Artificial Intelligence, Mohamed bin Zayed University(Mohamed bin Zayed大学人工智能学院)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出一种分层感知-深思框架PDF,通过分层多智能体架构、意图路由管理器、决策管理器及锦标赛式测试时缩放策略,实现经验自进化与测试时缩放定律在组合图像检索中的首次应用,在三个基准数据集上达到最优性能。

Comments 10 pages, 3 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02690 2026-07-21 cs.IR 版本更新 50%

AnnoRetrieve: Efficient Structured Retrieval for Unstructured Document Analysis

AnnoRetrieve:面向无结构文档分析的高效结构化检索

Teng Lin, Yuyu Luo, Nan Tang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出AnnoRetrieve,通过结构化注释替代向量嵌入,实现高效精准的语义检索,降低LLM调用频率和成本,提升文档分析的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 46 篇

2509.23071 2026-07-21 cs.CL cs.AI 版本更新 84%

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成

Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) McGill University, Montréal, Quebéc, Canada(麦吉尔大学) Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 83%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 规划推理 :self-correction(title);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16421 2026-07-21 cs.AI 新提交 83%

When to Plan: Learning to Select Between Reactive Control and Deliberative Planning

何时进行规划:学习在反应式控制和审慎规划之间进行选择

Adam Labiosa, Josiah P. Hanna

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究智能体如何学习元推理能力,引入基于反应式策略不确定性得分分配计算的强化学习方法训练元推理策略,通过实证研究表明该设计能让元推理策略学会何时采用反应式策略,何时进行决策时规划,且能随反应式策略改进转向完全反应式控制。

Comments RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16199 2026-07-21 cs.AI 新提交 83%

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统

Yuhang Wang

机构 * Fudan University(复旦大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22169 2026-07-21 cs.RO 版本更新 82%

VersualRL: Closed-Loop Verbal Reinforcement Learning with Visual Execution Feedback for Task-Level Robot Planning

闭环言语强化学习用于任务级机器人规划

Dmitrii Plotnikov, Iaroslav Kolomiets, Dmitrii Maliukov, Dmitrij Kosenkov, Daniia Zinniatullina, Artem Trandofilov, Georgii Gazaryan, Kirill Bogatikov, Timofei Kozlov, Mikhail Konenkov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出闭环言语强化学习框架,通过大语言模型与视觉语言模型交互,在符号规划层迭代优化行为树,实现可解释的任务级规划与执行不确定性下的自适应。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17266 2026-07-21 cs.CL cs.AI 新提交 81%

Debate-on-Graph: Reliable and Adaptive Reasoning of Large Language Model on Uncertain Knowledge Graph

图上辩论:大语言模型在不确定知识图谱上的可靠且自适应推理

Peiji Yu, Xin Chen, Tianxing Wu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在不确定知识图谱上问答时的问题,提出Debate-on-Graph框架,设计启发式搜索算法提取子图并引入多智能体辩论机制,经实验验证该框架能实现可靠且自适应推理,性能优于现有方法。

Comments 18 pages, Accepted by ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17710 2026-07-21 cs.LG 新提交 79%

Planning with Transformers: Chain of Computation and Structured Context Windows

使用Transformer进行规划:计算链与结构化上下文窗口

Ehsan Futuhi, Nathan R. Sturtevant

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 研究大语言模型解决规划问题的不足,提出计算链架构,利用结构化上下文窗口,让语言模型学习规划策略、预测世界模型并执行算术运算,在多个任务上取得高成功率,能解决复杂汉诺塔问题且减少训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 79%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17331 2026-07-21 cs.AI cs.MA 新提交 79%

Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning

智能企业资源规划(Agentic ERP):用于自主企业资源规划的多智能体大语言模型架构

Zhihao Liu, Tianyu Wang, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering(生产工程系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 研究针对ERP系统过度依赖人类决策的问题,提出Agentic ERP架构,结合角色对齐的LLM智能体、人工参与框架和图编排器。通过特定决策问题表述、编排解耦及多层面评估,证明该方法优于基线,能让ERP主动执行决策,提供了参考架构与评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30362 2026-07-21 cs.RO cs.AI cs.CV 版本更新 79%

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

ReactiveBFM:面向通用人形全身控制的反应式闭环运动规划

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出ReactiveBFM,一种实时闭环规划控制框架,通过调度前缀采样课程和异步重规划机制,解决生成式运动规划器与高频跟踪之间的延迟不匹配和暴露偏差问题,实现人形机器人全身协调和零样本反应式运动。

Comments Project page: https://xiao-chen.tech/reactivebfm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22681 2026-07-21 cs.AI 版本更新 79%

Scientific reasoning does not reliably translate into scientific forecasting in frontier AI

用人工智能预测科学进步

Sean Wu, Pan Lu, Yupeng Chen, Jonathan Bragg, Yutaro Yamada, Peter Clark, David Clifton, Philip Torr, James Zou, Junchi Yu

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学) Allen Institute for AI(人工智能研究所) Sakana AI

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了人工智能在预测科学进步中的能力,提出了一种基于时间的评估框架,并介绍了CUSP基准,通过可行性评估、机制推理、生成性解决方案设计和时间预测来评估AI系统的科学预测能力,发现当前前沿模型在不同领域存在系统性限制,且预测结果受事件发生时间影响较大,表明AI在科学预测中仍存在不足。

Comments 62 pages, 14 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18062 2026-07-21 cs.RO cs.CV 新提交 78%

UniETP: Unifying Environments for Generalizable Embodied Task Planning

UniETP:统一用于通用具身任务规划的环境

Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu

机构 * Peking University(北京大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对具身任务规划中模拟器和数据集孤立的问题,提出UniETP统一接口,整合四个常用模拟器,兼具标准化与多样性,构建新数据集,通过实验评估模型具身规划能力并分析瓶颈。

Comments We are actively working on releasing the codes and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17675 2026-07-21 cs.CV 新提交 78%

ShotPlan: Cinematic Video Generation with Learnable Planning Token

ShotPlan:使用可学习规划令牌生成电影级视频

Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin Huang, Hongxun Yao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对电影级视频生成难题,提出ShotPlan框架,基于视频扩散基础模型,引入可学习规划令牌捕捉镜头过渡线索,结合分数时间旋转位置嵌入在帧级别建模,实验证明其优于现有方法,提升了镜头管理与一致性。

Comments Project page: https://pensioner-11.github.io/ShotPlan/

详情

展开后加载摘要…

URL PDF HTML 收藏