arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-23 至 2026-06-23 共收录 276 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 16 篇

2606.19121 2026-06-23 cs.SE cs.CL cs.HC 新提交 57%

Written by AI, Managed by AI: Semantic Space Control and Index Sickness Elimination Across 391 Consecutive Sessions

由AI编写,由AI管理:跨越391个连续会话的语义空间控制与索引病消除

Hui Zhang, Shuren Song

机构 * Shenzhen Yunxi Technology Co., Ltd.(深圳云曦科技有限公司) Information Technology Center, Tsinghua University(清华大学信息科学技术中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文通过真实软件项目中的行动研究,发现长期LLM协作中增加形式约束反而导致“索引病”,提出“基线-日志物理分离”机制,有效消除该问题。

Comments 22 pages, 2 tables, 1 figure. Action research. Bilingual submission (Chinese companion version included as supplementary). Submitted to ICSE 2027 IOR track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19331 2026-06-23 cs.CL 版本更新 57%

Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

评估基于大语言模型的议会辩论总结的论证内容

Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago

机构 * School of Computer Science, University College Dublin(都柏林大学计算机科学学院) School of Politics and International Relations, University College Dublin(都柏林大学政治与国际关系学院) Department of Informatics, King’s College London(伦敦国王学院信息学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种评估议会辩论总结的框架,通过计算论证方法评估总结对辩论论证内容的忠实性,以欧洲议会辩论为例验证方法有效性。

Comments Accepted at KR'26 In The Wild Track. Camera Ready with additional supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23666 2026-06-23 stat.OT stat.ME 新提交 50%

Statistical Proof as a Window into Human-AI Collaboration: Practical Insights and a Community Agenda

统计证明作为人机协作的窗口:实践见解与社区议程

Xiaojing Sun, Huayu Tang, Buxin Su, Mateo Matijasevick, Chong Wu, Fei Xue, Bingxin Zhao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 通过统计证明任务,发现当前通用大语言模型在精确定义问题下可执行技术组件,但在开放或长链推理中不可靠,提出人机协作中人类专业知识应聚焦于问题构建与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 50%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21389 2026-06-23 cs.CR 新提交 50%

From Production SIEM to Reusable Cybersecurity Artifacts

从生产SIEM到可复用的网络安全工件

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出一种从生产金融安全运营中心提取、匿名化、结构化并验证SIEM数据的方法,生成可复用的研究工件,并通过训练和测量实验验证其隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21377 2026-06-23 cs.CR 新提交 50%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 15 篇

2606.21083 2026-06-23 cs.AI cs.LG 新提交 88%

Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

承诺下的一致性:探究LLM逻辑推理中的泛化与空洞记忆

Noor Islam S. Mohammad, Mahmudul Hasan

机构 * Department of Computer Science, Informatics Institute, Istanbul Technical University(伊斯坦布尔技术大学信息学研究所计算机科学系) School of Information Technology, Deakin University(迪肯大学信息技术学院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出双查询评估范式CUC,联合测量一致性与决断力,揭示LLM通过系统性弃权实现空洞一致性的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03553 2026-06-23 cs.CL cs.AI 版本更新 88%

MultiZebraLogic: A Multilingual Logical Reasoning Benchmark

MultiZebraLogic:多语言逻辑推理基准

Sofie Helene Bruun, Dan Saattrup Smart

机构 * The Alexandra Institute(亚历山大研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出多语言逻辑推理基准MultiZebraLogic,包含九种语言的高质量斑马谜题数据集,通过调整谜题大小和添加无关线索控制难度,分析语言、文化敏感性和线索类型对模型性能的影响。

Comments Camera-ready version for RESOURCEFUL 2026 at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22642 2026-06-23 cs.LG 版本更新 87%

Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning

压缩简单问题,探索困难问题:面向高效LLM推理的难度感知熵正则化

Qin-Wen Luo, Sheng Ren, Xiang Chen, Rui Liu, Jun Fang, Naiqiang Tan, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) College of Computer Science and Technology(计算机科学与技术学院) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 提出CEEH方法,通过难度感知的熵正则化,在强化学习中对简单问题压缩推理长度,对困难问题保持探索空间,从而在减少响应长度的同时维持推理准确性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23221 2026-06-23 cs.CV cs.AI 新提交 85%

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation

RS-Gen:用于推理和搜索增强图像生成的多阶段智能体框架

Feifei Bian, Zhimin Zheng, Wei Deng, Daiguo Zhou, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出RS-Gen,一种即插即用、无需训练的多阶段图像智能体框架,通过“提问-解决”闭环机制进行逻辑推理和知识补全,显著提升基础图像生成与编辑模型在模糊意图和分布外知识场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05181 2026-06-23 cs.CL cs.AI 版本更新 84%

Multi-Granularity Reasoning for Natural Language Inference

自然语言推理的多粒度推理

Chunling Xi, Di Liang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出多粒度推理网络(MGRN),通过分层语义特征交互模拟人类认知过程,在多个基准上超越强基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16118 2026-06-23 cs.AI cs.CL cs.LO 新提交 81%

Know Your Limits : On the Faithfulness of LLMs as Solvers and Autoformalizers in Legal Reasoning

了解你的局限:LLM在法律推理中作为求解器和自动形式化工具的忠实性

Olivia Peiyu Wang, Sanna Wong-Toropainen, Daneshvar Amrollahi, Ryan Bai, Tashvi Bansal, Arush Garg, Leilani H. Gilpin

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Univ. Helsinki(赫尔辛基大学) CodeX, Stanford(斯坦福大学CodeX中心) Stanford University(斯坦福大学) Canyon Crest Academy(峡谷峰学院) Monta Vista High School(蒙塔维斯塔高中) Los Altos High School(洛斯阿尔托斯高中)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在法律推理中是否忠实执行逻辑推理,发现LLM基于形式推理的高性能掩盖了范围清洗等不忠实模式,揭示基准准确性与逻辑忠实性之间的根本差距。

Comments 10 pages, submitted to COLM 2026 (under review, average score of 6.25 across 4 reviewers) and accepted by the AI4Law and AI4Math workshops at ICML. This is the version where we already addressed most of the reviews from the COLM & AI4Law &; AI4Math reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22488 2026-06-23 cs.AI 新提交 79%

SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments

SCOPE:面向开放环境规划的演化符号世界

Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Chalmers University of Technology(查尔姆斯理工大学) Lanzhou University(兰州大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 提出SCOPE框架,通过符号执行模拟器和自适应符号记忆模块,在开放环境中演化符号世界表示,提升规划完整性和鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21832 2026-06-23 cs.AI 新提交 70%

AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models

AgentCAT:通过多智能体大语言模型模拟计算机自适应测试

Weiyuan Zhou, Haiping Ma, Xiaoshan Yu, Changqian Wang, Shangshang Yang, Xingyi Zhang

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Institute of Physical Science and Information Technology, Anhui University(光电信息获取与防护技术国家重点实验室,物理科学与信息技术学院,安徽大学) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China, the Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(认知智能国家重点实验室,中国科学技术大学,人工智能研究院,合肥综合性国家科学中心)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出基于大语言模型的多智能体仿真系统AgentCAT,通过考生、选题和监督三个模块模拟动态测试过程,实现能力估计与选题策略的平衡,在真实数据集上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新 67%

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21565 2026-06-23 cs.AI 新提交 57%

Composing Verifiable Conceptual Models via Building Blocks: Towards Design-Time Verification of Agentic AI Workflows

通过构建块组合可验证的概念模型:面向智能体AI工作流的设计时验证

Noe Y. Flandre, Alexander C. Nwala, Philippe J. Giabbanelli

机构 * Team EVERGREEN Inria Centre Inria d’Université Côte d’Azur(法国国家信息与自动化研究所蔚蓝海岸大学中心EVERGREEN团队) Department of Data Science William & Mary(威廉与玛丽学院数据科学系) Office of Enterprise Research and Innovation Old Dominion University(欧道明大学企业研究与创新办公室)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 提出一种设计时验证方法,通过12条结构规则检查智能体工作流中可重用构建块的兼容性,实现设计缺陷检测。

Comments To appear at the 2026 Winter Simulation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21445 2026-06-23 cs.AI 新提交 57%

AutoRAS: Learning Robust Agentic Systems with Primitive Representations

AutoRAS: 学习具有原始表示的鲁棒智能系统

Yang Yue, Xuancheng Zhu, Yuyang Ma, Guoshun Nan, Zihan Dou, Jingru Shan, Congyu Guo, Ji Zhang, Hua Wang, Jingfeng Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Guangxi Transportation Science and Technology Group Co., Ltd.(广西交通科技集团有限公司) Fudan University(复旦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AutoRAS框架,通过生成符号原始序列并利用执行安全信号和流式序列级目标优化,自动设计鲁棒智能系统,在正常和对抗设置下均表现最佳。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14935 2026-06-23 cs.AI 新提交 57%

PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

PrologMCP:面向LLM代理的标准化Prolog工具接口

Agnieszka Mensfelt, Adarsh Prabhakaran, Adrian Haret, Vince Trencsenyi, Kostas Stathis

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PrologMCP,一个通过模型上下文协议将Prolog暴露为状态化工具的任务无关开源服务器,使LLM代理能够通过翻译-运行-检查-修复循环稳健地委托演绎推理,在PARARULE-Plus上达到或超越推理型LLM。

Comments Accepted at Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs, 18 July 2026, Lisbon v2: Added references to other Prolog MCP servers; fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21276 2026-06-23 cs.CY 新提交 50%

CEDAR-42001: From ISO/IEC 42001 Conformity to Architecture-Aware, Audit-Visible Assurance Posture for AI Cyber-Physical Systems

CEDAR-42001: 从ISO/IEC 42001符合性到面向架构、可审计可见的AI信息物理系统保障态势

Priyanka Prakash Surve, Asaf Shabtai, Yuval Elovici

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出CEDAR-42001方法,将ISO/IEC 42001审计证据转化为架构感知的保障态势,通过分层归因、成熟度评估和行动推荐,揭示符合性审计的局限性,并在自动驾驶案例中验证。

Comments 19 Pages, 3 figures, 4 tables. Code and data are available in the accompanying artifact repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 50%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 逻辑推理 :planning(abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 50%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 58 篇

2606.20641 2026-06-23 cs.RO cs.AI cs.LG 新提交 84%

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

MAGNIFIED: 多模态大语言模型的强化学习微调用于运动规划

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

机构 * Waymo LLC(Waymo有限责任公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGNIFIED方法,通过强化学习微调多模态大语言模型,利用令牌级奖励优化规划目标,在Waymo数据集上显著降低重叠率和偏离道路率。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21740 2026-06-23 cs.AI 新提交 83%

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

训练编排器:一种基于监督学习的端到端PDDL规划方法,使用LLM智能体

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

机构 * Oregon State University(俄勒冈州立大学)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出HALO框架,通过监督学习训练编排器,利用验证器提供的轨迹作为监督信号,在11个PDDL领域上以极低成本实现与前沿LLM相当的成功率。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14470 2026-06-23 cs.AI cs.CL cs.LG 新提交 82%

GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge

GitOfThoughts: 版本控制的推理与可回放、差异比较和合并的智能体记忆

Pavan C Shekar, Abhishek H S, Aswanth Krishnan

机构 * QpiAI

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GitOfThoughts框架,将智能体推理树存储为git仓库,实现推理的可回放、审计和合并;实验表明,对于新问题,任何记忆格式均不能可靠提升准确率,仅当检索案例与当前问题高度相似(>0.8)时才有显著提升,且收益来自答案检索而非方法迁移。

Comments 10 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 82%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22388 2026-06-23 cs.AI cs.CL 新提交 81%

PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

PlanBench-XL:评估大规模工具生态系统中LLM工具使用智能体的长时程规划能力

Jiayu Liu, Qihan Lin, Cheng Qian, Rui Wang, Emre Can Acikgoz, Xiaocheng Yang, Jiateng Liu, Zhenhailong Wang, Xiusi Chen, Heng Ji, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PlanBench-XL基准,包含327个零售任务和1665个工具,测试LLM智能体在检索受限工具环境下的长时程规划能力,实验表明GPT-5.4在无阻塞下准确率51.90%,严重阻塞下降至11.36%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20627 2026-06-23 cs.AI cs.LG 新提交 81%

Latent Goal Prediction from Language for Model-Based Planning

基于语言隐式目标预测的模型规划

Samuel Barbeau, Simon Roy, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * École de Technologie Supérieure, Montréal(蒙特利尔高等技术学院) International Laboratory on Learning Systems (ILLS)(国际学习系统实验室) Polytechnique Montréal(蒙特利尔综合理工学院) MILA Institut Universitaire de France (IUF)(法国大学研究院) Université Sorbonne, CNRS, ISIR(索邦大学,法国国家科学研究中心,智能系统与机器人研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出LAGO框架,通过在同一隐空间预测语言指令的中间子目标序列和动作条件轨迹,结合软最小轨迹代价规划,实现长程鲁棒规划。

Comments 9 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20599 2026-06-23 cs.AI cs.LG 新提交 81%

Beyond Fixed Budgets: Characterizing the Inelasticity and Limitations of Tree-of-Thought Reasoning Strategies

超越固定预算:刻画思维树推理策略的非弹性与局限性

Atkia Mahila, Avinash Maurya, M. Mustafa Rafique, Bogdan Nicolae

机构 * Rochester Institute of Technology(罗彻斯特理工学院) Argonne National Laboratory(阿贡国家实验室)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过评估两种代表性ToT方法在不同计算预算、模型规模和问题难度下的表现,揭示DPTS存在冷启动瓶颈而SSDP存在前沿耗尽问题,表明固定探索或剪枝策略无法适应计算连续体。

Comments Flexscience'26: ACM HPDC workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 79%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交 79%

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏