arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-24 至 2026-06-24 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2606.24849 2026-06-24 cs.CV cs.AI 新提交 93%

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) Ant Group(蚂蚁集团) The University of Hong Kong(香港大学)

专题命中 规划推理 :CoT(title,title_cn);chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新 88%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 规划推理 :planning(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00618 2026-06-24 cs.AI 版本更新 85%

Efficient Test-time Inference for Generative Planning Models with OCL Search

生成式规划模型的高效测试时推理

Robert Gieselmann, Mihai Samson, Federico Pecora, Jeremy L. Wyatt

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出一种改进的开放-封闭列表搜索算法,结合生成模型和启发式模型,在测试时高效推理,提升生成式规划模型的解质量和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24510 2026-06-24 cs.AI cs.CL 新提交 81%

A specialized reasoning large language model for accelerating rare disease diagnosis: a randomized AI physician assistance trial

一种用于加速罕见病诊断的专用推理大语言模型:随机AI辅助医生试验

Haichao Chen, Songchi Zhou, Zhengyun Zhao, Shikai Hu, Xianghong Jin, Hongwei Ji, Li He, Shuli Li, Yiming Qin, Xin Tan, Runfeng Shi, Yih Chung Tham, Jiaye Zhu, Ye Li, Ye Jin, Longhao Cao, Dawei Li, Honghan Wu, Hongqiu Gu, Guanqiao Li, Tudor Groza, Chunying Li, Dian Zeng, Weihong Yu, Gareth Baynam, Saumya Shekhar Jamuar, Min Shen, Shuyang Zhang, Bin Sheng, Sheng Yu, Tien Yin Wong

机构 * Tsinghua Medicine, Tsinghua University(清华大学医学部,清华大学) Department of Ophthalmology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院眼科,中国医学科学院 & 北京大学医学部) Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系) Department of Rheumatology and Clinical Immunology, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院风湿免疫科,中国医学科学院 & 北京大学医学部) Department of Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(北京大学人民医院罕见病科,中国医学科学院 & 北京大学医学部) Department of Dermatology, Xijing Hospital, Air Force Medical University(西安空军军医大学西京医院皮肤科) School of Computer Science and Technology, East China Normal University (ECNU)(东华大学计算机科学与技术学院) Department of Neurosurgery, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院神经外科) Department of Ophthalmology, National University of Singapore(新加坡国立大学眼科) Singapore Eye Research Institute, Singapore National Eye Centre(新加坡眼科学研究所,新加坡国家眼科中心) Ophthalmology and Visual Science Academic Clinical Program, Duke-NUS Medical School(杜克-国立新加坡大学医学学校眼科与视觉科学学术临床项目) Department of Pediatrics, The First Hospital of Tsinghua University(清华大学第一医院儿科) College of Future Technology, Peking University(北京大学未来技术学院) School of Health and Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出开源推理大模型RaDaR(32B参数),通过增强推理训练和合成数据,在罕见病诊断中超越DeepSeek-R1等模型,随机试验显示其辅助使医生诊断准确率提升21.44个百分点。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 79%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24101 2026-06-24 cs.RO cs.CV 新提交 78%

NavWM: A Unified Navigation World Model for Foresight-Driven Planning

NavWM:一种用于前瞻性规划的统一导航世界模型

Yanghong Mei, Longteng Guo, Ming-Ming Yu, Guiyu Zhao, Xingjian He, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 规划推理 :planning(title);reasoning(abstract)

AI总结 提出NavWM统一导航世界模型,通过潜在世界令牌提取几何与语义先验,结合锚点多模态轨迹预测框架生成多样化动作空间,利用视觉前瞻评估最优路径,在多种机器人数据集上显著提升未来状态生成与零样本导航成功率。

Comments 13 pages, 5 figures, accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24597 2026-06-24 cs.CL 新提交 77%

Qwen-AgentWorld: Language World Models for General Agents

Qwen-AgentWorld: 通用智能体的语言世界模型

Yuxin Zuo, Zikai Xiao, Li Sheng, Fei Huang, Jianhong Tu, Yuxuan Liu, Tianyi Tang, Xiaomeng Hu, Yang Su, Qingfeng Lan, Yantao Liu, Qin Zhu, Yinger Zhang, Bowen Yu, Haiquan Zhao, Haiyang Xu, Jianxin Yang, Jiayang Cheng, Junyang Wang, Lianghao Deng, Mingfeng Xue, Tianyi Bai, Yang Fan, Yubo Ma, Yucheng Li, Zeyu Cui, Zhihai Wang, Zhihui Xie, Zhuorui Ye, An Yang, Dayiheng Liu, Jingren Zhou, Ning Ding

机构 * Qwen Team(Qwen团队)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 提出基于语言模型的世界模型Qwen-AgentWorld,通过三阶段训练(CPT、SFT、RL)模拟7个领域的智能体环境,并构建AgentWorldBench基准,实验表明其显著优于现有模型,且能作为环境模拟器和智能体基础模型提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24470 2026-06-24 cs.AI 新提交 70%

The Latent Bridge: A Continuous Slow-Fast Channel for Real-Time Game Agents

潜在桥:用于实时游戏智能体的连续慢-快通道

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对实时游戏智能体,提出一种可学习的连续潜在桥(Latent Bridge),将慢速推理VLM的残差投影到快速反应VLM的输入嵌入空间,在7个Atari游戏和驾驶域中匹配或超越文本桥,且增益高度可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24047 2026-06-24 cs.AI cs.LG 新提交 62%

Ensemble Feature Selection and Harris Hawks Optimization for Explainable Mental Health Risk Prediction in Female Sex Workers

集成特征选择与哈里斯鹰优化用于女性性工作者可解释心理健康风险预测

Ahnaf Atef Choudhury, Md. Parvej Hoque Palash, Shahriar Siddique Ayon, Ramkrishna Saha, Abdullah Al Mamun

机构 * Department of Information Sciences and Technology(信息科学与技术系) George Mason University(乔治·马歇尔大学) Department of Computer Science and Engineering(计算机科学与工程系) Jahangirnagar University(贾汗吉尔纳加尔大学) AIUB The University of Texas at Dallas(德克萨斯大学达拉斯分校) Dhaka University of Engineering and Technology(达卡工程与技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出集成ANOVA和互信息的特征选择与哈里斯鹰优化逻辑回归的混合模型,在3005名女性性工作者中实现95.78%准确率,识别创伤后应激、客户暴力和职业因素为抑郁主要贡献因素。

Comments Accepted and presented at the 2026 8th IEEE Symposium on Computers & Informatics (ISCI 2026). To appear in IEEE conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交 62%

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10607 2026-06-24 cs.LG cs.AI 62%

MONAQ: Multi-Objective Neural Architecture Querying for Time-Series Analysis on Resource-Constrained Devices

MONAQ:面向资源受限设备的时间序列分析多目标神经架构查询

Patara Trirat, Jae-Gil Lee

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MONAQ通过多目标神经架构查询框架,结合大语言模型能力,实现对时间序列数据的高效处理与部署,实验表明其模型性能优于传统方法。

Comments EMNLP 2025 (Findings), Project Page: https://kaist-dmlab.github.io/MONAQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24669 2026-06-24 cs.AI 新提交 61%

LaGO: Latent Action Guidance for Online Reinforcement Learning

LaGO:面向在线强化学习的潜在动作引导

Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。

Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24842 2026-06-24 cs.AI 新提交 57%

World Models in Pieces: Structural Certification for General Agents

分片世界模型:通用智能体的结构化认证

Yikai Lu, Yifei Wu, Xinyu Lu, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(香港中文大学(深圳)数据科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对通用智能体在大世界场景下无法普遍胜任的问题,提出结构化认证框架,通过深度组合目标过滤特定转移,证明世界模型具有O(1/n)+O(δ)误差界,实现可认证部署。

Comments 30 pages, camera-ready version in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24143 2026-06-24 cs.LG 新提交 57%

AsyncOPD: How Stale Can On-Policy Distillation Be?

AsyncOPD:同策略蒸馏可以有多陈旧?

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjun Kang, Sanghyun Park, Donghoon Kim, Minjae Lee, Minseo Kim, Rishabh Tiwari, Yuchen Zeng, Hyung Il Koo, Kangwook Lee

机构 * FuriosaAI Ajou University(亚洲大学) UC Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) KRAFTON Ludo Robotics

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 研究异步同策略蒸馏中陈旧数据的影响,发现前向KL对陈旧更鲁棒,反向KL脆弱但可通过重算信号缓解,并提出AsyncOPD框架实现1.6-3.8倍加速。

Comments Code: https://github.com/furiosa-ai/async-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23983 2026-06-24 cs.CR cs.AI cs.LO cs.MA 新提交 57%

Maestro Order: A Model-Agnostic Orchestration Harness

Maestro Order: 一种模型无关的编排框架

Hidayet Aksu

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 提出Maestro Order框架,通过分解、集成、验证和递归四种原语组合模型,并利用预算感知控制器分配计算资源,将不可靠的求解器转化为可靠的问题解决系统,显著提升可靠性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16420 2026-06-24 cs.LG 版本更新 57%

Hybrid Sequence Modeling and Reinforced Verification for Controllable Target-Conditioned Decision Making

混合序列建模与强化验证的可控目标条件决策

Yue Pei, Hongming Zhang, Chao Gao, Martin Müller, Yingying Zhang, Mengxiao Zhu, Hao Sheng, Ziliang Chen, Liang Lin, Haogang Zhu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Department of Computing Science and Amii, University of Alberta(阿尔伯塔大学计算机科学系和Amii) Edmonton Research Center, Huawei Canada(华为加拿大埃德蒙顿研究中心) Hangzhou International Innovation Institute, Beihang University(杭州国际创新院,北航) School of Artificial Intelligence and Computer Science, North China University of Technology(北中国技术大学人工智能与计算机科学学院) Research Institute of Multiple Agents and Embodied Intelligence, Peng Cheng Laboratory(鹏城实验室多智能体与具身智能研究院)

专题命中 规划推理 :verifier(abstract);分类 cs.LG

AI总结 提出Doctor框架,结合掩码轨迹Transformer与强化验证,通过生成候选动作并选择验证值最接近目标回报的动作,提升目标条件策略在低覆盖数据下的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24244 2026-06-24 stat.ME cs.CY cs.HC econ.EM stat.ML 新提交 50%

When Surveys Become Conversations: Adaptive Matrix Validation for AI-Assisted Interviews

当调查变成对话:面向AI辅助访谈的自适应矩阵验证

Tyler H. McCormick

专题命中 规划推理 :planning(abstract)

AI总结 提出自适应矩阵验证(AMV)方法,通过少量随机结构化问题校准AI从访谈中映射的变量,提升均值、子组和回归系数的估计精度,并在三个模拟研究中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24694 2026-06-24 cs.HC 新提交 50%

SupplyNet: Supporting Visual Exploratory Learning in Supply Chain via Contextual Multi-Agent Simulation

SupplyNet: 通过上下文多智能体模拟支持供应链中的视觉探索式学习

Yanjia Li, Kelcy Kexin Han, Tianrui Hu, Yi-Fan Cao, Huamin Qu, Sicheng Song

专题命中 规划推理 :reasoning(abstract)

AI总结 提出SupplyNet,一种基于上下文图的多智能体LLM框架的视觉模拟系统,通过交互式网络视图、分支时间线和任务分析控制台,支持供应链中的反事实探索、因果追踪和比较推理,提升用户参与度和理解。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24462 2026-06-24 cs.RO 新提交 50%

Varying Bundle Size Reactive Multi-Task Assignment using Selective Cost Estimation for Multi-Agent Systems

基于选择性成本估计的多智能体系统变束大小反应式多任务分配

Niklas Dahlquist, Shridhar Velhal, George Nikolakopoulos

机构 * Luleå University of Technology(吕勒奥理工大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出一种分布式两阶段多保真束生成框架,通过低保真启发式搜索束空间,仅对最有希望候选进行高保真路径规划,实现反应式多机器人任务分配,提高拍卖方法性能。

Comments Accepted for publication at the 23rd World Congress of the International Federation of Automatic Control (IFAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24292 2026-06-24 cs.CV 新提交 50%

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

ActiveScope: 主动寻求和纠正MLLMs的感知

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

机构 * University of Chinese Academy of Sciences(中国科学院大学) State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 规划推理 :self-correction(abstract)

AI总结 提出ActiveScope框架,通过语义锚点定位和干扰抑制细化模块,解决MLLMs在高分辨率图像中的细粒度感知问题,在V* Bench上达到96.34%准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09496 2026-06-24 cs.IR 版本更新 50%

Unifying Search and Recommendation in LLMs via Gradient Multi-Subspace Tuning

通过梯度多子空间调优统一大语言模型中的搜索与推荐

Jujia Zhao, Zihan Wang, Shuaiqun Pan, Suzan Verberne, Zhaochun Ren

专题命中 规划推理 :reasoning(abstract)

AI总结 针对搜索与推荐统一中全微调计算昂贵、参数高效微调存在梯度冲突和用户意图理解偏移的问题,提出梯度多子空间调优框架,通过多子空间分解和零空间投影缓解冲突并保持通用知识,在基准数据集上超越现有方法。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏