arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 21 篇

2602.12286 2026-05-12 q-bio.GN cs.CL 70%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01643 2026-05-12 cs.LG cs.AI 62%

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14785 2026-05-12 cs.LG cs.AI 62%

Exploring the In-Context Learning Capabilities of LLMs for Money Laundering Detection in Financial Graphs

探索LLMs在金融图谱中反洗钱检测中的情境学习能力

Erfan Pirmorad

机构 * The Vanguard Group, Inc.(先锋集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs在金融图谱中进行反洗钱检测的能力,通过提取局部子图并利用少量样本进行情境学习,展示LLMs在识别可疑行为和生成解释方面的潜力。

Comments Accepted at AI4FCF-ICDM 2025

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09580 2026-05-12 cs.AI cs.CL 62%

GraphMERT: Efficient and Scalable Distillation of Reliable Knowledge Graphs from Unstructured Data

GraphMERT:从非结构化数据中高效可扩展地蒸馏可靠知识图谱

Margarita Belova, Jiaxin Xiao, Shikhar Tuli, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphMERT,一种高效的图神经网络模型,通过蒸馏高质量知识图谱提升领域知识的可靠性与有效性。

Comments Camera-ready version. Published in Transactions on Machine Learning Research (TMLR), 2026. Reviewed on OpenReview: https://openreview.net/forum?id=tnXSdDhvqc

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11537 2026-05-12 cs.LG cs.AI 62%

Simulus: Combining Improvements in Sample-Efficient World Model Agents

Simulus:结合高效样本世界模型代理的改进

Lior Cohen, Kaixin Wang, Bingyi Kang, Uri Gadot, Shie Mannor

机构 * Technion(技术ion大学) Microsoft Research(微软研究院) ByteDance Seed(字节跳动种子实验室)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。

Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15599 2026-05-12 cs.AI 57%

Autonomous Business System via Neuro-symbolic AI

通过神经符号AI实现自主业务系统

Cecil Pang, Hiroki Sayama

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿分校系统科学与工业工程学院) AI Engineering, USA TODAY Co., Inc.(USA TODAY公司人工智能工程部) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿复杂系统中心) Waseda Innovation Lab, Waseda University(早稻田大学创新实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自主业务系统AUTOBUS,结合大语言模型、谓词逻辑编程和企业数据,构建神经符号架构以执行端到端业务任务,通过人机协作提升业务处理的确定性和适应性。

Comments IEEE SysCon 2026

Journal ref 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06483 2026-05-12 cs.AI cs.RO cs.SY eess.SY 57%

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

ReasonSTL:通过工具增强的过程奖励学习桥接自然语言与信号时间逻辑

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ReasonSTL框架,通过工具增强和过程奖励学习,解决自然语言到信号时间逻辑(STL)的转换难题,提供透明、低成本且隐私保护的正式规范起草方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09573 2026-05-12 cs.SE 50%

ConCovUp: Effective Agent-Based Test Driver Generation for Concurrency Testing

ConCovUp:面向并发测试的有效代理基于测试驱动生成

Yuandao Cai, Shuhao Fu, Wensheng Tang, Cheng Wen, Shengchao Qin, Charles Zhang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出ConCovUp框架,结合LLM与程序分析,通过静态分析提取共享内存访问及调用上下文,利用LLM驱动的逆向追踪方法生成有效并发测试,提升SMAP覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00241 2026-05-12 math.OC 50%

Paratransit Optimization with Constraint Programming: A Case Study in Savannah, Georgia

约束编程在萨凡纳市的拼车服务优化研究

Liam Jagrowski, Kevin Dalmeijer, Tinghan Ye, Pascal Van Hentenryck

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出基于约束编程的拼车服务优化模型,通过萨凡纳案例证明其在服务效率和请求数量上的优势,相比传统方法更易实施且灵活性高。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 79 篇

2604.18486 2026-05-12 cs.CV cs.CL cs.RO 91%

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

小米OneVL:基于视觉-语言解释的一步潜在推理与规划

Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Xizhou Bu, Haochen Tian, Yihang Qiu, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, Bing Wang, Haiyang Sun, Jingwei Zhao, Jiahui Huang, Pei Liu, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Hanchao Leng, Kun Ma, Naiyan Wang, Guang Chen, Kuiyuan Yang, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。

Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09269 2026-05-12 cs.CL cs.CV 85%

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

DeltaRubric: 通过联合规划和验证实现生成式多模态奖励建模

Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文元) University of Maryland, College Park(马里兰大学 College Park 分校) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 DeltaRubric通过联合规划和验证流程,提升多模态奖励建模的可靠性与泛化能力,实验表明其在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 84%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11578 2026-05-12 cs.AI 83%

Efficient LLM Collaboration via Planning

通过规划实现高效的LLM协作

Byeongchan Lee, Jonghoon Lee, Dongyoung Kim, Jaehyung Kim, Kyungjoon Park, Dongjun Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出COPE框架,通过规划模型与执行模型的协作,提升小模型和大模型在复杂任务中的性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08477 2026-05-12 cs.CL 83%

Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling

智能体是否需要分步规划?重新审视数据导向工具调用中的规划范围

Naoki Otani, Nikita Bhutani, Hannah Kim, Dan Zhang, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文研究了数据导向任务中规划范围的影响,发现全范围规划结合延迟重规划在准确性和效率上优于单步规划。

Comments CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20164 2026-05-12 cs.LG cs.AI cs.CL 83%

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

计划是什么?LLMs中隐式规划的度量及其在押韵生成和问答中的应用

Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

机构 * HPI / University of Potsdam(HPI/波茨坦大学) Utrecht University(乌特勒支大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出简单方法评估LLM隐式规划,通过押韵生成和问答案例展示其可扩展性,发现隐式规划在1B参数模型中普遍存在,为AI安全提供新视角。

Comments 41 pages, 34 figures, Accepted at ICLR 2026, Code available at https://github.com/Jim-Maar/implicit-planning-in-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09584 2026-05-12 cs.CL cs.AI cs.LG 82%

CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics

CLR-voyance:通过结果感知的评分表强化住院患者临床决策支持中的开放性推理

Aishik Nagar, Arun-Kumar Kaliya-Perumal, Yu-Hsuan Han, Andrew Sheng-Han Huang, Kristen Kee, Yushi Cao, Yiming Chen, Hongchao Jiang

机构 * ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务(AICS)) Rehabilitation Research Institute of Singapore, Nanyang Technological University(新加坡康复研究院,南洋理工大学) Department of Family Medicine, Taipei Veterans General Hospital(台北荣民总医院家庭医学部) School of Medicine, National Yang Ming Chiao Tung University(国家阳明交通大学医学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CLR-voyance将住院患者推理建模为POMDP,通过结果感知和临床验证的奖励机制提升决策支持,实现住院患者临床推理的最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08831 2026-05-12 cs.RO 82%

AssemPlanner: A Multi-Agent Based Task Planning Framework for Flexible Assembly System

AssemPlanner:一种面向灵活装配系统的多智能体任务规划框架

Chenhao Zhang, Chaoran Zhang, Zhaobo Xu, Yongbo Yang, Pingfa Feng, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China(清华大学深圳国际研究生院,清华大学,深圳 518055,中国) Department of Mechanical Engineering, Tsinghua University, Beijing 100084, China(清华大学机械工程系,清华大学,北京 100084,中国)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出AssemPlanner,一种多智能体任务规划框架,通过自然语言描述的任务转化为可执行的生产操作序列,解决传统方法配置耗时的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02450 2026-05-12 cs.RO cs.AI cs.LG 81%

CHARMS: A Cognitive Hierarchical Agent for Reasoning and Motion Stylization in Autonomous Driving

CHARMS:用于自动驾驶中的推理与运动风格化的认知层次代理

Jingyi Wang, Duanfeng Chu, Zejian Deng, Liping Lu, Jinxiang Wang, Chen Sun

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械与电子工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究所) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CHARMS通过强化学习预训练和监督微调pipeline,实现人类般的决策行为和交互真实性,同时利用泊松认知层次理论生成多样化驾驶场景。

Journal ref ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01301 2026-05-12 cs.AI cs.CL 81%

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

克服多步复杂性以实现多模态理论思维推理:一种可扩展的贝叶斯规划器

Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

机构 * Dartmouth College(达特茅斯学院) Honda Research Institute USA(本田美国研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种可扩展的贝叶斯理论思维规划器,通过分步贝叶斯更新分解理论思维推理,利用弱到强控制使小语言模型专精于理论思维似然估计,并将其推理行为转移给大语言模型,从而在多模态理论思维基准测试中实现4.6%的准确率提升。

Comments Accepted as a Spotlight at the 2025 Forty-Second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10872 2026-05-12 cs.RO cs.AI cs.CL 81%

REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?

Chenxi Jiang, Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08406 2026-05-12 cs.CL cs.AI 81%

Effective Explanations Support Planning Under Uncertainty

有效解释支持在不确定性下的规划

Hanqi Zhou, Britt Besch, Charley M. Wu, Tobias Gerstenberg

机构 * University of Tübingen(图宾根大学) Technical University Darmstadt(达姆施塔特技术大学) Max Planck Institute for Biological Cybernetics(生物 cybernetics 最大平面研究所) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种计算模型,将解释转化为行动计划,通过大规模语言模型生成策略先验和价值图,结合规划代理在部分可观测条件下执行,验证了高质量解释能提升导航效率。

Comments CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08404 2026-05-12 cs.CL cs.AI cs.CV cs.ET 81%

Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

利用大视觉-语言模型从遥感图像中推导建成环境

Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在智慧城市中的应用,通过多尺度遥感图像输入多模态语言模型,评估其对建成环境推理的影响,并比较了InternVL和Qwen等先进模型在生成建成环境建议中的准确性和可靠性。

Comments Published in the International Conference on Industrialized Construction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11419 2026-05-12 cs.AI cs.RO 80%

FocalAD: Local Motion Planning for End-to-End Autonomous Driving

FocalAD:端到端自动驾驶中的局部运动规划

Bin Sun, Boao Zhang, Jiayi Lu, Xinjie Feng, Jiachen Shang, Rui Cao, Mengchao Zheng, Chuanye Wang, Shichun Yang, Yaoguang Cao, Ziying Song

机构 * School of Transportation Science and Engineering(交通科学与工程学院) State Key Lab of Intelligent Transportation System(智能交通运输系统国家重点实验室) Hangzhou International Innovation Institute(杭州国际创新研究院) School of Computer Science and Technolog(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出FocalAD框架,通过增强局部运动表示和关注关键局部邻居,提升自动驾驶的规划可靠性与鲁棒性,在nuScenes和Bench2Drive等数据集上表现优异。

Journal ref FocalAD: Local Motion Planning for End-to-End Autonomous Driving. Automot. Innov. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10172 2026-05-12 cs.CV cs.CL 79%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11734 2026-05-12 cs.RO cs.AI 79%

SCORP: Scene-Consistent Multi-agent Diffusion Planning with Stable Online Reinforcement Post-Training for Cooperative Driving

SCORP:具有稳定在线强化学习后训练的场景一致多智能体扩散规划用于协作驾驶

Haojie Bai, Aimin Li, Ruoyu Yao, Xiongwei Zhao, Tingting Zhang, Xing Zhang, Lin Gao, and Jun Ma

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Middle East Technology University (METU)(中东技术大学) Robotics and Autonomous Systems Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) School of Computer Science and Technology, Qinghai University(青海大学计算机科学与技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 SCORP通过场景条件多智能体去噪架构和两层马尔可夫决策过程提升多智能体协作驾驶的场景一致性和效率,实验表明其在安全性和效率指标上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12334 2026-05-12 cs.CL 79%

QM-ToT: A Medical Tree of Thoughts Reasoning Framework for Quantized Model

QM-ToT: 一种用于量化模型的医学树状思维推理框架

Zongxian Yang, Jiayu Qian, Kay Chen Tan, Hau-San Wong, Yulong Chen, Haoyu Zhang, Zhi-An Huang

机构 * City University of Hong Kong(Dongguan)(香港城市大学(东莞)) Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出QM-ToT框架,通过树状思维方法分解复杂医疗问题,提升INT4量化模型在MedQAUSMLE数据集上的性能,使LLaMA2-70b模型准确率从34%提升至50%。

Comments Accepted by ICIC 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09801 2026-05-12 cs.RO 78%

Efficient Multi-Robot Motion Planning with Precomputed Translation-Invariant Edge Bundles

高效多机器人运动规划与预计算的平移不变边束

Himanshu Gupta, Paul Motter, Aritra Chakrabarty, Rishabh Sodani, Srikrishna Bangalore Raghu, Alessandro Roncone, Bradley Hayes, Zachary Sunberg

机构 * Smead Aerospace Engineering Sciences, University of Colorado Boulder(科罗拉多大学博尔德分校航空航天工程科学系) Department of Computer Science, University of Colorado Boulder(科罗拉多大学博尔德分校计算机科学系) Cherry Creek High School, Greenwood Village, CO, USA(科罗拉多州格里诺村樱桃溪高中)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出KiTE-Extend方法,通过预计算轨迹段提升多机器人运动规划效率,尤其在多智能体场景中显著改善规划性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02340 2026-05-12 eess.SY cs.SY 78%

Risk-Based PV-Rich Distribution System Planning Using Generative AI

基于风险的光伏丰富配电系统规划使用生成式AI

Habtemariam Aberie Kefale, Weijie Xia, Nanda Kishor Panda, Peter P. Palensky, Pedro P. Vergara

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出一种基于风险的光伏容量评估框架,利用生成式AI生成时间相关负载需求场景,以量化电压违规的风险,提升配电系统规划的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22508 2026-05-12 cs.AI 77%

Metacognitive Behavioral Tuning of Large Language Models for Multi-Hop Question Answering

元认知行为调节用于多跳问答的大型语言模型

Ik-hwan Kim, Hyeongrok Han, Mingi Jung, Sangwon Yu, Jinseok Hong, Sang Hun Kim, Yoonyoung Choi, Sungroh Yoon

机构 * Dept. of ECE Seoul Nat’l Univ.(首尔国立大学电子工程系) AI Center Samsung Elec. Korea(三星电子韩国人工智能中心) AIIS, ASRI, INMC, ISRC, Interdisc. Prog. in AI Seoul Nat’l Univ.(首尔国立大学人工智能研究所、高级研究机构、人工智能中心、国际研究所以及人工智能跨学科研究计划)

专题命中 规划推理 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出元认知行为调节(MBT)框架,通过五阶段结构提升多跳问答任务的准确性和效率,减少冗余并保持推理轨迹稳定。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10820 2026-05-12 cs.AI cs.LG 73%

MaD Physics: Evaluating information seeking under constraints in physical environments

MaD Physics:在物理环境中评估受约束的信息获取

Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev

机构 * Mila – Quebec AI Institute, Université de Montréal(Mila-魁北克人工智能研究所,蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MaD Physics通过三个基于不同物理定律的环境,评估智能体在资源受限条件下进行测量和推理的能力,揭示了现有模型在科学推理和约束规划方面的不足。

Comments 64 pages, 10 figures. Project page: https://mad-physics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏