arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 128 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2604.08527 2026-04-10 cs.CL cs.LG 73%

Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models

解开OPD之谜:大型语言模型中的长度膨胀与稳定策略

Feng Luo, Yu-Neng Chuang, Guanchu Wang, Zicheng Xu, Xiaotian Han, Tianyi Zhang, Vladimir Braverman

机构 * Department of Computer Science, Rice University, Houston, USA(莱斯大学计算机科学系,美国休斯顿) Department of Computer Science, University of North Carolina at Charlotte, Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系,美国夏洛特) Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系,美国巴尔的摩) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了OPD训练中长度膨胀问题,提出StableOPD框架结合参考 divergence 约束和rollout混合蒸馏,有效稳定训练并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03703 2026-04-10 cs.LG cs.AI 73%

TreeAdv: Tree-Structured Advantage Redistribution for Group-Based RL

TreeAdv:基于群体的强化学习中的树状优势再分配

Lang Cao, Hui Ruan, Yongqian Li, Peng Chao, Wu Ning, Haonan Song, Renhong Chen, Yitong Li

机构 * Huawei Technologies Co., Ltd., China(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TreeAdv通过引入树状结构显式化群体回放的探索和优势分配,提升群体强化学习在复杂推理任务中的效率与逻辑深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI 57%

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2604.05399 2026-04-10 cs.LO cs.SE 71%

PROMISE: Proof Automation as Structural Imitation of Human Reasoning

PROMISE:证明自动化作为人类推理的结构模仿

Youngjoo Ahn, Sangyeop Yeo, Gijung Im, Jongmin Lee, Jinyoung Yeo, Jieung Kim

专题命中 代码与定理证明 :reasoning(title)

AI总结 PROMISE通过结构化嵌入框架实现证明生成自动化,通过挖掘证明状态的结构模式提升大规模定理证明的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08226 2026-04-10 cs.AI cs.HC cs.SY eess.SY 57%

Grounding Clinical AI Competency in Human Cognition Through the Clinical World Model and Skill-Mix Framework

通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力

Seyed Amir Ahmad Safavi-Naini, Elahe Meftah, Josh Mohess, Pooya Mohammadi Kazaj, Georgios Siontis, Zahra Atf, Peter R. Lewis, Mauricio Reyes, Girish Nadkarni, Roland Wiest, Stephan Windecker, Christoph Grani, Ali Soroush, Isaac Shiri

机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。

Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07468 2026-04-10 cs.AI 57%

M-ArtAgent: Evidence-Based Multimodal Agent for Implicit Art Influence Discovery

M-ArtAgent:基于证据的多模态代理用于隐式艺术影响发现

Hanyi Liu, Zhonghao Jiu, Minghao Wang, Yuhang Xie, Heran Yang

机构 * China Electronics Technology Group Co., Ltd.(中国电子科技集团有限公司) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) University of California San Diego(加州大学圣迭戈分校) Northeastern University(东北大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出M-ArtAgent,通过概率裁决框架解决隐式艺术影响发现问题,结合多模态感知与领域约束的反驳机制,实现83.7%的F1分数和0.910的ROC-AUC。

Comments 13 pages, 5 figures, submitted to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15960 2026-04-10 cs.CL 57%

Efficient PRM Training Data Synthesis via Formal Verification

通过形式验证高效PRM训练数据合成

Ryo Kamoi, Yusen Zhang, Nan Zhang, Sarkar Snigdha Sarathi Das, Ranran Haoran Zhang, Wenpeng Yin, Rui Zhang

机构 * Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FoVer框架,利用形式验证工具生成PRM训练数据,提升LLM推理能力,实验显示其在数学逻辑和自然语言推理任务中均有效。

Comments ACL 2026 Findings. Datasets, models, and code are provided at https://github.com/psunlpgroup/FoVer. Please also refer to our project website at https://fover-prm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08495 2026-04-10 math.OC cs.MA cs.RO cs.SY eess.SY 50%

Density-Driven Optimal Control: Convergence Guarantees for Stochastic LTI Multi-Agent Systems

密度驱动最优控制:随机线性时不变多智能体系统的收敛保证

Kooktae Lee

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业与技术学院)

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文提出随机密度驱动最优控制方法,通过拉格朗日框架实现多智能体系统非均匀区域覆盖,确保在随机LTI动态下时间平均经验分布收敛到非参数目标密度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 11 篇

2505.00017 2026-04-10 cs.CL cs.AI cs.DB cs.LG 82%

ReCellTy: Domain-Specific Knowledge Graph Retrieval-Augmented LLMs Reasoning Workflow for Single-Cell Annotation

ReCellTy:领域特定的知识图谱检索增强型大语言模型推理工作流用于单细胞注释

Dezheng Han, Yibin Jia, Ruxiao Chen, Wenjie Han, Shuaishuai Guo, Jianbo Wang

机构 * Shandong University(山东大学) Qilu Hospital of Shandong University(山东大学齐鲁医院) Johns Hopkins University(约翰霍普金斯大学) Cognicore Artificial Intelligence Co., Ltd.(科智人工智能有限公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReCellTy,通过整合生物信息知识图谱和多任务推理工作流,提升单细胞注释的准确性与自动化水平,改进人类评估得分和语义相似度,缩小大中小语言模型性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08401 2026-04-10 cs.AI cs.CL 81%

Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing

在提交前验证:通过自我审计实现LLM代理中的忠实推理

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Xuehe Wang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAVeR框架,通过在行动承诺前验证内部信念状态,提升LLM代理的推理忠实性,实验表明其在保持任务性能的同时提升了推理可靠性。

Comments Accepted by ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04500 2026-04-10 cs.AI cs.RO 70%

"Don't Do That!": Guiding Embodied Systems through Large Language Model-based Constraint Generation

别这样做!

Amin Seffo, Aladin Djuhera, Masataro Asai, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出STPR框架,利用LLM将自然语言中的约束转化为可执行Python代码,解决复杂约束的翻译问题,并在仿真环境中验证其高效性和兼容性。

Comments ICLR 2026 Workshop -- Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07622 2026-04-10 cs.CL cs.AI cs.LG 67%

DIVERSED: Relaxed Speculative Decoding via Dynamic Ensemble Verification

DIVERSED: 通过动态集成验证实现放松的推测解码

Ziyi Wang, Siva Rajesh Kasa, Ankith M S, Santhosh Kumar Kasa, Jiaru Zou, Sumit Negi, Ruqi Zhang, Nan Jiang, Qifan Song

机构 * Purdue University(普渡大学) Amazon Inc.(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DIVERSED通过动态集成验证框架提升解码效率,保留生成质量,通过任务和上下文依赖的权重融合草案与目标模型分布,提升推理效率。

Comments 35 pages, 9 figures, accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08468 2026-04-10 cs.LG cs.AI 62%

TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis

TTVS: 通过测试时变分合成提升自我探索强化学习

Sikai Bai, Haoxi Li, Jie Zhang, Yongjiang Liu, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TTVS框架,通过动态增强未标记测试查询流,使大推理模型自我进化,提升测试时适应性能,实验显示其在八种模型架构上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08284 2026-04-10 cs.CL cs.AI 62%

Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models

分布式多层编辑用于大语言模型中的规则级知识

Yating Wang, Wenting Zhao, Yaqi Zhao, Yongshun Gong, Yilong Yin, Haoliang Sun

机构 * School of Software, Shandong University(山东大学软件学院) Salesforce AI Research

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对规则级知识的编辑问题,提出分布式多层编辑方法,通过多层干预提升规则理解和实例可迁移性。

Comments 17 pages,3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07897 2026-04-10 cs.AI cs.LG 62%

Visual Perceptual to Conceptual First-Order Rule Learning Networks

基于视觉感知的概念性一阶规则学习网络

Kun Gao, Davide Soldà, Thomas Eiter, Katsumi Inoue

机构 * Zhongguancun Academy(中关村学院) Vienna University of Technology (TU Wien)(维也纳技术大学) National Institute of Informatics(国立信息学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出γILP框架,通过图像常量替换到规则结构归纳的可微流程,解决图像数据中无标签学习规则及自动发明谓词的问题,实验证明其在符号关系数据和图像数据上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08245 2026-04-10 cs.AI 57%

From Phenomenological Fitting to Endogenous Deduction: A Paradigm Leap via Meta-Principle Physics Architecture

从现象拟合到内生推导:通过元原理物理架构实现范式跃迁

Helong Hu, HongDan Pan, ShuiQing Hu

机构 * Guangdong Ocean University(广东海洋大学) Maoming Administrative Service Center(茂名市行政服务中心) China Pacific Insurance (Group) Co., Ltd. Foshan Branch(中国太平洋保险(集团)股份有限公司佛山分公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过元原理物理架构将现象拟合与内生推导结合,提升物理推理、数学任务和逻辑任务性能,同时降低验证困惑度,展现原理嵌入设计的鲁棒性和可解释性。

Comments 23 pages, 4 figures, 11 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16750 2026-04-10 cs.LG 57%

Interpretable Clinical Classification with Kolmogorov-Arnold Networks

可解释的临床分类与科拉莫戈罗夫-阿诺德网络

Alejandro Almodóvar, Patricia A. Apellániz, Alba Garrido, Fernando Fernández-Salvador, Santiago Zazo, Juan Parras

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于科拉莫戈罗夫-阿诺德网络的可解释性临床分类方法,通过Logistic KAN和KAAM模型在多个公开数据集上验证了其在预测性能和临床透明度上的优势。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07752 2026-04-10 cs.SE cs.AI 57%

MIMIC-Py: An Extensible Tool for Personality-Driven Automated Game Testing with Large Language Models

MIMIC-Py:一种基于人格驱动的大型语言模型自动游戏测试工具

Yifei Chen, Sarra Habchi, Lili Wei

机构 * Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 MIMIC-Py通过模块化架构实现人格驱动LLM代理的可重用性和扩展性,支持多种交互机制,降低新游戏环境部署难度。

Comments 10 pages, Accepted by FSE Companion '26, July 5--9, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07592 2026-04-10 cs.RO 50%

Spatio-Temporal Grounding of Large Language Models from Perception Streams

从感知流中对大语言模型进行时空 grounding

Jacob Anderson, Bardh Hoxha, Georgios Fainekos, Hideki Okamoto, Danil Prokhorov

机构 * Toyota Motor North America Research & Development(丰田北美研发中心)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 25 篇

2604.07944 2026-04-10 cs.RO cs.AI cs.SY eess.SY 85%

On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning

语言模型在自动驾驶运动规划中的在线策略蒸馏

Amirhossein Afsharrad, Amirhesam Abedsoltan, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究如何将大模型的运动规划知识迁移到小模型,提出在线通用知识蒸馏方法,在nuScenes基准测试中表现优于强化学习基线,模型规模缩小5倍仍保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01062 2026-04-10 cs.CL cs.AI cs.LG 85%

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

SealQA: 提升搜索增强语言模型在事实性问题中的推理能力

Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SealQA是一个新的挑战性基准,用于评估搜索增强语言模型在事实性问题上的能力,揭示当前模型在处理冲突、噪声或无用搜索结果时的局限性。

Comments Camera Ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07048 2026-04-10 cs.CL cs.AI 84%

Search-R3: Unifying Reasoning and Embedding in Large Language Models

Search-R3:在大型语言模型中统一推理与嵌入

Yuntao Gui, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Search-R3通过统一推理与嵌入生成过程,提升大型语言模型在检索任务中的性能,采用监督学习、强化学习和专用环境机制实现有效嵌入生成。

Comments CHANGELOG: (1) Completed training of Search-R3-Large; (2) Corrected error formulation; (3) Added a `Discussion` section to the appendix. We appreciation to the anonymous reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17209 2026-04-10 cs.RO cs.AI 83%

LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios

LiloDriver:一种面向长尾自动驾驶场景闭环运动规划的终身学习框架

Huaiyuan Yao, Pengfei Li, Bu Jin, Yupeng Zheng, An Liu, Lisen Mu, Qing Su, Qian Zhang, Yilun Chen, Peng Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Horizon Robotics(地平线机器人)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 LiloDriver通过结合大语言模型与记忆增强的规划生成系统,实现了在长尾自动驾驶场景中闭环运动规划的持续适应,优于传统规则和学习方法。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV 82%

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 81%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07687 2026-04-10 cs.LG cs.AI 81%

Joint Task Offloading, Inference Optimization and UAV Trajectory Planning for Generative AI Empowered Intelligent Transportation Digital Twin

生成式人工智能赋能的智能交通数字孪生中的联合任务卸载、推断优化与无人机轨迹规划

Xiaohuan Li, Junchuan Fan, Bingqi Zhang, Rong Yu, Xumin Huang, Qian Chen

机构 * Guangxi University Key Laboratory of Intelligent Networking and Scenario System (School of Information and Communication, Guilin University of Electronic Technology)(广西大学智能组网与场景系统重点实验室(桂林电子科技大学信息与通信学院)) Research Institute of Highway Ministry of Transport(交通运输部公路科学研究院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Architecture and Transportation Engineering, Guilin University of Electronic Technology(桂林电子科技大学建筑与交通工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种联合优化方法,通过无人机任务卸载、推断优化和轨迹规划提升生成式人工智能赋能的智能交通数字孪生的精度与延迟平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06925 2026-04-10 cs.MM 78%

LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment

LungCURE:多模态真实世界临床推理基准测试用于精准肺癌诊断与治疗

Fangyu Hao, Jiayu Yang, Yifan Zhu, Zijun Yu, Qicen Wu, Wang Yunlong, Jiawei Li, Yulin Liu, Xu Zeng, Guanting Chen, Shihao Li, Zhonghong Ou, Meina Song, Mengyang Sun, Haoran Luo, Yu Shi, Yingyi Wang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出LungCURE基准测试,通过1000个真实世界病例评估多模态模型在肺癌TNM分期、治疗推荐和临床决策支持中的性能,并引入LCAgent框架提升模型在复杂医疗场景中的推理能力。

Comments 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01804 2026-04-10 cs.CL cs.AI cs.LG 75%

$\texttt{SEM-CTRL}$: Semantically Controlled Decoding

SEM-CTRL:语义控制解码

Mohammad Albinhassan, Pranava Madhyastha, Alessandra Russo

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEM-CTRL,通过集成基于答案集语法的约束,使LLM在不微调的情况下保证输出的语法和语义正确性,实验显示其在多种任务中优于现有模型。

Comments Published in Transactions on Machine Learning Research (TMLR), 03/2026

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08033 2026-04-10 cs.AI cs.MA cs.NI 70%

IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling

IoT-Brain:为语义-空间传感器调度 grounding LLMs

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin, Jinke Song

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出IoT-Brain系统,通过引入空间轨迹图(STG)解决LLM在语义-空间传感器调度中的表示、推理和优化缺陷,提升任务成功率37.6%并显著降低资源消耗。

Comments To appear in ACM MobiCom 2026; 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08296 2026-04-10 cs.AI 70%

Towards a Science of Scaling Agent Systems

迈向代理系统的科学:扩展性研究

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究院) Massachusetts Institute of Technology(麻省理工学院) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过260种配置评估六种代理基准,探讨代理系统在扩展维度上的性能变化规律,揭示协调、模型能力与任务结构之间的关系,发现协作成功取决于协调与任务结构的匹配程度。

详情

展开后加载摘要…

URL PDF HTML 收藏