arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-20 至 2026-04-20 共收录 116 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 14 篇

2603.03332 2026-04-20 cs.CL cs.AI cs.LG 88%

Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations

脆弱的思考:大型语言模型如何处理推理链扰动

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型在推理链扰动下的鲁棒性,通过五种扰动类型评估13种模型,发现不同扰动对模型的影响各异,模型规模在某些扰动中起到保护作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15701 2026-04-20 cs.CL 87%

Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information

通过关键信息的分步注意力混合层蒸馏提升小模型的推理能力

Yao Chen, Jiawei Sheng, Wenyuan Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出一种基于分步注意力的混合层蒸馏方法,通过引导学生模型逐步聚焦关键信息,提升小模型的推理能力,并在多个数学和常识推理数据集上取得一致性能提升。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02996 2026-04-20 cs.CL 87%

Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners

大型推理模型是(尚未)多语言潜在推理器

Yihong Liu, Raoyuan Zhao, Hinrich Schütze, Michael A. Hedderich

机构 * cisnlp

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究了多语言潜在推理在大型推理模型中的表现,发现其在资源丰富语言中表现较强,但在低资源语言中较弱,且在更难的基准测试中更不明显。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19563 2026-04-20 cs.AI cs.CL 87%

TabularMath: Understanding Math Reasoning over Tables with Large Language Models

TabularMath: 通过大规模语言模型理解表格上的数学推理

Shi-Yu Tian, Zhi Zhou, Wei Dong, Kun-Yang Yu, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出TabularMath基准,通过神经符号框架将数学问题转化为可扩展的表格推理任务,揭示表格复杂度、质量及表征对推理性能的影响,发现低质量表格对当前LLM的可靠性构成严重风险。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08281 2026-04-20 cs.CL 86%

When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning

何时信任工具?用于工具集成数学推理的自适应工具信任校准

Ruotao Xu, Yixin Ji, Yu Luo, Jinpeng Li, Dong Li, Peifeng Li, Juntao Li, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门) Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学深圳(HITSZ))

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

AI总结 本文提出ATTC框架,通过自适应选择信任或忽略工具结果来解决工具忽略问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11274 2026-04-20 cs.AI cs.CL 84%

SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning

SelfBudgeter:面向高效大语言模型推理的自适应令牌分配

Zheng Li, Qingxiu Dong, Jingyuan Ma, Di Zhang, Kai Jia, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) BandAI, Bytedance(字节跳动BandAI)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SelfBudgeter策略,通过自适应预算分配提升LLM推理效率,实验显示在数学推理任务中平均响应长度压缩61%并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI 81%

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15842 2026-04-20 cs.CL 79%

Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms

解构大语言模型中的数学推理:对内部机制的调查

Tanja Baeumel, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland University(萨尔兰大学) Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过分析LLM执行算术任务时的内部机制,揭示模型在早期层识别算术任务,但正确结果生成仅在最终层完成,并发现擅长算术的模型在注意力与MLP模块间有明确分工。

Comments MathNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15490 2026-04-20 cs.CL 79%

Think Multilingual, Not Harder: A Data-Efficient Framework for Teaching Reasoning Models to Code-Switch

多语言思考,而非更难:一种数据高效的框架,用于教授推理模型进行语言混合

Eleanor M. Lin, David Jurgens

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种数据高效的框架,用于识别并教授推理模型更有效的语言混合行为,通过分析不同模型的语言混合行为,开发出有效的微调干预措施,提升推理模型的语言混合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07774 2026-04-20 cs.CL 79%

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards

用评分奖励模型治愈大语言模型数学推理中的奇迹步骤

Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳)) UC Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过评分奖励模型解决大语言模型数学推理中的奇迹步骤问题,通过系统分析和人类验证建立失败模式分类,提升推理准确性和可靠性。

Comments Accepted by ACL 2026 Main, 22 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML 67%

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16259 2026-04-20 cs.LG cs.AI 62%

Beyond Distribution Sharpening: The Importance of Task Rewards

超越分布细化:任务奖励的重要性

Sarthak Mittal, Leo Gagnon, Guillaume Lajoie

机构 * Mila Université de Montréal(蒙特利尔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比分布细化与基于任务奖励的学习,揭示了任务奖励在提升模型性能中的关键作用,实验表明任务奖励能带来更稳定的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15416 2026-04-20 cs.LG cs.AI math.OC 62%

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models

StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型

Dingzhi Yu, Rui Pan, Yuxing Liu, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14517 2026-04-20 cs.CL cs.LG 62%

Large Language Models for Math Education in Low-Resource Languages: A Study in Sinhala and Tamil

大型语言模型在低资源语言中的数学教育应用:斯里兰卡语和泰米尔语的研究

Sukumar Kishanthan, Kumar Thushalika, Buddhi Jayasekara, Asela Hevapathige

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Moratuwa(穆拉图瓦大学) Department of Electrical and Information Engineering(电气与信息工程系) University of Ruhuna(鲁胡纳大学) Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院) Tampere University(塔尔皮奥大学) School of Computing(计算学院) Australian National University(澳大利亚国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大型语言模型在斯里兰卡语和泰米尔语中的数学推理能力,发现基础算术推理在不同语言间表现稳定,但复杂问题在两种语言中均有显著下降,表明英语表现佳不等于多语言可靠。

Comments Accepted to ITHET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2604.15839 2026-04-20 cs.AI cs.CL cs.LO 62%

Discover and Prove: An Open-source Agentic Framework for Hard Mode Automated Theorem Proving in Lean 4

发现与证明:一个开源代理框架用于Lean 4中的硬模式自动定理 proving

Chengwu Liu, Yichun Yin, Ye Yuan, Jiaxuan Xie, Botao Li, Siqi Li, Jianhao Shen, Yan Xu, Lifeng Shang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(信息处理国家重点实验室,计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAP框架,通过LLM自然语言推理与自我反思发现答案,并将硬模式问题转换为易模式问题以提升自动定理证明性能,实现了CombiBench和PutnamBench上的显著提升。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2604.14334 2026-04-20 q-bio.QM cs.AI 89%

Mamba-SSM with LLM Reasoning for Feature Selection: Faithfulness-Aware Biomarker Discovery

Mamba-SSM结合LLM推理进行特征选择:面向生物标志物发现的可信度意识方法

Pushpa Kumar Balan, Aijing Feng

机构 * Department of Computer Science and Cybersecurity(计算机科学与网络安全系)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(summary_cn,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究LLM推理在过滤特征选择中的作用,通过Mamba-SSM提取基因并结合CoT提升预测性能,发现特征筛选能提高AUC并验证部分已知生物标志物。

Comments 9 pages, 4 figures. Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15727 2026-04-20 cs.AI cs.LG cs.LO 87%

Structured Abductive-Deductive-Inductive Reasoning for LLMs via Algebraic Invariants

通过代数不变量实现LLMs的结构归纳-演绎-演绎推理

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深思科技) Department of Computer Science University of Florida(佛罗里达大学计算机科学系)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过代数不变量实现LLMs的结构归纳-演绎-演绎推理框架,通过五种代数不变量确保推理链中结论的可靠性,防止逻辑不一致的累积。

Comments 10 pages + 3 pages references. Accepted as a poster at the ICLR 2026 Workshop for LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17292 2026-04-20 cs.CL cs.AI 81%

Multi-View Attention Multiple-Instance Learning Enhanced by LLM Reasoning for Cognitive Distortion Detection

多视角注意力多实例学习增强的认知扭曲检测

Jun Seo Kim, Hyemi Kim, Woo Joo Oh, Hongjin Cho, Hochul Lee, Hye Hyeon Kim

机构 * Gachon University(加成大学) Korea Telecom Research(韩国电信研究所) Yonsei University(延世大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合大语言模型与多实例学习架构的方法,通过分解情绪、逻辑和行为成分提升认知扭曲检测的可解释性和推理能力。

Comments Accepted to the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20689 2026-04-20 cs.AI cs.CL 62%

WiseMind: a knowledge-guided multi-agent framework for accurate and empathetic psychiatric diagnosis

WiseMind: 一种基于知识的多智能体框架,用于准确且富有同理心的精神病诊断

Yuqi Wu, Guangya Wan, Jingjing Li, Shengming Zhao, Lingfeng Ma, Tianyi Ye, Ion Pop, Yanbo Zhang, Jie Chen

机构 * College of Biomedical Engineering(生物医学工程学院) Fudan University(复旦大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Alberta(阿尔伯塔大学) University of Virginia(弗吉尼亚大学) McIntire School of Commerce(麦金尼商学院) School of Data Science(数据科学学院) Department of Psychiatry(精神病学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 WiseMind通过整合理性与情感智能体,结合DSM-5知识图谱,提升了精神病诊断的准确性与同理心,其在1206次模拟对话和180次真实交互中达到85.6%的诊断准确率,超越了单智能体方法。

Comments Accepted at npj Digital Medicine (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15736 2026-04-20 cs.CV cs.CL 57%

RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees

RefereeBench: 视频多模态大语言模型是否准备好成为多项目裁判

Yichen Xu, Yuanhang Liu, Chuhan Wang, Zihan Zhao, jinghan luo, Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RefereeBench,首个评估多模态大语言模型作为自动体育裁判的基准,通过11项运动925个视频和6475对问答,评估犯规存在、分类、推理、实体感知和时间定位能力,发现当前模型在规则应用和时间定位上表现不足。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15623 2026-04-20 cs.AR 50%

Overmind NSA: A Unified Neuro-Symbolic Computing Architecture with Approximate Nonlinear Activations and Preemptive Memory Bypass

Overmind NSA:一种具有近似非线性激活和抢先记忆绕过功能的统一神经符号计算架构

Weilun Wang, Zirui Wang, Wantong Li

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出Overmind架构,通过Padé近似、抢先记忆绕过和软件栈优化,解决神经符号计算中的计算瓶颈,实现高能效和吞吐量。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15163 2026-04-20 cs.DB 50%

DPC: Training-Free Text-to-SQL Candidate Selection via Dual-Paradigm Consistency

DPC:基于双范式一致性的无训练文本到SQL候选选择

Boyan Li, Ou Ocean Kun Hei, Yue Yu, Yuyu Luo

专题命中 逻辑推理 :self-correction(abstract)

AI总结 本文提出DPC方法,通过双范式一致性框架解决文本到SQL的生成与选择差距问题,利用SLICER和TESTER代理构建最小区分数据库,通过执行一致性验证提升候选选择准确性。

Comments ACL 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 23 篇

2604.16022 2026-04-20 cs.AI cs.LG cs.MA 88%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02935 2026-04-20 cs.CL cs.AI cs.MA 88%

Theory of Mind in Action: The Instruction Inference Task in Dynamic Human-Agent Collaboration

行动中的理论思维:动态人机协作中的指令推断任务

Fardin Saad, Pradeep K. Murukannaiah, Munindar P. Singh

机构 * North Carolina State University(北卡罗来纳州立大学) Delft University of Technology(代尔夫特理工大学)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出指令推断任务,通过Tomcat模型评估人机协作中理论思维能力,实验表明Fs-CoT在GPT-4o和DeepSeek-R1上表现接近人类参与者。

Comments 66 pages with appendix, 10 figures (Appendix: 26 Figures), 11 tables. Code available at: https://github.com/fardinsaad/Tomcat-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12390 2026-04-20 cs.AI 83%

Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models

思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理

Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Shenyang Aerospace University(沈阳航空航天大学) ZGC LAB, Beijing,China(北京ZGC实验室) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出HCoT方法,通过启发式分类模型整合专家系统启发式方法,提升大型语言模型在复杂问题中的推理能力,实现更高效的决策和更稳定的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16263 2026-04-20 cs.RO 82%

Semantic Area Graph Reasoning for Multi-Robot Language-Guided Search

语义区域图推理用于多机器人语言引导搜索

Ruiyang Wang, Hao-Lun Hsu, Jiwoo Kim, Miroslav Pajic

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出语义区域图推理框架,通过结构化语义拓扑抽象实现多机器人语义搜索,提升复杂室内环境中的目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 81%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 79%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10446 2026-04-20 cs.RO cs.AI 79%

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph:用于可验证机器人规划的场景图

Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

机构 * University of Maryland, College Park, MD USA(马里兰大学学院公园分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 VeriGraph通过整合视觉语言模型和场景图,提升机器人任务规划的可行性验证与修正,显著提高任务完成率。

Comments Accepted to ICRA 2026. Project website: https://verigraph-agent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15456 2026-04-20 cs.AI 70%

DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI

DeepER-Med: 通过代理AI推进医学中的深度证据导向研究

Zhizheng Wang, Chih-Hsuan Wei, Joey Chan, Robert Leaman, Chi-Ping Day, Chuan Wu, Mark A Knepper, Antolin Serrano Farias, Jordina Rincon-Torroella, Hasan Slika, Betty Tyler, Ryan Huu-Tuan Nguyen, Asmita Indurkar, Mélanie Hébert, Shubo Tian, Lauren He, Noor Naffakh, Aseem Aseem, Nicholas Wan, Emily Y Chew, Tiarnan D L Keenan, Zhiyong Lu

机构 * Division of Intramural Research (DIR), National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)内务研究部,国家卫生研究院(NIH)) Hunterian Neurosurgical Laboratory, Johns Hopkins School of Medicine(约翰霍普金斯医学院霍尔特神经外科实验室) Cancer Data Science Laboratory, Center for Cancer Research, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)癌症数据科学实验室,国家癌症研究中心,国家卫生研究院(NIH)) Experimental Immunology Branch, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)实验免疫学分支,国家卫生研究院(NIH)) Epithelial Systems Biology Laboratory, Systems Biology Center, National Heart, Lung, and Blood Institute (NHLBI), National Institutes of Health (NIH)(国家心肺血液研究所(NHLBI)上皮系统生物学实验室,系统生物学中心,国家卫生研究院(NIH)) Brain Tumor Genetics Lab, Department of Neurosurgery, Johns Hopkins Hospital(约翰霍普金斯医院神经外科部脑肿瘤遗传实验室) Division of Hematology/Oncology, University of Illinois Chicago(伊利诺伊大学芝加哥分校血液/肿瘤科部) University of Illinois Cancer Center, Chicago, IL 60612, USA(伊利诺伊大学癌症中心,芝加哥,IL 60612,美国) Division of Epidemiology and Clinical Applications, National Eye Institute (NEI), National Institutes of Health (NIH)(国家眼耳研究所(NEI)流行病学与临床应用部,国家卫生研究院(NIH)) University of Michigan Medical School, Ann Arbor, MI 48109, USA(密歇根大学医学学院,安阿伯,MI 48109,美国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DeepER-Med通过代理AI框架提升医学研究的证据生成流程,包含研究规划、协作和证据综合模块,并通过专家评估和真实临床案例验证其有效性。

Comments 37 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏