arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 341 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 34 篇

2604.17501 2026-04-21 cs.CL 57%

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

CoAct:基于人机协同的LLM偏好学习

Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

机构 * Northwestern University(西北大学) Google(谷歌) University of Southern California(南加州大学) University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05760 2026-04-21 cs.CL 57%

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning

Writing-RL: 通过自适应课程强化学习推进长文本写作

Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) Institute of Intelligent Computing(智能计算研究院) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。

Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09536 2026-04-21 cs.CL 57%

Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors

评估大型语言模型对多语言拼写错误的鲁棒性

Raoyuan Zhao, Yihong Liu, Lena Altinger, Hinrich Schütze, Michael A. Hedderich

机构 * Center for Information and Language Processing(信息与语言处理中心) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MulTypo算法,评估18种开源LLM在多语言拼写错误下的表现,发现拼写错误显著降低性能,尤其在生成任务和推理任务中,且语言和任务类型影响鲁棒性,强调需关注噪声训练和多语言鲁棒性评估。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV 50%

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 8 篇

2604.16584 2026-04-21 cs.SE cs.AI cs.PL 83%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 代码与定理证明 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17010 2026-04-21 cs.CL cs.AI cs.LG cs.PL 82%

Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal Verification

通过形式验证的语义等价自博弈提升大语言模型代码推理

Antonio Valerio Miceli Barone, Poon Tsz Nok

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于形式验证的语义等价自博弈框架,利用对抗训练提升代码推理能力,通过验证等价性与非等价性,释放OpInstruct-HSx数据集,实验显示在EquiBench上提升13.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14628 2026-04-21 cs.PL cs.AI cs.CR cs.LO 79%

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

s2n-bignum-bench:评估LLM低级代码推理能力的实用基准

Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出s2n-bignum-bench基准,用于评估LLM在工业级低级密码学汇编代码中的定理证明能力,通过形式化验证挑战证明生成。

Comments Accepted as a Workshop paper at AIPV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17252 2026-04-21 cs.CL cs.AI cs.RO 62%

Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents

看见并不等于相信:通过主动干预缓解具身智能体中的信念惯性

Hanlin Wang, Chak Tou Leong, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过主动干预缓解具身智能体中的信念惯性问题,引入EVU机制提升任务成功率。

Comments Accepted by ACL2026 Fingdings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18404 2026-04-21 cs.AI 61%

Six Llamas: Comparative Religious Ethics Through LoRA-Adapted Language Models

六头 llama:通过 LoRA 调整的语言模型进行比较宗教伦理研究

Chad Coleman, W. Russell Neuman, Manan Shah, Ali Dasdan, Matthew Crispi, Morris Chiang, Zack Leitman, Mustafa Poonawala

机构 * Meta

专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文通过 LoRA 调整的语言模型比较不同宗教文本对伦理推理的影响,发现调整模型在伦理推理上与基础模型有系统性差异,并在不同温度设置下表现出稳定性与多样性。

Comments 51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17229 2026-04-21 cs.AI 57%

Yanasse: Finding New Proofs from Deep Vision's Analogies, Part 1

Yanasse:从深度视觉类比中寻找新证明,第一部分

Alexandre Linhares

机构 * Getulio Vargas Foundation and ARGO LABS(格尔维拉斯基金会和ARGO实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Yanasse通过将证明策略模式从结构上遥远的数学领域转移到另一个领域,发现新证明。该方法在概率与表示论之间应用,生成4个Lean验证的新证明,证明编译无错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01645 2026-04-21 cs.CR 50%

Contextualizing Sink Knowledge for Java Vulnerability Discovery

在Java漏洞发现中 contextualizing sink knowledge

Fabian Fleischer, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16524 2026-04-21 cs.CR 50%

Anumati: Proof of Adherence as a Formal Consent Model for Autonomous Agent Protocols

Anumati:作为自主代理协议的合规性证明形式化同意模型

Ravi Kiran Kadaboina

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一种形式化同意模型,用于自主代理协议中的合规性证明,通过三个原始构件实现版本化、只追加的同意模型,并将其扩展到两种常用代理协议中。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 13 篇

2604.17819 2026-04-21 cs.CL cs.AI 86%

PDDL-Mind: Large Language Models are Capable on Belief Reasoning with Reliable State Tracking

PDDL-Mind:大型语言模型在具有可靠状态跟踪的信念推理中表现出色

Wang Bill Zhu, Qiutong Tony Yi, Robin Jia, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 PDDL-Mind通过将叙述描述转换为显式状态和动作,为LLM提供了一致的世界状态表示,从而在信念推理任务中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02871 2026-04-21 cs.CL cs.AI 81%

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00430 2026-04-21 cs.AI 79%

MIRROR: Converging Cognitive Principles as Computational Mechanisms for AI Reasoning

MIRROR:将认知原则转化为AI推理的计算机制

Nicole Hsing

机构 * arcarae

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MIRROR通过将人类认知原理转化为计算机制,提升了多轮对话中在注意力干扰下的约束维持能力,验证了平行处理与整合合成的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12950 2026-04-21 cs.AI 79%

NumCoKE: Ordinal-Aware Numerical Reasoning over Knowledge Graphs with Mixture-of-Experts and Contrastive Learning

NumCoKE: 基于混合专家和对比学习的图知识中有序意识数值推理

Ming Yin, Zongsheng Cao, Qiqing Xia, Chenyang Tu, Neng Gao

机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Information Science, Tsinghua University(清华大学信息学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出NumCoKE框架,通过混合专家和对比学习解决知识图谱中数值推理的语义整合不足和有序区分困难问题,实验表明其在不同属性分布下表现优越。

Comments Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17225 2026-04-21 cs.CL 77%

A Multi-Agent Approach for Claim Verification from Tabular Data Documents

从表格数据文档中验证声明的多智能体方法

Rudra Ranajee Saha, Laks V. S. Lakshmanan, Raymond T. Ng

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MACE,通过规划器、执行器和验证器三个智能体,实现可解释的表格数据验证,实验显示其在多个数据集上达到SOTA性能,且在参数较少时仍表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06328 2026-04-21 cs.AI 70%

C-World: A Computer Use Agent Environment Creator

C-World:一个计算机使用代理环境创建者

Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou

机构 * UC San Diego(UC圣迭戈大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 C-World通过四个组件构建代理环境,解决LLM代理在规划和推理中与人类的差距问题,展示其作为评估环境和数据引擎的双重价值。

Comments Submitted to ACL 2026 12 pages, 4 figures Ziqiao Xi and Shuang Liang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17475 2026-04-21 cs.AI cs.CL cs.LG 67%

Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception

觉醒失明:为基于视觉感知的代理轨迹进行无监督的冷启动优化

Ashutosh Bajpai, Tamal Majumder, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎比) Microsoft Research(微软研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SPECTRA框架,通过冷启动强化学习提升小视觉语言模型的视觉鲁棒性和工具协调能力,无需监督即可提高任务准确性和工具效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18052 2026-04-21 cs.CR cs.AI cs.LG 62%

ExAI5G: A Logic-Based Explainable AI Framework for Intrusion Detection in 5G Networks

ExAI5G:一种用于5G网络入侵检测的基于逻辑的可解释人工智能框架

Saeid Sheikhi, Panos Kostakos, Lauri Loven

机构 * organization= Faculty of Information Technology Electrical Engineering, University of Oulu , addressline= , city= Oulu , postcode= 90570 , state= , country= Finland

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExAI5G框架,结合Transformer深度学习与逻辑可解释AI技术,实现高精度且透明的入侵检测,通过逻辑规则提取和解释评估方法,达到99.9%准确率和0.854宏F1分数,展示出模型推理的透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16871 2026-04-21 cs.AI cs.LG 62%

GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

GRAIL:自主概念 grounding 用于神经符号强化学习

Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Google Intrinsic(谷歌内在) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17988 2026-04-21 cs.CL 57%

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

利用通用和生物医药大语言模型与先进提示工程进行药事流行病学研究设计

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较通用和生物医药大语言模型在药事流行病学研究设计中的表现,发现通用模型在相关性和逻辑性上表现更优,但提示策略对模型性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11182 2026-04-21 cs.CL 57%

MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization

MetaMem: 通过自反思符号优化实现元记忆的进化以促进知识利用

Haidong Xin, Xinze Li, Zhenghao Liu, Yukun Yan, Shuo Wang, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MetaMem框架,通过自反思符号优化增强记忆系统,帮助LLM更有效地利用记忆知识。实验表明,MetaMem在多个任务中显著优于基线模型,提升超过3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17142 2026-04-21 cs.MA 50%

Logic-Based Verification of Task Allocation for LLM-Enabled Multi-Agent Manufacturing Systems

基于逻辑的任务分配验证在LLM赋能的多智能体制造系统中

Jonghan Lim, Mostafa Tavakkoli Anbarani, Rômulo Meira-Góes, Ilya Kovalenko

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出一种利用大语言模型灵活性并保持安全性的控制架构,通过时序逻辑和离散事件系统验证任务分配,通过多机器人装配案例证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV 50%

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 68 篇

2507.20409 2026-04-21 cs.CL cs.AI cs.CY 91%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);planning(abstract)

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03154 2026-04-21 cs.CL 90%

Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective

解耦链式推理的影响:从人类标签变异视角出发

Beiduo Chen, Tiancheng Hu, Caiqi Zhang, Robert Litschko, Anna Korhonen, Barbara Plank

机构 * MaiNLP Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) LMU Munich, Germany(慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Language Technology Lab, University of Cambridge, United Kingdom(语言技术实验室,剑桥大学,英国)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过系统解耦实验探讨了链式推理对分布任务的影响,发现推理内容对最终准确性贡献大,而模型先验对分布排名起主导作用。

Comments Accepted by ACL 2026 Findings, 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07745 2026-04-21 cs.CL cs.AI cs.LG 85%

Parallel Test-Time Scaling for Latent Reasoning Models

潜在推理模型的并行测试时缩放

Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shandong Jianzhu University(山东建筑大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过改进采样和聚合方法,使潜在推理模型能有效利用并行测试时缩放,提升连续空间中的推理能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 84%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11407 2026-04-21 cs.CL cs.AI 84%

Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning

检索即生成:一个统一框架与自触发信息规划

Bo Li, Mingda Wang, Gexiang Fang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GRIP框架通过生成引导检索与信息规划,实现检索与推理的紧密耦合,支持动态多步推理,实验表明其在问答基准上优于RAG基线并接近GPT-4o。

Comments Github: https://github.com/WisdomShell/GRIP HuggingFace:https://huggingface.co/collections/WisdomShell/grip

Journal ref ACL2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏