arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2605.30686 2026-06-01 cs.CR cs.AI cs.LG 73%

Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity

工具调用ReAct代理中深度相关的间接提示注入:注入深度、载荷框架和轮次预算敏感性

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室) Berlin, Germany(柏林,德国)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 通过四个对照实验(共460次试验),研究在工具调用ReAct代理中,注入深度、载荷框架和轮次预算对间接提示注入攻击成功率的影响,发现注入深度是主导变量,且仅清理第一个工具观察可捕获67%的注入成功。

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31408 2026-06-01 cs.CL cs.AI cs.LG 67%

Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study

大型语言模型代理中的技能可用性与呈现粒度:一项受控的SkillsBench研究

Xiaonan Xu, Wenjing Wu

机构 * Computer Information Technology, Northern Arizona University(计算机信息科技,北亚利桑那大学) Computer Science, University of Colorado Boulder(计算机科学,科罗拉多大学博尔德分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过受控实验研究技能知识的呈现粒度对下游任务成功率的影响,发现技能可用性显著提升成功率,而呈现粒度变化影响较小且不确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31228 2026-06-01 cs.LG cs.AI 62%

EchoRL: Reinforcement Learning via Rollout Echoing

EchoRL:通过回滚回响进行强化学习

Jinhe Bi, Aniri, Minglai Yang, Xingcheng Zhou, Wenke Huang, Sikuan Yan, Yujun Wang, Zixuan Cao, Michael Färber, Xun Xiao, Volker Tresp, Yunpu Ma

机构 * Munich Center for Machine Learning(慕尼黑机器学习中心) Huawei Heisenberg Research Center(华为海森堡研究所以) University of Arizona(亚利桑那大学) College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) MemAgents Lab(MemAgents实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR训练中优势退化问题,提出EchoRL模块,通过从成功回滚中提取EchoClip作为辅助监督信号,持续提升训练性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30913 2026-06-01 cs.CL cs.AI cs.CY cs.HC 62%

Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits

有毒幻觉:扰动提示与追踪LLM电路

Soorya Ram Shimgekar, Agam Goyal, Amruta Parulekar, Joshua Chen, Yian Wang, Navin Kumar, Hari Sundaram, Eshwar Chandrasekharan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nimblemind

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究有毒语言扰动对LLM事实可靠性的影响,发现有毒词汇降低准确率并增加不确定性,通过归因图分析揭示内部机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31423 2026-06-01 cs.LG 57%

Fixed Universal Transformers

固定通用Transformer

Jingwen Liu, Alexandr Andoni, Daniel Hsu

机构 * Columbia University(哥伦比亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出固定通用Transformer,通过输入嵌入模拟任意给定类别的Transformer,证明其通用性在足够大嵌入维度下可通过稀疏结构实现,且随机初始化几乎必然通用,实验验证了理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31370 2026-06-01 cs.AI 57%

HypoAgent: An Agentic Framework for Interactive Abductive Hypothesis Generation over Knowledge Graphs

HypoAgent: 一种用于知识图谱上交互式溯因假设生成的智能体框架

Yisen Gao, Yixi Cai, Tianshi Zheng, Jiaxin Bai, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beihang University(北航) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出HypoAgent框架,通过三个智能体(意图识别、假设生成、根因分析)实现知识图谱上的交互式溯因假设生成,在常识和生物医学领域知识图谱上达到最优语义相似度。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31146 2026-06-01 cs.HC cs.AI 57%

From Evidence to Design: Developing an AI-Augmented UX Research Point of View for Digital Wellbeing in Emergency and Public Safety Contexts

从证据到设计:开发面向紧急与公共安全情境下数字福祉的AI增强用户体验研究视角

Olumuyiwa Ayorinde, Huseyin Dogan, Festus Adedoyin, Nan Jiang, Emmanuel Oluokun, Abiodun Adedeji, Melike Akca

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究结合用户体验研究方法与AI支持分析,针对紧急与公共安全人员开发数字福祉干预措施的设计方向,通过文献分析识别模式并整合行为改变技术与说服性设计原则,最终产出UXR PoV金字塔、九张UXR游戏卡和利益相关者叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31056 2026-06-01 cs.CL 57%

How Much Do LLMs Know About Chinese Zero Pronouns?

LLMs 对中文零代词的了解程度如何?

Yifei Li, Guanyi Chen, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北省人工智能与智能学习重点实验室) National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究中心) School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 通过一系列语言学动机任务(识别、指称性分类、指称类型分类、消解和翻译),系统评估了大型语言模型处理中文零代词的能力,发现当前LLMs在零代词处理上仍面临巨大挑战,尤其在识别和指称性分类等上游任务上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06453 2026-06-01 cs.AI 57%

ConSensus: Multi-Agent Collaboration for Multimodal Sensing

ConSensus:面向多模态感知的多智能体协作

Hyungjun Yoon, Mohammad Malekzadeh, Sung-Ju Lee, Fahim Kawsar, Lorena Qendro

机构 * KAIST(韩国科学技术院) Nokia Bell Labs(诺基亚贝尔实验室) University of Glasgow(格拉斯哥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ConSensus,一种无需训练的多智能体协作框架,通过将多模态感知任务分解为专用智能体并采用混合融合机制,在五个基准上平均准确率提升7.1%,融合token成本降低12.7倍。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21513 2026-06-01 cs.LG 57%

IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference

IntAttention: 面向高效边缘推理的全整数注意力流水线

Wanli Zhong, Haibo Feng, Zirui Zhou, Hanyang Peng, Shiqi Yu

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 针对Transformer在边缘设备上部署时softmax路径导致的数据类型转换瓶颈,提出IntAttention全整数注意力流水线,通过IndexSoftmax算子、稀疏感知裁剪、32项查找表近似和直接整数归一化,消除数据类型转换开销,在Armv8 CPU上实现高达3.7倍加速和61%能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14190 2026-06-01 cs.AI 57%

Inferring Events from Time Series using Language Models

利用语言模型从时间序列中推断事件

Mingtian Tan, Mike A. Merrill, Zack Gottesman, Tim Althoff, David Evans, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大型语言模型能否从时间序列数据中推断自然语言事件,提出自动化任务生成方法和新基准,并通过蒸馏与强化学习提升小模型性能。

Comments 21 pages, 15 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31256 2026-06-01 cs.RO 50%

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

在封闭停车场之前:面向自动驾驶高效具身大语言模型的强化学习时间剪枝

Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

机构 * Department of Control and Computer Engineering(控制与计算机工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出一种在强化学习过程中进行剪枝的策略BPF,通过任务特定监督和闭环反馈压缩具身大语言模型控制器,在自动驾驶控制管道中实现了更好的性能-内存-吞吐量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10778 2026-06-01 cs.CR 50%

GoodVibe: Security-by-Vibe for LLM-Based Code Generation

GoodVibe:基于神经元的LLM代码生成安全增强方法

Maximilian Thang, Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Jona te Lintelo, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 其他推理 :reasoning(abstract)

AI总结 提出GoodVibe框架,通过梯度归因识别安全相关神经元并进行选择性微调,在保持模型通用性的同时显著提升代码生成安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏