arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5820 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 878 篇

2608.14026 2026-08-19 cs.CE 版本更新 88%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11461 2026-08-17 cs.RO 版本更新 88%

CoViLLM: An Adaptive Human-Robot Collaborative Assembly Framework Using Large Language Models

CoViLLM:一种利用大语言模型的自适应人机协作装配框架

Jiabao Zhao, Jonghan Lim, Hongliang Li, Ilya Kovalenko

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CoViLLM框架,结合深度相机定位、人类操作员分类和大语言模型,实现定制化和新产品的自适应装配,通过NIST装配任务板验证,实验表明该框架提升了人机协作的灵活性。

Comments 6 pages, 7 figures. Accepted to ASME MSEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12244 2026-08-04 cs.RO 版本更新 88%

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

任何房屋任何任务:为抽象人类任务的可扩展长周期规划

Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20639 2026-08-04 cs.CL cs.AI cs.LG 版本更新 88%

Latent Collaboration in Multi-Agent Systems

多智能体系统中的潜在协作

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He, James Zou, Mengdi Wang, Ling Yang

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。

Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16586 2026-07-30 cs.CV 版本更新 88%

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

LOCUS: 局部视觉线索搜索增强多模态大语言模型的细粒度感知

Zhou Tao, Fang Zhang, Zewen Ding, Shida Wang, Xiaokun Sun, YongXiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出LOCUS训练框架,通过可验证的局部线索搜索代理任务,使MLLM内化细粒度证据选择,提升定位敏感视觉理解而不改变推理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00491 2026-07-30 cs.NI 版本更新 88%

Smart-TCP: An Agentic AI-based Autonomous and Adaptive TCP Protocol

Smart-TCP:基于智能体AI的自主自适应TCP协议

Yule Han, Kezhi Wang, Yizhe Zhao, Kun Yang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Smart-TCP框架,利用大/小语言模型与算术逻辑单元协同决策,实现TCP控制逻辑的自适应,实验显示高精度与全生命周期成功率。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21334 2026-07-14 cs.AI cs.CE cs.CL cs.LG econ.GN q-fin.EC 版本更新 88%

Ideological Bias in LLMs' Economic Causal Reasoning

大语言模型在经济因果推理中的意识形态偏见

Donggyu Lee, Hyeok Yun, Jungwon Kim, Junsik Min, Sungwon Park, Sangyoon Park, Jihee Kim

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) College of Business, KAIST(韩国科学技术院商学院) School of Computing, KAIST(韩国科学技术院计算机学院) Division of Social Science, HKUST(香港科技大学社会科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨LLM在经济因果推理中的意识形态偏见,通过扩展EconCausal基准测试,评估20种先进LLM在处理意识形态冲突案例时的准确性,发现LLM在意识形态冲突案例上表现更差,且存在系统性偏倚。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08387 2026-07-07 cs.CV 版本更新 88%

AULLM++: Structured-Token-Conditioned Large Language Models for Micro-Expression Action Unit Detection

AULLM++:用于微表情动作单元检测的结构化令牌条件大语言模型

Zhishu Liu, Kaishen Yuan, Bo Zhao, Hui Ma, Zitong Yu

机构 * Great Bay University(广东东莞大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 针对微表情动作单元检测,以往方法有局限。本文提出AULLM++框架,利用大语言模型,将视觉特征注入文本提示,分证据构建、结构建模和基于推理预测三阶段,融合多粒度证据等,提升性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22873 2026-06-16 cs.LG cs.AI cs.CL 版本更新 88%

When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions

LLM何时推理?基于熵相变的动力系统视角

Wei Xia, Haoqing Wang, Zhi-Hong Deng, Yehui Tang

机构 * Samsung Research(三星研究院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,北京理工大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过早期解码熵动态检测LLM的推理状态,提出轻量级无训练路由框架EDRM,自适应选择推理策略,在减少token消耗的同时提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08983 2026-06-12 cs.RO 版本更新 88%

AssemLM: A Spatial Reasoning Multimodal Large Language Model for Robotic Assembly

AssemLM: 用于机器人装配的空间推理多模态大语言模型

Zhi Jing, Jinbin Qiao, Ouyang Lu, Jicong Ao, Shuang Qiu, Huazhe Xu, Yu-Gang Jiang, Chenjia Bai

机构 * Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Tianjin University(天津大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出AssemLM,一种融合装配手册、点云和文本指令的多模态大语言模型,通过专用点云编码器提取几何与旋转特征,实现精确的6D装配位姿推理,并构建含90万样本的AssemBench基准,在真实机器人装配任务中取得最优性能。

Comments Project Page: https://assemlmhome.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08735 2026-06-11 cs.CV 版本更新 88%

From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models

从对应到动作:多模态大语言模型中类人多图像空间推理

Masanari Oi, Koki Maeda, Ryuto Koike, Daisuke Oba, Nakamasa Inoue, Naoaki Okazaki

机构 * University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出HATCH框架,通过补丁级空间对齐和动作-答案推理两个目标,提升多模态大模型在多图像空间推理中的性能,在三个基准上超越同规模基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13252 2026-08-13 cs.CL 版本更新 87%

A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems

语言模型作为形式化工具在约束满足问题上的现实检验

Rikhil Amonkar, Ceyhun Efe Kayan, Qimei Lai, Ronan Le Bras, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 研究评估了语言模型作为形式化工具在约束满足问题中的表现,发现其在15种模型-数据集组合中表现劣于作为求解器,尽管形式化更具可验证性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05307 2026-08-12 cs.CL 版本更新 87%

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab: 选择性大到小推理时指导以实现高效推理

Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * UIUC(伊利诺伊大学香槟分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);SLM(abstract,abstract_cn);small language model(abstract);分类 cs.CL

AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08856 2026-08-11 cs.SE cs.AI 版本更新 87%

LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns

LAUDE: 基于LLM的硬件设计单元测试生成与调试

Deeksha Nandal, Riccardo Revalor, Soham Dan, Debjit Pal

机构 * Dept. of Electrical and Computer Engineering, University of Illinois Chicago(伊利诺伊大学芝加哥分校电子与计算机工程系) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 LAUDE利用大语言模型能力,实现硬件设计的单元测试生成与调试,有效检测和修复设计中的错误。

Comments 11 Pages, 9 Figures, 9 Tables Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00344 2026-07-29 cs.CL 版本更新 87%

PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning

PilotRL: 通过全局规划引导的渐进式强化学习训练语言模型代理

Keer Lu, Chong Chen, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Huawei Cloud BU(华为云业务部)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 PilotRL通过全局规划引导的渐进式强化学习训练语言模型代理,提升长周期决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03021 2026-07-28 cs.CL 版本更新 87%

Hint-Guided Diversified Policy Optimization for LLM Reasoning

提示引导的多样化策略优化用于大语言模型推理

Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Can Ye, Qiaoming Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出提示引导的多样化策略优化(HDPO),通过“提出-选择-思考”轨迹激励模型生成多样且可靠的解决方案,提升推理能力、候选方案多样性和可靠方案识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11936 2026-07-24 cs.AI 版本更新 87%

From Noise to Diversity: Random Embedding Injection in LLM Reasoning

从噪声到多样性:在LLM推理中的随机嵌入注入

Heejun Kim, Seungpil Lee, Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim, Sundong Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术学院) Seoul National University(首尔国立大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了随机软提示(RSPs),通过在输入中添加随机嵌入向量提升推理性能,揭示了注入过程对生成多样性的影响,并在推理和训练中均取得显著效果。

Comments Under review, ICML 2026 Mechanistic Interpretability Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21378 2026-07-22 cs.RO cs.AI 版本更新 87%

RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation

RoboInspector:揭示用于基于大语言模型的机器人操作的策略代码的不可靠性

Chenduo Ying, Linkang Du, Peng Cheng, Yuanchao Shu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的机器人操作中策略代码不可靠问题,设计RoboInspector从任务复杂性和指令粒度揭示其不可靠性,通过实验识别四种不可靠行为及原因,还引入优化方法,可提高策略代码生成可靠性达35%。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03651 2026-07-20 cs.LG math.OC 版本更新 87%

LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs

基于文本业务输入的大语言模型引导的交通枢纽容量规划

Xiaoyue Liu, Zheng Dong

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究提出用大语言模型代理依自然语言业务描述迭代提出枢纽容量决策的框架,核心机制是思维链推理协议,经反馈回路验证决策,在实际货运网络中表现优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 87%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10785 2026-07-07 physics.ed-ph cs.AI cs.HC 版本更新 87%

Developing an LLM-Based Feedback System Grounded in Evidence-Centered Design to Support Physics Problem Solving

构建基于证据中心设计的大型语言模型自动反馈系统以支持物理问题解决

Holger Maus, Fabian Kieser, Stefan Petersen, Peter Wulff, Paul Tschisgale

机构 * Leibniz Institute for Science and Mathematics Education(莱布尼茨科学和数学教育研究所) Free University of Berlin(柏林自由大学) Ludwigsburg University of Education(路德维希堡教育大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于大型语言模型的自动反馈系统,采用证据中心设计方法,评估其在德国物理奥林匹克竞赛中的表现,发现反馈在20%的情况下存在错误,需进一步改进以提高可靠性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25741 2026-07-03 cs.CL 版本更新 87%

Scaling Latent Reasoning via Looped Language Models

通过循环语言模型扩展潜在推理

Rui-Jie Zhu, Zixuan Wang, Kai Hua, Tianyu Zhang, Ziniu Li, Haoran Que, Boyi Wei, Zixin Wen, Fan Yin, He Xing, Lu Li, Jiajun Shi, Kaijing Ma, Shanda Li, Taylor Kergan, Andrew Smith, Xingwei Qu, Mude Hui, Bohong Wu, Qiyang Min, Hongzhi Huang, Xun Zhou, Wei Ye, Jiaheng Liu, Jian Yang, Yunfeng Shi, Chenghua Lin, Enduo Zhao, Tianle Cai, Ge Zhang, Wenhao Huang, Yoshua Bengio, Jason Eshraghian

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 提出Ouro系列循环语言模型,通过在潜在空间迭代计算、熵正则化深度分配和扩展至7.7T令牌,实现优于更大模型的推理性能,并展示其知识操控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11599 2026-07-01 cs.LG 版本更新 87%

Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol

面向LLM推理的定向测试:一种受审计约束的协议

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出一种受审计约束的协议,用于评估LLM推理能力,通过组件自适应提示采样与均匀采样对比,验证了在受控环境下研究定向提示变化的有效性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10187 2026-06-25 cs.LG 版本更新 87%

MINIF2F-DAFNY: LLM-Guided Mathematical Theorem Proving via Auto-Active Verification

MINIF2F-DAFNY: 通过自动主动验证的LLM引导数学定理证明

Mantas Baksys, Stefan Zetzsche, Olivier Bouissou, Sean B. Holden

机构 * University of Cambridge, Cambridge, UK(剑桥大学) Amazon Web Services, London, UK(亚马逊网络服务(伦敦)) Amazon Web Services, Boston, USA(亚马逊网络服务(波士顿))

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 提出首个将数学基准miniF2F翻译到自动主动验证器Dafny的数据集,评估8个LLM的证明生成能力,最佳模型Claude Opus 4.6达到62.7%的累积通过率,比空证明基线提升23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19331 2026-06-23 cs.CL 版本更新 87%

Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

评估基于大语言模型的议会辩论总结的论证内容

Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago

机构 * School of Computer Science, University College Dublin(都柏林大学计算机科学学院) School of Politics and International Relations, University College Dublin(都柏林大学政治与国际关系学院) Department of Informatics, King’s College London(伦敦国王学院信息学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种评估议会辩论总结的框架,通过计算论证方法评估总结对辩论论证内容的忠实性,以欧洲议会辩论为例验证方法有效性。

Comments Accepted at KR'26 In The Wild Track. Camera Ready with additional supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10384 2026-06-16 cs.AI 版本更新 87%

Beyond Scalars: Evaluating and Understanding LLM Reasoning via Geometric Progress and Stability

超越标量:通过几何进展和稳定性评估与理解LLM推理

Xinyan Jiang, Ninghao Liu, Di Wang, Lijie Hu

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出TRACED框架,利用几何运动学将推理轨迹分解为进展和稳定性,揭示正确推理与幻觉的拓扑差异,实现鲁棒的推理质量评估。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16456 2026-06-11 cs.AI 版本更新 87%

GPO: Learning from Critical Steps to Improve LLM Reasoning

GPO:从关键步骤中学习以改进大语言模型推理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science Northwestern University(计算机科学系西北大学) AI Foundations Capital One(人工智能基础资本 one) Meta AI

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出引导式关键优化(GPO)微调策略,通过识别推理轨迹中的关键步骤并优先学习,显著提升大语言模型的多步推理能力。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23057 2026-06-08 cs.AI 版本更新 87%

Don't Make the LLM Read the Graph: Make the Graph Think

不要让大语言模型读图:让图思考

Yuqi Sun, Tianqin Meng, George Liu, Yashraj Panwar, Lakshya Chaudhry, Munasib Ilham, Aman Chadha

机构 * Mindoverflow University of Waterloo(多伦多大学) Carnegie Mellon University(卡内基梅隆大学) Foothill College(foothill学院) Purdue University(普渡大学) University of Wisconsin(威斯康星大学) Apple(苹果公司)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 通过3000多次对照实验,研究显式信念图在合作多智能体推理中是否提升LLM性能,发现集成架构决定图的价值,识别出“规划者违抗”现象,并证明图深度收益递减。

Comments main body has 9 pages, 4 figures, under review for COLM 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10758 2026-07-08 cs.CR 版本更新 87%

Agents at Risk: How Users Unwittingly Undermine LLM Safety

处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性

Fengchao Chen, Tingmin Wu, Van Nguyen, Surya. Nepal, Carsten Rudolph

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。

Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03237 2026-08-19 cs.HC cs.AI cs.CL 版本更新 87%

Supporting Calibrated Reliance in Human-AI Collaboration: Different Strategies for Different Tasks

说服悖论:当LLM解释未能提升人机团队表现时

Ruth Cohen, Lu Feng, Ayala Bloch, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) University of Virginia(弗吉尼亚大学) Department of Psychology, Ariel University(阿里尔大学心理学系)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 研究揭示LLM解释在提升人机团队表现上的矛盾效果,通过三组实验发现解释增加信心但未必提升准确性,且可能抑制错误恢复能力,强调需转向校准依赖与有效错误恢复的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏