arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-20 至 2026-08-20 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2509.19893 2026-08-20 cs.CL 版本更新 79%

Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning

为离线强化学习未来政策近似改进数学推理

Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03447 2026-08-20 cs.LG cs.AI 版本更新 62%

Approximate Speculative Decoding

近似投机解码

Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

专题命中 数学推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无需训练的Approximate Speculative Decoding(ASD),通过带预算的最长前缀选择优化投机解码,提升了生成吞吐量与验证器接受率,且无需新草稿模型或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-08-20 cs.CL cs.AI 版本更新 62%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2607.14178 2026-08-20 cs.AI cs.MA 版本更新 79%

ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System

ReasFlow:通过基于知识的多智能体系统助力应用数学中以推理为中心的科学发现

Yutong He, Daibo Li, Guohong Li, Jiahe Geng, Zhengyang Huang, Can Ren, Zekun Zhang, Yifan Liu, Shuchen Zhu, Hengrui Zhang, Boao Kong, Ming Sun, Shu Li, Chenyi Li, Jiang Hu, Kun Yuan, Zaiwen Wen, Pingwen Zhang

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 针对理论驱动科学发现探索不足的问题,ReasFlow引入以推理为中心的自主智能体系统,通过内部验证循环和知识检索机制减少专家干预,能统一多项科研任务,从最少提示生成高质量论文,在开源基线中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 8 篇

2608.07734 2026-08-20 cs.RO cs.AI cs.MA 版本更新 79%

Complete, Scalable, and Robust Prioritized Planning for Multi-Robot Ordered Storage and Retrieval at Maximum Capacity

面向最大容量下多机器人有序存取任务的完备、可扩展且鲁棒的优先规划

William Zhang, Tzvika Geft, Jingjin Yu, Kostas Bekris

机构 * Rutgers University(罗格斯大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对最大容量下多机器人有序存取问题,提出利用无重排布局特性的在线优先多智能体路径规划算法,实现可扩展且鲁棒的规划,完工时间随机器人数量近线性提升,处理不确定性时执行速度无显著损失。

Comments WAFR 2026 (World Symposium on the Algorithmic Foundations of Robotics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04100 2026-08-20 cs.AI 版本更新 79%

Hybrid Reinforcement Learning and Search for Flight Trajectory Planning

混合强化学习与搜索的飞行轨迹规划

Alberto Luise, Michele Lombardi

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种混合强化学习与搜索的方法,用于快速优化民航飞行路径,通过预计算近优路径减少求解空间,提升计算效率并保持燃油消耗相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-20 cs.AI cs.LG cs.MA 版本更新 73%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments This submission is withdrawn because the uploaded manuscript does not accurately reflect the intended structure or results. Several components referenced in the text are incomplete or not represented in the PDF, and the current version may mislead readers. The work is therefore withdrawn to maintain clarity of the record

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 70%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-20 cs.RO cs.AI cs.CL 版本更新 62%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-20 cs.RO cs.AI 版本更新 57%

Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01324 2026-08-20 cs.AI 版本更新 57%

G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution

G-ReAct:基于结构-状态协同演化的图引导深度搜索

Shaoxiong Yang, Mengyuan Zhang, Shaojun Lin, Chao Li, Wei Liu, Kun Shao, Jian Luan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出图引导深度搜索框架G-ReAct,通过结构-状态协同演化解决现有LLM深度搜索的上下文遗忘等问题,仅用少量轨迹微调即提升模型在BrowseComp-ZH、XBench上的准确率,且推理时可增强现有LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13840 2026-08-20 cs.RO cs.CV 版本更新 50%

Multi-Agent Embodied Autonomous Driving (MAEAD): From V2X Information Exchange to Shared World Models

多智能体具身自动驾驶:从V2X信息交换到共享世界模型

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Yiqin Deng, Yuguang Fang

机构 * Lingnan University, Hong Kong(岭南大学(香港))

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 3 篇

2608.04759 2026-08-20 cs.CV cs.CL 版本更新 85%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-20 cs.AI 版本更新 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21064 2026-08-20 cs.CV 版本更新 50%

2Xplat: Decoupling Geometry and Appearance Modeling for Feed-Forward 3D Gaussian Splatting

2Xplat:两个专家胜过一个通才

Hwasik Jeong, Seungryong Lee, Gyeongjin Kang, Seungkwon Yang, Xiangyu Sun, Seungtae Nam, Eunbyung Park

机构 * Yonsei University(延世大学) Sungkyunkwan University(成均馆大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出2Xplat框架,通过分离几何估计与高斯生成,改进3DGS生成效果,证明模块化设计在复杂3D建模中的优势。

Comments Project page: this https URL (https://hwasikjeong.github.io/2Xplat)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 1 篇

2607.28147 2026-08-20 cs.CR 版本更新 50%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 3 篇

2605.06185 2026-08-20 cs.AI cs.CV 版本更新 79%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16002 2026-08-20 cs.CL cs.AI 版本更新 62%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-08-20 cs.CV 版本更新 50%

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 4 篇

2606.16149 2026-08-20 cs.AI 版本更新 79%

Teaching agentic AI to learn expert reasoning for rare disease diagnosis

LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体

Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler, Kevin W. Byram, Chih-Ting Yang, Fan Ma, Hua Xu, Wu-Chen Su, Chao Yan, Wei-Qi Wei, Adam Wright, Lisa Bastarache, Josh F. Peterson, Lingyao Li, Siyuan Ma, Undiagnosed Diseases Network, Rizwan Hamid, Thomas A. Cassini, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心) University of South Florida(南佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出轻量级框架LiteOdyssey,通过人类-AI协作的诊断策略和公共生物医学工具增强单个推理语言模型,在罕见病诊断基准上达到最先进性能,无需微调或多智能体集成。

Comments Updated abalation experiments and layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14778 2026-08-20 cs.CV cs.LG 版本更新 74%

AMPLIFAI: A Multiphase CT Dataset for Benchmarking Clinical Reasoning in LI-RADS Assessment of Liver Lesions

AMPLIFAI:用于基准测试LI-RADS肝脏病变评估临床推理的多期CT数据集

Pranav Kulkarni, Nikhil Shah, Amritansh Suryavanshi, Jana G. Delfino, James Tonascia, Jade Wong-You-Cheong, Barton Lane, Joseph Chirico, Jeffrey D. Hirsch, Ang Li, Heng Huang, Florence X. Doo

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Maryland School of Medicine(马里兰大学医学院) University of Maryland Institute for Health Computing(马里兰大学健康计算研究所) University of Maryland Medical System(马里兰大学医学系统)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 研究针对LI-RADS肝脏病变评估AI模型缺乏公开高质量数据集的问题,推出首个公开多期腹部CT扫描的AMPLIFAI数据集,标注LI-RADS类别并分割关键特征,助力相关透明可复现研究。

Comments 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 62%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 57%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他推理 4 篇

2608.17253 2026-08-20 cs.LG cs.AI cs.CV 版本更新 81%

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21079 2026-08-20 cs.CV 版本更新 78%

Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models

聚焦推理:面向视觉语言模型的有状态、基于动作的视觉聚焦

Juhong Min, Lazar Valkov, Vitali Petsiuk, Hossein Souri, Deen Dayal Mohan

机构 * AI Center -- Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出Foveated Reasoner,通过整合聚焦与推理机制,提升视觉语言模型在高分辨率图像下的效率与准确性,实验证明其在多种基准测试中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00919 2026-08-20 cs.CL cs.LG 版本更新 62%

Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models

迈向轻量级可靠性:使用软提示缓解大型语言模型中的幻觉

S M Tahmid Siddiqui, Akib Jawad Ononto, Anoop Singhal, Latifur Khan

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(国家标准与技术研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出一种参数高效的软提示方法RCSP,通过对比学习、课程学习和KL正则化平衡事实回忆、幻觉抑制和弃权,在多个QA数据集上优于基线。

Comments 20 pages, 5 tables, 2 figures. Accepted for publication in DBSec 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07941 2026-08-20 cs.CR 版本更新 50%

Collective Hallucination in Multi-Agent LLMs:Modeling and Defense

多智能体大语言模型中的集体幻觉:建模与防御

Saeid Jamshidi

专题命中 其他推理 :reasoning(abstract)

AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。

详情

展开后加载摘要…

URL PDF HTML 收藏