arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 33 篇

2607.05029 2026-07-07 cs.CR cs.AI 新提交 87%

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

你的智能体记忆并非其自身所有:针对大语言模型智能体记忆的伪造推理攻击及防御

Neeraj Karamchandani, Piyush Nagasubramaniam, Sencun Zhu, Dinghao Wu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体记忆伪造推理的攻击,提出FARMA攻击方法,通过规避语言伪造推理痕迹并强化,还引入SENTINEL防御管道,实验表明该防御能有效降低攻击成功率。

Comments Preprint. 10 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02805 2026-07-07 cs.LG cs.AI cs.CL 新提交 85%

Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

使用部分双向性训练混合块扩散语言模型

Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

机构 * Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型高吞吐量长上下文生成挑战,提出BDLM Mamba-attention混合模型,通过限制反向Mamba扫描到活动去噪块解决缓存问题,在长上下文推理中吞吐量有显著提升。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30169 2026-07-07 cs.CY cs.AI cs.MA 版本更新 83%

Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms

分离性身份:语言模型代理缺乏声誉机制的基础

Botao Amber Hu, Helena Rong, Max Van Kleek

机构 * University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校)

专题命中 长上下文与记忆 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。

Comments Accepted by FaccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-07-07 cs.CV 版本更新 82%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract)

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03228 2026-07-07 cs.AI cs.MA 新提交 81%

Organizational Memory for Agentic Business Process Execution

用于智能业务流程执行的组织记忆

Lukas Kirchdorfer, Adrian Rebmann, Christian Warmuth, Timotheus Kampik, Theiss Heilker, Gregor Berg

机构 * SAP Signavio(思爱普西格诺威)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM智能体执行商业流程面临的问题,提出需组织记忆,推导其要求,给出构建与使用架构,并在采购场景中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02574 2026-07-07 cs.DC cs.AI cs.LG 新提交 81%

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

从张量缓冲区到分布式内存层次结构:大语言模型服务中键值缓存管理综述

Jie Li, Tongyang Wang, Yong Chen

机构 * Texas Tech University Department of Computer Science(德克萨斯理工大学计算机科学系)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 综述通过四个轴对三十多个键值管理系统和框架分类,揭示五种架构原型,还审计当前评估,找出七个缺失测量,关联容错等开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04031 2026-07-07 cs.AR 新提交 80%

TileLens: Efficiently Using Large-Granularity Memory Systems with Transparent Two-Dimensional Memory Layout

TileLens:通过透明二维内存布局高效使用大粒度内存系统

Jae Hyung Ju, Euijun Chung, Hritvik Taneja, Anish Saxena, Shinnung Jeong, Hyesoon Kim, Moinuddin K. Qureshi

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型推理受GPU高带宽内存限制问题,指出大粒度内存系统致 tiled 矩阵乘法性能降。提出用 tile-major 布局缓解读放大,介绍TileLens软硬件扩展,评估显示其能在特定条件下接近HBM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03365 2026-07-07 cs.CV cs.AI 新提交 79%

Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources

品牌即记忆:视觉语言模型为新闻来源编码因果性、可机制定位的可信度先验

Chih-Ting Liao, Xin Cao

机构 * University of New South Wales(新南威尔士大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中基于媒体身份的来源可信度先验,通过交叉模型基准测试和机制分析,揭示其特性及影响,如模型和规模依赖性、因果形成机制等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02980 2026-07-07 cs.CL cs.AI 新提交 79%

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

正确实现分层稀疏注意力:迈向无限上下文建模

Xiang Hu, Xinyu Wei, Hao Gu, Minshen Zhang, Tian Liang, Huayang Li, Lei Zhu, Yan Wang, Sirui Han, Yushi Bai, Kewei Tu, Haitao Mi, Leo Liang

机构 * Tencent HY Team(腾讯混元团队) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究如何解决现代大语言模型扩展到长上下文时的计算成本和注意力长度外推问题。提出分层地标稀疏注意力机制,通过语言模型损失端到端学习块选择,实现高效长上下文建模。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02588 2026-07-07 cs.CV cs.AI cs.CL 新提交 79%

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

荷马:通过分层记忆和智能推理理解长视频

Yixin Ji, Fanghua Ye, Juntao Li, Bo Zhao, Zexuan Qiu, Zhaopeng Tu, Liefeng Bo, Min Zhang

机构 * Soochow University(苏州大学) Tencent Hunyuan Multimodal Department(腾讯混元多模态部)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02677 2026-07-07 cs.HC cs.CY 78%

Human Thinking under Plural LLM Assistance: Mathematical Problem Solving and Open-Ended Writing

超越AI导师:基于LLM代理的社会学习

Harsh Kumar, Jace Mu, Jonathan Vincentius, Ashton Anderson

专题命中 长上下文与记忆 :LLM(title,abstract)

AI总结 本文通过两个实验探讨多代理LLM配置是否能提升学习效果,发现与单代理相比,多代理能增强学习成果并避免单一模型的同质化问题。

Comments Working draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01767 2026-07-07 cs.AI 新提交 77%

Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts

修复放大器,而非症状:面向智能体轨迹的稳定世界模型修正

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.AI

AI总结 针对长流程规划中的图级错误,提出WM-SAR方法,通过子图放大反向定位因果子图进行修复,在有限token预算下优于传统扫描修复方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03741 2026-07-07 cs.SE 新提交 75%

Graph-Aware Fuzzing for Graph Database Management Systems

用于图数据库管理系统的图感知模糊测试

Yu Li, Qiang Hu, Yao Zhang, Junjie Wang, Hao Liu, Rui Wang, Yongqiang Lyu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对图数据库管理系统现有测试方法不足,提出GRAF框架。通过基于级联依赖解析的图上下文感知查询生成有效多样查询,用执行状态反馈引导变异操作,提升测试效果,发现众多未知漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 75%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04221 2026-07-07 cs.CL cs.AI cs.LG 版本更新 75%

Context Tuning for In-Context Optimization

上下文调整用于上下文优化

Jack Lu, Ryan Teehan, Zhenbang Yang, Mengye Ren

机构 * Agentic Learning AI Lab(智能代理学习AI实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍上下文调整方法,利用模型固有上下文学习能力从示例初始化可训练记忆表示并优化,提升少样本适应能力,在多基准测试中表现优于其他方法。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02881 2026-07-07 cs.CL 新提交 70%

PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction

PraMem:用于长时行为预测的实践衍生经验记忆

Zhuoqun Li, Boxi Cao, Jiawei Chen, Hanshu Zhou, Ruoxi Xu, Guiping Jiang, Ruotong Pan, Tingting Gao, Han Li, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Kuaishou Technology(快手科技)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究长时行为预测问题,针对大语言模型在该任务中的不足,提出PraMem范式,通过对历史序列预实践构建经验记忆辅助长时行为预测,实验证明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13956 2026-07-07 cs.MA cs.AI 版本更新 70%

AOI: Context-Aware Multi-Agent Operations via Dynamic Scheduling and Hierarchical Memory Compression

AOI:通过动态调度和分层内存压缩实现的上下文感知多智能体操作

Zishan Bai, Hanxuan Chen, Jiayi Gu, Wenqian Weng, Enze Ge, Jiacheng Shi, Yichao Zhang, Zhimo Han, Riyang Bao, Xinyuan Song, Jacqueline Pang, Junfeng Hao

机构 * Columbia University(哥伦比亚大学) Hunan University(湖南大学) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) AI Agent Lab, Vokram Group(Vokram集团人工智能代理实验室) College of William and Mary(威廉与玛丽学院) University of Texas(得克萨斯大学) Zhengzhou University of Light Industry(郑州轻工业大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医科大学附属医院肾病科)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AOI框架,通过动态任务调度和分层内存压缩,提升复杂IT基础设施的自主运维能力,实现72.4%的上下文压缩和94.2%的任务成功率。

Comments new revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19228 2026-07-07 cs.CL 版本更新 70%

CompLLM: Compression for Long Context Q&A

CompLLM:长上下文问答的压缩方法

Gabriele Berton, Jayakrishnan Unnikrishnan, Son Tran, Mubarak Shah

机构 * Amazon(亚马逊) Center For Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型处理长上下文的计算挑战,提出CompLLM软压缩技术。核心方法是将上下文分段独立压缩,具有效率、可扩展性和可重用性。贡献是提升处理速度、减小缓存大小且性能可比甚至超越未压缩情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05378 2026-07-07 cs.LG 新提交 57%

CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

CompactionRL:面向长视界智能体的带上下文压缩强化学习

Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 针对长视界大语言模型智能体受上下文窗口限制的问题,提出结合上下文压缩的强化学习方法,联合优化任务执行与摘要生成,在智能体编码任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04391 2026-07-07 cs.CL 新提交 57%

Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture

内存编排语义系统(MOSS):一种可审计的智能记忆架构

Serge Lacasse, Jérémie Hatier, Alex Baker

机构 * Faculté de musique, Université Laval, Québec, Canada(加拿大魁北克拉瓦尔大学音乐学院) Faculté des sciences et de génie, Université Laval, Québec, Canada(加拿大魁北克拉瓦尔大学理工学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 研究针对AI智能体长期记忆的弱点,提出MOSS架构,通过在结构化关系数据库上驱动检索,具有模型、存储、API无关性,检索可审计且从语料库派生概念词汇,报告了在个人学者工作语料库上的长期部署。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03516 2026-07-07 cs.SE cs.AI cs.CY 新提交 57%

AGL-1: The Enterprise AI Governance Layer as a Control Plane for Trusted Enterprise Intelligence

AGL-1:作为可信企业智能控制平面的企业人工智能治理层

Roopam W. Sure

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 研究企业人工智能从实验走向运营面临的治理挑战,介绍AGL-1企业人工智能治理层这一参考模型,基于相关原则将治理问题从检索控制扩展到全执行路径治理,定义七个治理领域。

Comments 16 pages, 1 figure; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03601 2026-07-07 cs.AR 新提交 50%

ArchEval: Measuring AI Agents as Computer Architects

ArchEval:将人工智能代理作为计算机架构师进行评估

Chenyu Wang, Zishen Wan, Jeffrey Ma, Shvetank Prakash, Zhenting Qi, Haebin Do, Andy Cheng, Arya Tschand, Jiahe Shi, Yilun Du, Vijay Janapa Reddi

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02579 2026-07-07 cs.SE 新提交 50%

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

何时不写入内存:管理来自相关代理痕迹的错误推广

Yijiashun Qi, Xiang Xu, Yuxuan Li

专题命中 长上下文与记忆 :language agent(abstract)

AI总结 研究语言代理从执行痕迹写入可复用内存时何时应拒绝写入的问题,引入GovMem策略,通过估计依赖感知支持等进行决策,在测试中能减少错误推广。

Comments accepted by mlise 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27318 2026-07-07 cs.CV 版本更新 50%

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

专题命中 长上下文与记忆 :language model(abstract)

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15706 2026-07-07 cs.CV 版本更新 50%

RoMa v2: Harder Better Faster Denser Feature Matching

RoMa v2:更优更快更密集的特征匹配

Johan Edstedt, David Nordström, Yushan Zhang, Georg Bökman, Jonathan Astermark, Viktor Larsson, Anders Heyden, Fredrik Kahl, Mårten Wadenbäck, Michael Felsberg

机构 * Linköping University(_linköping大学) Chalmers University of Technology(_chalmers技术大学) University of Amsterdam(_阿姆斯特丹大学) Centre for Mathematical Sciences, Lund University(_数学科学中心,吕勒奥大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 研究针对现有密集匹配器在复杂场景中表现不佳及高精度模型慢等弱点,通过系列改进构建新架构与损失函数,采用解耦管道加速训练、减少内存使用,利用基础模型提升鲁棒性,新匹配器达新的技术水平。

Comments ECCV 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11330 2026-07-07 physics.optics 版本更新 50%

Quantitative Decomposition of Speckle Decorrelation for Inverse Problems in Complex Wave Scattering

复波散射反问题中散斑去相关的定量分解

Qihang Zhang, Haoyu Yue, Ninghe Liu, Danlin Xu, Renjie Zhou, Liangcai Cao, George Barbastathis

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 研究复波散射反问题,揭示反向散射去相关可量化为两项,分别源于表面和体积散射,通过实验验证理论预测,为反问题提供先进正向模型并举例验证。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 99 篇

2509.26306 2026-07-07 cs.AI 版本更新 92%

Interactive Learning for LLM Reasoning

为LLM推理设计的交互学习

Hehai Lin, Shilei Cao, Sudong Wang, Haotian Wu, Minzhi Li, Linyi Yang, Juepeng Zheng, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ILR框架,通过动态交互和感知校准提升LLM独立问题解决能力,实验表明其在多个基准测试中优于单agent学习。

Comments The code is available at https://github.com/linhh29/Interactive-Learning-for-LLM-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11500 2026-07-07 cs.CR 版本更新 91%

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

ARMOR:通过精细推理对齐安全的大语言模型

Zhengyue Zhao, Yingzi Ma, Somesh Jha, Marco Pavone, Patrick McDaniel, Chaowei Xiao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 研究大语言模型安全问题,针对现有方法不足,提出ARMOR,通过三步推理管道提取核心恶意意图并验证,开发ARMOR-Think提升性能,在防御越狱攻击上效果显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27806 2026-07-07 cs.AI 新提交 91%

Agent vs. Parametric World Models: Hybrid Planning for Reliable Language Agents

基于基础迭代语言规划:参数化世界模型如何减少LLM代理中的幻觉传播

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);language agent(title,abstract);language model(abstract);分类 cs.AI

AI总结 提出GILP方法,结合小参数化世界模型与LLM推理,通过一致性门控减少幻觉,在规划基准上将幻觉率从0.176降至0.035,成功率从0.668提升至0.838。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23270 2026-07-07 cs.AI 版本更新 91%

CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

CAP-CoT:用于提升大语言模型推理中思维链的循环对抗提示

Shuxu Chen, Yitian Zhou, Jiaquan Zhang, Haoyu Bian, Wenrui Hu, Aming Wu, Sungyoung Lee, Chaoning Zhang, Hyundong Shin

机构 * Department of Electronic Engineering, Kyung Hee University(韩国庆熙大学电子工程系) School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) Henan Polytechnic University(河南理工大学) School of Computing, Kyung Hee University(韩国庆熙大学计算机学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CAP-CoT通过循环对抗提示框架提升LLM推理的准确性和稳定性,通过生成候选推理链、构造有缺陷的链并对比反馈,优化推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏