arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-10 至 2026-04-10 共收录 307 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 16 篇

2504.20472 2026-04-10 cs.CR 67%

Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction

通过引用实现鲁棒性:通过引用已执行的指令来防御提示注入攻击

Yulin Chen, Haoran Li, Yuan Sui, Yue Liu, Yufei He, Xiaoling Bai, Chi Fei, Yabo Li, Haozhe Ma, Yangqiu Song, Bryan Hooi

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出通过利用LLM的指令遵循能力来防御提示注入攻击,通过生成包含答案和对应指令引用的响应,有效过滤非原始指令关联的答案,实验表明其在降低攻击成功率方面优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08181 2026-04-10 cs.LG 57%

Long-Term Embeddings for Balanced Personalization

长期嵌入用于平衡个性化

Andrii Dzhoha, Egor Malykh

机构 * Zalando SE

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出Long-Term Embeddings方法,通过固定语义基底确保跨版本兼容性,解决长期偏好与短期意图的平衡问题,并在Zalando实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07146 2026-04-10 cs.CV 50%

Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

学习搜索:一种基于决策的知识增强视觉问答代理

Zhuohong Chen, Zhenxian Wu, Yunyao Yu, Hangrui Xu, Zirui Liao, Zhifang Liu, Xiangwen Deng, Pen Jiao, Haoqian Wang

机构 * Tsinghua University(清华大学) University of Arizona(亚利桑那大学) Hefei University of Technology(合肥工业大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 50%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 指令微调 :SFT(abstract)

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 7 篇

2508.13993 2026-04-10 cs.CL cs.AI 91%

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization

片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样

Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Microsoft Research Asia, China(微软亚洲研究院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13551 2026-04-10 cs.CL cs.AI 88%

Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models

面向增强大语言模型推理能力的分层多步奖励模型

Teng Wang, Zhangyi Jiang, Zhenqi He, Shenyang Tong, Wenhan Yang, Yanan Zheng, Zeyu Li, Zifan He, Hailei Gong, Zewen Ye, Shengjie Ma, Jianping Zhang

机构 * the University of Hong Kong(香港大学) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) the Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08454 2026-04-10 cs.LG 85%

Less Approximates More: Harmonizing Performance and Confidence Faithfulness via Hybrid Post-Training for High-Stakes Tasks

少而精:通过混合后训练实现性能与置信度忠实的和谐统一

Haokai Ma, Lee Yan Zhen, Gang Yang, Yunshan Ma, Ee-Chien Chang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) Singapore Management University, Singapore(新加坡管理大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出HyTuning框架,通过混合后训练方法在有限监督下提升模型准确性并实现置信度忠实,支持'少而精'的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08042 2026-04-10 cs.CV cs.AI 85%

3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

3DrawAgent:通过早期对比经验教LLM进行3D绘制

Hongcan Xiao, Xinyue Xiao, Yilin Wang, Yue Zhang, Yonggang Qi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jiangnan University(江南大学) HaoHan Data(浩瀚数据)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 3DrawAgent通过几何反馈利用大语言模型生成3D贝塞尔曲线,引入相对经验优化策略,无需参数更新提升3D空间理解与绘制质量,实现免训练的3D草图智能发展。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06670 2026-04-10 cs.CL 85%

PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch

PIKA:从零开始的专家级合成数据集用于训练后对齐

Shangjian Yin, Shining Liang, Wenbiao Ding, Yuli Qian, Zhouxing Shi, Hongzhi Li, Yutao Xie

机构 * University of California, Riverside(加州大学河滨分校) Microsoft AI(微软人工智能)

专题命中 后训练与偏好优化 :post-training(title);LLM(abstract);SFT(abstract);preference optimization(abstract)

AI总结 PIKA通过高效的数据集提升对齐效果,仅用3万例超越大规模数据集,在AlpacaEval 2.0等基准测试中表现优异,且提供高质量偏好优化数据,降低数据需求,促进资源受限研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07837 2026-04-10 cs.AI 77%

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

SPARD:通过整合奖励动态和数据效用实现强化学习对齐的自适应课程

Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, YI WU, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 SPARD通过动态调整多目标奖励权重和数据重要性,提升强化学习对齐效果,实验显示在多个基准上显著增强模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10476 2026-04-10 cs.CL cs.AI 73%

Learning to Negotiate: Multi-Agent Deliberation for Collective Value Alignment in LLMs

学习协商:多智能体协商以实现大语言模型中的集体价值对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Nima Asgharbeygi, Jad Tarifi

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于多智能体协商的对齐框架,通过集体代理(CA)目标提升大语言模型的集体价值对齐能力,并改进冲突解决能力,实验表明其在冲突解决性能上有显著提升。

Comments To appear in LREC 2026 2nd DELITE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 15 篇

2604.07752 2026-04-10 cs.SE cs.AI 89%

MIMIC-Py: An Extensible Tool for Personality-Driven Automated Game Testing with Large Language Models

MIMIC-Py:一种基于人格驱动的大型语言模型自动游戏测试工具

Yifei Chen, Sarra Habchi, Lili Wei

机构 * Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MIMIC-Py通过模块化架构实现人格驱动LLM代理的可重用性和扩展性,支持多种交互机制,降低新游戏环境部署难度。

Comments 10 pages, Accepted by FSE Companion '26, July 5--9, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08224 2026-04-10 cs.SE cs.MA 85%

Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering

LLM代理中的外部化:内存、技能、协议和Harness工程的统一综述

Chenyu Zhou, Huacan Chai, Wenteng Chen, Zihan Guo, Rong Shan, Yuanyi Song, Tianyi Xu, Yingxuan Yang, Aofan Yu, Weiming Zhang, Congming Zheng, Jiachen Zhu, Zeyu Zheng, Zhuosheng Zhang, Xingyu Lou, Changwang Zhang, Zhihui Fu, Jun Wang, Weiwen Liu, Jianghao Lin, Weinan Zhang

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了LLM代理中从模型权重到上下文再到Harness的演变,探讨了内存、技能和协议作为外部化形式的协同作用,分析了参数化能力与外部化能力的权衡及未来发展方向。

Comments 54 pages, tech report on Externalization in LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18030 2026-04-10 cs.OS cs.AI cs.PL cs.SE 79%

Quine: Realizing LLM Agents as Native POSIX Processes

Quine:将LLM代理作为原生POSIX进程实现

Hao Ke

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 Quine通过将LLM代理作为原生POSIX进程实现,利用操作系统提供的隔离、调度和通信机制,继承内核的隔离、组合和资源控制能力,支持递归委托和上下文刷新。

Comments Minor revision clarifying exec semantics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04759 2026-04-10 cs.CL cs.AI 79%

Stacked from One: Multi-Scale Self-Injection for Context Window Extension

从一叠起:多尺度自我注入用于上下文窗口扩展

Wei Han, Pan Zhou, Soujanya Poria, Shuicheng Yan

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) Singapore Management University (SMU)(新加坡管理大学) Nanyang Technological University (NTU)(南洋理工大学) National University of Singapore (NUS)(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多尺度自我注入框架,通过压缩和查询感知信息获取扩展上下文窗口,实现高效且准确的长上下文处理。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08206 2026-04-10 cs.MA 75%

"Theater of Mind" for LLMs: A Cognitive Architecture Based on Global Workspace Theory

LLM 的 '心灵剧场':基于全局工作空间理论的认知架构

Wenlong Shang

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于全局工作空间理论的全局工作空间代理(GWA)架构,通过引入熵驱动机制和双层记忆分叉策略,解决LLM自主性不足的问题,实现持续自主认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07981 2026-04-10 cs.CL cs.AI cs.LG 75%

A Decomposition Perspective to Long-context Reasoning for LLMs

从分解视角看大语言模型的长上下文推理

Yanling Xiao, Huaibing Xie, Guoliang Zhao, Shihan Dou, Shaolei Wang, Yiting Liu, Nantao Zheng, Cheng Zhang, Pluto Zhou, Zhisong Zhang, Lemao Liu

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University(西安交通大学) Tencent(腾讯) Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从分解视角出发,将长上下文推理分解为基本原子技能,并通过伪数据集训练提升模型能力,实验证明该方法在多个基准测试中提升了7.7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07589 2026-04-10 cs.HC 75%

COSMIC: Emotionally Intelligent Agents to Support Mental and Emotional Well-being in Extreme Isolation: Lessons from Analog Astronaut Training Missions

COSMIC:支持心理健康和情绪福祉的智能代理:来自类比宇航员训练任务的启示

A. Xygkou-Tsiamoulou, Alexandra Covaci, Zeqi Jia, Jenny Yiend, Chee Siang Ang

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出COSMIC,一种高保真情感智能AI伴侣,用于评估生成AI在极端孤立环境下的有效性,通过模块化架构和自然观察框架评估心理韧性。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07740 2026-04-10 cs.CV cs.AI 70%

Beyond Pedestrians: Caption-Guided CLIP Framework for High-Difficulty Video-based Person Re-Identification

超越行人:基于描述的CLIP框架用于高难度视频基的人重识别

Shogo Hamano, Shunya Wakasugi, Tatsuhito Sato, Sayaka Nakamura

机构 * Sony Group Corporation(索尼集团公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CG-CLIP框架,通过文本描述和可学习令牌提升视频中高难度行人重识别性能,实验表明其在多个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07737 2026-04-10 cs.CL 70%

SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMs

SepSeq:一种无需训练的长数值序列处理框架

Jie Sun, Yu Liu, Lu Han, Qiwen Deng, Xiang Shu, Yang Xiao, Xingyu Lu, Jun Zhou, Pengfei Liu, Lintao Ma, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) University of Edinburgh(爱丁堡大学) East China Normal University(华东师范大学) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Ocean University of China(中国海洋大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM处理长数值序列性能下降问题,提出SepSeq框架通过插入分隔符令牌缓解注意力分散,提升准确率并减少推理令牌消耗。

Comments 16 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG 70%

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08290 2026-04-10 cs.SE 67%

Tokalator: A Context Engineering Toolkit for Artificial Intelligence Coding Assistants

Tokalator:一个用于人工智能代码助手的上下文工程工具包

Vahid Farajijobehdar, İlknur Köseoğlu Sarı, Nazım Kemal Üre, Engin Zeydan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 Tokalator为AI辅助开发提供上下文管理工具,包含实时预算监控、11个命令、九个计算器及17种大语言模型支持,通过50名开发者的调研发现指令文件注入和低相关性标签是主要预算消耗来源。

Comments 37 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07658 2026-04-10 cs.LG cs.AI cs.CL 67%

Optimal Decay Spectra for Linear Recurrences

线性递归模型的最优衰减谱

Yang Cao

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PoST框架,通过谱重参数化和位置自适应缩放,实现线性递归模型的最优衰减谱,提升长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07809 2026-04-10 cs.LG cs.AI 62%

PolicyLong: Towards On-Policy Context Extension

PolicyLong:迈向基于策略的上下文扩展

Junlong Jia, Ziyang Chen, Xing Wu, Chaochen Gao, TingHao Yu, Feng Zhang, Songlin Hu

机构 * Hunyuan Team, Tencent(腾讯混元团队) Chinese Academy of Sciences(中国科学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 PolicyLong通过动态在线策略方法解决LLM上下文扩展中的数据稀缺问题,通过迭代重新执行数据筛选,确保训练分布与模型能力同步,提升长上下文性能。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27765 2026-04-10 cs.AI 57%

Let the Agent Steer: Closed-Loop Ranking Optimization via Influence Exchange

让代理引导:通过影响交换实现闭环排名优化

Yin Cheng, Liao Zhou, Xiyu Liang, Dihao Luo, Tewei Lee, Kailun Zheng, Weiwei Zhang, Mingchen Cai, Jian Dong, Andy Zhang

机构 * Shopee

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出Sortify,首个自主LLM驱动的排名优化代理,通过影响交换闭环实现从诊断到参数部署的自动化优化,解决了结构问题并提升了GMV和广告收入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07901 2026-04-10 cs.CV 50%

PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation

PanoSAM2:轻量级的失真和内存感知的SAM2改进用于360视频对象分割

Dingwen Xiao, Weiming Zhang, Shiqi Wen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文提出PanoSAM2,通过改进SAM2以应对360视频中的失真和内存问题,提升分割可靠性,同时保持用户友好的提示设计。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 51 篇

2510.07048 2026-04-10 cs.CL cs.AI 90%

Search-R3: Unifying Reasoning and Embedding in Large Language Models

Search-R3:在大型语言模型中统一推理与嵌入

Yuntao Gui, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Search-R3通过统一推理与嵌入生成过程,提升大型语言模型在检索任务中的性能,采用监督学习、强化学习和专用环境机制实现有效嵌入生成。

Comments CHANGELOG: (1) Completed training of Search-R3-Large; (2) Corrected error formulation; (3) Added a `Discussion` section to the appendix. We appreciation to the anonymous reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04500 2026-04-10 cs.AI cs.RO 89%

"Don't Do That!": Guiding Embodied Systems through Large Language Model-based Constraint Generation

别这样做!

Amin Seffo, Aladin Djuhera, Masataro Asai, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出STPR框架,利用LLM将自然语言中的约束转化为可执行Python代码,解决复杂约束的翻译问题,并在仿真环境中验证其高效性和兼容性。

Comments ICLR 2026 Workshop -- Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08401 2026-04-10 cs.AI cs.CL 86%

Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing

在提交前验证:通过自我审计实现LLM代理中的忠实推理

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Xuehe Wang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAVeR框架,通过在行动承诺前验证内部信念状态,提升LLM代理的推理忠实性,实验表明其在保持任务性能的同时提升了推理可靠性。

Comments Accepted by ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08369 2026-04-10 cs.AI cs.CL cs.MA 86%

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

不要过度思考:跨回合动作一致性作为LLM代理的自由自适应计算信号

Khushal Sethi

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TrACE通过测量跨回合动作一致性,实现LLM代理的自适应计算分配,无需训练或外部验证,在多步序列决策任务中提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏