arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-10 至 2026-06-10 共收录 105 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2601.21218 2026-06-10 cs.CL 版本更新 93%

Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data

参数化知识并非全部:通过检索预训练数据实现诚实的语言模型

Christopher Adrian Kusuma, Muhammad Reza Qorib, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型在知识不足时产生幻觉的问题,提出利用公开预训练数据构建更鲁棒的诚实性评估基准,并设计检索预训练数据的方法提升模型诚实性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28054 2026-06-10 cs.CL 版本更新 91%

Who Wrote the Book? Detecting and Attributing LLM Ghostwriters

谁写了这本书?检测与归因LLM代笔作者

Anudeex Shetty, Qiongkai Xu, Olga Ohrimenko, Jey Han Lau

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息学院) School of Computing, FSE, Macquarie University, Australia(麦考瑞大学计算学院)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出GhostWriteBench数据集和TRACE指纹方法,用于检测和归因LLM生成的长文本,在跨域和未见模型上达到SOTA性能。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06888 2026-06-10 cs.LG 版本更新 88%

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

数据受限的语言模型预训练:改进的正则化与缩放定律

Zhiwei Xu, Shihao Wu, Hanseul Cho, Wei Hu, Yixin Wang

机构 * University of Michigan(密歇根大学) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究数据受限下语言模型预训练的正则化与缩放,提出掩码输入正则化(MIR)改善验证损失,并设计SoftQ缩放定律更准确拟合重复数据下的模型与数据规模交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04287 2026-06-10 cs.LG cs.CL q-bio.GN 版本更新 81%

Entropy, Disagreement, and the Limits of Foundation Models in Genomics

熵、分歧与基因组基础模型的局限性

Maxime Rochkoulets, Lovro Vrček, Mile Šikić

机构 * Genome Institute of Singapore, A*STAR(新加坡基因组研究院,A*STAR) KU Leuven(卢森堡大学) Faculty of Electrical Engineering and Computing, University of Zagreb(扎格雷布大学电子工程与计算学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过分析熵对模型学习的影响,发现基因组序列的高熵导致输出分布接近均匀、模型间分歧大和静态嵌入不稳定,且Fisher信息集中在嵌入层,表明仅靠序列自监督训练可能不适用于基因组数据。

Comments Accepted to LMLR Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17907 2026-06-10 cs.CL cs.AI 版本更新 81%

Improving Topic Modeling by Distilling Soft Labels from Language Models

DSL-Topic:通过从语言模型中蒸馏软标签改进主题建模

Raymond Li, Amirhossein Abaskohi, Chuyuan Li, Gabriel Murray, Giuseppe Carenini

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DSL框架,通过从语言模型蒸馏软标签来增强主题模型训练,利用上下文感知的软标签重构信号,显著提升主题连贯性和分配准确性。

Comments 22 pages, 5 figures. Camera-ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-06-10 cs.CV 版本更新 75%

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28093 2026-06-10 cs.CL 版本更新 70%

ConRAG: Consensus-Driven Multi-View Retrieval for Multi-Hop Question Answering

ConRAG: 用于多跳问答的共识驱动多视角检索

Yikai Zhu, Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ConRAG框架,通过共识驱动的多视角检索(关系、实体、文本信号)优化查询和语料库,显著提升多跳问答性能,在MuSiQue上创下新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01248 2026-06-10 cs.LG 版本更新 57%

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data

$S^3$-R1: 通过合成数据学习逐步检索与回答

Harsh Goel, Akhil Udathu, Susmija Jabbireddy, Pradnesh Kalkar, Atharva Parulekar

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :post-training(abstract);分类 cs.LG

AI总结 提出S^3-R1框架,通过合成数据生成和密集奖励信号,解决强化学习后训练中稀疏奖励和缺乏多跳问题数据的问题,提升模型搜索与问答能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01135 2026-06-10 cs.LG 版本更新 57%

Your Autoregressive Model Already Reveals the Causal Graph

你的自回归模型已经揭示了因果图

Hugo Math, Rainer Lienhart

机构 * Department of Machine Learning \& Computer Vision, University of Augsburg, Augsburg, Germany

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出TRACE框架,利用预训练自回归模型作为密度估计器进行条件独立性测试,从单序列离散事件中恢复时间因果图,并在大规模非线性SCM和真实车辆诊断日志上取得显著性能提升。

Comments 8 pages

Journal ref Structured Probabilistic Inference & Generative Modeling workshop ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12071 2026-06-10 cs.LG 版本更新 57%

Influence Dynamics and Stagewise Data Attribution

影响动力学与分阶段数据归因

Jin Hwa Lee, Matthew Smith, Maxwell Adam, Jesse Hoogland

机构 * University College London(伦敦大学学院) Independent(独立) University of Melbourne(墨尔本大学) Timaeus

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 针对神经网络训练中样本影响动态变化的问题,基于奇异学习理论提出分阶段数据归因框架,预测影响非单调变化(符号翻转、尖峰),并在玩具模型和语言模型中验证与模型学习阶段的对应。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 7 篇

2511.10234 2026-06-10 cs.LG cs.AI 版本更新 92%

Lost in Serialization: Invariance and Generalization of LLM Graph Reasoners

迷失在序列化中:LLM图推理器的不变性与泛化能力

Daniel Herbst, Lea Karbevska, Divyanshu Kumar, Akanksha Ahuja, Fatemeh Gholamzadeh Nasrabadi, Fabrizio Frasca

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM图推理器对图表示对称性的缺乏不变性,通过分解序列化因素并评估微调影响,发现大模型更鲁棒,微调降低节点重标敏感但增加结构和格式敏感,且不保证泛化。

Comments ICML 2026 Workshop on Graph Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22017 2026-06-10 cs.LG 版本更新 90%

Domain Adapted Large Language Models for Additive Manufacturing

面向增材制造的领域自适应大语言模型

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文通过约5000万token的小型数据集对开源大语言模型进行领域自适应预训练和指令微调,构建多模态领域自适应模型,在增材制造基准测试中达到90%以上准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14717 2026-06-10 cs.CL 版本更新 86%

What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects

表格LLM真正重要的是什么?模型与数据影响的元评估

Naihao Deng, Sheng Zhang, Henghui Zhu, Shuaichen Chang, Jiani Zhang, Alexander Hanbo Li, Chung-Wei Hang, Hideo Kobayashi, Yiqun Hu, Patrick Ng

机构 * University of Michigan(密歇根大学) AWS AI Labs(AWS人工智能实验室) Figma OKX Google(谷歌)

专题命中 指令微调 :LLM(title_cn,abstract);foundation model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 通过指令微调12个模型并在16个基准上评估,发现基座模型选择比训练数据对性能影响更大,泛化与推理仍是挑战。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 83%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09475 2026-06-10 cs.AI cs.LG 版本更新 82%

Emergent alignment and the projectability of ethical personas

涌现对齐与伦理人格的可投射性

Guillermo Del Pinal, Youngchan Lee, Calum McNamara, Alejandro Perez Carballo

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究微调大语言模型在窄任务上如何引发广泛对齐行为,通过宪法AI方法赋予模型伦理人格,发现窄对齐可投射到未训练类别,并提出对齐策略应评估可投射性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07800 2026-06-10 cs.CV 版本更新 75%

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

SARA: 语义自适应关系对齐用于视频扩散模型

Jiesong Lian, Zixiang Zhou, Ruizhe Zhong, Yuan Zhou, Qinglin Lu, Rui Wang, Long Hu, Yixue Hao, Baoru Huang

机构 * Tencent Hunyuan(腾讯文英)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新 50%

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

专题命中 指令微调 :language model(abstract)

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 3 篇

2509.25760 2026-06-10 cs.CL cs.AI cs.LG 版本更新 89%

TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning

TruthRL: 通过强化学习激励诚实的LLM

Zhepei Wei, Xiao Yang, Kai Sun, Jiaqi Wang, Rulin Shao, Jingxiang Chen, Mohammad Kachuee, Teja Gollapudi, Yiwei Liao, Nicolas Scheffer, Rakesh Wanga, Anuj Kumar, Yu Meng, Wen-tau Yih, Xin Luna Dong

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TruthRL框架,使用GRPO和三值奖励直接优化LLM的诚实性,减少幻觉并允许不确定时弃权,在知识密集型基准上显著提升诚实性。

Comments ICML 2026. Code: https://github.com/facebookresearch/TruthRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新 88%

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11702 2026-06-10 cs.LG stat.ML 版本更新 79%

Post-Training Augmentation Invariance

训练后增强不变性

Keenan Eikenberry, Lizuo Liu, Yoonsang Lee

机构 * Department of Mathematics, Dartmouth College(达特茅斯学院数学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 提出训练后增强不变性框架,通过轻量级MLP适配器网络在预训练模型潜空间上实现近似不变性,无需微调且保持原始特征。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 6 篇

2605.22714 2026-06-10 cs.AI cs.CL cs.LG 版本更新 92%

AMEL: Accumulated Message Effects on LLM Judgments

AMEL: 累积消息对LLM判断的影响

Sid-Ali Temkit

机构 * chut.app

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLM在对话中因历史消息极性而偏离基准判断的累积消息效应(AMEL),发现模型偏向历史主流极性,且负向历史偏见更强,但偏见不随上下文长度增长,简单修复是为每个项目使用新上下文。

Comments 24 pages, 14 figures, 8 tables. Single author. Code, data (84,088 deduplicated API responses), and analysis pipeline at https://github.com/chutapp/amel

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04195 2026-06-10 cs.AI 版本更新 90%

Constructing coherent spatial memory in LLM agents through graph rectification

通过图修正构建LLM智能体中的连贯空间记忆

Puzhen Zhang, Xuyang Chen, Yu Feng, Yuhan Jiang, Liqiu Meng

机构 * Chair of Cartography and Visual Analytics(制图学与视觉分析教授会)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LLM-MapRepair框架,通过版本控制和边影响评分检测并修正增量构建的导航图中的结构不一致性,在多个基准上显著提升节点和边召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22565 2026-06-10 cs.CL cs.AI 版本更新 90%

Learning Evidence Highlighting for Frozen LLMs

学习为冻结的LLM突出证据

Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Jian Li

机构 * Stony Brook University(石桥大学) Meta AI

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出HiLight框架,通过强化学习训练轻量级Actor在长上下文中插入高亮标签,使冻结的LLM更关注关键证据,无需证据标签或修改求解器,在序列推荐和长上下文问答中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03164 2026-06-10 cs.LG cs.AI 版本更新 82%

MemCast: Memory-Driven Time Series Forecasting with Experience-Conditioned Reasoning

MemCast:基于经验条件推理的记忆驱动时间序列预测

Xiaoyu Tao, Mingyue Cheng, Ze Guo, Shuo Yu, Yaguo Liu, Qi Liu, Shijin Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MemCast框架,将时间序列预测转化为经验条件推理任务,通过层次化记忆学习历史模式、推理智慧和一般规律,并采用动态置信度适应策略实现持续进化,在多个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06758 2026-06-10 cs.CL 版本更新 79%

Diagnosing Evidence Utilization in Long-Context and Retrieval-Augmented Language Models under Matched Evidence Conditions

长上下文与检索增强语言模型中证据利用的四条件诊断协议

Haizhou Xia

机构 * University of Western Ontario(西方大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 提出四条件证据可用性协议,通过ONCU估计器分离无证据、全上下文、检索证据和Oracle证据四种条件下的模型表现,诊断长上下文与检索增强语言模型的证据利用瓶颈。

Comments 46 pages, 37 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18271 2026-06-10 cs.CL cs.AI cs.IR cs.LG 版本更新 75%

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

从体积到价值:面向设备端RAG的偏好对齐记忆构建

Changmin Lee, Jaemin Kim, Taesik Gong

机构 * Department of Computer Science and Engineering, Ulsan National Institute of Science and Technology (UNIST), Ulsan, Republic of Korea(计算机科学与工程系,全州国立科学与技术研究所(UNIST),全州,韩国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EPIC方法,通过将用户偏好作为紧凑且稳定的个人上下文形式,整合到RAG流程中,以在有限内存下提高检索与用户偏好的对齐度,从而减少内存使用并提升准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/UbiquitousAILab/EPIC

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 14 篇

2407.20242 2026-06-10 cs.CY cs.AI cs.RO 版本更新 92%

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

BadRobot: 在物理世界中越狱具身LLM智能体

Hangtao Zhang, Chenyu Zhu, Xianlong Wang, Ziqi Zhou, Changgan Yin, Minghui Li, Lulu Xue, Yichen Wang, Shengshan Hu, Aishan Liu, Peijin Guo, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Beihang University(北航) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。

Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29025 2026-06-10 cs.CL cs.AI 版本更新 91%

The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning

模型说走:表面启发式如何覆盖LLM推理中的隐式约束

Yubo Li, Lu Zhang, Tianchong Jiang, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM在表面线索与隐式约束冲突时的失败,提出启发式覆盖基准(HOB),通过因果行为分析揭示距离线索影响远大于目标,并验证目标分解提示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09171 2026-06-10 cs.LG cs.AI cs.CL 版本更新 90%

Fact-Augmented Lookahead Planning for LLM Agents

面向LLM智能体的事实增强前瞻规划

Samuel Holt, Max Ruiz Luyten, Thomas Pouplin, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LWM-Planner框架,通过从轨迹中提取关键事实并用于条件化动作提议、世界模型模拟和状态值估计,实现无需参数更新的在线规划改进,在多个环境上优于ReAct/Reflexion和纯搜索基线。

Comments Accepted at the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026). Camera-ready version. 9-page main text plus appendices (63 pages total), 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01993 2026-06-10 cs.CL cs.AI 版本更新 90%

SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning

SAFE: 一种基于LLM作为验证器的证据驱动多跳推理框架

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SAFE框架,通过将推理分解为知识图谱三元组,在生成过程中逐步验证中间步骤,以解决多跳问答中模型通过无效推理得到正确答案的问题,平均准确率提升8.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏