arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2604.24881 2026-04-29 cs.AI 90%

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

潜在代理:一种事后训练过程用于内部化多代理辩论

John Seon Keun Yi, Aaron Mueller, Dokyun Lee

机构 * Boston University(波士顿大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);large language model(abstract);language model(abstract)

AI总结 本文提出一种两阶段微调流程,将多代理辩论转化为单个LLM,通过动态奖励调度和长度截断实现内部化,减少93%的token使用,同时通过激活引导发现代理特定子空间,并展示通过内部化辩论抑制恶意代理的应用。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV 88%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24804 2026-04-29 cs.LG cs.CL 86%

Intrinsic Mutual Information as a Modulator for Preference Optimization

内在互信息作为偏好优化的调节器

Peng Liao, Peijia Zheng, Lingbo Li, Shangsong Liang, Lin Chen

机构 * Sun Yat-sen University(中山大学) University of Warwick(华威大学) Macao Polytechnic University(澳门理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RMiPO框架,利用内在响应级互信息进行偏好优化,通过超参数调节动态解耦偏好贡献,减少训练开销,提升性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02467 2026-04-29 cs.CV cs.AI 85%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23964 2026-04-29 cs.IR 85%

RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce

RAD-DPO:面向电商生成检索的鲁棒自适应去噪直接偏好优化

Zhiguo Chen, Guohao Sun, Yiming Qiu, Xingzhi Yao, Mingming Li, Huimu Wang, Yangqi Zhang, Songlin Wang, Sulong Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn)

AI总结 针对生成检索中直接偏好优化的局限性,提出RAD-DPO方法,通过梯度分离保护前缀结构、动态奖励加权缓解标签噪声、全局对比学习扩展正样本覆盖,提升检索精度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24952 2026-04-29 cs.CV cs.AI 79%

Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

从噪声偏好学习:一种半监督学习方法用于直接偏好优化

Xinxin Liu, Ming Li, Zonglin Lyu, Yuzhang Shang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出Semi-DPO方法,通过半监督学习处理多维偏好噪声,提升复杂人类偏好对齐性能,无需额外人工标注或显式奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25872 2026-04-29 cs.LG cs.AI stat.ML 79%

When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

当错误可能有益:对策略梯度中不完美奖励的分类

Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在策略梯度方法中,不完美奖励的错误并非全然有害,通过理论分析分类了不同类型的奖励误差对真实奖励增加的影响,提出了改进人类反馈强化学习和可验证奖励设计的实用方法。

Comments Code available at https://github.com/princeton-pli/imperfect-rewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25832 2026-04-29 cs.AI 70%

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

TrialCalibre:一种完全自动化的因果引擎用于RCT基准测试和观察性试验校准

Amir Habibdoust, Xing Song

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TrialCalibre,一种多智能体系统,用于自动化和扩展BenchExCal流程,通过专门的智能体协调整个过程,实现适应性、可审计和透明的因果效应估计。

Comments 5 pages , 2 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025. Copyright 2025 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12759 2026-04-29 cs.CL 57%

RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning

RAG-RL:通过强化学习和课程学习推进检索增强生成

Jerry Huang, Siddarth Madala, Risham Sidhu, Cheng Niu, Hao Peng, Julia Hockenmaier, Tong Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 RAG-RL通过强化学习和课程学习提升检索增强生成性能,使生成模型能识别并引用相关信息,提高样本效率和泛化能力,实验显示在多跳问答任务中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25291 2026-04-29 cs.IR 50%

From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space

从局部索引到全局标识符:通过全局动作空间实现生成式重排序的推荐系统

Pengyue Jia, Xiaobei Wang, Yingyi Zhang, Shuchang Liu, Yupeng Hou, Hailan Yang, Xu Gao, Xiaopeng Li, Yejing Wang, Julian McAuley, Xiang Li, Lantao Hu, Yongqi Liu, Kaiqiao Zhan, Han Li, Kun Gai, Xiangyu Zhao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出GloRank框架,通过生成全局标识符替代局部索引选择,解决推荐系统重排序中动作空间语义不一致的问题,实验表明其在基准和工业数据上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 12 篇

2604.25847 2026-04-29 math.OC cs.AI cs.LG 90%

From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling

从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模

Jianghao Lin, Zi Ling, Chenyu Zhou, Tianyi Xu, Ruoqing Jiang, Zizhuo Wang, Dongdong Ge

机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) University of Chicago Booth School of Business(芝加哥大学布斯商学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) School of Economics and Management(清华大学经济管理学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25135 2026-04-29 cs.CL 86%

FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments

FAMA:面向交互工具使用环境的开源大语言模型失败意识元代理框架

Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay, Gaowen Liu, Ali Payani, Jayanth Srinivasa, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FAMA框架通过分析基线代理的失败轨迹识别常见错误,并利用 orchestration 机制激活专门的代理来针对性解决失败问题,实验显示在开源LLM上性能提升达27%。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19684 2026-04-29 cs.CR 82%

LLM-Assisted Authentication and Fraud Detection

基于大语言模型的认证与欺诈检测

Emunah S-S. Chan, Aldar C-F. Chan

专题命中 长上下文与记忆 :LLM(title,abstract)

AI总结 本文提出基于大语言模型的认证机制和欺诈检测流水线,通过语义判断和文档分段提升认证准确率,减少欺诈误报,验证了大语言模型在安全流程中的应用价值。

Comments 20 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24905 2026-04-29 cs.MA cs.AI 81%

MultiHedge: Adaptive Coordination via Retrieval-Augmented Control

MultiHedge:通过检索增强控制实现自适应协调

Feliks Bańka, Jarosław A. Chudziak

机构 * The Faculty of Electronics and Information Technology(电子与信息技术学院)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出MultiHedge框架,通过检索增强的LLM协调提升模块化决策系统的鲁棒性,实验表明记忆增强比单纯扩大模型规模更有效。

Comments 8 pages, 2 figures. Accepted to the 26th International Conference on Computational Science (ICCS 2026), to appear in Springer LNCS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08816 2026-04-29 cs.IR cs.AI 81%

MemRec: Collaborative Memory-Augmented Agentic Recommender System

MemRec:协同记忆增强的代理推荐系统

Weixin Chen, Yuhan Zhao, Jingyuan Huang, Zihe Ye, Clark Mingxuan Ju, Tong Zhao, Neil Shah, Li Chen, Yongfeng Zhang

机构 * Hong Kong Baptist University(香港 Baptist大学) Rutgers University(罗格斯大学) Snap Inc.(Snap公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MemRec通过引入协同记忆机制,解决传统推荐系统中记忆隔离导致的上下文过载问题,通过轻量级语言模型管理动态记忆图谱,提升推荐精度与效率。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12087 2026-04-29 cs.CL 81%

BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding

BLASST: 通过Softmax阈值实现动态阻塞注意力稀疏性

Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach, Richard Cai, Julien Demouth, John D. Owens, Xia Hu, Song Han, Timmy Liu, Huizi Mao

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 长上下文与记忆 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BLASST通过Softmax阈值实现动态稀疏注意力机制,提升LLM长上下文推理效率,无需训练,减少预计算,优化硬件支持,实现1.52x和1.48x的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24809 2026-04-29 cs.LG cs.AI 73%

Nautile-370M: Spectral Memory Meets Attention in a Small Reasoning Model

Nautile-370M:在小推理模型中融合频谱记忆与注意力

Maixent Chenebaux

专题命中 长上下文与记忆 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 Nautile-370M是一款3.7亿参数的小语言模型,通过融合频谱记忆与注意力机制,在有限参数和推理预算下实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05030 2026-04-29 cs.CL cs.AI cs.LG 67%

Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space

相关联记忆:复杂希尔伯特空间中的序列建模

Gowrav Vishwakarma, Christopher J. Agostino

机构 * Xavoc Technocrats Pvt.\ Ltd., , India

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出相关联记忆(PAM)模型,利用复杂值序列建模在复杂希尔伯特空间中实现更有效的语言建模,通过对比实值和复值架构,发现复值架构在参数规模增加时具有更快的改进速度。

Comments submitting to APS Open Science, 13 pages, 3 figure, code and training logs available at https://github.com/gowrav-vishwakarma/qllm2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07499 2026-04-29 cs.CL cs.AI cs.LG 67%

When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs

当思维遇见事实:长上下文语言模型的可重用推理

Soyeong Jeong, Taehee Jung, Sung Ju Hwang, Joo-Kyung Kim, Dongyeop Kang

机构 * KAIST(韩国科学技术院) Amazon(亚马逊) University of Minnesota(明尼苏达大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Thought Templates用于长上下文语言模型的可重用推理,通过迭代更新策略提升多跳推理能力,并展示其在多种基准测试中的优越表现。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI 57%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26554 2026-04-29 cs.LG stat.ML 57%

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory

谱优化器在关联记忆学习中的容量扩展分析

Juno Kim, Eshaan Nichani, Denny Wu, Alberto Bietti, Jason D. Lee

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文研究了谱优化器在关联记忆问题中的性能,发现Muon的存储容量显著超过SGD,且在仅使用一阶信息时可与牛顿法匹配。通过实验验证了预测的扩展规律,为更实际的语言建模任务提供了理论基础。

Comments 84 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 50%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 40 篇

2604.25053 2026-04-29 cs.CL cs.AI 92%

Analyzing LLM Reasoning to Uncover Mental Health Stigma

分析LLM推理以揭示心理健康污名

Sreehari Sankar, Aliakbar Nafar, Mona Barman, Hannah K. Heitz, Ashwin Kumar, Pouria Tohidi, Dailun Li, Danish Hussain, Russell DuBois, Hamed Hasheminia, Farshad Majzoubi

机构 * BetterHelp

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM推理过程,揭示隐藏的污名化语言及内部逻辑,利用临床专业知识分类污名化模式,并扩展心理健康污名基准以识别模型逻辑缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 91%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 91%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15707 2026-04-29 cs.CL cs.AI 91%

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

大型语言模型在推理任务上的表现是否受提问方式的影响?

Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究探讨了不同提问方式对大型语言模型推理任务准确性的影响,发现问题类型显著影响模型表现,选项数量和用词选择也会影响最终答案选择的准确性。

Comments ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 90%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12283 2026-04-29 cs.HC 90%

Large Language Models have Chain-of-Affect

大型语言模型具有情感链

Junjie Xu, Xingjiao Wu, Luwei Xiao, Yuzhe Yang, Jie Zhou, Zihao Zhang, Luhan Wang, Yi Huang, Nan Wu, Yingbin Zheng, Chao Yan, Cheng Jin, Honglin Li, Liang He

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25880 2026-04-29 cs.SE 89%

From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions

从线程到轨迹:一个多LLM管道用于从GitHub问题讨论中提取社区知识

Nazia Shehnaz Joynab, Soneya Binta Hossain

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出SWE-MIMIC-Bench数据集,通过多LLM管道从GitHub讨论生成问题轨迹,用于提取复杂问题的结构化知识,提升软件工程社区的协作理解与LLM训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25247 2026-04-29 cs.CR 89%

R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models

R-CoT:通过冗余链式推理的推理层水印

Ziming Zhang, Li Li, Guorui Feng, Hanzhou Wu, Xinpeng Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 本文提出R-CoT方法,通过在大语言模型的推理路径中嵌入水印,利用双轨迹优化机制实现水印与原推理路径共存,提升水印的鲁棒性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏