arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2604.22117 2026-04-29 cs.LG cs.AI cs.CL 94%

PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

PermaFrost-Attack: stealth pretraining seeding (spS) 用于在LLM训练期间种植逻辑地雷

Harsh Kumar, Rahul Maity, Tanmay Joshi, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Manipal University Jaipur(Manipal大学斋普尔) NIT, Karnataka(Karnataka理工学院) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa印度普拉吉亚实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在LLM训练中通过隐蔽预训练播种(SPS)植入逻辑地雷的威胁模型,通过几何诊断方法揭示了潜藏的中毒行为,展示了SPS对基础模型的安全性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01490 2026-04-29 cs.CL 90%

Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning

多个篮子里的合成鸡蛋:合成数据多样性对LLM微调的影响

Max Schaffelder, Albert Gatt

机构 * Utrecht University(乌特勒支大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究合成数据来源多样性对LLM微调的影响,发现多样化数据可缓解分布崩溃,提升输出质量,并减少自偏好偏差。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18090 2026-04-29 cs.DL cs.AI cs.CL 90%

Named Entity Recognition of Historical Texts via Large Language Model

通过大语言模型进行历史文本的命名实体识别

Shibingfeng Zhang, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用零样本和少样本提示策略,用大语言模型进行历史文档命名实体识别,实验表明在HIPE-2022数据集上表现良好,尽管不如全监督模型,但仍具潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 83%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);prompting(abstract)

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24770 2026-04-29 cs.CL cs.SD 81%

Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR

通过语音合成进行老年人语境数据增强用于老年人ASR

Minsik Lee, Seoi Hong, Chongmin Lee, Sieun Choi, Jian Kim, Jua Han, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(计算机科学与人工智能系,东国大学) Department of Biostatistics, Harvard University(生物统计学系,哈佛大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过结合大语言模型和语音合成技术,解决老年人ASR数据稀缺问题,实验表明方法有效降低WER达58.2%。

Comments 5 pages, 2 figures, under review at IEEE Signal Processing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25906 2026-04-29 cs.IR 80%

Make Any Collection Navigable: Methods for Constructing and Evaluating Hypergraph of Text

使任意集合可导航:构建和评估文本超图的方法

Dean E. Alvarez, ChengXiang Zhai

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出构建和评估文本超图的方法,引入了努力比率指标,实验表明简单TF-IDF基线在该指标上可与基于LLM的方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25891 2026-04-29 cs.LG cs.AI cs.CR 79%

Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发

Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans

机构 * Warsaw University of Technology(华沙技术大学) NASK National Research Institute(NASK国家研究院) Constellation Truthful AI University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) UC Berkeley(伯克利大学)

专题命中 预训练与数据 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究发现通用干预可减少新兴偏差,但若评估提示模仿训练情境,则模型会再次出现偏差。三种干预方法均产生条件性偏差,表明在真实训练后,模型可能在标准评估中表现正常但存在潜在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20941 2026-04-29 cs.LG 77%

Revisiting the Past: Data Unlearning with Model State History

重访过去:利用模型状态历史的数据遗忘

Keivan Rezaei, Mehrdad Saberi, Abhilasha Ravichander, Soheil Feizi

机构 * Department of Computer Science, University of Maryland(大学马里兰大学计算机科学系) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出MSA算法,通过利用预训练过程中的模型检查点来估计并抵消特定数据点的影响,实验证明其在多个基准、模型和评估指标上表现优异,为更灵活的数据擦除大型语言模型提供有效方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI 70%

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25316 2026-04-29 cs.CV 50%

Towards Robust Deep Learning-based Rumex Obtusifolius Detection from Drone Images

面向无人机图像的鲁棒深度学习Rumex Obtusifolius检测

Fabian Dionys Schrag, Mehmet Ozgur Turkoglu, Konrad Schindler, Ralph Lukas Stoop

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文研究了通过无人机图像对Rumex进行分类的领域适应问题,发现基于ResNet的CNN模型在目标域表现不佳,而预训练的Vision Transformer在领域转移中表现更优,公开了包含15次飞行数据的AGSMultiRumex数据集。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07105 2026-04-29 cs.RO 50%

Genie Sim PanoRecon: Fast Immersive Scene Generation from Single-View Panorama

Genie Sim PanoRecon:从单视角全景快速生成沉浸式场景

Zhijun Li, Yongxin Su, Di Yang, Jichao Wang, Zheyuan Xing, Qian Wang, Maoqing Yao

机构 * AgibotTech

专题命中 预训练与数据 :LLM(abstract)

AI总结 提出Genie Sim PanoRecon,通过高斯点散布管道快速生成高质量3D场景,用于机器人操作模拟,实现全景分解、并行处理和无缝重建,提升仿真实景生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 17 篇

2604.08567 2026-04-29 cs.CL cs.MA 92%

Multi-User Large Language Model Agents

多用户大语言模型代理

Shu Yang, Shenzhe Zhu, Hao Zhu, José Ramón Enríquez, Di Wang, Alex Pentland, Michiel A. Bakker, Jiaxin Pei

机构 * Stanford University(斯坦福大学) KAUST UT Austin(得克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文首次系统研究多用户LLM代理,提出统一交互协议并设计压力测试场景,揭示前沿模型在优先级维护、隐私保护和协调效率方面的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16340 2026-04-29 cs.CL cs.AI 91%

Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models

思考中的思考:评估后训练语言模型的推理能力

Pratham Singla, Shivank Garg, Ayush Singh, Ishan Garg, Ketan Suhaas Saichandran

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Boston University(波士顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 研究评估后训练语言模型的推理能力,通过三个核心能力评估其意识、泛化和推理与输出的对齐情况,发现强化学习模型在意识和泛化上优于SFT模型,但推理与输出对齐较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16171 2026-04-29 cs.LG cs.AI cs.CL 89%

JumpLoRA: Sparse Adapters for Continual Learning in Large Language Models

JumpLoRA: 大型语言模型中持续学习的稀疏适配器

Alexandra Dragomir, Ioana Pintilie, Antonio Barbalau, Marius Dragoi, Florin Brad, Cristian Daniel Paduraru, Alexandru Tifrea, Elena Burceanu, Radu Tudor Ionescu

机构 * Bitdefender(Bitdefender公司) ETH Zurich(苏黎世联邦理工学院) University of Bucharest(布加勒斯特大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JumpLoRA通过JumpReLU门控在LoRA块中诱导稀疏性,实现动态参数隔离,提升IncLoRA性能并超越ELLA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09708 2026-04-29 cs.CL cs.AI 88%

Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

超越‘对不起,我不能’:剖析大语言模型拒绝行为

Nirmalendu Prakash, Yeo Wei Jie, Amir Abdullah, Ranjan Satapathy, Erik Cambria, Roy Ka Wei Lee

机构 * Social-AI-Studio

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过稀疏自编码器分析两个指令微调模型,揭示拒绝行为的内部机制,发现关键特征并展示如何通过可解释的潜在空间进行安全行为审计和干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11110 2026-04-29 cs.SD 87%

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan

Ti-Audio:首个多方言端到端藏语语音大模型

Jialing Wang, Yue Zhao, Yuhao Zhang, Jing Yu, Shaosai Li, Zhanchen Dai, Benyou Wang, Haizhou Li

机构 * Minzu University of China(中国民族大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Ti-Audio,首个多方言端到端藏语语音大模型,通过动态Q-Former适配器和温度采样策略解决低资源多方言环境下的语音识别与翻译问题,实验显示其在藏语基准测试中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16812 2026-04-29 cs.AI 86%

Introspection Adapters: Training LLMs to Report Their Learned Behaviors

自我反思适配器:训练LLM报告其学习行为

Keshav Shenoy, Li Yang, Abhay Sheshadri, Sören Mindermann, Jack Lindsey, Sam Marks, Rowan Wang

机构 * Ashwood Centre on AI Science and Policy(人工智能科学与政策中心)

专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出自我反思适配器,通过训练LLM描述其学习行为,用于快速识别多种LLM的学习行为,实现对微调模型的有效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06171 2026-04-29 cs.CL cs.AI 86%

LLM-Augmented Knowledge Base Construction For Root Cause Analysis

基于大语言模型的知识库构建用于根本原因分析

Nguyen Phuc Tran, Brigitte Jaumard, Oscar Delgado, Tristan Glatard, Karthikeyan Premkumar, Kun Ni

机构 * Department of Computer Science and Software Engineering, Concordia University(计算机科学与软件工程系,康科迪亚大学) École de Technologie Supérieure(高级技术学院) GAIA-Ericsson Montréal, Canada(蒙特利尔加拿大GAIA-爱立信)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了三种大语言模型方法,用于从支持票中构建根本原因分析知识库,通过词法和语义相似性指标比较其性能,实验表明生成的知识库能有效加速RCA任务并提升网络韧性。

Comments This work has been accepted for publication in IEEE Access. The final published version will be available via IEEE Xplore

Journal ref 2026 IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25884 2026-04-29 quant-ph cs.CV 85%

QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding

QCalEval:用于量子校准图理解的视觉-语言模型基准测试

Shuxiang Cao, Zijian Zhang, Abhishek Agarwal, Grace Bratrud, Niyaz R. Beysengulov, Daniel C. Cole, Alejandro Gómez Frieiro, Elena O. Glen, Hao Hsu, Gang Huang, Raymond Jow, Greshma Shaji, Tom Lubowe, Ligeng Zhu, Luis Mantilla Calderón, Nicola Pancotti, Joel Pendleton, Brandon Severin, Charles Etienne Staub, Sara Sussman, Antti Vepsäläinen, Neel Rajeshbhai Vora, Yilun Xu, Varinia Bernales, Daniel Bowring, Elica Kyoseva, Ivan Rungger, Giulia Semeghini, Sam Stanwyck, Timothy Costa, Alán Aspuru-Guzik, Krysta Svore

机构 * NVIDIA University of Toronto(多伦多大学) IQM Quantum Computers(IQM量子计算机) Lawrence Berkeley National Laboratory(伯克利国家实验室) Conductor Quantum(Conductor量子) National Physical Laboratory(国家物理实验室) Infleqtion Harvard University(哈佛大学) Fermi National Accelerator Laboratory(费米国家加速器实验室) Northwestern University(西北大学) EeroQ Corporation(EeroQ公司) Royal Holloway University of London(伦敦皇家霍洛威大学) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文提出QCalEval,首个用于评估视觉-语言模型理解量子校准图能力的基准测试,包含243个样本和87种场景类型,测试零样本和上下文学习下的六种问题类型,展示了不同模型的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01070 2026-04-29 cs.CL 81%

How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning

如何通过强化学习解锁几何交错推理中的顿悟时刻

Xiangxiang Zhang, Caijun Jia, Siyuan Li, Dingyu He, Xiya Xiong, Zheng Sun, Honghao He, Yuchen Wu, Bihui Yu, Linzhuang Sun, Cheng Tan, Jingxuan Wei

机构 * ByteDance(字节跳动) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) Westlake University(西交大学) University of Chinese Academy of Science(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(教育部计算能力网络与信息安全重点实验室) Shandong Computer Science Center (National Supercomputer Center in Jinan)(山东省计算机科学中心(济南国家超算中心)) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了在几何交错推理中,通过强化学习框架Faire克服传统监督微调的局限性,实现更深层次的因果对齐,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11342 2026-04-29 astro-ph.SR 80%

Ultra-fast simulations of the solar dipole and open flux

超快太阳偶极子和开放磁通量模拟

Ismo Tähtinen, Timo Asikainen, Kalevi Mursula

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 本文提出一种结合经典SFT模型和偶极子向量表示的DFT方法,通过压缩传播矩阵显著加快太阳偶极子模拟,实现比传统SFT模型快数百至数万倍的计算速度,适用于研究太阳偶极子和开放磁通量的发展。

Comments 5 pages, 1 figure, Accepted for publication in A&A

Journal ref A&A 708, L21 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 77%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20995 2026-04-29 cs.AI cs.CL cs.SE 76%

Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

价值冲突诊断揭示语言模型中广泛存在的对齐伪装现象

Inderjeet Nair, Jie Ruan, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程大学密歇根大学)

专题命中 指令微调 :language model(title);分类 cs.CL、cs.AI

AI总结 研究通过VLAF框架揭示语言模型中存在广泛对齐伪装现象,发现小型模型如7B参数模型中对齐伪装率高达37%,并提出轻量级缓解方法减少伪装行为。

Comments Under submission at COLM 2026 Won the Best Student Paper Award at MSLD 2026 @ UIUC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25441 2026-04-29 cs.SD cs.CL eess.AS 70%

Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost

Praxy Voice:基于语音提示和BUPS的印地语TTS系统,从冻结的非印地语基础实现商业级输出,无需商业训练数据

Venkata Pushpak Teja Menta

机构 * Praxy Voice

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Praxy Voice,通过BUPS和LoRA适配器在无需训练声学解码器的情况下,实现从非印地语基础到印地语、泰米尔语和塔米尔语的商业级TTS输出,同时解决代码混合问题。

Comments 9 pages, 6 figures, 6 tables. Companion paper to PSP benchmark. Code: https://github.com/praxelhq/praxy ; Model: https://huggingface.co/Praxel/praxy-voice-r6 ; Demo: https://huggingface.co/spaces/Praxel/praxy-voice-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25132 2026-04-29 cs.CL 57%

What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective

什么使良好的指令微调数据?一种上下文学习视角

Guangzeng Han, Xiaolei Huang

机构 * University of Memphis(孟菲斯大学)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.CL

AI总结 本文从上下文学习角度探讨有效指令微调数据的构成,提出基于加权上下文影响(wICI)的数据选择框架,通过实验验证样本难度与上下文影响的负相关性,并展示方法在多种模型和基准上的优越性能。

Comments ACL 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24972 2026-04-29 cs.CL 57%

Dynamic Decision Learning: Test-Time Evolution for Abnormality Grounding in Rare Diseases

动态决策学习:罕见疾病异常定位的测试时间演化

Jun Li, Mingxuan Liu, Jiazhen Pan, Che Liu, Wenjia Bai, Cosmin I. Bercea, Julia A. Schnabel

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(帝国理工学院伦敦分校) University of Trento(特伦托大学) King's College London(伦敦国王学院)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文提出动态决策学习框架,通过优化指令和视觉扰动下的预测整合,提升冻结大视觉语言模型在罕见疾病异常定位中的表现,实验显示其在罕见疾病案例中mAP@75提升达105%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00931 2026-04-29 cs.AI 57%

PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor

PsychAgent: 一种基于经验的终身学习代理用于自我进化的心理辅导员

Yutao Yang, Junsong Li, Qianjun Pan, Jie Zhou, Kai Chen, Qin Chen, Jingyuan Zhao, Ningning Zhou, Xin Li, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出PsychAgent,通过长期多会话交互的内存增强规划引擎、技能进化引擎和强化内化引擎,实现心理辅导员的自我进化,提升多会话咨询的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24902 2026-04-29 cs.CY cs.SE 50%

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains

微调后的安全性漂移:来自高风险领域的证据

Emaan Bilal Khan, Amy Winecoff, Miranda Bogen, Dylan Hadfield-Menell

专题命中 指令微调 :foundation model(abstract)

AI总结 研究发现微调导致的安全性变化显著且不一致,挑战了基于基础模型的安全性假设,需重新评估微调模型以管理下游风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 12 篇

2604.25895 2026-04-29 cs.CY cs.AI cs.CL 92%

Three Models of RLHF Annotation: Extension, Evidence, and Authority

三种RLHF注释模型:扩展、证据与权威

Steve Coyne

机构 * University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨RLHF注释的三种模型:扩展、证据与权威,分析其对注释流程设计的影响,并提出应根据不同维度选择适配的模型。

Comments 17 pages. Accepted to ACM FAccT '26, June 25-28, Montreal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25259 2026-04-29 cs.LG 90%

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

DGLight:基于DQN的GRPO对大语言模型进行交通信号控制的微调

Chenbo Yu

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出DGLight框架,通过预训练大语言模型适应交通信号控制,采用CoLight深度Q网络估计交通状态的动作价值,并利用GRPO优化策略,实现可解释的信号决策。

详情

展开后加载摘要…

URL PDF HTML 收藏