arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 37 篇

2604.23091 2026-04-28 cs.LG 87%

Channel Adaptation for EEG Foundation Models: A Systematic Benchmark Across Architectures, Tasks, and Training Regimes

EEG基础模型的通道适应:跨架构、任务和训练模式的系统性基准测试

Kuntal Kokate, Bruno Aristimunha, Dung Truong, Arnaud Delorme

机构 * Swartz Center for Computational Neuroscience, Institute for Neural Computation, University of California San Diego(斯瓦茨计算神经科学中心,神经计算研究所,加州大学圣地亚哥分校) Yneuro Centre de Recherche Cerveau et Cognition, CNRS, Université Paul Sabatier(脑与认知研究中心,法国国家科学研究中心,保罗·萨巴蒂埃大学)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 本文系统比较了四种通道适应方法在不同EEG基础模型、任务和训练模式中的表现,发现灵活模型在微调时需外部方法辅助,且5M参数CBraMod在4/5数据集上超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23121 2026-04-28 cs.RO cs.CV 87%

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

打破锁定:在低数据VLA后训练中保持可引导性

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出DeLock方法,通过保留视觉 grounding 和测试时对比提示指导,解决VLA策略在低数据后训练中因过度专业化导致的概念和空间锁定问题,实验证明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22893 2026-04-28 cs.LG cs.AI 85%

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

面向效用的数据定价:LLMs的令牌级质量与经验训练增益

Minghui Xu, Qi Luo, Kun Li

机构 * Shandong University(山东大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。

Comments 23 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20164 2026-04-28 cs.CL cs.AI 84%

AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications

超越核心领域的人工智能安全:简历筛选作为专门大语言模型应用中对抗性漏洞的案例研究

Honglin Mu, Jinghao Liu, Kaiyang Wan, Rui Xing, Xiuying Chen, Timothy Baldwin, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) Natural Language Processing Research Department(自然语言处理研究部) MBZUAI Paul G. Allen School of Computer Science and Engineering(保罗·G·阿伦计算机科学与工程学院) University of Washington(华盛顿大学) School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型在简历筛选中的对抗性漏洞,提出FIDS防御机制,通过实验显示训练时防御优于推理时缓解,有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24693 2026-04-28 cs.CL 83%

Contextual Linear Activation Steering of Language Models

上下文线性激活引导的语言模型

Brandon Hsu, Daniel Beaglehole, Adityanarayanan Radhakrishnan, Mikhail Belkin

机构 * UC San Diego(加州大学圣地亚哥分校) MIT(麻省理工学院) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学Broad研究所)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出CLAS方法,通过动态调整线性激活引导强度,在有限标注数据下提升语言模型的专精能力,优于传统方法和ReFT、LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22825 2026-04-28 cs.CV cs.AI 83%

SGP-SAM: Self-Gated Prompting for Transferring 3D Segment Anything Models to Lesion Segmentation

SGP-SAM:用于将3D分割任何模型转移到病变分割的自门控提示

Zixuan Tang, Shen Zhao

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen China(智能系统工程学院,中山大学,深圳中国)

专题命中 指令微调 :prompting(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出SGP-SAM,通过自门控提示模块提升3D病变分割的转移效果,设计Zoom损失增强小病变学习,实验显示在肝肿瘤和脑肿瘤数据集上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04745 2026-04-28 cs.CL 83%

Can LLMs Interpret and Leverage Structured Linguistic Representations? A Case Study with AMRs

大型语言模型能否解释并利用结构化的语言表示?一项基于AMR的案例研究

Ankush Raut, Xiaofeng Zhu, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Northwestern University(西北大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.CL

AI总结 本文研究了大型语言模型在结构化语言表示下的表现,发现短文任务中添加AMR会降低性能,但长文任务如对话摘要能提升模型表现,尤其在大模型中效果更显著。

Comments 13 pages, 23 figures. Accepted to XLLM Workshop at ACL 2025

Journal ref Proceedings of the 1st Joint Workshop on Large Language Models and Structure Modeling (XLLM 2025), page 173, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10141 2026-04-28 cs.CV cs.CL cs.MM 83%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23036 2026-04-28 cs.LG cs.CL 82%

Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning

在混合专家调谐中保持长尾专家信息

Haoze He, Xingyuan Ding, Xuan Jiang, Xinkai Zou, Alex Cheng, Yibo Zhao, Juncheng Billy Li, Heather Miller

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) UCSD(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需辅助损失的MoE SFT框架,通过偏置驱动稀疏化与始终活跃的门控凝结专家,有效保留长尾专家信息,实验显示在数学推理和常识问答基准上优于现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22125 2026-04-28 cs.CV 82%

GA2-CLIP: Generic Attribute Anchor for Efficient Prompt Tuningin Video-Language Models

GA2-CLIP:通用属性锚点用于视频-语言模型高效提示微调

Bin Wang, Ruotong Hu, Wentong Li, Wenqian Wang, Mingliang Gao, Runmin Cong, Wei Zhang, Xudong Jiang

机构 * Shandong Provincial Key Laboratory of New Power Distribution & Utilization Technology and Equipment, School of Electrical and Electronic Engineering, Shandong University of Technology(山东省新型电力分布与利用技术及设备重点实验室,山东理工大学电气与电子工程学院) School of Computer Science and Technology, Shandong University of Technology(山东理工大学计算机科学与技术学院) School of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) Pillar of Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计 pillar) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 GA2-CLIP通过引入外部监督提示和无关视频集,优化视频任务中V-L模型的泛化性能,防止语义空间过拟合,提升模型在新类别预测上的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19482 2026-04-28 cs.CV 82%

Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following

无需指令的大型视觉语言模型在医疗指令遵循中的调优

Myeongkyun Kang, Soopil Kim, Xiaoxiao Li, Sang Hyun Park

机构 * Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Department of Robotics and Mechatronics Engineering, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院机器人与机电工程系) Division of Intelligent Robot, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院智能机器人系) Vector Institute(向量研究所) Department of Computer Science and Engineering, Pohang University of Science and Technology (POSTECH)(釜山科学技术大学计算机科学与工程系)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract)

AI总结 本文提出无需指令的调优方法,利用图像描述对训练模型,提升医疗领域视觉语言模型的指令遵循能力,实现多选视觉问答任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 80%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14295 2026-04-28 cs.RO cs.MA 80%

Aegis: Automated Error Generation and Attribution for Multi-Agent Systems

Aegis:多智能体系统的自动化错误生成与归因

Fanqi Kong, Ruijie Zhang, Huaxiao Yin, Guibin Zhang, Xiaofei Zhang, Ziang Chen, Zhaowei Zhang, Xiaoyuan Zhang, Song-Chun Zhu, Xue Feng

机构 * Peking University Beijing Institute of General Artificial Intelligence(北京大学北京通用人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Aegis框架,通过自动化生成大规模多智能体系统错误数据,提升错误归因能力,实验表明其模型性能可与专有模型媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23385 2026-04-28 cs.LG 79%

Domain-Adapted Fine-Tuning of ECG Foundation Models for Multi-Label Structural Heart Disease Screening

领域适应的ECG基础模型微调用于多标签结构性心脏病筛查

Duc N. Do, Minh N. Do, Dang Nguyen, Khanh T. Q. Le, Khoa D. Pham, Hung N. Huynh, Phi Pham-Van-Hoang, Quan K. Huynh, Ramez M. Odat, Perisa Ashar, Ethan Philip Lowder, Minh H. N. Le, Hoang Le, Phat V. H. Nguyen, Quan Le, Jacques Kpodonu, Phat K. Huynh

机构 * PASSIO Laboratory, North Carolina A&T State University(北卡罗来纳阿塔州立大学PASSIO实验室) Department of Computer Science, University of Manitoba(曼尼托巴大学计算机科学系) Harvard T.H. Chan School of Public Health, Harvard University(哈佛大学T.H. Chan公共卫生学院) Department of Medicine, Jordan University of Science and Technology(约旦科学与技术大学医学院) Department of Biomedical Engineering, Duke University(达特茅斯大学生物医学工程系) Harvard Medical School(哈佛医学院) Beth Israel Deaconess Medical Center, Harvard Medical School(哈佛医学院贝塞斯达以色列德acons医疗中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文探讨了使用公开的EchoNext Mini-Model基准评估开放预训练的ECG基础模型在多标签结构性心脏病检测中的应用,通过领域适应和选择性监督微调提升性能。

Comments Accepted to Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24070 2026-04-28 cs.CL cs.AI 79%

Distilling Self-Consistency into Verbal Confidence: A Pre-Registered Negative Result and Post-Hoc Rescue on Gemma 3 4B

将自我一致性融入言语自信:Gemma 3 4B上的预注册负结果及事后补救

Jon-Paul Cacioli

机构 * Independent Researcher, Melbourne, Australia(墨尔本独立研究者)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现,小规模指令微调LLM在最小激发下产生退化言语自信,通过自我一致性衍生目标的自信条件监督微调未能缩小内部信息与言语输出间的差距,但事后去除过滤器后在TriviaQA上提升了AUROC2至0.774,支持目标依赖性解释。

Comments 12 pages, 3 figures, 4 tables. Pre-registered on OSF (https://osf.io/mpcr5). Code and data: https://github.com/synthiumjp/metacog-engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23166 2026-04-28 cs.CY cs.CV 78%

A satellite foundation model for improved wealth monitoring

一种用于改进财富监测的卫星基础模型

Zhuo Zheng, Iván Higuera-Mendieta, Richard Lee, David Newhouse, Talip Kilic, Stefano Ermon, Marshall Burke, David B. Lobell

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Earth System Science, Stanford University(斯坦福大学地球系统科学系) Center on Food Security and the Environment, Stanford University(斯坦福大学食品安全与环境中心) Development Economics Data Group, World Bank Group(世界银行发展经济学数据组) Department of Environmental Social Science, Stanford University(斯坦福大学环境社会科学系)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出Tempov模型,通过自监督学习预训练并高效微调,实现大规模高精度财富映射与动态监测,减少对昂贵标签的依赖,并在非洲大陆层面取得良好性能。

Comments 22 pages, 10 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 70%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06352 2026-04-28 cs.AI 70%

CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation

CARD: 基于奖励引导解码的集群级适应用于个性化文本生成

Yutong Song, Jiang Wu, Weijia Zhang, Chengze Shen, Shaofan Yuan, Weitao Lu, Jian Wang, Yu Wang, Nikil Dutt, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) University of Amsterdam(阿姆斯特丹大学) TikTok Inc.(TikTok公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CARD通过分层框架实现有效个性化,通过集群用户风格模式聚类和LoRA适配器学习,结合隐式偏好学习机制和解码时的轻量级偏好向量注入,提升个性化文本生成的效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22880 2026-04-28 cs.CL 70%

TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction

TexOCR: 提升可编译页面到LaTeX重建的文档OCR模型

Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao

机构 * Yale University(耶鲁大学) Zhejiang University(浙江大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出TexOCR-Bench和TexOCR-Train,通过监督微调和强化学习训练出2B参数模型,提升科学PDF到可编译LaTeX的重建能力,验证了可验证奖励在结构和编译指标上的改进。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10486 2026-04-28 cs.CR cs.AI 70%

MEASER: Malware embedding attacks on open-source LLMs

MEASER:对开源大语言模型的恶意嵌入攻击

Ming Tan, Wei Li, Hu Tao, Hailong Ma, Aodi Liu, Qian Chen, Zilong Wang

机构 * Information Engineering University(信息工程大学) Laboratory of Cyberspace Endogenous Security(网络空间内生安全实验室) National Key Laboratory of advanced communication networks(先进通信网络国家重点实验室) Key Laboratory of Cyberspace Security Ministry of Education of China(中国教育部网络空间安全重点实验室) Henan Province Key Laboratory of Information Security(河南省信息安全重点实验室) State Key Laboratory of Integrated Service Networks(集成服务网络国家重点实验室) Institute of Mathematics and Interdisciplinary Sciences(数学与交叉科学研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对开源大语言模型的恶意嵌入攻击,提出MEASER攻击方法,通过识别目标参数、嵌入负载、注入触发器并按顺序执行负载,提升攻击鲁棒性,实验表明其在 stealth 性能和抗量化方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23977 2026-04-28 cs.CV 67%

Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification

多视图协同学习与视觉-语言适应用于低资源生物医学图像分类

Xiaoliu Luo, Minxue Xiao, Ting Xie, Mengzhu Wang, Huiqing Qi, Joey Tianyi Zhou, Taiping Zhang, Xu Wang

机构 * Chongqing University of Technology(重庆理工大学) Collge of Computer Science, Sichuan University(四川大学计算机学院) Hebei University of Technology(河北工业大学) Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出多视图协同学习框架,通过视觉-语言适应提升低资源下生物医学图像分类性能,采用多粒度对比学习和结构监督增强跨模态对齐与细粒度区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14228 2026-04-28 cs.CV 67%

Not All Directions Matter: Towards Structured and Task-Aware Low-Rank Model Adaptation

并非所有方向都重要:迈向结构化和任务感知的低秩模型适应

Xi Xiao, Chenrui Ma, Yunbei Zhang, Chen Liu, Zhuxuanzi Wang, Yanshu Li, Lin Zhao, Guosheng Hu, Tianyang Wang, Hao Xu

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) University of Virginia(弗吉尼亚大学) Tulane University(路易斯安那州立大学) Yale University(耶鲁大学) Brown University(布朗大学) Northeastern University(东北大学) University of Bristol(布里斯托尔大学) Harvard University(哈佛大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出StructLoRA框架,通过信息瓶颈引导过滤和图协调器解决低秩适应中的语义漂移和结构不一致问题,实验证明其在多种模型上均优于传统LoRA及其他方法,尤其在低秩和低数据场景下表现突出。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22177 2026-04-28 cs.LG cs.CV 57%

Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage

通过REINFORCE与James-Stein收缩设计实例级采样计划

Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) UCLA(加州大学洛杉矶分校)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 本文提出通过REINFORCE学习实例级采样计划,结合James-Stein收缩估计器提升高维策略学习的梯度估计精度,实现文本图像对齐和生成质量提升。

Comments CVPR 2026; 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI 57%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10419 2026-04-28 cs.IR 50%

ZeroGR: A Generalizable and Scalable Framework for Zero-Shot Generative Retrieval

ZeroGR: 一种通用且可扩展的零样本生成检索框架

Weiwei Sun, Keyi Kong, Xinyu Ma, Shuaiqiang Wang, Dawei Yin, Maarten de Rijke, Zhaochun Ren, Yiming Yang

专题命中 指令微调 :language model(abstract)

AI总结 ZeroGR通过自然语言指令扩展生成检索,解决零样本检索场景下的泛化问题,提出文档ID生成器、指令调优查询生成器和反向退火解码策略,实验表明其在BEIR和MAIR基准上表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 20 篇

2604.22785 2026-04-28 cs.LG 92%

CoFi-PGMA: Counterfactual Policy Gradients under Filtered Feedback for Multi-Agent LLMs

CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度

Stela Tong, Elai Ben-Gal

机构 * Stanford Graduate School of Business(斯坦福商学院) Stanford University(斯坦福大学) Department of Mathematics(数学系)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);RLHF(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11079 2026-04-28 cs.LG cs.AI 91%

Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training

基于探针的数据归因:发现并缓解LLM微调后的不良行为

Frank Xiao, Santiago Aranguri

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03847 2026-04-28 cs.LG cs.AI 90%

DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training

DVPO:基于分布价值建模的策略优化用于大语言模型后训练

Dingwei Zhu, Zhiheng Xi, Shihan Dou, Yuhui Wang, Sixian Li, Junjie Ye, Honglin Guo, Shichun Liu, Chenhao Huang, Yajie Yang, Junlin Shang, Senjie Jin, Ming Zhang, Jiazheng Zhang, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣誉设备有限公司)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 DVPO通过结合条件风险理论与分布价值建模,在噪声监督下提升大语言模型后训练的鲁棒性和泛化能力,优于PPO、GRPO等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05799 2026-04-28 cs.CL cs.AI cs.SD 88%

Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech

高效的目标令牌级偏好优化用于基于大语言模型的文本到语音

Rikuto Kotoge, Yuichi Sasaki

机构 * SpiralAI Inc.(SpiralAI公司) The University of Osaka(大阪大学) Shizuoka University(izuoka大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23988 2026-04-28 cs.LG cs.AI 88%

Hindsight Preference Optimization for Financial Time Series Advisory

金融时间序列建议的 hindsight 偏好优化

Yanwei Cui, Guanghui Wang, Xing Zhang, Peiyang He, Ziyuan Li, Bing Zhu, Wei Qiu, Xusheng Wang, Zheng Yu, Anqi Xin

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc(汇丰控股有限公司) HSBC Technology Center China(汇丰技术中心(中国))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过回顾性偏好优化方法,利用观测结果生成偏好对,提升语言模型在金融时间序列预测中的建议质量。

Comments Accepted at ICLR 2026 TSALM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏