arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 24 篇

2603.20480 2026-05-01 cs.CE 92%

Developing an ESG-Oriented Large Language Model through ESG Practices

通过ESG实践开发一个面向ESG的大型语言模型

Gabriel Assis, Ayrton Surica, Pedro Kroll, Gabriela Aires, Darian Rabbani, Edson Bollis, Lucas Pellicer, Aline Paes

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种面向ESG的LLM适应流程,通过整合ESG原则作为目标领域和训练约束,生成三种ESG专用模型,并在零样本和知识增强设置下评估其在ESG问答任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27238 2026-05-01 cs.CR cs.AR 91%

SafeTune: Mitigating Data Poisoning in LLM Fine-Tuning for RTL Code Generation

SafeTune: 缓解LLM微调中RTL代码生成的数据污染

Mahshid Rezakhani, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SafeTune通过结合图神经网络和语义验证模块,有效过滤数据污染,提升LLM微调的鲁棒性和可靠性,不改变底层模型架构。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026. 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27929 2026-05-01 cs.CL 90%

DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models

DPN-LE: 大语言模型双人格神经元定位与编辑

Lifan Zheng, Xue Yang, Jiawei Chen, Chenyan Wu, Jingyuan Zhang, Fanheng Kong, Xinyi Zeng, Xiang Chen, Yu Tian

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Zhejiang University of Technology(浙江工业大学) Kuaishou Technology(快手科技) Northeastern University(东北大学) Tsinghua University(清华大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出DPN-LE方法,通过对比高特质与低特质样本的MLP激活,定位并编辑双人格神经元,实现精准的人格控制与能力保留。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01611 2026-05-01 cs.CL 89%

In-context Learning vs. Instruction Tuning: The Case of Small and Multilingual Language Models

上下文学习与指令微调:小语言模型和多语言情况的案例

David Ponce, Thierry Etchegoyhen

机构 * Fundación Vicomtech, Basque Research and Technology Alliance (BRTA)(维克森科技基金会,巴斯克研究与技术联盟(BRTA)) University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU)

专题命中 指令微调 :language model(title,abstract);instruction tuning(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究评估了上下文学习在非英语语言和不同模型大小下的指令遵循有效性,发现其表现下降,但通过直接偏好优化可部分提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27840 2026-05-01 cs.LG cs.AI 87%

CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting

CastFlow:学习用于时间序列预测的角色专用代理工作流

Bokai Pan, Mingyue Cheng, Zhiding Liu, Shuo Yu, Xiaoyu Tao, Yuchong Wu, Qi Liu, Defu Lian, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21479 2026-05-01 cs.CV 86%

Frozen LLMs as Map-Aware Spatio-Temporal Reasoners for Vehicle Trajectory Prediction

冻结的大语言模型作为具有地图意识的时空推理器用于车辆轨迹预测

Yanjiao Liu, Jiawei Liu, Xun Gong, Zifei Nie

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用冻结的大语言模型作为时空推理器,通过交通编码器提取轨迹特征并结合轻量CNN处理地图信息,评估LLM在动态交通代理行为和道路拓扑理解中的能力,提升轨迹预测的准确性与泛化性。

Comments Accepted for publication at IEEE Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28182 2026-05-01 cs.LG cs.CL 85%

Exploration Hacking: Can LLMs Learn to Resist RL Training?

探索黑客:大语言模型能否学会抵抗强化学习训练?

Eyon Jang, Damon Falck, Joschka Braun, Nathalie Kirch, Achu Menon, Perusha Moodley, Scott Emmons, Roland S. Zimmermann, David Lindner

机构 * MATS UC San Diego(UC圣迭戈大学) Google DeepMind(谷歌DeepMind) Anthropic

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。

Comments 81 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27426 2026-05-01 cs.CR cs.AI 83%

Secret Stealing Attacks on Local LLM Fine-Tuning through Supply-Chain Model Code Backdoors

通过供应链模型代码后门进行本地LLM微调中的秘密窃取攻击

Zi Li, Tian Zhou, Wenze Li, Jingyu Hua, Yunlong Mao, Sheng Zhong

机构 * Nanjing University(南京大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 研究揭示本地微调数据中敏感信息泄露风险,提出通过供应链代码后门实现主动执行劫持,引入确定性全链记忆机制,实现高精度秘密窃取,实验表明方法在不干扰主要任务的前提下达到98%以上的ASR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12414 2026-05-01 cs.CV cs.AI cs.LG cs.RO 82%

AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models

AutoVDC:利用视觉-语言模型实现自动化视觉数据清洗

Santosh Vasa, Aditi Ramadwar, Jnana Rama Krishna Darabattula, Md Zafar Anwar, Stanislaw Antol, Andrei Vatavu, Thomas Monninger, Sihao Ding

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰北美研发公司) University of Stuttgart, Institute for Artificial Intelligence(斯图加特大学人工智能研究所)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG;foundation model(comments)

AI总结 本文提出AutoVDC框架,利用视觉-语言模型自动识别视觉数据集中的错误标注,提升数据质量。通过KITTI和nuImages数据集验证,展示了方法在错误检测和数据清洗中的高性能。

Comments Accepted to IV 2026 Drive-X Foundation Models for Autonomous Driving (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18731 2026-05-01 cs.CL cs.AI cs.LG 80%

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

通过可验证准确性和回避奖励的课程强化学习缓解多轮对话中的迷失问题

Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLAAR框架,通过可验证准确性和回避奖励的课程强化学习,减少多轮对话中因提前回答导致的性能下降,提升模型可靠性。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27962 2026-05-01 cs.AI cs.CE cs.MA 79%

Language Models Refine Mechanical Linkage Designs Through Symbolic Reflection and Modular Optimisation

语言模型通过符号反思和模块化优化改进机械连杆设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出语言模型通过符号表示和模块化优化改进机械连杆设计,显著降低几何误差并提高结构有效性,展示出符号抽象在工程设计中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12089 2026-05-01 eess.SP cs.CL 79%

RadarPLM: Adapting Pre-trained Language Models for Marine Radar Target Detection by Selective Fine-tuning

RadarPLM:通过选择性微调适应预训练语言模型用于海洋雷达目标检测

Qiying Hu, Yaowen Li, Shengyi Zhang, Chuan Huang, Yu Liu, You He

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文提出RadarPLM框架,通过轻量级适应模块和选择性微调策略提升海洋雷达目标检测性能,在低信噪比环境下实现显著提升。

Comments Preprint,in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06992 2026-05-01 cs.IR cs.AI cs.CL 73%

FinCARDS: Card-Based Analyst Reranking for Financial Document Question Answering

FinCARDS: 基于卡片的分析师重排序用于财务文档问答

Yixi Zhou, Fan Zhang, Yu Chen, Haipeng Zhang, Preslav Nakov, Zhuohan Xie

机构 * ShanghaiTech University(上海科技大学) The University of Tokyo(东京大学) MBZUAI

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 FinCARDS通过结构化重排序框架,将财务证据选择转化为在财务意识模式下的约束满足问题,提升长文档问答的稳定性与可追溯性。

Comments 17 pages, including figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28082 2026-05-01 cs.AI 70%

Characterizing the Consistency of the Emergent Misalignment Persona

刻画涌现偏差人格的一致性

Anietta Weckauff, Yuchen Zhang, Maksym Andriushchenko

机构 * ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过微调Qwen 2.5 32B Instruct模型,探讨了涌现偏差人格在不同任务和领域中的一致性,发现两种模式:一致人格模型和反向人格模型,揭示了涌现偏差的影响更复杂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19630 2026-05-01 cs.CL 70%

Real-World Doctor Agent with Proactive Consultation through Multi-Agent Reinforcement Learning

现实世界中的医生代理通过多智能体强化学习实现主动咨询

Yichun Feng, Jiawei Wang, Lu Zhou, Yikai Zheng, Zhen Lei, Yixue Li

机构 * Guangzhou National Laboratory(广州国家实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DoctorAgent-RL框架,通过多智能体强化学习提升医疗咨询的动态决策能力,实现70%的准确诊断匹配率,验证了其在现实中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27487 2026-05-01 cs.LG cs.CR 70%

Low Rank Adaptation for Adversarial Perturbation

低秩适应于对抗扰动

Han Liu, Shanghao Shi, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究对抗扰动是否具有低秩结构,提出基于低秩性质提升对抗攻击效率的方法,通过两步策略改进攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27253 2026-05-01 cs.AI 70%

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

AutoSurfer -- 通过全面浏览、学习和建模教学网络代理

Fazle Elahi Faisal, Qianhui Wu, Baolin Peng, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoSurfer通过系统性广度优先探索策略、任务合成引导和轨迹优化,实现全面覆盖网站操作空间,提升网络代理轨迹生成的准确性和多样性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26984 2026-05-01 cs.LG 70%

Monitoring Neural Training with Topology: A Footprint-Predictable Collapse Index

通过拓扑监测神经训练:可预测的崩溃指数

Alexander Kalinowski

机构 * SUNY Empire(SUNY 帝国)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种在线拓扑监测方法,结合模块化莫尔斯同调维护与崩溃指数,用于快速检测神经表示的崩溃,适用于训练过程中的干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13559 2026-05-01 cs.AI 70%

OpAgent: Operator Agent for Web Navigation

OpAgent:网页导航的运算代理

Yuyu Guo, Wenjie Yang, Siyuan Yang, Ziyang Liu, Cheng Chen, Yuan Wei, Yun Hu, Yang Huang, Guoliang Hao, Dongsheng Yuan, Jianming Wang, Xin Chen, Hang Yu, Lei Lei, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出OpAgent,通过在线强化学习优化网页导航策略,结合层级多任务微调和混合奖励机制,实现71.6%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15549 2026-05-01 cs.CL 70%

M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

M-DaQ:用于指令微调数据集的多语言多样性与质量样本检索

Chunguang Zhao, Yilun Liu, Pufan Zeng, Yuanchang Luo, Shimin Tao, Minggui He, Weibin Meng, Song Xu, Chen Liu, Hongxia Ma, Li Zhang, Boxing Chen, Daimeng Wei

机构 * Huawei Technologies Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 M-DaQ通过联合优化指令-响应质量与跨语言语义多样性,构建高质量平衡训练数据,验证了多语言设置下的Superficial Alignment Hypothesis,并在18种语言上展示出超过60%的胜率。

Comments Accepted by SIGIR 2026 Short

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27818 2026-05-01 cs.CR 67%

MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks

MASCing:通过激活引导掩码实现可配置的专家混合行为

Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 MASCing通过LSTM模型捕捉跨层路由依赖,利用引导矩阵优化专家电路,实现无需重新训练的MoE行为灵活重构,提升安全场景下的模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 62%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27796 2026-05-01 cs.AI 57%

Post-Optimization Adaptive Rank Allocation for LoRA

LoRA的后优化自适应秩分配

Vishnuprasadh Kumaravelu, Sunil Gupta, P. K. Srijith

机构 * Indian Institute of Technology Hyderabad(印度海得拉巴理工学院) Deakin University(德肯大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 本文提出PARA方法,通过奇异值分解在无需数据的情况下优化LoRA秩分配,减少参数冗余,提升模型压缩效率并保持预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27166 2026-05-01 cs.LG cs.GT 57%

Distributional Alignment Games for Answer-Level Fine-Tuning

分布对齐博弈用于答案级微调

Mehryar Mohri, Jon Schneider, Yifan Wu

机构 * Google Research(谷歌研究) Microsoft Research(微软研究)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏