arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 48 篇

2605.17413 2026-05-19 cs.CR cs.AI 83%

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications

消除安全性:用于安全应用的语言模型对齐机制

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究探讨了通过受控转换评估协议去除语言模型对齐机制的方法,评估了安全任务中的拒绝率、尝试率、安全成功率、一般能力保留、不稳定性及超出范围的不安全合规性,证明了去除对齐作为效用-风险前沿的重要性,而非单纯的去审查配方。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18703 2026-05-19 cs.CL cs.LG 82%

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体

Minrui Xu, Zilin Wang, Mengyi DENG, Zhiwei Li, Zhicheng Yang, Xiao Zhu, Yinhong Liu, Boyu Zhu, Baiyu Huang, Chao Chen, Heyuan Deng, Fei Mi, Lifeng Shang, Xingshan Zeng, Zhijiang Guo

机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) University of Cambridge(剑桥大学) UCL(伦敦大学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI 81%

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18584 2026-05-19 cs.LG cs.AI cs.CV 81%

GIST: Targeted Data Selection for Instruction Tuning via Coupled Optimization Geometry

GIST: 通过耦合优化几何进行指令微调的目标数据选择

Guanghui Min, Tianhao Huang, Ke Wan, Chen Chen

机构 * Department of Computer Science, University of Virginia, Charlottesville, USA(弗吉尼亚大学计算机科学系)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GIST方法,通过子空间对齐替代轴对齐缩放,解决参数高效微调中参数耦合问题,实现更高效的目标数据选择。

Comments ICML 2026; 27 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16690 2026-05-19 cs.LG 79%

UB-SMoE: Universally Balanced Sparse Mixture-of-Experts for Resource-adaptive Federated Fine-tuning of Foundation Models

UB-SMoE:面向资源自适应联邦微调的通用平衡稀疏专家混合模型

Van-Tuan Tran, Hong-Hanh Nguyen-Le, Marco Ruffini, Merim Dzaferagic

机构 * School of Computer Science and Statistics, Trinity College Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) School of Computer Science, University College Dublin, Ireland(都柏林大学学院计算机科学学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出UB-SMoE,通过动态调节路由和通用伪梯度解决异构联邦学习中专家利用率失衡和Top-K路由非可微问题,实现低资源客户端的计算节省与性能提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01674 2026-05-19 cs.AI 79%

Can Heterogeneous Language Models Be Fused?

异构语言模型能否融合?

Shilian Chen, Jie Zhou, Qin Chen, Wen Wu, Xin Li, Qi Feng, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出HeteroFusion方法,解决异构语言模型融合中的架构不匹配和冲突问题,通过功能模块对齐和冲突感知去噪,实现稳定高效的模型融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06809 2026-05-19 cs.CV 78%

VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance

VA-Adapter:将超声基础模型适应于超声心动图探头引导

Teng Wang, Haojun Jiang, Yuxuan Wang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Computer Science and Technology, Xidian University(计算机科学与技术学院、西安电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Chinese PLA General Hospital(中国人民解放军总医院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出VA-Adapter,通过将超声基础模型与理解个体三维结构的能力相结合,提高超声心动图探头引导的精度和效率,实验表明其在参数量较少的情况下表现优于现有模型。

Comments MICCAI2026 Early Accept Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17577 2026-05-19 cs.CV 78%

TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models

TAME: 通过混合专家架构实现视觉语言模型的测试时对抗提示调优

Xin Wang, Yixu Wang, Jiaming Zhang, Ruofan Wang, Jiaqi Yu, Kai Chen, Jingjing Chen, Xingjun Ma, Yu-Gang Jiang

机构 * Fellow, IEEE(IEEE会士)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出TAME,一种基于混合专家架构的测试时防御方法,旨在提升视觉语言模型在对抗扰动下的鲁棒性,同时保持对清洁样本的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10503 2026-05-19 cs.AI 77%

SLASH the Sink: Sharpening Structural Attention Inside LLMs

SLASH the Sink: 在大语言模型中 sharpening 结构性注意力

Yiming Liu, Bin Lu, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Geographical Science and Natural Resources Research(地理科学与自然资源研究所) Chinese Academy of Sciences(中国科学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型内部机制,发现其能自发重构图拓扑,但受注意力sink影响导致结构理解被削弱。提出SLASH方法,通过插件式注意力重分布增强内部结构理解,实验表明在纯图任务和分子预测中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17458 2026-05-19 cs.LG 77%

ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

ClaHF:一种基于人类反馈的强化学习框架,用于改进分类任务

Tianxiang Xu, Xiaoyan Zhu, Xin Lai, Jiayin Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文提出ClaHF,一种基于人类反馈的强化学习框架,用于改进文本分类任务,通过整合偏好建模和强化学习优化,无需额外人工标注,在分类流程中提升分类性能和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06984 2026-05-19 cs.LG cs.AI 76%

FediLoRA: Practical Federated Fine-Tuning of Foundation Models Under Missing-Modality Constraints

FediLoRA: 在缺失模态约束下联邦微调基础模型的实用方法

Lishan Yang, Wei Emma Zhang, Nam Kha Nguygen, Po Hu, Yanjun Shu, Weitong Chen, Mong Yuan Sim

机构 * Adelaide University(阿德莱德大学) Central China Normal University(中央中国师范大学) Harbin Institute of Technology(哈尔滨工程大学)

专题命中 指令微调 :foundation model(title);分类 cs.AI、cs.LG

AI总结 本文提出FediLoRA,一种轻量级的联邦LoRA聚合框架,旨在解决联邦学习中异构环境下的缺失模态问题,通过联合简单平均和结构化编辑提升全局和个性化模型性能,实现在多个通用领域和医疗领域基准数据集上的强大表现。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17152 2026-05-19 cs.CL 76%

Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages

多语言和多模态大语言模型在野:为低资源语言构建

Firoj Alam, Shammur Absar Chowdhury, Enamul Hoque Prince

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) HBKU(哈马德大学) York University(约克大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL;large language model(comments);language model(comments)

AI总结 本文探讨了在有限数据和计算资源下构建多语言多模态大语言模型的方法,涵盖了低成本数据创建、三模态对齐适配器堆栈以及文化感知评估等核心技术和资源。

Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Low-resources-language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10503 2026-05-19 cs.RO 75%

Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning

迈向长寿命机器人:通过强化微调实现持续学习的VLA模型

Yuan Liu, Haoran Li, Shuai Tian, Yuxing Qin, Yuhui Chen, Yupeng Zheng, Yongzhen Huang, Dongbin Zhao

机构 * CASIA(中国科学院自动化研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出LifeLong-RFT方法,通过整合分块级在线强化学习与多维过程奖励机制,提升VLA模型在多任务学习中的性能,实现持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05136 2026-05-19 cs.CV cs.AI 74%

Fine-tuning an ECG Foundation Model to Predict Coronary CT Angiography Outcomes

微调一种心电图基础模型以预测冠状动脉CT血管造影结果

Yujie Xiao, Qinghao Zhao, Gongzheng Tang, Hao Zhang, Zhuoran Kan, Deyun Zhang, Jun Li, Guangkun Nie, Xiaocheng Fang, Haoyu Wang, Shun Huang, Tong Liu, Jian Liu, Kangyin Chen, Shenda Hong

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) Tianjin Key Laboratory of Ionic-Molecular Function of Cardiovascular Disease, Department of Cardiology, Tianjin Institute of Cardiology, The Second Hospital of Tianjin Medical University(天津医科大学心血管离子-分子功能重点实验室,天津心脏病学研究院,天津医科大学第二医院心内科) Heart Voice Medical Technology(心声医疗科技) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 指令微调 :foundation model(title);分类 cs.AI

AI总结 本文研究了通过微调心电图基础模型来预测冠状动脉CT血管造影结果的研究问题,采用多中心研究方法,利用CTCA作为解剖参考标准,开发并验证了AI-ECG模型,以预测血管特异性冠状动脉狭窄,并展示了模型在内部和外部验证中的表现,以及其在临床中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16470 2026-05-19 cs.LG cs.AI 73%

Strategic Over-Parameterization for Generalizable Low-Rank Adaptation

战略性过参数化以实现通用的低秩适应

Jing Gao, Zhong-Yi Lu, Pan Zhang, Ze-Feng Gao

机构 * School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(1 基础物理与数学科学学院,杭州先进研究院,UCAS,杭州 310024,中国) School of Physical Sciences, University of Chinese Academy of Sciences, No. 19A Yuquan Road, Beijing 100049, China(2 物理科学学院,中国科学院大学,玉泉路19A号,北京 100049,中国) CAS Key Laboratory of Theoretical Physics, Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(3 中国科学院理论物理重点实验室,理论物理研究所,中国科学院,北京 100190,中国) School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China, Beijing 100872, China(4 物理学院和量子态构造与操控(教育部)重点实验室,中国人民大学,北京 100872,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LoRA-Over框架,通过训练时丰富优化景观并推理时压缩,提升低秩适应的泛化能力,实验显示其在多个任务上优于传统LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13795 2026-05-19 cs.CV 71%

Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models

无需训练的零样本时序动作检测与视觉-语言模型

Chaolei Han, Hongsong Wang, Jidong Kuang, Lei Zhang, Jie Gui

机构 * Southeast University School of Cyber Science and Engineering(东南大学网络安全科学与工程学院) Southeast University School of Computer Science and Engineering(东南大学计算机科学与工程学院) Nanjing Normal University School of Electrical Engineering and Automation(南京师范大学电气工程与自动化学院)

专题命中 指令微调 :language model(title)

AI总结 本文提出一种无需训练的零样本时序动作检测方法FreeZAD,利用现有的视觉-语言模型直接对未标记视频中的未知活动进行分类和定位,无需额外微调或适应,并通过LogOIC和频率基于的动作校准以及测试时适应策略提升性能。

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16769 2026-05-19 cs.CV 71%

GLT-PEFT: Gated Lie-Tucker Parameter-Efficient Fine-Tuning for Alzheimer's Disease Diagnosis with Hippocampal Segmentation Pretraining

GLT-PEFT: 基于门控李-塔克参数高效微调的阿尔茨海默病诊断方法(结合海马体分割预训练)

Guanghua He, Hancan Zhu, Gaohang Yu, An Zhang

机构 * Department of Mathematics, Hangzhou Dianzi University(杭州电子科技大学数学系) School of Mathematics, Physics and Information, Shaoxing University(绍兴大学数学与物理学院) Department of Mathematics, Zhejiang University of Science and Technology(浙江科技学院数学系)

专题命中 指令微调 :pretraining(title)

AI总结 本文提出GLT-PEFT方法,通过门控李-塔克分解实现高效参数微调,用于阿尔茨海默病诊断,结合海马体分割预训练,提升医学影像模型的适应性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17598 2026-05-19 cs.CL 70%

Mixture of Experts for Low-Resource LLMs

专家混合用于低资源大语言模型

Ori Bar Joseph, Smadar Arvatz, Noam Kayzer, Dan Revital, Sarel Weinberger

机构 * National Institute for Testing and Evaluation(国家测试与评估研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了专家混合架构在低资源语言中的专家路由行为,发现持续预训练能有效缓解路由不平衡问题,且路由改进与下游任务表现提升相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09855 2026-05-19 cs.LG 70%

Concordia: Self-Improving Synthetic Tables for Federated LLMs

Concordia:面向联邦大语言模型的自改进合成表格

Jimin Huang, Duanyu Feng, Nuo Chen, Xiaoyu Wang, Zhiqiang Zhang, Xueqing Peng, Mingquan Lin, Prayag Tiwari, Guojun Xiong, Alejandro Lopez-Lira, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) National University of Singapore(新加坡国立大学) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈姆斯塔德大学) Harvard University(哈佛大学) University of Florida(佛罗里达大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在无法共享原始数据的情况下,如何通过自改进的合成表格来提升联邦学习中大语言模型的适应能力,提出了一种三层优化框架Concordia,通过参数高效LoRA训练和轻量级效用评分器提升联邦验证效用和跨客户端稳定性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17364 2026-05-19 cs.CL cs.IR 70%

NewsLens: A Multi-Agent Framework for Adversarial News Bias Navigation

NewsLens: 一个用于对抗性新闻偏见导航的多智能体框架

Joy Bose

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出NewsLens多智能体框架,通过五个智能体协作解构新闻文章,揭示意识形态缺失、修辞操纵和框架边界,利用Qwen2.5-3B-Instruct和Mistral 7B模型进行评估,展示了系统在不同政治事件簇中的表现。

Comments 17 pages, 2 figures, 7 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16462 2026-05-19 cs.CR cs.AI 70%

Asking Back: Interaction-Layer Antidistillation Watermarks

反向提问:交互层反知识蒸馏水印

Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) Meta

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出交互层反知识蒸馏水印,通过教师模型的行为特征进行水印,验证其在不同模型上的有效性与鲁棒性。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18048 2026-05-19 cs.AI 57%

DocOS: Towards Proactive Document-Guided Actions in GUI Agents

DocOS: 向 GUI 代理中的主动文档引导行动迈进

Jingjing Liu, Ziye Huang, Zihao Cheng, Zeming Liu, Jiahong Wu, Yuhang Guo, Kehai Chen, Yunhong Wang, Haifeng Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北航计算机科学与工程学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science and Technology, Beijing Institute of Technology, Beijing(北京理工大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)计算机科学与技术学院) Baidu Inc., Beijing, China(百度公司)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.AI

AI总结 本文提出 DocOS 基准,通过引导文档解决长尾任务,解决 GUI 代理在动态开放网络环境中处理长尾任务的能力限制,核心方法是主动文档引导行动,主要贡献是设计了一个评估文档引导问题解决能力的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15735 2026-05-19 cs.CV cs.AI 57%

UAM: A Dual-Stream Perspective on Forgetting in VLA Training

UAM:VL A训练中遗忘的双流视角

Jianke Zhang, Yuanfei Luo, Yucheng Hu, Xiaoyu Chen, Yanjiang Guo, Ziyang Liu, Hongbin Xu, Tian Lan, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出UAM模型,通过双流架构解决VL A训练中因单一编码器导致的多模态能力下降问题,展示了通过架构分离而非冻结权重或辅助数据可实现语义保留,并在多种任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15377 2026-05-19 cs.AI 57%

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

为AI控制的集束监控:多样信号胜过更多计算

Eugene Koran, Yejun Yun, Samantha Tetef, Benjamin Arnav, Pablo Bernabeu-Pérez

机构 * Yale University(耶鲁大学)

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 本文研究了通过结合多种监控信号来提高AI行为检测的性能,发现多样性的监控集合比单一或同质的监控集合更有效,且细调的监控方法在检测能力上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17077 2026-05-19 cs.RO cs.AI 57%

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

如何指导你的机器人:密集语言标注助力机器人策略学习

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA

专题命中 指令微调 :post-training(abstract);分类 cs.AI

AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13161 2026-05-19 cs.CV cs.LG 57%

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning

A₃B₂:一种自适应非对称适配器,用于缓解视觉-语言图像分类中的分支偏差

Yiyun Zhou, Zhonghua Jiang, Wenkang Han, Kunxi Li, Mingjing Xu, Chang Yao, Jingyuan Chen

机构 * Zhejiang University(浙江大学) Swansea University(斯旺西大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出A₃B₂适配器,通过引入不确定性感知适配器阻尼机制,缓解少样本学习中的分支偏差问题,实验表明其在多个数据集上优于现有基线方法。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17666 2026-05-19 cs.RO 50%

Robust and Resilient Soft Robotic Object Insertion with Compliance-Enabled Contact Formation and Failure Recovery

具有合规性接触形成和故障恢复的鲁棒且具有弹性的软机器人物体插入

Mimo Shirasaka, Cristian C. Beltran-Hernandez, Masashi Hamaya, Yoshitaka Ushiku

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种基于合规性腕部的物体插入方法,通过大变形吸收接触,实现安全接触形成和故障恢复,实验显示在随机条件下成功率高达83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16404 2026-05-19 cs.CV 50%

Hybrid Quantum-MambaVision: A Quantum-enhanced State Space Model for Calibrated Mixed-type Wafer Defect Detection

混合量子-马amba视觉:一种增强状态空间模型用于校准混合型晶圆缺陷检测

Satwik Sai Prakash Sahoo, Jyoti Prakash Sahoo, Ting Wang, Subrota Kumar Mondal

机构 * Odisha University of Technology and Research(奥里萨理工大学) National Taiwan University of Science and Technology(台湾科技大学) East China Normal University(东华大学) Macau University of Science and Technology(澳门科技大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出Hybrid Quantum-MambaVision,通过结合状态空间模型与量子适配器,解决工业视觉数据中极端类别不平衡和计算复杂性问题,实现高效多标签分类。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 41 篇

2407.16216 2026-05-19 cs.CL 95%

Reinforcement Learning for LLM Post-Training: A Survey

为大型语言模型进行后训练的强化学习:综述

Zhichao Wang, Kiran Ramnath, Bin Bi, Shiva Kumar Pentyala, Sougata Chaudhuri, Shubham Mehrotra, Zixu, Zhu, Xiang-Bo Mao, Sitaram Asur, Na, Cheng

机构 * Salesforce AWS AI Labs Airbnb

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文综述了通过强化学习进行大型语言模型后训练的方法,分析了RLHF和RLVR等技术,并提出统一的策略梯度框架,旨在为研究人员提供技术参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG 92%

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);language model(abstract);small language model(abstract)

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏