arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 48 篇

2605.17967 2026-05-19 cs.AI 94%

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

弥合对SFT在LLM中效果的矛盾观点:一种交互视角

Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) UniDT

专题命中 指令微调 :SFT(title,title_cn);LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文从交互视角探讨了SFT在LLM中的效果不一致问题,发现SFT主要去除噪声交互但难以获得可靠新交互,且去噪阶段短暂,继续微调易引入过拟合交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16826 2026-05-19 cs.LG cs.AI cs.CL 94%

Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

解耦KL与轨迹:为LLM蒸馏中的SFT、DAgger、离线RL和OPD提供统一视角

Anhao Zhao, Haoran Xin, Yingqi Fan, Junlong Tong, Wenjie Li, Xiaoyu Shen

机构 * Eastern Institute of Technology(东技术院) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能 thrust,香港科学与技术大学(广州))

专题命中 指令微调 :LLM(title,title_cn);SFT(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了知识蒸馏中KL散度与轨迹之间的耦合问题,通过解耦两个轴向,提出了四种有效的蒸馏目标,并通过实验揭示了KL方向、前缀源和训练长度之间的权衡关系,提出了KL混合和熵门长度课程等实用方法。

Comments Code available at https://github.com/EIT-NLP/Decoupled-Distill

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16452 2026-05-19 cs.LG cs.AI 92%

Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign

峰值检测器:通过指令调优的大语言模型实现可解释的多模态峰值检测

Jiahui Li, Yida Zhang, Zixuan Zeng, Jiayu Chen, Yingjian Song, Yin Xiao, Nishan Dong, Junjie Lu, Younghoon Kwon, Xiang Zhang, Jin Lu, Wenzhan Song, Fei Dou

机构 * University of Georgia(佐治亚大学) Yixing People’s Hospital(宜兴人民医院) University of Washington(华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文提出Peak-Detector框架,利用指令调优的大语言模型实现跨模态、可解释的峰值检测,通过峰表示技术压缩时间序列数据并提升检测准确性,同时生成解释性内容以支持验证与错误分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18309 2026-05-19 cs.LG cs.AI 92%

Alignment Dynamics in LLM Fine-Tuning

在LLM微调中的对齐动力学

Yuhan Huang, Huanran Chen, Yinpeng Dong

机构 * Shanghai Qi Zhi Institue & University of Tokyo(上海启智研究院 & 东京大学) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM微调过程中对齐的动态特性,提出了一种可计算的对齐评分,并推导了其在微调过程中的闭式更新公式,从而建立了对齐动态的统一框架。通过将对齐更新分解为两种竞争成分:反弹力和驱动力,解释了为何先前的对齐可能被后续微调逆转,以及为何更狭窄的后验结构会增强这种逆转。此外,该框架预测了‘复习强化效应’,即先前的对齐会在重新暴露时留下潜在的后验印记,从而增强驱动力,导致更快的重新对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18395 2026-05-19 cs.CY cs.AI 92%

Diagnosing Korean-Language LLM Political Bias via Census-Grounded Agent Simulation

通过人口普查基础代理模拟诊断韩语LLM的政治偏见

Sungwoo Kang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Korea University(韩国大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过人口普查基础代理模拟框架Dynamo-K,研究韩语LLM在六个韩国选举中的政治行为,识别出三种系统性失败模式,并提出解决方案以校准模型,从而提高政治行为诊断的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07239 2026-05-19 cs.CL 91%

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

Red-Bandit:通过带引导的LoRA专家实现LLM红队测试的测试时适应

Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Red-Bandit框架,通过带引导的LoRA专家在不同攻击风格下实现LLM的测试时适应,通过强化学习生成不安全提示,并利用多臂老虎机策略动态选择攻击风格专家,从而在AdvBench上取得最佳结果,同时生成更易读的提示。

Comments Accepted to the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23267 2026-05-19 cs.CL cs.LG 91%

Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective

在大型语言模型中微调与上下文学习:从形式语言学习的角度

Bishwamittra Ghosh, Soumi Das, Till Speicher, Qinyuan Wu, Mohammad Aflah Khan, Deepak Garg, Krishna P. Gummadi, Evimaria Terzi

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Boston University(波士顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文从形式语言学习的角度比较了大型语言模型中的微调与上下文学习,通过设计精确的语言边界、受控字符串采样和无数据污染的任务,发现微调在分布内泛化上优于上下文学习,而两者在分布外泛化上表现相当,且两者在不同熟练度水平上的归纳偏置也有所不同。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04161 2026-05-19 cs.CL 90%

Traces of Social Competence in Large Language Models

大语言模型中社会能力的踪迹

Tom Kouwenhoven, Michiel van der Meer, Max van Duijn

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在虚假信念测试中的表现,通过贝叶斯逻辑回归分析模型大小和训练方法对社会认知能力的影响,发现模型规模扩大有助于性能提升,但并非绝对,同时指出解释命题态度会改变响应模式,进一步的推理导向微调会加剧这种影响。

Comments Presented at the 2026 Conference on Computational Natural Language Learning (CoNLL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16345 2026-05-19 cs.LG cs.AI 90%

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

面向目标的监督学习用于大语言模型微调

Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Intuit AI Research(Intuit人工智能研究)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出目标条件监督学习(GCSL)框架,通过将反馈信号作为显式目标,利用监督学习生成高质量响应,改进了传统监督微调和直接偏好优化的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17432 2026-05-19 cs.LG cs.CR 89%

DP-SelFT: Differentially Private Selective Fine-Tuning for Large Language Models

DP-SelFT: 大语言模型的差分隐私选择性微调

Haichao Sha, Zihao Wang, Yuncheng Wu, Hong Chen, Wei Dong

机构 * Renmin University of China(中国人民大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出DP-SelFT框架,通过选择性微调方法在保持差分隐私的同时提升大语言模型的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16274 2026-05-19 cs.HC cs.AI 89%

ChartDesign: Towards LLM Designer of Data Visualization

ChartDesign: 向数据可视化设计的LLM设计师迈进

Mohammed Afaan Ansari, Aniruddh Bansal, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChartDesign,利用大语言模型生成数据可视化设计属性,提升图表设计性能,实现84%的准确率,并在未见领域中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16632 2026-05-19 cs.LG cs.AI cs.LO 88%

Learning How to Cube

学习如何求立方

Ferhat Erata, Sam Kouteili, Thanos Typaldos, Timos Antonopoulos, Robert B. Jones, Byron Cook, Ruzica Piskac

机构 * Yale University(耶鲁大学) AWS Agentic AI(AWS智能体AI)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);post-training(abstract);preference optimization(abstract)

AI总结 本文提出一种神经符号后训练框架,通过MCTS数据整理管道和符号启发式方法,使4B参数模型在SAT竞赛基准上取得53的pass@5分数,超越了Claude-Sonnet-4等前沿LLM。

Comments 33 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18253 2026-05-19 cs.CL cs.AI 88%

Machine Unlearning for Masked Diffusion Language Models

针对掩码扩散语言模型的机器去学习

Georu Lee, Seungwon Jeong, Hoki Kim, Jinseong Park, Woojin Lee

机构 * Dongguk University-Seoul(东国大学-首尔) Chung-Ang University(Chung-Ang 大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对掩码扩散语言模型的去学习框架MDU,通过重新审视扩散过程中的知识学习,实现了高效的去学习性能。

Comments 20 pages, 8 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18504 2026-05-19 cs.CL 86%

Ancient Greek to Modern Greek Machine Translation: A Novel Benchmark and Fine-Tuning Experiments on LLMs and NMT Models

古希腊语到现代希腊语机器翻译:一种新的基准和对LLM和NMT模型的微调实验

Spyridon Mavromatis, Sokratis Sofianopoulos, Prokopis Prokopidis, Maria Giagkou

机构 * National and Kapodistrian University of Athens, Department of Informatics and Telecommunications(雅典国家和卡普迪斯特里亚大学信息与电信系) Institute for Language and Speech Processing, Athena RC(语言与语音处理研究所,雅典RC)

专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出了一种新的基准测试,并对LLM和NMT模型进行了微调实验,以解决古希腊语到现代希腊语的低资源机器翻译问题,展示了微调在提升翻译性能上的显著效果。

Comments 14 pages. Accepted for presentation at the 15th Language Resources and Evaluation Conference (LREC 2026), Palma, Mallorca, Spain

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 8685-8698. European Language Resources Association (ELRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17792 2026-05-19 cs.LG physics.geo-ph 86%

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

HydroAgent: 通过模拟器引导的强化学习缩小前沿大语言模型与人类专家在水文模型校准之间的差距

Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong

机构 * Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系) Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系) Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系) Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究如何利用前沿大语言模型(LLM)代理替代人类水文模型师进行水文模型校准,提出HydroAgent方法,通过模拟器引导的强化学习(RLSF)进行微调,以提高模型在不同流域中的适应性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11208 2026-05-19 cs.CV 86%

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation

Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器

Kedi Sun, Chaohui Dang, Yue Feng, James Glasbey, Theodoros N. Arvanitis, Le Zhang

机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院) School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Hi-GaTA框架,通过时间聚合压缩长视频序列生成LLM兼容的视觉前缀令牌,结合预训练的外科专用视频编码器和LoRA微调,实现高质量外科报告生成。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16714 2026-05-19 cs.AI cs.CR 84%

GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction

GRID:用于安全文本知识图谱构建的智能数据图表示

Liangyi Huang, Zichen Liu, Fei Shao, Shang Ma, Mengshi Zhang, Zihao Chen, Yanfang Ye, Xusheng Xiao

机构 * Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学) University of Notre Dame(诺丁汉大学) TensorBlock Facebook(脸书)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出GRID框架,通过构建可追溯的文章-图对齐,将文档到图学习转化为剧本任务库,提升安全知识图谱构建的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07111 2026-05-19 cs.CL cs.AI 84%

Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation

超越LoRA与全微调:基于梯度的优化器路由用于大语言模型适应

Haozhan Tang, Xiuqi Zhu, Xinyin Zhang, Boxun Li, Virginia Smith, Kevin Kuo

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Infinigence AI

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种混合LoRA和全微调(MoLF)框架,通过在优化器层面动态路由更新,实现两种训练模式之间的连续导航,从而提升大语言模型的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01404 2026-05-19 cs.CL cs.AI 84%

Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models

硅世界中的朋友与祖母:在语言模型中本地化实体细胞

Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

机构 * Mentaleap Independent Researcher(独立研究者) Tel Aviv University(特拉维夫大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过寻找稀疏的实体选择性MLP神经元(实体细胞)探讨语言模型如何检索实体特定事实,并发现这些细胞在早期层聚集,具有因果作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02064 2026-05-19 cs.LG cs.AI cs.CL 83%

Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct

对Llama3-8b-Instruct自生成文本识别能力的检查与控制

Christopher Ackerman, Nina Panickssery

专题命中 指令微调 :LLM(summary_cn,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了LLM是否能识别自身生成的文本,发现Llama3-8b-Instruct模型能够区分自身输出与人类输出,并通过残差流中的特定向量控制其行为和感知,揭示了模型自我归属的认知机制。

Comments 10 pages, 13 figs, 2 tables, accepted as conference paper to ICLR 2025

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17413 2026-05-19 cs.CR cs.AI 83%

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications

消除安全性:用于安全应用的语言模型对齐机制

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究探讨了通过受控转换评估协议去除语言模型对齐机制的方法,评估了安全任务中的拒绝率、尝试率、安全成功率、一般能力保留、不稳定性及超出范围的不安全合规性,证明了去除对齐作为效用-风险前沿的重要性,而非单纯的去审查配方。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18703 2026-05-19 cs.CL cs.LG 82%

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体

Minrui Xu, Zilin Wang, Mengyi DENG, Zhiwei Li, Zhicheng Yang, Xiao Zhu, Yinhong Liu, Boyu Zhu, Baiyu Huang, Chao Chen, Heyuan Deng, Fei Mi, Lifeng Shang, Xingshan Zeng, Zhijiang Guo

机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) University of Cambridge(剑桥大学) UCL(伦敦大学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI 81%

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18584 2026-05-19 cs.LG cs.AI cs.CV 81%

GIST: Targeted Data Selection for Instruction Tuning via Coupled Optimization Geometry

GIST: 通过耦合优化几何进行指令微调的目标数据选择

Guanghui Min, Tianhao Huang, Ke Wan, Chen Chen

机构 * Department of Computer Science, University of Virginia, Charlottesville, USA(弗吉尼亚大学计算机科学系)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GIST方法,通过子空间对齐替代轴对齐缩放,解决参数高效微调中参数耦合问题,实现更高效的目标数据选择。

Comments ICML 2026; 27 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16690 2026-05-19 cs.LG 79%

UB-SMoE: Universally Balanced Sparse Mixture-of-Experts for Resource-adaptive Federated Fine-tuning of Foundation Models

UB-SMoE:面向资源自适应联邦微调的通用平衡稀疏专家混合模型

Van-Tuan Tran, Hong-Hanh Nguyen-Le, Marco Ruffini, Merim Dzaferagic

机构 * School of Computer Science and Statistics, Trinity College Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) School of Computer Science, University College Dublin, Ireland(都柏林大学学院计算机科学学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出UB-SMoE,通过动态调节路由和通用伪梯度解决异构联邦学习中专家利用率失衡和Top-K路由非可微问题,实现低资源客户端的计算节省与性能提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01674 2026-05-19 cs.AI 79%

Can Heterogeneous Language Models Be Fused?

异构语言模型能否融合?

Shilian Chen, Jie Zhou, Qin Chen, Wen Wu, Xin Li, Qi Feng, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出HeteroFusion方法,解决异构语言模型融合中的架构不匹配和冲突问题,通过功能模块对齐和冲突感知去噪,实现稳定高效的模型融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06809 2026-05-19 cs.CV 78%

VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance

VA-Adapter:将超声基础模型适应于超声心动图探头引导

Teng Wang, Haojun Jiang, Yuxuan Wang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Computer Science and Technology, Xidian University(计算机科学与技术学院、西安电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Chinese PLA General Hospital(中国人民解放军总医院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出VA-Adapter,通过将超声基础模型与理解个体三维结构的能力相结合,提高超声心动图探头引导的精度和效率,实验表明其在参数量较少的情况下表现优于现有模型。

Comments MICCAI2026 Early Accept Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17577 2026-05-19 cs.CV 78%

TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models

TAME: 通过混合专家架构实现视觉语言模型的测试时对抗提示调优

Xin Wang, Yixu Wang, Jiaming Zhang, Ruofan Wang, Jiaqi Yu, Kai Chen, Jingjing Chen, Xingjun Ma, Yu-Gang Jiang

机构 * Fellow, IEEE(IEEE会士)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出TAME,一种基于混合专家架构的测试时防御方法,旨在提升视觉语言模型在对抗扰动下的鲁棒性,同时保持对清洁样本的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10503 2026-05-19 cs.AI 77%

SLASH the Sink: Sharpening Structural Attention Inside LLMs

SLASH the Sink: 在大语言模型中 sharpening 结构性注意力

Yiming Liu, Bin Lu, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Geographical Science and Natural Resources Research(地理科学与自然资源研究所) Chinese Academy of Sciences(中国科学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型内部机制,发现其能自发重构图拓扑,但受注意力sink影响导致结构理解被削弱。提出SLASH方法,通过插件式注意力重分布增强内部结构理解,实验表明在纯图任务和分子预测中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17458 2026-05-19 cs.LG 77%

ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

ClaHF:一种基于人类反馈的强化学习框架,用于改进分类任务

Tianxiang Xu, Xiaoyan Zhu, Xin Lai, Jiayin Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文提出ClaHF,一种基于人类反馈的强化学习框架,用于改进文本分类任务,通过整合偏好建模和强化学习优化,无需额外人工标注,在分类流程中提升分类性能和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏