arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 78 篇

2512.11470 2026-05-12 cs.LG cs.CL 93%

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21357 2026-05-12 cs.AI cs.CL 92%

AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling

AgentHER: 用于LLM代理轨迹重标记的回溯经验回放

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 AgentHER通过四阶段流程将废弃轨迹转化为SFT、DPO和ShareGPT训练数据,在WebArena和ToolBench上提升性能并提高样本效率,同时降低标签噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09927 2026-05-12 physics.optics physics.data-an 92%

Information Extraction of Nested Complex Structure of Quantum Cascade Lasers via Large Language Models

通过大语言模型提取量子级联激光器嵌套复杂结构的信息

Xiao Fang, Ming Lü, Hanwen Liang, Xingshen Song, Kele Xu, Hui Cai, Chaofan Zhang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本文提出基于JSON Schema指导的信息提取流程,提升复杂结构数据提取精度,通过12种先进LLM测试,最高F1分数达83.4%,显著提升中等和开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06117 2026-05-12 cs.LG 92%

BoostLLM: Boosting-inspired LLM Fine-tuning for Few-shot Tabular Classification

BoostLLM: 通过提升范式提升LLM微调用于少样本表格分类

Yi-Siang Wang, Kuan-Yu Chen, Yu-Chen Den, Darby Tien-Hao Chang

机构 * SinoPac Holdings(SinoPac控股公司)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出BoostLLM框架,通过多轮残差优化提升LLM微调性能,在少样本表格分类中超越传统方法,匹配甚至超越XGBoost,并在强树模型和延长提升周期下进一步提升。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12374 2026-05-12 cs.CL cs.AI 91%

A Scalable Entity-Based Framework for Auditing Bias in LLMs

一种可扩展的基于实体的LLM偏见审计框架

Akram Elbouanani, Aboubacar Tuo, Adrian Popescu

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,法国原子能委员会,List)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出一种可扩展的基于实体的LLM偏见审计框架,通过合成数据测量模型行为中的系统性差异,揭示了模型对政治倾向、国家和地区、公司类型等的偏见,并指出模型规模和提示语言对偏见的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09009 2026-05-12 cs.LG cs.AI 91%

Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning

用于序列决策的大型语言模型:通过监督微调提升上下文学习

Minmin Zhang, Sina Aghaei, Soroush Saghafian

机构 * Harvard University(哈佛大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在序列决策任务中的上下文学习能力,通过监督微调提升其在马尔可夫决策过程等场景中的决策性能,实验表明微调后的模型在复杂环境中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00195 2026-05-12 cs.LG 90%

Diversity in Large Language Models under Supervised Fine-Tuning

大型语言模型在监督微调下的多样性

Roman Klypa, Oleksandr Cherednichenko

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, 38000 Grenoble, France(格勒诺布尔阿尔卑斯大学,国家科学研究中心,格勒诺布尔INP,LJK,法国格勒诺布尔) Department of Mathematics and Mathematical Statistics, Integrated Science Lab, Umeå University, Sweden(乌梅大学数学与统计学系,整合科学实验室,瑞典)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究监督微调对大型语言模型生成多样性的影响,提出TOFU损失函数以解决低频模式忽略和知识遗忘问题,验证微调后生成多样性下降,并展示TOFU提升输出多样性同时保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08766 2026-05-12 cs.IR cs.CL 90%

UserGPT Technical Report

UserGPT 技术报告

Yunyi Xuan, Hao Yi, Fengling Mao, Daye Cai, Leikun Liang, Xingsheng He, Jiangnan Xie, Guoshuai Wang, Yushan Han, Wenwen Guo, Xiaoxiao Xu, Lin Qu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出UserGPT框架,通过属性生成和摘要生成提升LLM的人格理解能力,结合行为模拟引擎和数据导向语义化模块,实现对长行为历史的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09760 2026-05-12 cs.CL 90%

ConFit v3: Improving Resume-Job Matching with LLM-based Re-Ranking

ConFit v3:通过基于LLM的重排序提升简历-岗位匹配

Xiao Yu, Ruize Xu, Chengyuan Xue, Junyu Chen, Matthew So, Shijun Ma, Bo Liu, Xiangye Liang, Zhou Yu

机构 * Columbia University(哥伦比亚大学) John Hopkins University(约翰霍普金斯大学) Intellipro Group Inc.(Intellipro集团)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出ConFit v3,通过改进重排序算法和数据处理方法,提升简历与岗位匹配的准确性,优于现有最佳系统和大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09195 2026-05-12 cs.AI 90%

The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations

遗忘的几何学:时间知识漂移作为LLM表示中的独立轴

Rania Elbadry, Ahmed Heakl, Fan Zhang, Dani Bouch, Yuxia Wang, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) INSAIT, Sofia University(索菲亚大学INSAIT)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示LLM中时间知识漂移作为独立轴的几何结构,通过验证六种模型发现漂移检测的几何正交性,指出传统方法无法捕捉漂移的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10633 2026-05-12 cs.CL cs.AI 90%

Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs

内在护栏:人格语义几何与LLM中涌现偏差的交互

Krishak Aneja, Manas Mittal, Anmol Goel, Ponnurangam Kumaraguru, Vamshi Krishna Bonagiri

机构 * International Institute of Information Technology, Hyderabad(国际信息研究所,海得拉巴) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi(Mohamed bin Zayed人工智能大学,阿布扎比)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过心理测量学方法揭示LLM人格空间的稳定性,发现人格向量可作为内在护栏抑制LLM的涌现偏差。

Comments 20 pages, 9 figures including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18901 2026-05-12 cs.LG cs.AI cs.CL 89%

Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams

有害意图作为LLM残差流中的几何可恢复特征

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过几何方法识别LLM残差流中有害意图的特征,发现其在不同模型架构中线性可分离,并通过优化策略实现高检测性能。

Comments 26 pages, 1(+6) figures, 4(+14) tables. Code at https://github.com/isaac-6/harm-directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10765 2026-05-12 cs.CV cs.AI cs.LG 89%

Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

动态跨模态提示生成用于多模态持续指令微调

Tao Hu, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DRAPE框架,通过生成连续实例特定的软提示提升多模态持续指令微调性能,采用跨模态注意力和投影梯度投影减少遗忘,实验显示优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23750 2026-05-12 cs.LG cs.AI 89%

The Override Gap: A Magnitude Account of Knowledge Conflict Failure in Hypernetwork-Based Instant LLM Adaptation

覆盖差距:基于超网络的即时LLM适应中知识冲突失败的幅度解释

Shuaizhi Cheng, Xiang Shi, Zhiwei Zhang, Mingwei Li

机构 * Harbin Institute of Technology(哈尔滨工程大学) Imperial College London(伦敦帝国理工学院) KigLand Machine Learning Lab(KigLand机器学习实验室)

专题命中 指令微调 :LLM(title,title_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示超网络方法在知识冲突中的失败源于幅度问题,通过选择性层提升和意识冲突内部化技术,显著提升深度冲突准确性,同时保持新知识召回。

Comments 35 pages, 15 figures v2: minor layout fixes and author list update

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08368 2026-05-12 cs.AI cond-mat.stat-mech cs.LG 89%

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

在训练后区分能力激发与能力创造:从自由能视角出发

Yuhao Li, Shengchao Liu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文从自由能视角出发,区分训练后的能力激发与能力创造,通过引入可及支持的概念,探讨训练过程对行为概率和可达行为空间的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20863 2026-05-12 cs.CL 89%

GIFT: Guided Importance-Aware Fine-Tuning for Diffusion Language Models

GIFT: 用于扩散语言模型的引导重要性感知微调

Guowei Xu, Wenxin Xu, Jiawang Zhao, Kaisheng Ma

机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GIFT方法,通过根据熵分配不同重要性权重来优化扩散语言模型的微调,从而在多个基准测试中优于标准SFT。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18113 2026-05-12 cs.LG cs.AI 88%

VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models

VC-Soup:基于价值一致性指导的多价值对齐方法用于大语言模型

Hefei Xu, Le Wu, Yu Wang, Min Hou, Han Wu, Zhen Zhang, Meng Wang

机构 * Key Laboratory of Knowledge Engineering with Big Data(知识工程与大数据重点实验室) Hefei University of Technology(合肥工业大学) Innovation School of Artificial Intelligence(人工智能创新学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VC-Soup方法,通过数据过滤和参数融合框架解决多价值对齐中的冲突问题,提升模型在多价值下的表现。

Comments 12 pages; Accepted to WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09015 2026-05-12 cs.CL cs.LG 88%

LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language

LLiMba:单块GPU上的萨丁语——将一个3B语言模型适应到一种消失的罗曼语

Luca Ballore

机构 * Qwen2.5-3B-Instruct

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LLiMba,通过持续预训练和监督微调,在单块24GB显卡上将Qwen2.5-3B-Instruct模型适应到萨丁语,实现低资源罗曼语的高效生成,展示了rsLoRA r256在翻译性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19115 2026-05-12 cs.CV 88%

Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?

生成巨人,检索弱者:为何多模态大语言模型在多模态检索中表现不佳?

Hengyi Feng, Zeang Sheng, Meiyi Qiang, Yang Li, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) Tencent Inc(腾讯公司) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 研究揭示多模态大语言模型在多模态检索中表现不佳的原因,通过稀疏自编码器分析发现其表示空间主要由文本语义构成,视觉语义不足,导致检索性能下降,提出ReAlign方法提升检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09995 2026-05-12 cs.CL 87%

Annotations Mitigate Post-Training Mode Collapse

标注缓解训练后模式崩溃

Jacob Mitchell Springer, Madhu Advani, Lukas Aichberger, Arwen Bradley, Eran Malach, Omid Saremi, Sinead Williamson, Preetum Nakkiran, Etai Littwin, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司) Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文提出标注锚定训练方法,通过在预训练中引入语义标注,减少训练后模型的语义模式崩溃,提升模型多样性。

Comments 21 pages, 8 figures, 11 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09922 2026-05-12 cs.CL cs.AI 87%

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

基于双自适应加权的团队自博弈:用于微调大语言模型

Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出TPAW算法,通过团队协作与竞争机制提升自监督下LLM对齐效果,采用双自适应加权机制提高优化效率,实验证明其在多种模型和基准测试中表现优异。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10606 2026-05-12 cs.CV 87%

ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models

ViSurf:面向大视觉-语言模型的视觉监督与强化微调

Yuqi Liu, Liangyu Chen, Jiazhen Liu, Mingkang Zhu, Zhisheng Zhong, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) Renmin University of China(中国人民大学) The Hong Kong University of Science(香港科学大学)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出ViSurf,一种融合监督微调与强化学习的单阶段方法,通过整合外部监督与内部强化提升大视觉-语言模型性能,实验表明其在多个基准上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18923 2026-05-12 cs.CL 85%

Holmes: A Benchmark to Assess the Linguistic Competence of Language Models

Holmes:一个评估语言模型语言能力的基准

Andreas Waldis, Yotam Perlitz, Leshem Choshen, Yufang Hou, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Technical University of Darmstadt(达姆施塔特技术大学) Information Systems Research Lab(信息系统研究实验室) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学) IBM Research AI(IBM AI研究部) MIT CSAIL(MIT CSAIL实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) IBM Research Europe - Ireland(IBM欧洲爱尔兰研究部)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);prompting(abstract);分类 cs.CL

AI总结 Holmes基准通过分类器探测方法评估语言模型对语法、形态学等语言现象的理解,发现模型大小、架构和指令微调显著影响性能,提出FlashHolmes提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09773 2026-05-12 cs.CL cs.AI 84%

Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models

无欺骗的利用:黑暗三联征特征引导揭示语言模型中的可分离反社会回路

Cameron Berg, Roshni Lulla

机构 * Reciprocal Research Brain & Creativity Institute, University of Southern California(美国南加州大学脑与创造力研究所)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过稀疏自编码器特征引导增强Llama-3.3-70B-Instruct的黑暗三联征特质,发现反社会行为与认知共情分离,揭示语言模型中可区分的反社会回路。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06047 2026-05-12 cs.LG cs.AI 84%

TFM-Retouche: A Lightweight Input-Space Adapter for Tabular Foundation Models

TFM-Retouche: 一种轻量级的输入空间适配器用于表格基础模型

Duong Nguyen, Mohammed Jawhar, Nicolas Chesneau

专题命中 指令微调 :foundation model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TFM-Retouche,一种轻量级输入空间残差适配器,用于调整预训练表格基础模型以适应特定任务,通过在输入空间学习残差修正,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08992 2026-05-12 cs.LG 83%

When More Parameters Hurt: Foundation Model Priors Amplify Worst-Client Disparity Under Extreme Federated Heterogeneity

当更多参数有害:基础模型先验放大极端联邦异质性下的最差客户端差异

Kiran Naseer, Umar Shoaib

机构 * University of Gujrat(瓜尔杰特大学)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究发现,在极端联邦异质性下,基础模型先验可能加剧最差客户端的差异,通过实验对比文本分类中TextCNN与DistilBERT+LoRA的表现,揭示FM公平性悖论。

Comments 7 pages, 5 figures. Submitted to FL@FM-IJCAI 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01402 2026-05-12 cs.CL cs.CV cs.LG 82%

Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

通过强化学习为深度不平衡回归注入分布意识

Yao Du, Shanshan Song, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于组相对策略优化的分布感知强化学习框架,通过一致性相关系数奖励实现跨样本关系监督,提升长尾回归任务的分布对齐能力,在中等和少样本场景下表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09187 2026-05-12 cs.AI cs.CL cs.LG 82%

Emergent Semantic Role Understanding in Language Models

语言模型中语义角色理解的涌现

Carla Griffiths, Mirco Musolesi

机构 * University College London(伦敦大学学院) University of Bologna(博洛尼亚大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型预训练中语义角色理解的涌现情况,发现预训练表示包含显著的语义角色信息,但未完全匹配微调模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10770 2026-05-12 cs.LG 81%

DynaMiCS: Fine-tuning LLMs with Performance Constraints using Dynamic Mixtures

DynaMiCS: 通过动态混合实现具有性能约束的LLM微调

Eleonora Gualdoni, Sonia Laguna, Louis Bethune, Joao Monteiro, Pierre Ablin, Marco Cuturi

机构 * Apple(苹果公司)

专题命中 指令微调 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DynaMiCS,通过动态混合优化解决多领域微调中目标领域性能提升与约束领域性能保持的矛盾,实现更高效且更稳定的模型优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10172 2026-05-12 cs.CV cs.CL 81%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏