arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 885 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 885 篇

2607.20511 2026-07-24 cs.AI 新提交 85%

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 85%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 85%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17043 2026-07-21 cs.CL 新提交 85%

Learning from Synthetic Data without Model Collapse in Iterative Instruction Tuning

在迭代指令微调中从合成数据学习而不发生模型崩溃

Xiaonan Luo, Yue Huang, Kehan Guo, Ping He, Chuan Zou, Ting Hua, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Vanderbilt University(范德堡大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究在合成数据用于指令微调时避免模型崩溃的问题,提出KITE两阶段框架,结合失败引导数据生成与边界感知不确定性整理,实验表明该框架比合成数据基线能更稳定地提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14605 2026-07-17 cs.CL cs.CY 新提交 85%

Investigating first-language bias in LLM-based automated essay scoring: A cross-prompt evaluation of an open-weight AI-model on TOEFL essays

研究基于大语言模型的自动作文评分中的母语偏见:对托福作文的开放权重人工智能模型进行跨提示评估

John Maurice Gayed

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于大语言模型的自动作文评分中母语偏见,用LoRA适配的开放权重模型Gemma-3-27B-it,在托福作文语料库测试其跨提示泛化和母语评分效果,发现有评分偏移,实现了较高等级一致性,是首次此类大规模L1公平性分析。

Comments 21 pages, 2 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04640 2026-07-07 cs.CL 新提交 85%

Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models

先错后对:对齐语言模型中的后期挽救与接口故障

Jiaqi Deng

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :language model(title,abstract);post-training(abstract);SFT(abstract);分类 cs.CL

AI总结 研究对齐语言模型中正确性的构建,用分层差分轨迹识别错误倾向,发现中间层会短暂倾向错误答案,后期层校正挽救。通过实验验证该现象,并得出对齐放大、预测压缩失败、可训练及在自然语言I/O中存在等结论。

Comments 16 pages, 10 figures. Code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 85%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16769 2026-06-16 cs.AI 新提交 85%

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体

Tianyi Zhang, Zhonghao Qi

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。

Comments Preprint. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14222 2026-06-15 cs.LG 新提交 85%

Learning the Context of Errors: Black-Box Online Adaptation of Time Series Foundation Models

学习错误的上下文:时间序列基础模型的黑盒在线自适应

Xilin Dai, Yiding Liu, Hongjie Xia, Yifan Hu, Zewei Dong, Jiang-Ming Yang, Qiang Xu

机构 * Ant International(蚂蚁国际) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对黑盒时间序列基础模型在线自适应问题,提出ORCA方法,通过学习基础模型预测误差的上下文(输入和输出)进行自适应,在5个模型和8个数据集上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12273 2026-06-11 cs.CL 新提交 85%

Beyond Fully Random Masking: Attention-Guided Denoising and Optimization for Diffusion Language Models

超越完全随机掩码:扩散语言模型的注意力引导去噪与优化

Jia Deng, Junyi Li, Wayne Xin Zhao, Jinpeng Wang, Hongyu Lu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Meituan(美团) WeChat, Tencent(腾讯微信) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(大型模型与智能治理北京市重点实验室)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL

AI总结 提出AGDO框架,利用注意力结构指导去噪顺序并强化关键令牌,在数学和编码基准上提升扩散语言模型的推理性能。

Comments 13 pages. Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27824 2026-07-31 cs.AI cs.LG 新提交 85%

STEREODISCO: Discovering Stereotypicality in LLMs

STEREODISCO:发现大语言模型中的刻板印象

Farane Jalali Farahani, Corina Dima, Mojtaba Nayyeri, Raphael H. Heiberger, Steffen Staab

机构 * Institute for Artificial Intelligence(人工智能研究所) Institute for Social Science(社会科学研究所) University of Southampton(南安普顿大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 STEREODISCO框架适配语义差异法研究LLM内部表征的刻板印象,发现LLM编码的社会群体刻板印象与人类存在差异,且识别出多种新的刻板印象语义轴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 85%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 指令微调 :language model(title);small language model(title);分类 cs.CL、cs.LG

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08393 2026-07-10 cs.AI cs.CL 新提交 85%

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

迈向对大语言模型微调中记忆知识无法泛化原因的机理理解

Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型微调中记忆知识无法泛化的问题,用自修补技术监测知识渗透动态,发现与知识电路未对准假设一致,还设计启发式策略验证,跨域实验证明发现具稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27742 2026-06-29 cs.CL cs.AI 新提交 85%

KG2Cypher: Data-Centric Pipeline for Building Enterprise Text-to-Cypher Systems

KG2Cypher:面向构建企业文本到Cypher系统的数据驱动流水线

Minjun Choi, Yerin Kim, Junghyuk Seo, Sujin Mo, Hyemin Lee, Youngjoong Ko

机构 * Sungkyunkwan University(成均馆大学) NAVER

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出KG2Cypher数据驱动流水线,从现有知识图谱生成可执行Cypher查询及对应自然语言问题,通过LoRA微调提升企业文本到Cypher转换的准确率。

Comments 11 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21890 2026-06-23 cs.CL cs.AI 新提交 85%

Scaling Performance and Low-Resource Annotation with Many-Shot In-Context Learning for Named Entity Recognition

扩展性能与低资源标注:面向命名实体识别的多示例上下文学习

Qi Zhang, Fangping Lan, Cornelia Caragea, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多示例上下文学习在命名实体识别中的扩展性,发现使用数百示例可使LLM匹配甚至超越监督BERT,并利用约百个人工标注示例生成高质量数据,在低资源NER上提升约10% F1。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07314 2026-08-10 cs.RO cs.CV 新提交 85%

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

TEMPO:面向视觉-语言-动作模型的语义-动作解耦强化学习后训练

Ziheng Liu, Quantao Yang

机构 * School of Computer Science and Technology, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文提出TEMPO框架,通过解耦语义投影层与动作专家采用双时间尺度RL后训练,提升VLA模型在操作任务上的性能,在基准与真实任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18039 2026-07-21 cs.IR 新提交 85%

Evidence-in-the-Loop: Trace-Driven Optimization for Customer-Service LLM Agents

循证优化:面向客户服务语言模型代理的跟踪驱动优化

Chunming Wu, Dafei Qiu, Congde Yuan, Charles Quan, Jun Wu, Suipeng Li, Mo Wu, Gavin Xie, Hope Chen, Max Yao

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究面向客户服务语言模型代理的优化,提出循证客户服务代理工作流程,通过多种技术构建证据,结合政策引导编排。贡献混合RAG证据构建、循证问题/行动决策、跟踪驱动的RAG和重排器改进三种部署模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11102 2026-07-14 cs.SD 新提交 85%

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

CHARM:基于大语言模型的多模态讽刺检测中的电荷校准与声学救援

Qiyang Sun, Yi Chang, Yupei Li, Xi Shao, Zixing Zhang, Björn W. Schuller

机构 * GLAM – the Group on Language, Audio, & Music, Imperial College London(伦敦帝国理工学院语言、音频和音乐小组) College of Telecommunications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) CHI – Chair of Health Informatics, TUM University Hospital(慕尼黑工业大学医院健康信息学主席) relAI – the Konrad Zuse School of Excellence in Reliable AI(康拉德·楚泽可靠人工智能卓越学院) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型在讽刺检测中过度预测积极类别及韵律线索利用不足的问题,提出CHARM框架,含双向电荷校准和声学后期融合救援两个模块,无需微调主干,提升检测性能,揭示跨文化韵律解耦,产生可解释的跨语言多模态检测器。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19100 2026-07-02 cs.CV 新提交 85%

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

AMALIA-VL: 一个原生欧洲葡萄牙语开源视觉与语言模型

Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz, Afonso Simplício, Gonçalo Vinagre, Diogo Tavares, Rafael Ferreira, Inês Calvo, Inês Vieira, David Semedo, João Magalhães

机构 * NOVA School of Science and Technology(NOVA科学与技术学校) NOVA LINCS

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);preference optimization(abstract)

AI总结 针对欧洲葡萄牙语缺乏开源多模态模型的问题,提出AMALIA-VL,通过三阶段训练和葡萄牙语中心数据混合,建立强基线并开源所有资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 85%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24123 2026-06-24 cs.SD 新提交 85%

Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

使用指令微调和反馈驱动对齐将 MusicLLM 与情感对齐

Takuya Hasumi, Welly Naptali

机构 * LY Corporation

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究如何通过指令微调和反馈驱动对齐策略,使音乐大语言模型(MusicLLM)具备情感回归能力,并证明反馈驱动对齐能显著提升唤醒度和效价预测性能,同时保持音乐问答能力。

Comments Accepted to Interspeech 2026, 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18472 2026-06-18 cs.CV 新提交 85%

Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

通过正则化微调实现可域泛化的3D视觉-语言模型适应

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康考迪亚大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);foundation model(abstract)

AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14492 2026-08-17 cs.LG 新提交 84%

Approximate Muon with low-rank adapters

基于低秩适配器的近似Muon优化器

Ben Anson, Conor Houghton, Edward Milsom

机构 * University of Bristol(布里斯托大学) School of Mathematics(数学学院) School of Engineering Mathematics and Technology(工程数学与技术学院) University of Bath(巴斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对Muon优化器难以与LoRA结合用于低秩微调的问题,提出sMuon方法,经实验验证其在SFT和ReLoRA预训练中表现良好,可适度提升低秩微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08746 2026-08-11 cs.AI 新提交 84%

Scale-to-Dialogue: Low-Burden Elicitation of Daily Premenstrual Symptom Ratings with Small Language Models

对话式量表:用小型语言模型低负担引出日常经前症状评分

Yifan Wang

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

专题命中 指令微调 :language model(title);small language model(title);分类 cs.AI

AI总结 该研究将经前症状追踪转化为对话式有序标签恢复问题,用ModernBERT和Qwen2.5-1.5B-Instruct模型,实现低负担的日常经前症状评分,三簇策略效果接近固定六项策略且提问量减半。

Comments 10 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07570 2026-08-11 cs.CV cs.AI 新提交 84%

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架

Rui Yang, Wei Zhou, Dingyong Gou, Xiaohui Cui, Cong Li, Yinyin Gong, Yipo Huang, Jiliang Zhao

机构 * ZTE Corporation(中兴通讯)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04200 2026-08-06 q-fin.MF cs.LG 新提交 84%

From Financial Sentiment Classification to Return Predictability: A QLoRA Benchmark of Large Language Models

从金融情感分类到收益可预测性:大型语言模型的QLoRA基准测试

Fusheng Luo

专题命中 指令微调 :large language model(title);language model(title);分类 cs.LG

AI总结 该研究构建金融情感分类基准,对比TF-IDF朴素贝叶斯等模型,发现QLoRA可提升Qwen2.5性能,但分类准确率高的模型在收益预测的经济有效性上无显著优势,揭示分类准确率与可交易信号的差距。

Comments Waiting to submit to a conference (ICAIF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00181 2026-08-04 cs.SE cs.AI 新提交 84%

Cross-Benchmark Generalization in Long-Horizon Agents

长视野智能体的跨基准泛化

Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。

Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28661 2026-08-03 cs.CL 新提交 84%

Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试

Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin, Zhenzhen Shi, Lingfeng Zeng, Boyu Yang, Bing Zhao, Hu Wei, Lin Qu, Dayiheng Liu

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。

Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交 84%

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26596 2026-07-30 cs.CV cs.AI 新提交 84%

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏