arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 430 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 430 篇

2509.07829 2026-07-29 cs.CL cs.AI cs.LG 版本更新 86%

Building Large-Scale English-Romanian Literary Translation Resources with Open Models

构建大规模英语-罗马尼亚文学翻译资源的开放模型

Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

机构 * Babeș-Bolyai University(巴克斯-波耶_ai大学) KlusAI Labs(KlusAI实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出TF2框架,通过开放模型和大规模合成语料库构建英语-罗马尼亚文学翻译资源,实现高效、低成本的高质量翻译。

Comments 21 pages. Published version: Front. Artif. Intell. 9:1807431 (2026). Datasets and models released on Hugging Face

Journal ref Front. Artif. Intell. 9:1807431 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14926 2026-07-07 cs.CL cs.AI cs.LG 版本更新 86%

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

罗马尼亚视觉语言模型的参数高效多模态指令微调

George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology(科学技术大学)

专题命中 指令微调 :language model(title);instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对罗马尼亚语这种低资源语言,通过翻译并扩展Flickr30K数据集,采用参数高效的LoRA方法微调开源视觉语言模型来降低多模态NLP资源差距,模型在视觉问答等任务中能力提升且语法错误减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 86%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09633 2026-08-14 cs.CV cs.LG 版本更新 85%

LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection

仅基于LoRA的适配还不够:探究基础模型在人脸呈现攻击检测中的局限性

Peter Lorenz, Anjith George, Marcel Sébastien

机构 * Idiap Research Institute(伊迪亚普研究所) University of Lausanne (UNIL)(洛桑大学)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 本研究系统评估32种基础模型,发现LoRA适配仅优化数据集内人脸PAD性能,跨数据集泛化仍受限,指出仅靠LoRA适配不足以解决人脸PAD跨数据集性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新 85%

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04853 2026-07-07 cs.CL 版本更新 85%

Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"

分解式提示无法弥补知识差距,但有助于模型说“我不知道”

Dhruv Madhwal, Lyuxin David Zhang, Dan Roth, Tomer Wolfson, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) University of Pennsylvania(宾夕法尼亚大学) Oracle AI

专题命中 指令微调 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在闭卷问答中识别知识局限的问题,评估三种提示方式在不同模型规模和多跳问答基准下的影响,利用提示方式间的分歧信号实现无训练弃权策略,提升模型可靠性。

Comments Camera-ready version. Published in Findings of ACL 2026. Code and data: https://github.com/dhruvmadhwal/disagreement-based-abstention

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09715 2026-06-11 cs.AI 版本更新 85%

Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFT

问题真的重要吗?视觉-语言SFT的无训练数据选择

Peng Sun, Yi Yang, Huawen Shen, Yi Ban, Tianfan Fu, Yanbo Wang, Yuqiang Li

机构 * Nanjing University(南京大学) Institute of Information Engineering(信息工程研究所) North University of China(中国北方大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(title,title_cn);instruction tuning(abstract);分类 cs.AI

AI总结 提出CVS方法,利用冻结的视觉-语言大模型评估问题对答案有效性的影响,无需训练即可筛选出需要跨模态推理的高质量样本,在多个数据集上以少量数据超越全量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03867 2026-06-24 cs.CL cs.AI 版本更新 85%

A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs and Knowledge Graphs

一种基于LLM和知识图谱的无训练混合智能体框架用于多文档摘要

Cuong Vuong Tuan, Trang Mai Xuan, Tien-Cuong Nguyen, Vu-Duc Ngo, Thien Van Luong

机构 * Faculty of Artificial Intelligence and Data Science, Phenikaa University(人工智能与数据科学学院,泛尼克大学) VNPT AI, VNPT Group(VNPT AI,VNPT集团) MobiFone Research and Development Center, MobiFone Corporation(MobiFone研发与开发中心,MobiFone公司) Business AI Lab, Faculty of Data Science and Artificial Intelligence, National Economics University, College of Technology(商业人工智能实验室,数据科学与人工智能学院,国家经济大学,技术学院)

专题命中 指令微调 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练、结合大语言模型和知识图谱的混合智能体框架,通过分解摘要任务为专用智能体(抽取、知识感知抽象、迭代精炼)并利用多视角一致性机制,在英文和越南语数据集上取得领先性能。

Comments Accepted by Neural Computing and Applications

Journal ref Neural Comput & Applic 38, 538 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18383 2026-06-19 cs.CL cs.AI 版本更新 85%

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习

ChangSu Choi, Hoyun Song, Dongyeon Kim, WooHyeon Jung, Minkyung Cho, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) LG CNS

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 84%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03742 2026-08-11 cs.CL 版本更新 84%

Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus

针对低资源塔吉克语文本生成的大语言模型参数高效微调基准测试:基于塔吉克网络语料库

Mullosharaf K. Arabov

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL

AI总结 该研究发布塔吉克网络语料库,测试9种架构17种配置的三种微调策略,得出Mistral 7B搭配QLoRA r=8为最优方案,是首个针对塔吉克语文本生成的PEFT基准测试。

Comments LaTeLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11149 2026-08-11 cs.CL 版本更新 84%

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

数据重复胜过数据扩展在长链推理监督微调中

Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

机构 * University of Technology Nuremberg(图恩大学) NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究发现,在长链推理监督微调中,数据重复训练比数据扩展更有效,通过token准确率作为停止标准可替代昂贵的数据扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16637 2026-08-04 cs.AI 版本更新 84%

TopoTuner: Topological Finetuning of Large Language Models

TopoTuner:大语言模型的拓扑微调

Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah

机构 * University of Central Florida(中佛罗里达大学) University of Manitoba(曼尼托巴大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 研究针对大语言模型微调成本高及LoRA不足的问题,提出TopoTuner框架,通过拓扑引导选择性冻结注意力投影矩阵,从源数据集学习可复用冻结配置文件,在多模型上效果优于LoRA且大幅减少训练时间和参数更新量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22818 2026-07-20 cs.CR cs.AI 版本更新 84%

Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models

嵌入空间中的隐秘行动:基于几何的隐写术与大语言模型中的检测

Charles Westphal, Keivan Navaie, Fernando E. Rosas

机构 * UCL Centre for Artificial Intelligence, University College London, UK(伦敦大学学院人工智能中心,大学学院伦敦) School of Computing and Communications, Lancaster University, UK(兰卡斯特大学计算机与通讯学院) Department of Informatics, University of Sussex, UK(苏塞克斯大学信息学院) Centre for Psychedelic Research and Centre for Complexity Science, Imperial College London, UK(伦敦帝国学院迷幻研究与复杂科学中心) Centre for Eudaimonia and Human Flourishing, University of Oxford, UK(牛津大学幸福与人类繁荣中心)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出了一种低恢复性隐写术,通过嵌入空间衍生映射提升秘密恢复率,同时减少负载恢复性,并提出基于机制可解释性的检测方法,提高微调模型中的秘密检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01193 2026-06-26 cs.CL 版本更新 84%

Embarrassingly Simple Self-Distillation Improves Code Generation

令人惊讶的简单自蒸馏方法提升代码生成能力

Ruixiang Zhang, Richard He Bai, Huangjie Zheng, Navdeep Jaitly, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17421 2026-06-16 cs.CL 版本更新 84%

Oops, Wait: Discourse Tokens Matter in Reasoning Model

哎呀,等等:话语标记在推理模型中的重要性

Jaehui Hwang, Byeongho Heo, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究话语标记(如“wait”)在推理轨迹中的作用,发现数据高效微调可部分复现其模式,但不如大规模后训练与高置信答案转换对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14194 2026-06-08 cs.CL 版本更新 84%

GradShield: Alignment Preserving Finetuning

GradShield: 保持对齐的微调

Zhanhao Hu, Xiao Huang, Patrick Mendoza, Emad A. Alghamdi, Basel Alomair, Raluca Ada Popa, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) HUMAIN King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科学与技术城) University of Washington, Seattle(华盛顿大学(西雅图))

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GradShield过滤方法,通过计算微调隐式危害分数并采用自适应阈值,在微调前移除有害数据,保持LLM安全对齐,攻击成功率低于6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09974 2026-08-11 cs.AI cs.CL 版本更新 84%

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化

Seoyeon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。

Comments under review, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07559 2026-07-21 cs.CL cs.AI quant-ph 版本更新 84%

Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis

语言模型微调中的幻影相变

Vaibhav Prakash, Jayasri Dontabhaktuni

机构 * Mahindra University(马恒达大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究语言模型微调时,正确补全被近义词竞争而失败的现象,通过序参量分解信号与背景拖拽,发现两种失败模式,并揭示相变为幻影,源于softmax读出而非几何相变。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11889 2026-07-20 cs.CL cs.AI 版本更新 84%

Scaling Point-in-Time Language Models

扩展即时语言模型

Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu

机构 * Yale School of Management(耶鲁大学管理学院) AQR Capital Management(AQR资产管理公司) NBER(美国国家经济研究局) Swiss Finance Institute(瑞士金融研究所) EPFL(洛桑联邦理工学院) CEPR(经济政策研究中心)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13077 2026-06-26 cs.CL cs.AI 版本更新 84%

Tuning Language Models by Mixture-of-Depths Ensemble

通过深度混合集成微调语言模型

Haoyan Luo, Lucia Specia

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MoDE框架,将后期层作为集成通过学习路由权重贡献最终logits,可在任何微调方法上应用,以较小参数开销提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04872 2026-08-07 cs.CL cs.AI cs.LG 版本更新 83%

A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination

A-SR:通过分层协调实现符号回归的自进化智能体大语言模型

Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Ying Nian Wu, Fenghua Ling, Haobo Li, Lei Bai

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 A-SR是一种自进化智能体框架,通过分层协调实现符号回归,在LLM-SRBench科学领域和真实世界任务上显著提升了符号回归的Acc@0.01和归一化均方误差指标。

Comments 18 pages, 8 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20247 2026-08-07 cs.LG cs.AI cs.CL cs.CV 版本更新 83%

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE:一致性保留的混合专家用于持续学习

Yang Liu, Toan Nguyen, Flora D. Salim

机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19466 2026-06-29 cs.CV 版本更新 83%

ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

ProactiveBench: 多模态大语言模型主动性的基准测试

Thomas De Min, Subhankar Roy, Stéphane Lathuilière, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) University of Bergamo(贝拉米奥大学) Inria Grenoble(格勒诺布尔研究所) Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)

专题命中 指令微调 :large language model(title);language model(title)

AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15819 2026-06-19 cs.CV 版本更新 83%

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher:利用视频模型先验的序列草图生成

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 83%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07284 2026-08-12 cs.LG 版本更新 83%

Same Targets, Different Computation: How Post-Training Divides Work Across Model Layers

指令微调如何改变上游状态影响后期读取:一种跨修补诊断

Yifan Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract_cn);分类 cs.LG

AI总结 研究探讨指令微调如何通过后期栈与上游状态交互影响后续token选择,通过跨修补诊断发现指令微调模型的后期栈效果依赖自身训练状态,且稀疏特征在其中起中介作用。

Comments 14 pages, 4 figures. Code and compact artifacts: https://github.com/yifan1207/first-divergence-crosspatching

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21369 2026-08-04 cs.LG 版本更新 83%

Rethinking Federated Graph Foundation Models: A Graph-Language Alignment-based Approach

重新思考联邦图基础模型:基于图-语言对齐的方法

Yinlin Zhu, Di Wu, Xianzhi Zhang, Yuming Ai, Xunkai Li, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University, Guangzhou, China(中山大学) Beijing Institute of Technology, Beijing, China(北京理工大学)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 FedGALA通过图-语言对齐解决联邦图基础模型中的语义-结构正交性问题,提升多任务适应性与效率

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20379 2026-07-16 cs.AI 版本更新 83%

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

思维策略:通过在线策略进化扩展大语言模型推理的测试时训练

Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) Shanghai University of Finance and Economics(上海财经大学) South China Normal University(华南师范大学) LMU Munich(慕尼黑大学) Wuhan University(武汉大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。

Comments Under Review, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14343 2026-06-23 cs.LG 版本更新 83%

Localizing and Editing Knowledge in Large Audio-Language Models

定位与编辑大型音频-语言模型中的知识

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Auckland, New Zealand(奥克兰大学) Wuhan University, China(武汉大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出首个音频知识定位与编辑基准,通过语音感知因果追踪定位事实知识存储的层和模块,并应用编辑实现细粒度知识控制。

Comments Paper was accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏