arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 885 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 885 篇

2606.12318 2026-06-11 cs.LG cs.AI 新提交 82%

Harness In-Context Operator Learning with Chain of Operators

利用算子链实现上下文算子学习

Minghui Yang, Ling Guo, Liu Yang

机构 * Department of Mathematics, Shanghai Normal University(上海师范大学数学系) Department of Mathematics, National University of Singapore(新加坡国立大学数学系)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Chain of Operators (CHOP)框架,通过构造显式初等变换与冻结ICON的算子链,无需微调即可提升上下文算子网络在分布外算子任务上的泛化能力,在标量守恒律和平均场控制问题中降低推理误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10327 2026-06-10 cs.CL cs.LG 新提交 82%

The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring

顺序重要:LLaMA的序列微调用于连贯的自动作文评分

Ali Keramati, Mark Warschauer

机构 * University of California, Irvine(加州大学伊文斯分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出对LLaMA-3.1-8B进行任务感知的序列微调,按作文话语结构顺序训练,在PERSUADE 2.0语料上证据F1达65%、结论F1达87%,超越独立训练和70B基线,证明课程设计可提升自动作文评分性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09396 2026-06-09 cs.CL cs.LG 新提交 82%

PriFT: Prior-Support Guided Supervised Fine-Tuning

PriFT: 先验支持引导的监督微调

Ke Wang, Shuangqi Li, Mathieu Salzmann, Pascal Frossard

机构 * EPFL(瑞士联邦理工学院洛桑分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出PriFT方法,利用冻结的预训练模型计算token权重,避免在线模型导致的自我强化动态,在数学推理、代码生成和医疗问答任务中取得SFT最优结果,并为后续RL提供更好初始化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08471 2026-06-09 cs.CL cs.AI 新提交 82%

More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs

更多废话,更少意义:揭示小语言模型中的自我改进行为

Marina Igitkhanian, Erik Arakelyan

机构 * American University of Armenia(亚美尼亚美国大学) NVIDIA(英伟达)

专题命中 指令微调 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建充分性测试,发现小语言模型在自我纠正中仅获得4.4%的准确率提升,且较长的提示反而与错误答案正相关,表明其推理能力有限。

Comments GEM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07970 2026-06-09 cs.CL cs.AI 新提交 82%

Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

通过扩展训练时对抗攻击防御恶意微调

Haoming Wen, Shi Chen, Qingyu Shi, Siyuan Liu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07479 2026-06-08 cs.CL cs.AI 新提交 82%

Supervision versus Demonstration-Based In-Context Learning for Multiword Expression Classification

基于监督与基于演示的上下文学习在多词表达分类中的比较

Sercan Karakaş, Yusuf Şimşek

机构 * University of Chicago(芝加哥大学) Fırat University(费拉特大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究土耳其语多词表达分类,对比监督基线(BERTurk)与指令微调LLM在零样本、单样本和少样本提示下的表现,发现提示敏感性和演示偏差影响显著。

Comments Accepted to ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06920 2026-06-08 cs.LG cs.AI 新提交 82%

The Fine-Tuning Trap: Evaluating Negative Transfer and the Role of PEFT in Sub-1B Mathematical Reasoning

微调陷阱:评估负迁移及PEFT在亚十亿参数数学推理中的作用

Rahul Nair, Chun Tao

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 指令微调 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了五种亚十亿参数模型在数学推理任务中的微调策略,发现全量微调对小于3亿参数的模型造成负迁移,而参数高效微调(PEFT)是稳定性要求。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 82%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11233 2026-08-13 cs.CL cs.AI cs.LG 新提交 82%

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留

Mark Shapiro

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10708 2026-08-12 cs.CV 新提交 82%

Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

自几何:面向几何一致的3D视觉基础模型的无GT、即插即用测试时自适应方法

Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

机构 * Chung-Ang University(中央大学) Kyung Hee University(庆熙大学)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文针对3D视觉基础模型测试时几何一致性不足的问题,提出即插即用的Self-Geometry自适应流水线,结合多视图与对极一致性损失等,在6种模型和4个基准上实现位姿与几何估计的一致提升。

Comments Project page: https://cmlab-korea.github.io/Self-Geometry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22837 2026-07-28 cs.LG cs.AI cs.CL 新提交 82%

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

通过对数偏差对语言模型进行极其简单的黑箱适应

Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究院) Columbia University(哥伦比亚大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。

Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21694 2026-07-27 cs.CV 新提交 82%

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Oxygen-TryOn:用于任意物品虚拟试穿的时尚原生基础模型

Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

机构 * Oxygen AIGC Group(氧气AIGC集团) Joy Future Academy(京东探索研究院)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract)

AI总结 研究提出时尚原生的Oxygen-TryOn基础模型,用于任意物品虚拟试穿。通过专用数据引擎和特定训练构建,重新定义试穿任务,设计三阶段训练方法,在单物品和多物品试穿中取得先进成果,超越多个系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11732 2026-07-14 cs.CV 新提交 82%

GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting

GFR-SAM:通过跨图像提示实现免训练的指认伪装物体分割

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学)

专题命中 指令微调 :prompting(title,abstract);foundation model(abstract)

AI总结 研究指认伪装物体分割问题,提出GFR-SAM三阶段免训练框架,通过生成候选掩码、过滤背景干扰、细化边界等步骤,在R2C7K基准测试中表现出色,弥合通用模型与特定感知任务差距,凸显SAM3跨图像提示潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07237 2026-07-09 eess.SY cs.SY 新提交 82%

A Physics-guided Fine-tuned LLM-based Framework for Customized Power Distribution System Feeder Generation

基于物理引导微调大语言模型的定制化配电网馈线生成框架

Zhenghao Zhou, Yiyan Li, Tao Xu, Yike Guo, Zheng Yan, Mo-Yuen Chow

专题命中 指令微调 :LLM(title,abstract);SFT(abstract)

AI总结 针对配电网馈线模型获取难问题,提出基于大语言模型的合成馈线生成框架。通过监督微调、组相对策略优化及双智能体架构,实现从自然语言到物理一致馈线模型的端到端生成,所生成馈线具备多种优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20314 2026-07-08 hep-th gr-qc 新提交 82%

Macroscopic Black-Hole Remnants in a Nonlocal Field Theory: Towards Hawking Radiation in SFT

非局域场论中的宏观黑洞残余:走向弦场论中的霍金辐射

Feng-Yin Cheng, Pei-Ming Ho, Wei-Hsiang Shao

专题命中 指令微调 :SFT(title,abstract)

AI总结 通过弦场论中的非局域指数抑制效应,证明大黑洞的霍金辐射在搅乱时间后终止,粒子数趋零,形成宏观残余,为信息悖论提供新解。

Comments 17 pages, no figure, references added

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03801 2026-07-07 cs.LG cs.AI cs.CL 新提交 82%

Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks

超越自身能力:用于可验证多项选择题任务的微小语言模型的分类头微调

Bhavesh Sood, Jaromir Savelka

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何使参数约3B以下的微小语言模型适应可验证多项选择题任务,比较三种基于LoRA的微调范式,分类头微调在特定规模下表现更优,微调后的模型与大模型有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06714 2026-07-02 cs.CV 新提交 82%

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

锚定而非分级:视觉-语言模型在纹理倾斜感知中失败

Qian Zhang, Michal Golovanevsky, Fulvio Domini, James Tompkin

机构 * Brown University(布朗大学) Harvard University(哈佛大学)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 研究视觉-语言模型(VLM)在纹理倾斜感知任务中的表现,发现零样本和上下文提示均产生锚定失败,仅预测少数离散角度,监督微调部分缓解但残留锚定,表明问题在于表示到输出的语言接口无法分级表达。

Comments 15 pages. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19944 2026-06-19 cs.CV 新提交 82%

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式

Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han

机构 * Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tencent Jarvis Lab(腾讯贾维斯实验室) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract)

AI总结 提出Timage范式,通过约束薛定谔桥将查询文本作为排版覆盖层嵌入图像,以显式空间锚点引导模型关注,在不侵蚀骨干能力前提下提升细粒度空间推理性能。

Comments ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 82%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(title,title_cn)

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16334 2026-06-16 cs.CV 新提交 82%

Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT

时间盲:使用CHRONOSIGHT基准测试视觉语言模型的时间推理能力

Parthaw Goswami, Jaynto Goswami Deep

机构 * Department of Computer Science, University of Missouri(密苏里大学计算机科学系) SAP

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 提出CHRONOSIGHT基准,从五个维度评估视觉语言模型的时间推理能力,发现模型与人类存在巨大差距(人类平均0.89,最佳模型0.40),并通过微调显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16161 2026-06-16 cs.CV 新提交 82%

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification

多模态大语言模型赋能的通用行人重识别重排序

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract)

AI总结 提出利用多模态大语言模型(MLLM)的泛化能力,通过微调MLLM并计算μ-距离来改进推理阶段的重排序,从而提升领域泛化行人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12704 2026-06-12 physics.chem-ph cond-mat.mtrl-sci 新提交 82%

Fine-tuning MLIP foundation models: strategies for accuracy and transferability

微调MLIP基础模型:准确性与可迁移性的策略

Tamás Lajos Tompa, Eszter Varga-Umbrich, Ilyes Batatia, Alin M. Elena, Noam Bernstein, Gábor Csányi

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract)

AI总结 评估七种微调策略在化学多样性基准上的表现,发现基础模型质量、E0初始化和超参数选择比策略本身更重要,多头部回放能保持分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-14 cs.CV cs.CL 新提交 81%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

LingKai Bu

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12675 2026-08-14 cs.AI cs.CR 新提交 81%

Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs

通过向外部大语言模型隐藏敏感信息实现隐私保护的检索增强生成(RAG)

Saleh Almohaimeed, Saad Almohaimeed, Mousa Jari, Fahad Alotaibi, Khalid A. Alobaid

机构 * College of Applied Computer Science, King Saud University(沙特国王大学应用计算机科学学院) Institution of Public Administration(公共行政学院)

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SEAG隐私保护框架,通过构建实体替换表替换敏感信息,在向外部LLM隐藏敏感数据的同时保障RAG的回答准确性,相关模型在多维度评估中表现良好。

Comments Submitted to Knowledge-Based Systems Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10207 2026-08-12 cs.AI 新提交 81%

Mitigating Bus Bunching with Reinforcement Learning Enhanced by Semantic Stop Embedding

利用强化学习结合语义站点嵌入缓解公交车扎堆问题

Xin Dong, Vikash V. Gayah

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出LLM辅助的语义站点嵌入强化学习方法,在仿真中较Daganzo基线显著降低公交车扎堆及乘客等待时间,实现跨线路策略复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08907 2026-08-11 cs.CV cs.AI 新提交 81%

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具

Delin Mao, Chenghao Sun, Jingwei Song, Chishui Chen, Linfeng Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06802 2026-08-10 cs.CL 新提交 81%

Simple-OPD: Demystifying Warm-up for On-policy Distillation

Simple-OPD:揭开策略内蒸馏的预热阶段之谜

Tao Liu, Taiqiang Wu, Mao Zheng, Xuan Luo, Runming Yang, Xuewei Yang, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Tencent(腾讯)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL

AI总结 本文通过数据与训练视角研究OPD的预热阶段,发现预热依赖教师兼容CoT监督、LoRA近饱和训练优于全参数SFT,提出Simple-OPD方法并验证其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06778 2026-08-10 cs.CR cs.CL 新提交 81%

Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence

用于从网络威胁情报中提取攻击技术的检索约束策略优化

Jiayun Zhang, Junshen Xu, Zejun Xie, Yi Fan

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 研究针对CTI文本提取MITRE ATT&CK技术的挑战,提出两阶段框架TTP-R1,在四个CTI基准测试中F1值最优,子技术级F1超带检索增强的Claude Sonnet 4.5且推理速度更快

Comments Accepted to the AI Agent for Information Retrieval (Agent4IR) Workshop at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06758 2026-08-10 cs.CL 新提交 81%

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader: Structured Document Parsing via Capability Injection and Forgetting Control

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:基于能力注入与遗忘控制的结构化文档解析模型

Shi Chen, Hayato Aida, Makoto Morinaga, Shohei Tanaka, Kosuke Arima

机构 * Stockmark Inc.(斯托克马克公司)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出Stockmark-Nemotron-3-Nano-Omni-JapanDocReader模型,通过能力注入与遗忘控制优化结构化文档解析性能,结合混合SFT与DAPO式RL取得优于SFT的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05250 2026-08-07 cs.LG 新提交 81%

Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning

超越全模型回滚:用于适配器状态多任务监督微调的AuroSFT

Yue Han, Ziniu Liu

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 针对多任务SFT的全模型回滚成本高的问题,提出参数高效框架AuroSFT,将状态转为可合并的适配器状态,在保留骨干网络的比较中平均准确率达61.36%,优于msft的59.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏