arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-17 至 2026-06-17 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 23 篇

2603.03573 2026-06-17 cs.CE 版本更新 90%

STRIDE: Post-Training LLMs to Reason and Refine Bio-Sequences via Edit Trajectories

STRIDE: 通过编辑轨迹对生物序列进行后训练推理与优化

Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

专题命中 指令微调 :LLM(summary_cn,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 提出STRIDE框架,通过后训练使LLM生成可执行的插入/删除/替换轨迹,结合监督微调和策略优化实现离散生物序列的迭代优化,在蛋白质和分子编辑任务上显著提升成功率和新颖性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17321 2026-06-17 cs.LG cs.CV 新提交 90%

ProCUA-SFT Technical Report

ProCUA-SFT 技术报告

Jaehun Jung, Ximing Lu, Brandon Cui, Muhammad Khalifa, Shaokun Zhang, Hao Zhang, Jin Xu, Amala Sanjay Deshmukh, Karan Sapra, Andrew Tao, Yejin Choi, Jan Kautz, Mingjie Liu, Yi Dong

机构 * NVIDIA(英伟达) University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.LG

AI总结 提出 ProCUA-SFT 数据集,通过自动化管道从 2484 个应用组合的合成轨迹中蒸馏出 310 万步级 SFT 样本,微调 UI-TARS 7B 在 OSWorld 上达到 45.0% 的成功率,比基线提升 18.7 个百分点。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11715 2026-06-17 cs.LG cs.CL 版本更新 89%

DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels

DICE:扩散大语言模型在生成CUDA内核方面表现出色

Haolei Bai, Lingcheng Kong, Xueyi Chen, Jianmian Wang, Zhiqiang Tao, Huan Wang

机构 * Westlake University(西湖大学) Hong Kong University of Science and Technology(香港科技大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG;LLM(comments)

AI总结 提出CuKe数据集和BiC-RL训练框架,构建DICE系列扩散大语言模型(1.7B/4B/8B),在KernelBench上显著优于同类自回归和扩散模型,实现CUDA内核生成新SOTA。

Comments v2: Expanded with dLLM vs. autoregressive LLM comparisons, ablation studies, and qualitative case studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17281 2026-06-17 cs.CL cs.SD eess.AS 新提交 88%

Are you speaking my languages? On spoken language adherence in multimodal LLMs

你在说我的语言吗?多模态大语言模型中的口语遵循问题

Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic

机构 * Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型在自动语音识别中输出语言识别错误的问题,提出软提示方法、监督微调和思维链推理三种缓解策略,并引入新指标量化语言违背,比较各方法在减少违规和保持ASR性能上的效果。

Comments 7 pages, 3 tables in the main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12227 2026-06-17 cs.CL 版本更新 88%

A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation

结合在线优化与蒸馏以提升大语言模型的长上下文推理能力

Miguel Moura Ramos, Duarte M. Alves, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出dGRPO方法,结合在线优化与蒸馏,通过强教师模型提供密集指导,提升长上下文推理能力,同时保持短上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17838 2026-06-17 cs.CL 新提交 87%

Environment-Grounded Automated Prompt Optimization for LLM Game Agents

面向LLM游戏智能体的环境驱动自动提示优化

Rean Clive Fernandes, Lukas Fehring, Theresa Eimer, Marius Lindauer, Matthias Feurer

机构 * Lamarr institute for ML and AI(拉马尔机器学习与人工智能研究所) TU Dortmund University(多特蒙德工业大学) Leibniz University Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种自动提示优化框架,将观察-动作管道分解为描述器和选择器,通过环境回报驱动的进化循环迭代优化提示,在BabyAI任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 82%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(title,title_cn)

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03045 2026-06-17 cs.LG 版本更新 81%

Clarify Before You Draw: Proactive Agents for Robust Text-to-CAD Generation

先澄清再绘制:面向鲁棒文本到CAD生成的主动式智能体

Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出主动式智能体框架ProCAD,通过澄清代理在代码生成前解决用户提示中的歧义,再通过CAD编码代理生成可执行程序,显著提升鲁棒性,平均Chamfer距离降低79.9%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17164 2026-06-17 cs.CL cs.AI cs.HC cs.PL cs.SE 新提交 81%

PromptMN: Pseudo Prompting Language

PromptMN: 伪提示语言

Enkhzol Dovdon

机构 * ICT Group(ICT集团)

专题命中 指令微调 :prompting(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PromptMN,一种伪提示领域特定语言,通过紧凑的%前缀类型指令注释自然语言,减少上下文歧义,提升人机交互的清晰度和可审查性。

Comments 32 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14081 2026-06-17 cs.CV cs.AI cs.LG eess.IV 新提交 81%

Clay-CNN Hybrids: Leveraging Geospatial Foundation Models as Auxiliary Context for Landslide Detection

Clay-CNN混合模型:利用地理基础模型作为滑坡检测的辅助上下文

Huong Binh Vu

机构 * Harvard University(哈佛大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对滑坡检测中的极端类别不平衡问题,提出将地理基础模型Clay v1.5作为辅助上下文注入U-Net瓶颈的混合方法,在Landslide4Sense基准上达到64.5% F1,优于纯Clay或U-Net基线。

Comments 9 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17175 2026-06-17 cs.CL 新提交 79%

Self-Generated Error Training for Token Editing in Diffusion Language Models

扩散语言模型中令牌编辑的自生成错误训练

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :language model(title);pretraining(abstract);分类 cs.CL

AI总结 针对LLaDA2.1中令牌编辑的训练-推理不匹配问题,提出自生成T2T方法,通过无梯度草稿传递和自生成错误监督,提升编辑准确率并减少编辑强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17660 2026-06-17 cs.LG cs.AI 新提交 79%

TuneAhead: Predicting Fine-tuning Performance Before Full Training Begins

TuneAhead: 在完整训练开始前预测微调性能

Yuxiang Luo, Haonan Long, Chen Wang, Qiqi Duan, Xiaotian Lin, Yanwei Xu, Yuyu Luo, Weikai Yang, Nan Tang

机构 * The Hong Kong University of Science(香港科学与技术大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TuneAHEAD框架,通过元特征向量和SHAP归因,在微调前预测性能,在Qwen2.5-7B-Instruct上RMSE为1.47个百分点,95.1%预测误差在±3%内。

Comments 9 pages, 6 figures, accepted as ICML 2026 poster:https://icml.cc/virtual/2026/poster/64847

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17229 2026-06-17 cs.LG cs.AI cs.CL 新提交 78%

Rift: A Conflict Signature for Deception in Language Models

Rift: 语言模型中欺骗行为的冲突特征

Petr Nyoma

机构 * Harmonic Labs

专题命中 指令微调 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过对比知情欺骗与无知错误,发现欺骗性前向传递具有高残差秩的冲突特征,能以100%准确率无标签识别谎言,并跨模型、语言和架构迁移。

Comments 13 pages, 4 figures. Code and experiment logs: https://github.com/Omibranch/Rift

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19099 2026-06-17 cs.CV cs.AI 版本更新 77%

m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning

m2sv: 地图到街景空间推理的可扩展基准

Yosub Shin, Michael Buriek, Igor Molybog

机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出m2sv基准,通过匹配朝北俯视图与街景图像推断相机方向,评估VLM空间推理能力;最佳模型准确率65.2%,低于人类72.0%,揭示几何对齐与推理一致性的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16349 2026-06-17 cs.CR 新提交 75%

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning

从拒绝几何到安全几何:动态对抗微调下的有害性-拒绝耦合

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 研究通过双安全几何协议测量语言模型在对抗微调中有害性与拒绝机制的耦合程度,发现R2D2训练早期高耦合带来强鲁棒性但牺牲实用性,后期低耦合恢复部分实用性但攻击成功率回升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14632 2026-06-17 cs.CV 版本更新 75%

BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM

BusterX++: 迈向基于MLLM的统一跨模态AI生成内容检测与解释

Haiquan Wen, Tianxiao Li, Zhenglin Huang, Yiwei He, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 提出统一多模态大模型BusterX++,通过纯强化学习策略实现图像与视频伪造检测的跨模态能力迁移,性能超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17680 2026-06-17 cs.LG cs.CL 新提交 73%

EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

EnvRL: 在智能体强化学习中从环境动力学中学习

Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出EnvRL框架,通过状态预测和逆动力学两个辅助目标,将环境动力学学习融入智能体强化学习,在长周期任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25886 2026-06-17 cs.MM 版本更新 67%

MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding

MarkIt: 免训练视觉标记用于精确视频时间定位

Pengcheng Fang, Yuxia Chen, Xiaohao Cai

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17627 2026-06-17 cs.CV cs.AI 新提交 57%

Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

分、议、决:一种用于细粒度自我中心动作识别的多智能体框架

Alessandro Sottovia, Alessandro Torcinovich, Oswald Lanz

机构 * Faculty of Engineering, Free University of Bozen-Bolzano(博尔扎诺自由大学工程学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出一种零样本多智能体框架,通过视频分割、异构VLM专家协商和Borda计数聚合,提升细粒度自我中心动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09770 2026-06-17 q-bio.NC cs.LG 新提交 57%

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

发现功能选择性脑区:一种深度地形多模态模型

Badr AlKhamissi, Johannes Mehrer, Lara Marinov, Ahmed Abdelaal, Abdulkadir Gokce, Martin Schrimpf

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 提出Topo-Omni模型,通过空间平滑微调预训练基础模型,在单一连续虚拟皮层上整合视觉、听觉和语言/认知处理,产生与人类神经影像一致的多模态聚类,并用于发现新脑区。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-06-17 cs.CV cs.AI cs.RO 版本更新 57%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 指令微调 :pretraining(abstract);分类 cs.AI

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18033 2026-06-17 cs.CL cs.AI 新提交 54%

When English Isn't the Best Teacher: Source Language Effects in Cross-Lingual In-Context Learning

当英语不是最好的老师:跨语言上下文学习中的源语言效应

Fred Philippy, Siwen Guo, Jacques Klein, Tegawendé F. Bissyandé

机构 * Snt, University of Luxembourg(卢森堡大学科学技术系) Luxembourg Institute of Science and Technology(卢森堡科学技术研究院)

专题命中 指令微调 :分类 cs.CL、cs.AI;large language model(comments);language model(comments)

AI总结 研究跨语言上下文学习(ICL)中源语言选择的影响,发现基于微调的预期在ICL中不成立,提出有效选择源语言的替代启发式方法。

Comments Accepted at 1st Workshop on Multilinguality in the Era of Large Language Models (MeLLM 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 50%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 指令微调 :instruction tuning(abstract)

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏