arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 59 篇

2504.05108 2026-05-26 cs.AI cs.LG cs.NE 82%

Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning

利用大语言模型发现算法:进化搜索遇见强化学习

Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出通过强化学习微调持续优化大语言模型,结合进化搜索加速发现更优算法,在组合优化任务上验证有效性。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12677 2026-05-26 cs.CL cs.AI 82%

Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches

微调因果大语言模型用于文本分类:基于嵌入与基于指令的方法

Amirhossein Yousefiramandi, Ciaran Cooney

机构 * Clarivate Intellectual Property(Clarivate知识产权)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探索在资源受限下微调解码器-only大语言模型用于文本分类,比较了基于嵌入的分类头方法和基于指令的微调方法,并采用4位量化与LoRA实现高效训练,实验表明嵌入头方法在单标签分类中匹配或超越微调BERT基线,而指令微调仅在多标签且大参数量时有效。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19037 2026-05-26 cs.CL cs.AI cs.IT cs.LG cs.NE math.IT 82%

Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models

速度规划:用于掩码扩散语言模型的膨胀调度

Omer Luxembourg, Haim Permuter, Eliya Nachmani

机构 * School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Beersheba, Israel(电气与计算机工程学院,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出膨胀解掩码调度器(DUS),通过将序列位置划分为非相邻的膨胀组并并行解掩码,最小化联合熵增益上界,在不修改去噪器的情况下实现高达5.8倍加速。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23913 2026-05-26 cs.DC cs.CL 81%

Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?

LoRA融合能否支持云边协作中的跨域任务?

Yatong Wang, Fali Wang, Naibin Gu, Zheng Lin, Zhengxiao Liu, Dingyu Yao, Zhiwei Zhang, Jianxin Shi, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) The Pennsylvania State University, University Park, USA(宾夕法尼亚州立大学) Beihang University, Beijing, China(北航大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对云边协作中跨域问题解决的需求,提出剪枝-训练-恢复框架和冲突解决模块LoRA-CR,发现现有LoRA融合方法在跨域基准MMLU-CD上表现不佳,而LoRA-CR通过缓解参数冲突将性能提升高达3.8%。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25851 2026-05-26 cs.RO 80%

RePlan-Bot: Multi-Level Replanning for Embodied Instruction Following

RePlan-Bot:面向具身指令跟随的多级重规划

Xicheng Gong, Guozheng Sun, Peiran Xu, Yadong Mu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(summary_cn,abstract)

AI总结 提出RePlan-Bot,通过多级连续重规划(高层LLM审计器、常识引导搜索、轻量级ViT校正器)解决具身指令跟随中的长时规划和不可逆状态变化问题,在ALFRED基准上取得最佳性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24873 2026-05-26 cs.CL cs.AI cs.LG 80%

Towards a Universal Causal Reasoner

迈向通用因果推理器

Qirun Dai, Xiao Liu, Jiawei Zhang, Dylan Zhang, Hao Peng, Chenhao Tan

机构 * The University of Chicago(芝加哥大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出UniCo数据生成框架,覆盖Pearl因果阶梯的18种查询类型,将符号示例转化为代码和自然语言,通过监督微调显著提升LLM的因果推理能力和推理忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22222 2026-05-26 cs.LG 79%

ARC-STAR: Auditable Post-Hoc Correction for PDE Foundation Models

ARC-STAR: 面向PDE基础模型的可审计事后修正

Chengze Li, Lingwei Wei, Li Sun, Hongbo Lv, Jie Yang, Hanrong Zhang, Kening Zheng, Wei-Chieh Huang, Enze Ma, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Beijing University of Posts and Telecommunications(北京邮电大学) North China Electric Power University(华北电力大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 针对PDE基础模型预测漂移且误差空间集中的问题,提出冻结求解器的事后修正框架ARC-STAR,通过全局修正、局部精炼和预算感知路由三阶段实现可审计、低误差的修正。

Comments 40 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO 79%

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20477 2026-05-26 cs.LG 79%

Bi-CoG: Bi-Consistency-Guided Self-Training for Vision-Language Models

Bi-CoG:面向视觉语言模型的双一致性引导自训练

Rui Zhu, Song-Lin Lv, Zi-Kang Wang, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 针对半监督微调中模型偏差和超参数敏感问题,提出一种利用模型间和模型内一致性以及误差感知动态伪标签分配策略的即插即用方法Bi-CoG,在14个数据集上显著提升现有方法性能。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25835 2026-05-26 cs.LG cs.AI 79%

Context-Instrumental Data Distillation for Kubernetes Manifest Generation: Method and Experimental Evaluation

面向Kubernetes清单生成的上下文-工具数据蒸馏方法及实验评估

Andrey Kozachok, Anatoliy Bakaev, Aleksandr Kozachok, Shamil Magomedov, Artem Noev

机构 * RTU MIREA(俄罗斯莫斯科RTU MIREA)

专题命中 指令微调 :language model(abstract);small language model(abstract);SLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出上下文-工具数据蒸馏方法,通过合成生成和反向指令生成构建语料库,结合外部验证器过滤,在资源受限条件下微调1.5B参数小语言模型生成Kubernetes清单,实验表明严格输出格式比增加训练样本更关键。

Comments 15 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25565 2026-05-26 cs.LG cs.CL 79%

RotMoLE: Enhancing Mixture of Low-Rank Experts through Rotational Gating Mechanism

RotMoLE:通过旋转门控机制增强混合低秩专家

Mengyang Sun, Maochuan Dou, Tao Feng, Dan Zhang, Yihao Wang, Junpeng Liu, Yifan Zhu, Jie Tang

机构 * Tsinghua University(清华大学) Beijing Information Science and Technology University(北京信息科技大学) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对MoE-LoRA中传统门控仅标量加权限制表示能力的问题,提出RotMoLE框架,通过引入旋转门控机制对每个专家进行旋转操作,提升专家利用率和专业化程度,在多任务和多语言训练中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24517 2026-05-26 cs.LG cs.CL 79%

ECHO: Terminal Agents Learn World Models for Free

ECHO: 终端代理免费学习世界模型

Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出ECHO混合目标,通过预测环境观测令牌将终端反馈转化为密集监督信号,显著提升CLI代理在TerminalBench-2.0上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18932 2026-05-26 cs.LG cs.AI 79%

HypergraphFormer: Learning Hypergraphs from LLMs for Editable Floor Plan Generation

HypergraphFormer: 从大语言模型中学习超图以实现可编辑的楼层平面图生成

Nikita Klimenko, Hesam Salehipour, Parham Eftekhar, Amir Khasahmadi, Ramon Elias Weber

机构 * Autodesk Research(Autodesk研究院) York University(约克大学) UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出HypergraphFormer,利用大语言模型学习超图表示来生成楼层平面图,在RPLAN数据集上超越现有方法,并支持任意边界和高度可编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25495 2026-05-26 cs.RO cs.CV 78%

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

RepSAM: 通过表示引导的适应连接基础模型与机器人视觉

Wenhui Chu

机构 * Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 针对基础模型在非结构化机器人视觉场景中性能下降的问题,提出RepSAM框架,通过CKA引导的秩分配策略和多模态融合模块实现参数高效微调,在减少158倍可训练参数的同时达到全微调97.9%的性能。

Comments Accepted to IJCAI-ECAI 2026 (Special Track on AI and Robotics). 8 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25479 2026-05-26 cs.CV 78%

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

MAIL++: 视觉语言模型的多模态双向智能体层

Kaixiang Chen, Pengfei Fang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国)

专题命中 指令微调 :language model(title,abstract)

AI总结 提出MAIL/MAIL++方法,通过将跨模态耦合嵌入VLM内在计算模块并引入双向桥接,实现参数高效微调,在少样本分类和跨域检索中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23491 2026-05-26 cs.LG cs.AI cs.CL 75%

CoSPlay: Cooperative Self-Play at Test-Time with Self-Generated Code and Unit Test

CoSPlay: 测试时协作自我博弈与自生成代码和单元测试

Zhangyi Hu, Chenhui Liu, Tian Huang, Jindong Li, Yang Yang, Jiemin Wu, Zining Zhong, Menglin Yang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI, Wuxi, China(深度感知技术研究院,无锡,中国)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoSPlay框架,通过代码与单元测试的协作自我博弈,在无真实单元测试的情况下迭代优化两者,显著提升代码生成性能。

Comments Code is available at: https://github.com/sanae-ai/CosPlay | Data & log is available at: https://huggingface.co/datasets/yomi017/CosPlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02144 2026-05-26 cs.CL cs.AI 73%

Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts

类比路由:用于混合专家模型的kNN增强专家分配

Boxuan Lyu, Soichiro Murakami, Hidetaka Kamigaito, Peinan Zhang

机构 * Institute of Science Tokyo(东京科学研究院) CyberAgent Nara Institute of Science and Technology(奈良科学技術大學)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出kNN-MoE框架,通过检索历史相似案例的局部最优专家分配来增强MoE路由,使用检索邻居的平均相似度作为置信度混合系数,在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24058 2026-05-26 cs.LG cs.AI 73%

Signs Beat Floats: Low-Rank Double-Binary Adaptation for On-Device Fine-Tuning

符号胜过浮点:面向设备端微调的低秩双二值适配器

Yoshihiko Fujisawa, Yuma Ichikawa, Yudai Fujimoto, Akira Sakai, Katsuki Fujisawa

机构 * Fujitsu Limited(富士通株式会社) Institute of Science Tokyo(东京科学研究所) RIKEN Center for AIP(理化学研究所先进信息处理中心) Tokai University(静冈大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LoRDBA,一种用二值符号载波和通道级缩放替代低秩因子的适配器,在保持LoRA兼容性的同时显著降低存储和计算开销,并在设备端微调中匹配或超越低比特基线性能。

Comments 34 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19389 2026-05-26 cs.LG 72%

Federated Sketching LoRA: A Flexible Framework for Heterogeneous Collaborative Fine-Tuning of LLMs

联邦草图LoRA:一种用于异构协作微调大语言模型的灵活框架

Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Seyyedali Hosseinalipour, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学) University at Buffalo-SUNY(布法罗大学- SUNY)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG;LLM(comments)

AI总结 针对资源受限客户端上大语言模型微调中的异构性问题,提出联邦草图LoRA(FSLoRA),通过草图机制让客户端选择性更新服务器维护的全局LoRA模块子矩阵,并利用草图比例灵活适应客户端约束,提供收敛性分析,实验表明优于基线并提升训练效率。

Comments We propose Federated Sketching LoRA (FSLoRA), a theoretically grounded methodology for collaborative LLM fine-tuning that retains LoRA's flexibility while adapting to the communication and computational capabilities of individual clients

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24784 2026-05-26 cs.AI 70%

GRAIL: AI translation for scientists application workflow on satellite data

GRAIL:面向卫星数据科学家应用工作流的AI翻译

Zhuocheng Shang, Ahmed Eldawy

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出GRAIL系统,通过LangGraph管道将Python地理空间工作流翻译为可扩展的Spark程序,无需科学家学习新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25802 2026-05-26 cs.CV 67%

Rethinking VLM Representation for VLA Initialization

重新思考用于VLA初始化的VLM表示

Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei, Jianbo Liu, Hongsheng Li

机构 * CUHK(香港中文大学) PolyU Peking University(北京大学) ACE Robotics(ACE机器人)

专题命中 指令微调 :language model(abstract);pretraining(abstract)

AI总结 本文通过控制表示设计问题,沿能力级具身VQA监督、参数更新策略和机器人数据预训练三个轴,研究VLA初始化,发现保留预训练VLM表示对动作性能至关重要,而LoRA比全微调提供更可靠的初始化,分阶段基于LoRA的训练获得最强变体。

Comments 9 main-text pages, 5 appendix pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19739 2026-05-26 cs.CV 67%

FlowErase-RL: Rethinking Concept Erasure as Reward Optimization in Flow Matching Models

FlowErase-RL:将概念擦除重新思考为流匹配模型中的奖励优化

Yi Sun, Zhiqi Zhang, Xinhao Zhong, Yimin Zhou, Shuoyang Sun, Bin Chen, Shu-Tao Xia, Ke Xu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Jilin University(吉林大学) Peng Cheng Laboratory(鹏城实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出FlowErase-RL,首个基于GRPO的框架,通过动态双路径奖励机制将概念擦除转化为奖励优化问题,在抑制目标概念的同时保持生成保真度,实现最先进的擦除性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 67%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 指令微调 :language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14605 2026-05-26 cs.CR cs.AI cs.LG 62%

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

一步之遥:为什么针对恶意微调的防御在自适应对手面前失败

Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

机构 * Ben-Gurion University of the Negev(贝纳-约瑟夫大学) Amrita Vishwa Vidyapeetham(阿米塔维莎瓦迪耶佩塔)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析15种近期防御机制,发现它们共享一个弱点:仅掩盖或误导有害行为路径而未消除行为本身,并开发了一种统一的自适应攻击,成功突破了所有防御机制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01284 2026-05-26 cs.CV cs.AI cs.CL cs.IR 62%

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

证据链:面向迭代检索增强生成的像素级视觉归因

Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Tencent Technology(腾讯科技)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Chain of Evidence (CoE)框架,利用视觉语言模型直接对检索到的文档截图进行推理,输出精确边界框以可视化完整推理链,解决迭代检索增强生成中的粗粒度归因和视觉语义丢失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26037 2026-05-26 cs.CL 57%

Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

先升后降与知识图谱工具使用的四个接口通道

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学)

专题命中 指令微调 :pretraining(abstract);分类 cs.CL

AI总结 本文通过最小化知识图谱工具API实验,发现标准RLVR工具使用配方在自验证检索奖励下出现先升后降的崩溃模式,并识别出四种接口失败模式,提出接口反馈差异是核心原因,单次自蒸馏可缓解但受接口限制。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25427 2026-05-26 cs.CV cs.AI 57%

Binding Visual Features Point by Point

逐点绑定视觉特征

Udith Haputhanthri, Declan Campbell, Rim Assouel, Jonathan D. Cohen, Taylor W. Webb

机构 * Princeton University(普林斯顿大学) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究通过文本引导的“指向”机制解决视觉语言模型在多目标场景中的绑定问题,发现该机制诱导内部视觉搜索程序,消除绑定错误并实现组合泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO 57%

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11296 2026-05-26 cs.CV cs.LG 57%

$Δ\mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

$Δ\mathrm{Energy}$: 优化视觉-语言对齐过程中的能量变化提升OOD检测与OOD泛化

Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出ΔEnergy分数,通过重新对齐视觉-语言模态时的能量变化来同时提升分布外检测和分布外泛化性能,并基于此开发了统一微调框架EBM。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24792 2026-05-26 cs.CV cs.AI 57%

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

用于胃肠内窥镜的参数高效视觉语言模型:医学图像生成与临床视觉问答

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

机构 * Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系) International Organization for Migration (IOM)(国际移民组织) Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出双流水线参数高效微调模型,结合Florence-2和LoRA Stable Diffusion,分别解决临床视觉问答和隐私保护合成数据生成问题,在Kvasir-VQA数据集上取得高ROUGE和BLEU分数,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏