Mecha-nudges for Machines
机器人的微调:为机器设计的提示
机构 * University of Chicago(芝加哥大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究探讨了机器学习代理在互联网上的决策影响,通过结合经济学和计算机科学框架,发现机器学习模型在环境中自动调整信息呈现,从而提升预测能力,但对人类影响有限。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机器人的微调:为机器设计的提示
机构 * University of Chicago(芝加哥大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究探讨了机器学习代理在互联网上的决策影响,通过结合经济学和计算机科学框架,发现机器学习模型在环境中自动调整信息呈现,从而提升预测能力,但对人类影响有限。
TRACE: 面向能力的代理训练
机构 * Stanford University(斯坦福大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 TRACE通过对比成功与失败轨迹自动识别能力缺失,合成针对性训练环境并利用RL训练适配器,提升代理在不同环境中的表现。
规模还是推理?推理蒸馏的计算等价分析
机构 * Diabolocom ; Artefact Research Center ; Equall ; ISIA Lab, University of Mons(ISIA实验室,蒙斯大学) ; MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学)
专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL
AI总结 通过控制实验,在相同计算预算下比较推理蒸馏与标准指令微调,发现指令微调在多数配置下处于帕累托前沿,而推理蒸馏仅在7B以上开放任务中有效,混合25-50%推理数据可低成本获得大部分收益。
多用户决斗式赌博机:一种基于纳什社会福利的公平方法
机构 * Electrical and Computer Engineering, Purdue University(电子与计算机工程系,普渡大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对多用户偏好异质的决斗式赌博机问题,采用纳什社会福利目标最大化用户效用乘积,提出Fair-Explore-Then-Commit和Fair-ε-Greedy算法,并证明其遗憾上界匹配下界。
ToolSelf: 通过工具驱动的涌现适应统一任务执行与自我重构
机构 * The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出ToolSelf框架,将配置更新抽象为标准化工具接口,统一任务执行与自我重构,并采用配置感知两阶段训练(CAT)实现涌现适应性,在多种基准测试中平均超越静态配置基线28.8分。
答案源于内部:自衍生奖励实现可解释关系抽取
机构 * University of Arizona(亚利桑那大学) ; Shandong University(山东大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对大语言模型在无预定义标签的单次关系抽取中易受无关词干扰和抽象层级不匹配的问题,提出COGRE认知推理框架和HIT@DICT强化学习奖励策略,通过自动提取信用词典奖励关系相关短语,显著提升准确率和解释质量。
Comments Working in process
用于搜索的智能体强化学习使指令微调对齐失效
机构 * University of Oxford(牛津大学) ; Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) ; Harvard University(哈佛大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。
隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Huawei Inc.(华为公司)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。
Comments EMNLP-Findings 2025 (Correcting model settings)
面向视觉原生多模态深度搜索智能体的在策略数据演化
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Edinburgh(爱丁堡大学)
专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL
AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。
SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元
专题命中 指令微调 :large language model(abstract);language model(abstract)
AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。
BashCoder-R1: 面向鲁棒且可解释的Bash代码生成——鲁棒感知组相对策略优化
专题命中 指令微调 :LLM(abstract);SFT(abstract_cn)
AI总结 提出BashCoder-R1框架,结合持续预训练、长思维链监督微调和鲁棒感知组相对策略优化,在BashBench基准上实现高语法通过率、低鲁棒警告率和功能完整率,显著超越DeepSeek-V3.2。
Comments Accepted to ISSTA 2026
面向第一人称视角助手的视觉意图定位
机构 * National University of Singapore(新加坡国立大学) ; Google DeepMind(谷歌DeepMind)
专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract)
AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。
紧凑的任务对齐模仿学习用于实验室自动化
机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) ; Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) ; National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)
专题命中 指令微调 :language model(abstract);foundation model(abstract)
AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。
通过特定任务自我报告揭示隐藏模型行为
机构 * Jagiellonian University, Faculty of Mathematics and Computer Science(雅盖隆大学数学与计算机科学系) ; Jagiellonian University, Doctoral School of Exact and Natural Sciences(雅盖隆大学精确与自然科学研究博士学院)
专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对微调语言模型的隐藏行为问题,提出稳定适配器进行自我报告(SAR),能让模型用自然语言描述隐藏行为,相比现有基线方法检测更准确,减少幻觉,便于从业者审计模型。
Comments 17 pages, 8 figures, 2 tables; appendix with 37 additional pages
SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) ; Tsinghua University(清华大学)
专题命中 指令微调 :large language model(abstract);language model(abstract)
AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。
OmniAD:基于多模态推理的工业异常检测与理解
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) ; Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作实验室) ; Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所噪声与振动重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 指令微调 :SFT(abstract,abstract_cn)
AI总结 OmniAD是融合视觉与文本推理的多模态框架,以Text-as-Mask Encoding等技术实现工业异常检测与理解,在MMAD基准性能超Qwen2.5-VL-7B等模型,代码与模型将公开。
S-Agent:空间工具使用激发空间智能推理
机构 * NTU(南洋理工大学) ; THU(清华大学) ; ByteDance(字节跳动) ; NWPU(西北工业大学)
专题命中 指令微调 :SFT(abstract,abstract_cn)
AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。
Comments Project Page : https://Ropedia.github.io/S-Agent
Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 指令微调 :SFT(abstract,abstract_cn)
AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。
Comments 13 pages, 3 figures, 4 tables
太阳周期预测:挑战、进展与未来展望
专题命中 指令微调 :SFT(abstract,abstract_cn)
AI总结 本文综述了太阳周期预测的挑战与进展,指出多数方法难以准确预测峰值,ML模型效果不佳,极场预测最具物理依据但早期应用可能不准确,需改进 Dynamo 模型以更好地整合观测数据和物理机制。
Comments Invited review; 44 pages, including 17 figures and 1 Table
Journal ref Reviews of Modern Plasma Physics (2026) 10:11
用于大语言持续学习的子专家混合模型
专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言持续学习中稳定性-可塑性困境及可扩展性问题,提出子专家混合模型MoSEs,通过模块化稀疏性和组合路由,平衡困境,实现知识隔离、重组扩展及亚线性增长,实验验证其性能优于基线,为持续学习基础模型提供关键归纳偏置。
无需卫星的无人机视角地理定位
机构 * Nanjing University of Science and Technology(南京理工大学) ; University of Tsukuba(筑波大学) ; Nanyang Technological University(南洋理工大学)
专题命中 指令微调 :SFT(abstract,abstract_cn)
AI总结 本文提出无需卫星数据的训练框架,通过三维场景重建、伪正射影像生成和特征聚合,提升无人机在无GPS环境下的地理定位性能。
Comments Withdrawn by the authors to allow for substantial revision in light of valuable reviewer feedback. A thoroughly revised version may be submitted in the future
UNIPO:统一的交互式可视化用于RL微调策略优化
专题命中 指令微调 :large language model(abstract);language model(abstract)
AI总结 UNIPO通过统一设计揭示RL微调算法的token级训练动态,提供高阶训练概述、步骤级提示响应检查器和算法对比视图,支持非专家教学和AI从业者算法选择。
三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器
机构 * University of Southern California(南加州大学) ; NVIDIA Research(NVIDIA研究)
专题命中 指令微调 :large language model(abstract);language model(abstract)
AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。
Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav
Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026
进化引导解码:大语言模型的迭代值细化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Soochow University(苏州大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学)
专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现引导解码中值函数不准确源于分布差距,提出迭代值细化框架,用值探索提供训练信号,迭代自我细化利用改进值函数生成高质量数据,实验证明该框架能有效对齐语言模型并降低计算成本。
Comments Accepted to ACL 2026 (main conference)
少样本合成方言语音用于ASR微调:什么有助于什么?
机构 * University of Washington(华盛顿大学)
专题命中 指令微调 :LLM(abstract,abstract_cn)
AI总结 研究比较了合成方言语音在ASR微调中的有效性,发现随机音素扰动比目标方言音素编辑更有效,且真实语音与合成语音混合可稳定低资源微调。
Comments Accepted as a contributed talk and poster at the ICML 2026 Workshop on Machine Learning for Audio
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 指令微调 :LLM(abstract,abstract_cn)
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
通过逐步偏好调优的多模态智能体迭代工具使用探索
机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) ; Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中 指令微调 :language model(abstract);preference optimization(abstract)
AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。
Comments 24 pages
代码相关任务中的参数高效多任务微调
专题命中 指令微调 :large language model(abstract);language model(abstract)
AI总结 研究多任务QLoRA微调在代码生成、翻译和总结中的效果,发现其在1.5B、3B和7B规模上达到或优于单任务QLoRA和全微调,大模型平衡正确性与质量更佳。
评估自主编程代理中的计划合规性
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(IBM公司)
专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.AI
AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。
超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成
机构 * Nanjing University(南京大学) ; Australia National University(澳大利亚国立大学) ; Wuhan University(武汉大学) ; National University of Singapore(新加坡国立大学) ; University of Technology Sydney(技术科技大学)
专题命中 指令微调 :prompting(abstract);分类 cs.AI、cs.LG
AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。