arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 41 篇

2412.18084 2026-05-27 cs.AI 93%

Property Enhanced Instruction Tuning for Multi-task Molecule Generation with Large Language Models

属性增强指令微调用于大型语言模型的多任务分子生成

Xuan Lin, Long Chen, Yile Wang, Yangyang Chen, Xiangxiang Zeng

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Computer Science, University of Tsukuba(东京大学理工学部) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);instruction tuning(title)

AI总结 提出PEIT框架,通过多模态对齐预训练和指令微调,提升LLM在分子描述、文本分子生成、属性预测和多约束分子生成任务上的性能。

Comments 9

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14640 2026-05-27 cs.CL cs.AI 92%

Fact4ac at the Financial Misinformation Detection Challenge Task: Reference-Free Financial Misinformation Detection via Fine-Tuning and Few-Shot Prompting of Large Language Models

Fact4ac在金融虚假信息检测挑战赛中的方法:通过微调和少样本提示的大语言模型实现无参考金融虚假信息检测

Cuong Hoang, Le-Minh Nguyen

机构 * KaiNKaiho

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract_cn)

AI总结 本文提出一种结合零样本/少样本提示和LoRA参数高效微调的大语言模型框架,用于无外部证据的金融虚假信息检测,在公开和私有测试集上分别达到95.4%和96.3%的准确率,获得竞赛第一名。

Journal ref Proceedings of the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD 2026), 20th International AAAI Conference on Web and Social Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26924 2026-05-27 cs.CL 92%

Learning to Adapt SFT Data for Better Reasoning Generalization

学习适应SFT数据以实现更好的推理泛化

Lisong Sun, Li Wang, Chen Zhang, Jinyang Wu, Kui Zhang, Tianhao Peng, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高级创新中心)

专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出DART方法,通过强化学习训练映射器将分布不匹配的SFT数据转化为模型自适应的监督,提升推理泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18384 2026-05-27 cs.RO cs.FL 92%

LAD-VF: LLM-Automatic Differentiation Enables Fine-Tuning-Free Robot Planning from Formal Methods Feedback

LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划

Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin, Zhiwen Fan, Li Yin, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of São Paulo(圣保罗大学) Texas A&M University(德克萨斯A&M大学) SylphAI

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。

Comments Presented at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26785 2026-05-27 cs.CL cs.AI 92%

EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation

EmoDistill: 对抗性谈判中语言模型代理的离线情感技能蒸馏

Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup

机构 * University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学) Exiger LLC The Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出EmoDistill离线框架,通过隐式Q学习选择情感和低秩适应策略表达情感,蒸馏情感谈判技能到语言模型代理,在四个高风险谈判领域取得最高效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26656 2026-05-27 cs.CV 91%

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

DV-SFT: 直接视觉监督用于细粒度视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Bing Wang, Zhixing Tan

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)

专题命中 指令微调 :SFT(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17774 2026-05-27 cs.CL 91%

Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning

通过QLoRA微调将工具知识内化到小型语言模型中

Yuval Shemla, Ayal Yakobe, Tanmay Agarwal, Dhaval Patel, Kaoutar El Maghraoui

机构 * Columbia School of General Studies, Columbia University, NY, USA(哥伦比亚大学泛研学院) Columbia Engineering, Columbia University, NY, USA(哥伦比亚大学工程学院) IBM Research, NY, USA(IBM研究院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文研究通过QLoRA参数高效微调将工具知识内化到小型语言模型中,在AssetOpsBench基准上,微调后的Gemma 4 E4B和Qwen3-4B模型在无描述推理下优于有完整工具描述的未微调基线,输入长度减少82.6%,规划分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21972 2026-05-27 cs.AI cs.DC cs.MA 90%

Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic

基于多智能体Actor-Critic的分散式LLM协作学习

Shuo Liu, Tianle Chen, Ryan Amiri, Christopher Amato

机构 * Northeastern University, Boston, MA(波士顿马萨诸塞大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 针对分散式LLM协作优化,提出两种多智能体Actor-Critic方法(CoLLM-CC和CoLLM-DC),实验表明在长时域或稀疏奖励任务中集中式Critic方法优于蒙特卡洛方法和分散式Critic方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26184 2026-05-27 cs.LG cs.AI 90%

GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training

GAC: 面向混合SFT-RL后训练的噪声感知自适应混合

Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Maritime University(上海海洋大学)

专题命中 指令微调 :SFT(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出噪声感知控制器GAC,通过在线估计梯度方差和两个训练信号之间的不一致性,自适应调整混合权重,以改进混合后训练性能。

Comments 15 pages, 3 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15500 2026-05-27 cs.AI cs.LG 90%

Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty

不确定性下通过策略信息分配理解LLM中的推理

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 指令微调 :LLM(title_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个信息论框架,将推理分解为程序推进和认知外化(不确定性标记级外化),证明零散外化能在无显式错误触发时恢复收敛,并通过实验表明小规模SFT即可调控该能力,从而将推理重新定义为不确定性下的策略信息分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14993 2026-05-27 cs.CV cs.AI cs.LG 88%

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

Kandinsky 5.0:图像与视频生成的基础模型系列

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov

机构 * Kandinsky Lab(Kandinsky 实验室)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍Kandinsky 5.0系列模型,通过多阶段训练、自监督微调和强化学习后训练,实现高分辨率图像和10秒视频的高质量生成。

Comments Website: https://kandinskylab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26574 2026-05-27 cs.CR 88%

GradSentry: Gradient Spectral Entropy for Backdoor Sample Filtering in Large Language Model Fine-Tuning

GradSentry: 大语言模型微调中基于梯度谱熵的后门样本过滤

Haodong Zhao, Tianyi Xu, Tianhang Zhao, Zhuosheng Zhang, Gongshen Liu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 提出GradSentry方法,利用每个样本梯度的谱熵区分后门样本与干净样本,无需聚类即可在任意投毒比例下有效过滤后门样本。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13853 2026-05-27 cs.CL cs.AI 87%

APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation

APEX-Searcher: 通过子目标细化信用分配以增强智能体检索增强生成

Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao

机构 * University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Wenge Technology Co., Ltd(Wenger科技有限公司)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对复杂多跳问答中检索路径模糊和端到端强化学习奖励稀疏的问题,提出APEX-Searcher,通过分离规划与执行的信用分配(规划用RL优化、执行用SFT学习),在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27190 2026-05-27 cs.CL cs.AI cs.LG cs.SD 87%

Learning When to Think While Listening in Large Audio-Language Models

在大音频语言模型中学习何时在聆听时思考

Zhiyuan Song, Weici Zhao, Yang Xiao, Suhao Yu, Cheng Zhu, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种可学习的等待-思考-回答控制机制,通过多奖励强化学习优化大音频语言模型在流式语音交互中的推理时机,在提升准确率的同时减少响应延迟。

Comments 19 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18179 2026-05-27 cs.CR cs.AI 86%

Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs

托管LLM中审计会话替换检测的承诺SAE特征轨迹

Ziyang Liu

专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出一种承诺-开放协议,通过Merkle树提交稀疏自编码器特征轨迹,以检测托管LLM提供商在服务中静默替换模型的行为。

Comments We identified inaccuracies in the security analysis: the closed-form intrinsic-dimension lower bound on the feature-forgery attacker (Proposition 4.2, Section 4, Appendix V) and the cross-backend noise calibration for the joint z-score threshold (Section 5.1, Table 2). These affect the claimed attack-resistance guarantees. We are withdrawing the paper to correct them before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18288 2026-05-27 cs.CL 86%

TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling

TFD:面向低资源语言处理和大规模建模的综合结构化藏语基础数据集

Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu

机构 * University of Electronic Science and Technology of China(电子科技大学) Xizang University(西藏大学) ZenWeave AI The State Key Laboratory of Tibetan Intelligence(藏语智能国家重点实验室) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 为解决藏语大语言模型开发中缺乏覆盖预训练、指令微调、安全对齐、偏好优化和推理监督等完整流程的数据集问题,提出首个结构化、大规模、专家精选的藏语基础数据集TFD,包含超过110亿词元的统一语料库及链式推理数据集,通过训练Sun-Shine系列藏语模型在理解、安全、推理和生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22190 2026-05-27 cs.LG cs.AI cs.CL 86%

GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL

GUI-Libra:训练原生GUI代理进行推理与行动——基于动作感知监督和部分可验证强化学习

Rui Yang, Qianhui Wu, Zhaoyang Wang, Hanyang Chen, Ke Yang, Hao Cheng, Huaxiu Yao, Baolin Peng, Huan Zhang, Jianfeng Gao, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GUI-Libra训练方案,通过动作感知SFT和部分可验证RL中的KL正则化,解决GUI代理在长程导航任务中推理与定位冲突及部分可验证性问题,显著提升步骤准确率和任务完成率。

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26601 2026-05-27 cs.CV 85%

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07990 2026-05-27 cs.CL cs.AI cs.LG cs.SE 85%

Tool Calling is Linearly Readable and Steerable in Language Models

语言模型中的工具调用是线性可读且可引导的

Zekun Wu, Ze Wang, Seonglae Cho, Yufei Yang, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * University College London(伦敦大学学院) Holistic AI Imperial College London(伦敦帝国学院)

专题命中 指令微调 :language model(title);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现语言模型内部存在对应工具选择的线性方向,通过干预该方向可切换工具调用,并能提前检测潜在错误,在多个模型和基准上验证了有效性。

Comments 24 pages. ACL ARR May 2026 submission (EMNLP 2026 preferred venue); v2 reflects revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26807 2026-05-27 cs.SE cs.AI 84%

HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

HTMLCure:将浏览器体验转化为面向交互式HTML的状态引导修复

Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

机构 * Beihang University(北京航空航天大学) IQuest Research(IQuest研究院) Peking University(北京大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出HTMLCure框架,通过浏览器交互执行、状态感知诊断和闭环修复引擎,从大规模HTML页面中筛选并修复可修复页面,显著提升SFT数据质量和模型性能。

Comments 27 pages, 11 figures. Code: https://github.com/wuyuVerse/HTMLCure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05864 2026-05-27 cs.CL cs.CY 84%

On the Sensitivity of Instruction-tuned LLMs to Harmful Sentences in Long Inputs

关于指令微调大语言模型对长输入中有害句子的敏感性

Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过构建长输入并系统变化长度、有害比例、显隐性和位置,研究LLM对稀疏嵌入有害句子的敏感性,发现敏感性非单调、随长度下降、早期位置优先、显性危害更易识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08146 2026-05-27 cs.CL cs.AI cs.LG 83%

Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation

超越迁移准确率:用于受控低资源适应的忠实电路

Khumaisa Nur'aini, Ayu Purwarianti, Alham Fikri Aji, Derry Wijaya

机构 * Monash University Indonesia(印度尼西亚墨尔本大学) Institute Teknologi Bandung(Bandung理工大学) MBZUAI(MBZUAI研究所) Boston University(波士顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于上下文分解的电路发现方法(CD-T),通过标签平衡激活均值和任务方向相关性评分实现无反事实电路发现,并利用电路目标监督微调(CT-SFT)在低资源跨语言情感迁移中最小化灾难性遗忘,优于全局微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26526 2026-05-27 cs.LG cs.CR 83%

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

开源权重大语言模型微调防御易受简单攻击

Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文发现针对开源权重大语言模型的防御措施易受abliteration和prefilling等低成本攻击,并提出abliteration-resistant tuning (ART) 方法将攻击成功率降低10%-20%。

Comments main body: 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26421 2026-05-27 cs.CV 82%

HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

HydraPrompt: 面向合成图像检测的视觉语言模型自适应非对称框架

Senyuan Shi, Hao Tan, Zichang Tan, Shuhan Feng, Ajian Liu, Sergio Escalera, Jun Wan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) University of Barcelona(巴塞罗那大学)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 提出一种非对称提示框架HydraPrompt,通过动态调整类别中心对齐细粒度图像线索,结合条件监督对比学习,实现合成图像检测的SOTA性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26559 2026-05-27 cs.LG cs.AI econ.EM 81%

Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice

审计与修复离散选择中表格基础模型的经济有效性

Yingshuo Wang, Xian Sun, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校) Duke University, Durham, NC, USA(杜克大学) Northeastern University, Boston, MA, USA(东北大学) University of Illinois Urbana-Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University, Dallas, TX, USA(南方 Methodist 大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出两阶段适配器,将表格基础模型预测嵌入效用最大化框架,在保证经济一致性的同时提升选择预测精度。

Comments 5 pages, 1 table. Accepted at the FMSD Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27315 2026-05-27 cs.CL 79%

Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

真实图像,更差判断:评估视觉-语言模型在具体性和意象性上的表现

Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文通过具体性和意象性评分任务,发现真实图像上下文不仅未提升视觉-语言模型与人类判断的一致性,反而在视觉证据相关性低时加剧偏差,并表明推理时聚焦文本指令可缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26130 2026-05-27 cs.LG physics.ao-ph 79%

AirCast-SR: A Foundation Model for Kilometer-Scale Atmospheric Super-Resolution via Latent Consistency Diffusion

AirCast-SR: 基于潜在一致性扩散的千米级大气超分辨率基础模型

Somnath Luitel, Manmeet Singh, Joshua Durkee, Abdullah Al Fahad, Naveen Sudharsan, Prabhjot Singh, Cenlin He, Harsh Kamath, Zong-Liang Yang, Krishnagopal Halder, Sandeep Juneja, Parthasarathi Mukhopadhyay, Saptarishi Dhanuka, Amit Kumar Srivastava

机构 * Department of Earth, Environmental, and Atmospheric Sciences, Western Kentucky University, Bowling Green, KY, USA(地球、环境与大气科学系,西部肯塔基大学) NASA Goddard Space Flight Center, Greenbelt, MD, USA(NASA戈达德太空飞行中心) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) NSF National Center for Atmospheric Research, Boulder, CO, USA(国家大气科学研究中心) Leibniz Centre for Agricultural Landscape Research (ZALF), Berlin, Germany(莱比锡农业景观研究中心(ZALF)) Ashoka University, Sonipat, India(阿什oka大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出AirCast-SR基础模型,利用潜在一致性扩散框架将全球AI天气预报从0.25度降尺度至1公里分辨率,实现零偏差和跨区域零样本迁移。

Comments Somnath Luitel and Manmeet Singh are equal-contribution co-first authors, with Manmeet Singh (manmeet.singh@wku.edu) as corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17790 2026-05-27 cs.CV cs.CL 79%

UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action

UltraCUA: 一种具有混合动作的计算机使用智能体基础模型

Yuhao Yang, Zhen Yang, Zi-Yi Dou, Anh Nguyen, Keen You, Omar Attia, Andrew Szot, Michael Feng, Ram Ramrakhya, Alexander Toshev, Chao Huang, Yinfei Yang, Zhe Gan

机构 * Apple(苹果公司) The University of Hong Kong(香港大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.CL

AI总结 提出UltraCUA基础模型,通过混合动作(融合原始GUI操作与高级工具执行)克服计算机使用智能体仅依赖原始GUI动作的局限性,采用自动化管道、合成数据引擎、混合动作轨迹收集和两阶段训练方法,在OSWorld和WindowsAgentArena上分别实现22%的相对性能提升和21.7%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26293 2026-05-27 cs.CL cs.AI 79%

CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

CroCo: 基于自生成结果的跨语言对比偏好调优

Mike Zhang, Ali Basirat, Desmond Elliott

机构 * Department of Computer Science (DIKU), University of Copenhagen(哥本哈根大学计算机科学系(DIKU)) Centre for Language Technology (CST), University of Copenhagen(哥本哈根大学语言技术中心) Pioneer Centre for Artificial Intelligence(先锋人工智能中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CroCo方法,利用英语偏好训练的奖励模型对多语言自生成结果进行对比偏好调优,无需语言特定偏好标注,在14种高低资源语言上提升模型性能,并避免灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27019 2026-05-27 cs.LG cs.CL cs.CR 79%

Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

动态对抗微调重组拒绝几何结构

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen, Yijun Yang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University of Technology(内蒙古科技大学) Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究动态对抗微调如何改变安全对齐语言模型中拒绝行为的因果控制载体(低维子空间),发现R2D2沿鲁棒性-效用前沿重组几何结构但未建立自适应鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏