arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 37 篇

2410.21438 2026-05-11 cs.CL cs.LG 95%

UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function

UFT:通过通用隐式奖励函数统一SFT和RLHF/DPO/UNA的微调

Zhichao Wang, Bin Bi, Zixu Zhu, Xiangbo Mao, Jun Wang, Shiyu Wang, Cheng Wang, Dong Nie, Lingzi Hong

机构 * Salesforce RadixArk ChatAlpha AI University of North Texas(北卡罗来纳州立大学)

专题命中 指令微调 :SFT(title,title_cn);RLHF(title,title_cn);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文提出UFT框架,通过隐式奖励函数整合SFT与对齐过程,提升指令微调和事实性任务的性能,实验显示其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07127 2026-05-11 cs.LG cs.CL 91%

The Position Curse: LLMs Struggle to Locate the Last Few Items in a List

位置诅咒:LLM在列表中定位最后几个项目时表现不佳

Zhanqi Zhang, Hua-Dong Xiong, Robert C. Wilson, Mikio Aoi, Marcelo G. Mattar, Li Ji-An

机构 * UC San Diego(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) New York University(纽约大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 LLM在定位长列表中单个相关项目时表现优异,但在短列表中最后几个项目定位上存在缺陷,即位置诅咒。通过构建PosBench数据集进行微调后,虽然提升了定位能力,但仍未达到理想水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07403 2026-05-11 cs.SE 91%

Boosting Automatic Java-to-Cangjie Translation with Multi-Stage LLM Training and Error Repair

通过多阶段LLM训练和错误修复提升Java到Cangjie的自动翻译

Xinyue Liang, Jingxuan Zhang, Lin Li, Jun Zhang, Junhao Chen

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出多阶段LLM训练框架,结合编译器反馈和错误修复,提升Java到Cangjie的翻译准确性与语义一致性,实验显示在有限平行数据下功能等价性提升6.06%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14018 2026-05-11 cs.SE cs.AI 90%

PerfCoder: Large Language Models for Interpretable Code Performance Optimization

PerfCoder:用于可解释代码性能优化的大型语言模型

Jiuding Yang, Shengyao Lu, Hongxuan Liu, Shayan Shirahmad Gale Bagi, Zahra Fazel, Tomasz Czajkowski, Di Niu

机构 * University of Alberta(阿尔伯塔大学) University of Victoria(维多利亚大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 PerfCoder通过可解释的定制化优化生成高性能代码,优于现有模型,在代码性能基准上实现更高效的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07977 2026-05-11 cs.LG 89%

Self-Play Enhancement via Advantage-Weighted Refinement in Online Federated LLM Fine-Tuning with Real-Time Feedback

通过优势加权细化的自我扮演增强在线联邦大语言模型微调与实时反馈

Seohyun Lee, Wenzhi Fang, Dong-Jun Han, Seyyedali Hosseinalipour, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学) University at Buffalo-SUNY(布法罗大学-苏尼扬大学)

专题命中 指令微调 :LLM(title,summary_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出SPEAR算法,通过反馈引导的自我扮演循环生成对比对,利用标准最大似然和置信度加权不似然训练,在无需昂贵组生成和真实上下文的情况下实现高效的在线联邦LLM微调。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07764 2026-05-11 cs.RO 88%

CommandSwarm: Safety-Aware Natural Language-to-Behavior-Tree Generation for Robotic Swarms

CommandSwarm: 为机器人群体提供安全意识的自然语言到行为树生成

Mohammed Majid, Amjad Yousef Majid

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出CommandSwarm系统,通过多语言翻译、安全过滤和约束提示生成XML行为树,验证了紧凑量化领域适应的LLM在机器人群体控制中的有效性,强调了解析器接受和安全过滤的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07201 2026-05-11 cs.CL cs.AI cs.LG 88%

PSK@EEUCA 2026: Fine-Tuning Large Language Models with Synthetic Data Augmentation for Multi-Class Toxicity Detection in Gaming Chat

PSK@EEUCA 2026: 通过合成数据增强微调大语言模型用于游戏聊天中的多类毒性检测

Srikar Kashyap Pulipaka

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过合成数据增强微调大语言模型,用于游戏聊天中的多类毒性检测,实验结果显示在测试集上达到0.6234的F1-macro分数,发现验证性能高反而导致测试转移差的'验证陷阱'现象。

Comments Accepted to the EEUCA workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00513 2026-05-11 cs.LG 86%

Minerva: Reinforcement Learning with Verifiable Rewards for Cyber Threat Intelligence LLMs

Minerva: 为网络威胁情报LLM采用可验证奖励的强化学习

Md Tanvirul Alam, Aritran Piplai, Ionut Cardei, Nidhi Rastogi, Peter J Worth

机构 * Rochester Institute of Technology(罗切斯特理工学院) University of Texas at El Paso(德克萨斯大学埃尔帕索分校) Florida Atlantic University(佛罗里达Atlantic大学)

专题命中 指令微调 :LLM(title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Minerva,一种统一的数据集和训练流程,用于多类网络威胁情报子任务,通过任务特定验证器评分结构化输出。MinervaRL通过轻量自训练机制生成额外验证轨迹并反向蒸馏至模型,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07132 2026-05-11 cs.HC 86%

From Standard English to Singlish: A Retrieval-Augmented Approach for Code-Switched Creole Generation in Large Language Models

从标准英语到新加坡英语:一种检索增强的方法用于大型语言模型中的克里奥尔生成

Foong Ming Lai, Yujin Tan, Han Meng, Yi-Chieh Lee

专题命中 指令微调 :large language model(title);language model(title);prompting(abstract)

AI总结 本文提出一种检索增强生成框架,通过外部化方言知识实现受控的克里奥尔语言生成,无需微调,通过稀疏词法替换指导生成,实验表明其在自然度和语义保留方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02073 2026-05-11 cs.CL 85%

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

通过搜索驱动强化学习优化奖励函数以增强大语言模型推理能力

Arash Ahmadi, Sarah Sharif, Yaser, Banad

机构 * School of Electrical and Computer Engineering, University of Oklahoma(俄克拉荷马大学电气与计算机工程学院) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory, University of Oklahoma(智能神经形态与量子理解创新研究与工程实验室,俄克拉荷马大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出一种搜索驱动框架,通过优化奖励函数提升大语言模型推理能力,通过五轮搜索生成50个候选奖励,最终获得79.5%的F1分数,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11121 2026-05-11 cs.CL 84%

BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection

BITS Pilani 在 SemEval-2026 任务 9:基于 DPO 细调的结构化监督微调用于极化检测

Atharva Gupta, Dhruv Kumar, Yash Sinha

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,瓦拉纳西,印度)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出结合结构化监督微调与 DPO 细调的方法,用于社交媒体文本中的极化检测,通过 LoRA 微调 Qwen 2.5-7B-Instruct 并利用自动偏好对减少误判,最终在英文测试集上达到 0.7664 的 Macro-F1 分数。

Comments Accepted to the 20th International Workshop on Semantic Evaluation (SemEval-2026), to be held in conjunction with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08923 2026-05-11 cs.CL 84%

NCL-BU at SemEval-2026 Task 3: Fine-tuning XLM-RoBERTa for Multilingual Dimensional Sentiment Regression

NCL-BU 在 SemEval-2026 任务 3: 基于 XLM-RoBERTa 的多语言维度情感回归微调

Tong Wu, Nicolay Rusnachenko, Huizhi Liang

机构 * Independent Researcher(独立研究者) Centre for Applied Creative Technologies (CFACT+), Bournemouth University, UK(应用创意技术中心(CFACT+),伯恩茅斯大学,英国) School of Computing, Newcastle University, Newcastle upon Tyne, UK(计算学院,新castle大学,新castle upon Tyne,英国)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于 XLM-RoBERTa 的微调方法,用于多语言维度情感回归任务,通过双回归头预测情感值和唤醒度,跨领域和语言进行训练,实验显示任务特定微调优于其他大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08256 2026-05-11 cs.CL 84%

NCL-UoR at SemEval-2026 Task 5: Embedding-Based Methods, Fine-Tuning, and LLMs for Word Sense Plausibility Rating

NCL-UoR在SemEval-2026任务5中的表现:基于嵌入的方法、微调与大语言模型用于词义可plausibility评分

Tong Wu, Thanet Markchom, Huizhi Liang

机构 * Independent Researcher(独立研究者) Department of Computer Science, University of Reading(阅读大学计算机科学系) School of Computing, Newcastle University(新castle大学计算学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文比较了三种方法:基于嵌入的方法、Transformer微调和大语言模型提示,发现结构化提示优于微调和嵌入方法,提示设计比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL 83%

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07282 2026-05-11 cs.LG 83%

The Convergence Gap: Instruction-Tuned Language Models Stabilize Later in the Forward Pass

收敛差距:指令微调语言模型在前向传递后期趋于稳定

Yifan Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :language model(title);post-training(abstract);prompting(abstract);分类 cs.LG

AI总结 研究发现指令微调模型在前向传递后期更接近最终预测,通过分析六个预训练和指令微调检查点,发现后期MLP层对预测动态有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06761 2026-05-11 cs.AI cs.CV cs.LG 82%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06723 2026-05-11 cs.AI cs.CL cs.LG 82%

When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment

语言模型何时做出承诺?一种有限答案理论的预言语承诺

Long Zhang, Wei-neng Chen, Feng-feng Wei, Zi-bo Qin

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在生成最终答案前的推理过程,通过有限答案偏好稳定化理论分析模型在回答前的承诺时间,发现其在可解析前稳定,且信号可从隐藏状态恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26524 2026-05-11 cs.LG cs.AI 81%

TAP: Two-Stage Adaptive Personalization of Multi-Task and Multi-Modal Foundation Models in Federated Learning

TAP: 多任务和多模态基础模型在联邦学习中的两阶段自适应个性化

Seohyun Lee, Wenzhi Fang, Dong-Jun Han, Seyyedali Hosseinalipour, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学) University at Buffalo-SUNY(布法罗大学-苏尼尔)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAP方法,通过两阶段自适应个性化在联邦学习中提升多任务和多模态基础模型的泛化能力,解决数据、任务和模态异质性问题。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06173 2026-05-11 cs.CV cs.AI 79%

Retina-RAG: Retrieval-Augmented Vision-Language Modeling for Joint Retinal Diagnosis and Clinical Report Generation

Retina-RAG:基于检索增强的视觉-语言模型用于联合视网膜诊断和临床报告生成

Abdelrahman Zaian, Sheethal Bhat, Mohamed Abdalkader, Andreas Maier

机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 Retina-RAG通过整合高精度视网膜分类器和参数高效视觉语言模型,实现糖尿病视网膜病变分级、黄斑水肿检测及报告生成,优于现有方法,且在单块消费级GPU上运行。

Comments 10 pages, 5 figures. Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05995 2026-05-11 cs.CR cs.AI cs.CL 79%

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

安全锚:通过几何瓶颈防御有害微调

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出安全瓶颈正则化(SBR),通过几何瓶颈层限制有害查询的隐藏状态,以对抗有害微调攻击,实验表明单个安全锚即可显著降低有害分数。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05732 2026-05-11 cs.LG cs.AI 79%

CRAFT: Forgetting-Aware Intervention-Based Adaptation for Continual Learning

CRAFT:面向持续学习的遗忘感知干预式适应

Md Anwar Hossen, Fatema Siddika, Juan Pablo Munoz, Tanya Roosta, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Maro Systems(Maro系统) University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CRAFT通过在隐藏表示上学习低秩干预,避免更新模型权重,通过输出分布分歧路由任务、KL散度正则化和合并干预,减少遗忘并提升性能。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07850 2026-05-11 cs.CL cs.AI cs.LG 78%

MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning

MatryoshkaLoRA: 学习准确的分层低秩表示以用于大语言模型微调

Ionut-Vlad Modoranu, Mher Safaryan, Dan Alistarh

机构 * ISTA Lancaster University, UK(兰卡斯特大学,英国) ISTA Institute of Science and Technology Austria (ISTA)(奥地利ISTA科学与技术研究所(ISTA))

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MatryoshkaLoRA通过引入固定对角矩阵P,学习准确的分层低秩表示,实现动态秩选择并提升精度-性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07145 2026-05-11 cond-mat.mtrl-sci cs.CV 78%

Fine-tuning a vision-language model for fracture-surface morphology recognition

对骨折表面形貌识别进行视觉-语言模型的微调

Quanliang Liu, Jungtaek Kim, Kangwook Lee, Hyunseok Oh

机构 * Department of Materials Science & Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Electrical & Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系) KRAFTON Ludo Robotics

专题命中 指令微调 :language model(title,abstract)

AI总结 本文通过微调开源视觉-语言模型,利用定制化的13168张骨折表面图像数据集,提升了对骨折表面形貌的识别能力,展示了在材料表征中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07505 2026-05-11 cs.AI cs.LG 73%

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

LiteGUI: 通过强化学习蒸馏紧凑的GUI代理

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen

机构 * Moore Threads AI

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种无需监督微调的训练方法,通过引导在线蒸馏和多解决方案双层GRPO框架,提升小规模模型在GUI任务中的性能和探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07269 2026-05-11 cs.CL cs.LG 73%

MIPIAD: Multilingual Indirect Prompt Injection Attack Defense with Qwen -- TF-IDF Hybrid and Meta-Ensemble Learning

MIPIAD: 多语言间接提示注入攻击防御与Qwen-TF-IDF混合及元集成学习

Al Muhit Muhtadi, Mostafa Rifat Tazwar

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出MIPIAD框架,结合Qwen2.5-1.5B微调序列分类器、TF-IDF特征和元集成学习,通过合成基准测试在英文和孟加拉文上实现高准确率的攻击检测,有效减少跨语言差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06733 2026-05-11 cs.LG cs.AI 73%

Beyond Factor Aggregation: Gauge-Aware Low-Rank Server Representations for Federated LoRA

超越因子聚合:面向联邦LoRA的 gauge 意识低秩服务器表示

Jinqian Chen, Chang Liu, Jihua Zhu

机构 * School of Software Engineering(软件工程学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GLoRA通过估计共识更新子空间和共享参考坐标,实现语义化的低秩更新聚合,优于联邦LoRA基线,在数据、资源和任务异质性下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07465 2026-05-11 cs.CL 70%

SEIF: Self-Evolving Reinforcement Learning for Instruction Following

SEIF:用于指令跟随的自演化强化学习

Qingyu Ren, Qianyu He, Jiajie Zhu, Xingzhou Chen, Jingwen Chang, Zeye Sun, Han Xia, Fei Yu, Jiaqing Liang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(上海数据科学 key laboratory,计算机科学与人工智能学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学) Ant Group(蚂蚁集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEIF提出了一种自演化框架,通过闭环自我进化提升大语言模型的指令跟随能力,通过动态调整指令难度与模型能力相互促进,实验表明其在多模型规模上均有效提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21637 2026-05-11 cs.LG 70%

BoHA: Blockwise Hadamard Product Adaptation for Parameter-Efficient Fine-Tuning

BoHA:基于块状哈达玛积的参数高效微调

Feng Yu, Jia Hu, Geyong Min

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BoHA通过块状哈达玛积适配在参数受限下提升模型微调性能,保留初始任务表现,优于LoRA并在连续学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07324 2026-05-11 cs.CL cs.AI cs.CR cs.LG 67%

Activation Differences Reveal Backdoors: A Comparison of SAE Architectures

激活差异揭示后门:SAE架构的比较

Sachin Kumar

机构 * LexisNexis

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过对比稀疏自编码器架构,探讨如何通过激活差异检测语言模型中的后门,发现Diff-SAE在后门隔离中表现优于Crosscoders,且在不同层和微调策略下均有效。

Comments Accepted at IJCNN 2026 (IEEE WCCI). ©2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25380 2026-05-11 cs.CV 67%

Benchmarking and Improving GUI Agents in High-Dynamic Environments

在高动态环境中评估和改进GUI代理

Enqi Liu, Liyuan Pan, Zhi Gao, Yan Yang, Chenrui Shi, Yang Liu, Jingrong Wu, Qing Li

机构 * Beijing Institute of Technology(北京理工大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Yangtze Delta Region Academy of Beijing Institute of Technology(北京理工大学长江三角洲地区研究院) Australian National University(澳大利亚国立大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文提出DynamicGUIBench和DynamicUI,通过动态界面处理方法提升高动态GUI环境下的代理性能,同时保持其他基准测试的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏