arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 849 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 83 篇

2606.01873 2026-06-02 cs.LG 81%

G2LoRA: Gradient Orthogonal Low-Rank Adaptation Framework for Graph Continual Learning on Text-Attributed Graphs

G2LoRA: 面向文本属性图的梯度正交低秩自适应框架用于图持续学习

Yuhan Wang, Yibo Ding, Yutong Ye, Mufan Zhao, Wenbo Zhang, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 针对LLM-as-Aligner模型在文本属性图持续学习中的灾难性遗忘问题,提出G2LoRA框架,通过统一图-文本对齐目标、类别感知梯度投影和梯度幅度调制,实现任务间正向迁移并缓解模态漂移。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01022 2026-06-02 cs.CV cs.AI 81%

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00686 2026-06-02 cs.LG 81%

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

对齐的辩证法:利用不安全知识实现动态安全路由

Maryam Hashemzadeh, Jerry Huang, Minseon Kim, Marc-Alexandre Côté, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SafeMoE框架,通过混合专家模型将不安全知识隔离到领域特定的低秩适配器中,并训练轻量级门控网络动态路由这些专家,在保持安全性的同时生成信息丰富的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26436 2026-06-02 cs.CL cs.AI 81%

Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models

目标重掩码:在离散扩散语言模型中将令牌编辑替换为令牌到掩码的精炼

Lin Yao

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对离散掩码扩散语言模型中令牌编辑机制的局限性,提出无训练的令牌到掩码重掩码方法,通过将疑似错误令牌重置为掩码状态,利用扩散过程在更干净上下文中重新预测,显著提升数学等任务的性能。

Comments This paper has been significantly revised, expanded, and superseded by a more comprehensive version available at arXiv:2604.18738. The authors have chosen to withdraw this version to avoid overlap and direct readers to the updated work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00915 2026-06-02 physics.optics 80%

Autonomous agentic design for photonics

光子学的自主智能体设计

Prashanta Kharel, Amin Khavasi, Xinzhong Chen, Tyler W. Hughes

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于大型语言模型的自主智能体方法,通过自动设计循环(提出、模拟、评估、迭代)实现光子器件的高性能设计,并成功应用于无源、有源、射频及芯片布局四类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29287 2026-06-02 cs.IR cs.CV 80%

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote: 一种用于多模态表示和排序的统一嵌入模型

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

机构 * Xiaohongshu Beijing China(小红书北京中国) Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出UniNote统一嵌入模型,通过两阶段训练(对比SFT和强化学习)解决工业级Item-to-Item检索中全局表示与局部检索的平衡、解耦流水线效率及精度-延迟权衡问题,在小红书部署后显著提升检索质量和成本效率。

Comments Accepted by KDD Ads Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 80%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 80%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);preference optimization(abstract)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01734 2026-06-02 cs.CV cs.LG cs.RO 79%

FlatVPR: Plug-and-play Geo-linear Residual Adapter for Geometric Rectification of Foundation Model Feature Manifolds

FlatVPR: 用于基础模型特征流形几何校正的即插即用地线性残差适配器

Rai Hisada, Kanji Tanaka

机构 * Fundamental Engineering for Knowledge-Based Society, Graduate School of Engineering, University of Fukui(知识社会基础工程,工程研究生院,福井大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出FlatVPR范式,通过可学习残差适配器和Pullback Flatness Loss抑制特征流形曲率,实现稀疏锚点下的线性插值重建,在NCLT数据集上显著提升视觉位置识别精度。

Comments 5 pages, 1 figure, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06033 2026-06-02 cs.LG 79%

Can Vision Language Models Learn Intuitive Physics from Interaction?

视觉语言模型能否从交互中学习直观物理?

Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 研究通过强化学习与环境交互训练视觉语言模型,发现交互学习能提升任务内性能,但无法产生可泛化的物理直觉。

Comments Updated accepted version for ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06163 2026-06-02 eess.IV cs.CV cs.LG physics.med-ph 79%

Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation

基于低秩适应的3D卷积基础模型跨模态微调用于ADHD分类

Jyun-Ping Kao, Shinyeong Rho, Shahar Lazarev, Hyun-Hae Cho, Fangxu Xing, Taehoon Shin, C. -C. Jay Kuo, Jonghye Woo

机构 * National Institute of Mental Health, National Institutes of Health(国家精神卫生研究所,国立卫生研究院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出一种参数高效的迁移学习方法,通过3D低秩适应(LoRA)将预训练于CT图像的3D卷积基础模型微调至MRI的ADHD分类任务,在公开扩散MRI数据集上达到71.9%准确率和0.716 AUC,仅需164万可训练参数。

Comments Accepted for presentation at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30280 2026-06-02 cs.RO cs.AI cs.CL 79%

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qwen-VLA:统一跨任务、环境和机器人形态的视觉-语言-动作建模

Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lü, Zhibo Yang, Tao Yu, Xionghui Chen

机构 * Qwen Team(通义实验室)

专题命中 指令微调 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出Qwen-VLA,一种基于DiT动作解码器的统一具身基础模型,通过大规模联合预训练和具身感知提示,将操作、导航和轨迹预测统一为动作-轨迹预测框架,实现跨任务、环境和机器人形态的泛化。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23197 2026-06-02 cs.CL cs.LG stat.ML 79%

Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models

微调不忘上下文学习:线性注意力模型的理论分析

Chungpa Lee, Jy-yong Sohn, Kangwook Lee

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文通过线性注意力模型理论分析,揭示了微调目标如何修改注意力参数并导致少样本性能下降的条件,提出仅更新值矩阵可保持上下文学习能力。

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01967 2026-06-02 cs.CL 77%

Training Prompt Matters: State-Adaptive Optimization for Robust Fine-Tuning

训练提示至关重要:面向鲁棒微调的状态自适应优化

Wenhang Shi, Yiren Chen, Shuqing Bian, Zhe Zhao, Jinhao Dong, Pengfei Hu, Wei Lu, Xiaoyong Du

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出状态自适应提示优化(SAPO)策略,通过将任务公式从静态输入转变为动态状态自适应变量,有效缓解灾难性遗忘并提升泛化能力,在多个基准上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10014 2026-06-02 cs.LG stat.ML 77%

A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula

一种以任务为中心的迭代自改进理论,采用由易到难的课程

Chenruo Liu, Yijun Dong, Yiqiu Shen, Qi Lei

机构 * New York University(纽约大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过将自改进建模为基于奖励过滤分布的最大似然微调,推导了期望奖励的有限样本保证,并证明了在推理任务中由易到难的课程比固定任务混合训练具有更好的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03318 2026-06-02 cs.CL 77%

MIRROR: A Multi-Agent Framework with Iterative Adaptive Revision and Hierarchical Retrieval for Optimization Modeling in Operations Research

MIRROR: 一种用于运筹学优化建模的具有迭代自适应修正与分层检索的多智能体框架

Yifan Shi, Jiayi Wang, Minyi Wu, Ye Fan, Jialong Shi, Jianyong Sun

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 提出一种免微调的多智能体框架MIRROR,通过执行驱动的迭代自适应修正和分层检索机制,将自然语言优化问题直接转化为数学模型和求解器代码,在标准运筹学基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11056 2026-06-02 eess.SY cs.LG cs.SY 77%

BERT4beam: Large AI Model Enabled Generalized Beamforming Optimization

BERT4beam: 大型AI模型实现通用波束赋形优化

Yuhang Li, Yang Lu, Wei Chen, Bo Ai, Zhiguo Ding

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology(计算机科学与技术学院) School of Electronics and Information Engineering(电子与信息工程学院) School of Electrical and Electronic Engineering (EEE)(电子与电气工程学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于BERT的框架BERT4beam,将波束赋形优化转化为token级序列学习任务,通过预训练和微调实现单任务与多任务优化,在不同用户规模、系统效用和天线配置下均能接近最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00544 2026-06-02 cs.LG cs.CL 76%

Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

逃离模式抽彩:多响应训练提升语言模型泛化能力

Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 指令微调 :language model(title);分类 cs.CL、cs.LG

AI总结 本文提出多响应训练(MRT)方法,通过保留每个提示的多个有效响应来缓解传统单响应微调导致的“模式抽彩”问题,并从统计角度揭示了其提升分布泛化的原理和适用条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00155 2026-06-02 cs.CR cs.AI 76%

A Protocol-Language Model for Network Intrusion (Without Deep Packet Inspection)

一种用于网络入侵的协议语言模型(无需深度包检测)

Vivek Kumar Sharma

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 指令微调 :language model(title,comments);分类 cs.AI

AI总结 提出PLM-NIDS,利用RWKV-4状态空间模型将网络流作为语言处理,仅基于L3/L4包元数据检测攻击,无需深度包检测,实现零样本异常检测(PR-AUC=0.93)和加密协议透明处理。

Comments 20 pages Research paper on Packet Language Models for Network Intrusion Detection Systems(Without Deep Packet Inspection).Code available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01386 2026-06-02 cs.AI cs.CL cs.DC cs.LG 75%

GuidaPA: Privacy-Preserving Chatbot for Public Administration via Federated Learning

GuidaPA: 通过联邦学习为公共行政提供隐私保护的聊天机器人

Daniel M. Jimenez-Gutierrez, Albenzio Cirillo, Raffaele Nicolussi, Alessio Beltrame, Andrea Vitaletti

机构 * University of Bologna(博洛尼亚大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GuidaPA,一个基于联邦学习(FL)在意大利公共行政文档上训练的隐私保护聊天机器人,通过参数高效的联邦微调(QLoRA)和角色访问控制,在保持数据本地化的同时实现了接近集中式微调的答案质量。

Comments Accepted to the 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01695 2026-06-02 cs.LG 74%

CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models

CANARY: 语言模型中微调污染的无标签检测

Swapnil Parekh

机构 * Switzerland(瑞士)

专题命中 指令微调 :language model(title);分类 cs.LG

AI总结 提出CANARY方法,通过稀疏自编码器分析隐藏状态差异,在无标签情况下检测微调数据污染,实现1%污染率下AUROC=1.000,并支持检测、验证、优先排序和修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01080 2026-06-02 cs.LG cs.AI 73%

ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks

ThinkSwitch:基于LoRA和权重插值的上下文蒸馏用于特定目的推理任务

Dhruv Saini, Rohan Pandey

机构 * bellevue High School(贝尔维尤高中) DigitalOcean

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ThinkSwitch方法,通过QLoRA蒸馏和球面权重插值协同训练指令模型和思考模型,在AIME 2026和PubMedQA上分别提升指令模型10/30→20/30和13/30→18/30,思考模型14/30→22/30和18/30→25/30,仅需15个训练提示和$2.86成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00257 2026-06-02 cs.LG cs.AI 73%

ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate

ARCA: 当令牌信号退化时的适配器-残差信用分配

Rodney Lafuente-Mercado

机构 * Rodney Lafuente-Mercado(罗伊德·拉福恩特-默茨)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对LoRA微调下令牌级信用分配信号退化的问题,提出ARCA方法,利用适配器隐藏状态残差作为令牌显著性度量,无需学习奖励模型或价值头。

Comments Accepted to DEMO 2026: ICML Workshop on Decision-Making from Offline Datasets to Online Adaptation. Non-archival report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00147 2026-06-02 cs.LG cs.AI 73%

RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting

RAFT:用于缓解遗忘的领域微调的数据精炼与自适应蒸馏

Yuduo Li, Xiaofeng Shi, Qian Kou, Longbin Yu, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Beijing Jiaotong University (BJTU)(北京交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出RAFT框架,通过数据精炼(自条件重写、语义过滤、答案融合)和答案条件在线蒸馏(top-K温度蒸馏、EMA自适应损失平衡)来解决领域微调中的监督兼容性差距和轨迹保持差距,在提升领域性能的同时缓解通用能力退化。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00132 2026-06-02 cs.LG cs.AI 73%

Foundation-Preserving Adaptation via Generalized Rayleigh-Quotient Optimization

基于广义瑞利商优化的基础模型保留适配

Dongjun Kim, Adrian de Wynter, Huancheng Chen, Heasung Kim, Haris Vikalo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软) Microsoft AI(微软人工智能) Meta

专题命中 指令微调 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出FoLoRA框架,通过广义瑞利商优化更新方向,在微调中平衡下游任务性能与预训练能力保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27835 2026-06-02 cs.LG cs.CL 73%

CAREF: Calibration-Aware Regularization for Explanation Faithfulness Without Rationale Supervision

CAREF: 面向解释忠实性的校准感知正则化,无需理由监督

Naphat Nithisopa, Teerapong Panboonyuen

机构 * MARSAIL Chulalongkorn University(朱拉隆梭大学) PBYAIL (Panboonyuen AI Lab)(PBYAIL(Panboonyuen人工智能实验室))

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出CAREF框架,通过校准感知正则化联合优化预测准确性和解释忠实性,无需理由监督,在四个NLE基准上以少量可训练参数取得最佳性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11177 2026-06-02 cs.CL cs.AI 73%

What Do LLMs Know About Alzheimer's Disease? Multi-loss Fine-Tuning and Probing for AD Detection

LLMs 对阿尔茨海默病了解多少?用于 AD 检测的多损失微调和探针分析

Lei Jiang, Yue Zhou, Natalie Parde

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多损失微调 BERT、T5 和 Llama-1B 模型,在三个语料库上实现文本 AD 检测新 SOTA,并利用线性探针分析内部表征中 AD 相关信息的编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09492 2026-06-02 cs.LG cs.AI 73%

Beware of the Batch Size: Hyperparameter Bias in Evaluating LoRA

当心批量大小:评估 LoRA 中的超参数偏差

Sangyoon Lee, Jaeho Lee

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学(POSTECH))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现批量大小是导致 LoRA 变体性能矛盾的关键因素,提出基于代理的高效调优策略,将批量大小提升为一阶设计参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08868 2026-06-02 cs.LG cs.AI 73%

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力

Junru Zhang, Lang Feng, Haoran Shi, Xu Guo, Han Yu, Yabo Dong, Duanqing Xu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02001 2026-06-02 cs.CL 70%

Scaling Agentic Capabilities via Grounded Interaction Synthesis

通过基于交互合成扩展智能体能力

Wenhang Shi, Jinhao Dong, Yiren Chen, Zhe Zhao, Shuqing Bian, Wei Lu, Xiaoyong Du

机构 * Renmin University of China(中国人民大学) Peking University(北京大学) Tencent(腾讯)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GAIS框架,通过两阶段接地机制(协议锚定环境和结构引导规划)自动生成多样化的环境和复杂任务,显著提升智能体在BFCL、τ²-Bench和ACEBench上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏