arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 49 篇

2603.00089 2026-03-03 cs.CY 82%

Who Controls the Conversation? User Perspectives On Generative AI (LLM) System Prompts

谁控制对话?生成AI(LLM)系统提示的用户视角

Anna Neumann, Yulu Pi, Jatinder Singh

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文探讨用户对生成AI系统提示的认知与需求,旨在通过用户视角优化系统提示设计与治理实践。

Comments Accepted to CHI 2026 Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01973 2026-03-03 cs.CL cs.AI cs.SI 79%

CharacterFlywheel: Scaling Iterative Improvement of Engaging and Steerable LLMs in Production

CharacterFlywheel: 在生产环境中迭代改进社交聊天应用中吸引人且可操控的大型语言模型

Yixin Nie, Lin Guan, Zhongyao Ma, Anchit Gupta, Yipin Zhou, Xiao Li, Zhengping Zhou, Raymond Zeng, Gelin Zhou, Shigan Chu, Ajay Thampi, Wancen Mu, Nathan Shuster, Ketong Wang, Lin Chen, Jason Brewer, Derek Hao Hu, Alexander McCauley, Jason Weston, Sem Park, Na Zhang, Kevin Tang

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) OpenAI(开放人工智能研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 CharacterFlywheel通过迭代优化提升社交聊天应用中LLMs的参与度和可操控性,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01438 2026-03-03 cs.CL cs.AI 79%

Enhancing Persona Following at Decoding Time via Dynamic Importance Estimation for Role-Playing Agents

通过动态重要性估计增强解码时的个性跟随以用于角色扮演代理

Yuxin Liu, Mingye Zhu, Siyuan Liu, Bo Hu, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于理论的动态重要性估计方法,通过加权奖励引导解码提升角色扮演代理在动态场景中的个性跟随能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00540 2026-03-03 cs.AI 77%

LOGIGEN: Logic-Driven Generation of Verifiable Agentic Tasks

LOGIGEN: 逻辑驱动的可验证代理任务生成

Yucheng Zeng, Weipeng Lu, Linyun Liu, Shupeng Li, Zitian Qu, Chenghao Zhu, Shaofei Li, Zhengdong Tan, Mengyue Liu, Haotian Zhao, Zhe Zhou, Jianmin Wu

机构 * Baidu Inc.(百度公司) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 LOGIGEN通过逻辑驱动和验证训练生成可验证的复杂任务,提升代理在复杂环境中的任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01565 2026-03-03 eess.AS cs.SD 75%

Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation

探究基于扩散变压器的文本到音频生成中的群体相对策略优化

Yi Gu, Yanqing Liu, Chen Yang, Sheng Zhao

机构 * Tsinghua University(清华大学) Microsoft(微软)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文基于扩散变压器架构,利用群体相对策略优化提升文本到音频生成的保真度和提示遵循性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04281 2026-03-03 cs.CY cs.CR 75%

Prompt Injection Vulnerability of Consensus Generating Applications in Digital Democracy

共识生成应用在数字民主中的提示注入漏洞

Jairo Gudiño-Rosero, Clément Contet, Umberto Grandi, César A. Hidalgo

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究揭示了共识生成LLMs在数字民主中的提示注入漏洞,并提出鲁棒性方法以减少方向性失败。

Comments 33 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20089 2026-03-03 cs.CV cs.AI 74%

StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues

StructXLIP: 通过多模态结构线索增强视觉-语言模型

Zanxi Ruan, Songqun Gao, Qiuyu Kong, Yiming Wang, Marco Cristani

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01792 2026-03-03 cs.CL cs.AI 73%

ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs

ALTER: 用于LLM中基于令牌熵引导的不对称LoRA去学习

Xunlei Chen, Jinyu Guo, Yuang Li, Zhaokun Wang, Yi Gong, Jie Zou, Jiwei Wei, Wenhong Tian

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ALTER通过不对称LoRA架构实现基于令牌熵引导的LLM高效去学习,取得SOTA性能并保留高模型效用。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01651 2026-03-03 cs.CL cs.AI 73%

LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence

LexChronos:一个用于印度法理学中结构化事件时间线提取的代理框架

Anka Chandrahas Tummepalli, Preethu Rose Anish

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LexChronos通过双代理架构提取印度最高法院判决中的结构化事件时间线,提升法律文本理解和推理能力。

Comments Published in AILaw @ AAAI 2026 Conference

Journal ref AILaw @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01940 2026-03-03 cs.AI 70%

CoVe: Training Interactive Tool-Use Agents via Constraint-Guided Verification

CoVe:通过约束引导验证训练交互工具使用代理

Jinpeng Chen, Cheng Gong, Hanbo Li, Ziru Liu, Zichen Tian, Xinyu Fu, Shi Wu, Chenyang Zhang, Wu Zhang, Suiyun Zhang, Dandan Tu, Rui Liu

机构 * Huawei Research(华为研究)

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 CoVe通过约束引导验证方法有效提升交互式工具使用代理的训练数据合成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02643 2026-03-03 cs.AI 70%

AWARE-US: Preference-Aware Infeasibility Resolution in Tool-Calling Agents

AWARE-US: 工具调用代理中的偏好意识不可行性解决

Mehmet Kurmaz

机构 * Department of Computer Science University College London(计算机科学系伦敦大学学院)

专题命中 指令微调 :LLM(abstract);preference optimization(abstract);分类 cs.AI

AI总结 AWARE-US通过三种LLM方法解决工具调用代理中的不可行性问题,提升用户偏好一致性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06005 2026-03-03 cs.CL 70%

MASA: Rethinking the Representational Bottleneck in LoRA with Multi-A Shared Adaptation

MASA:重新思考LoRA中的表示瓶颈问题:多A共享适应

Qin Dong, Yuntian Tang, Heming Jia, Yunhang Shen, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Shaohui Lin, Rongrong Ji

机构 * East China Normal University(华东师范大学) Sanming University(三明大学) Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing of Ministry of Education of China, Xiamen University, China(中国教育部高效计算实验室,厦门大学,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MASA通过多A共享适应架构提升LoRA在多领域泛化和多任务推理中的表现,实现更高准确率

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21914 2026-03-03 cs.CL 70%

Rote Learning Considered Useful: Generalizing over Memorized Data in LLMs

机械记忆被视为有用的:在大语言模型中超越记忆数据

Qinyuan Wu, Soumi Das, Mahsa Amani, Bishwamittra Ghosh, Mohammad Aflah Khan, Krishna P. Gummadi, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德伦大学) UAR RC Trust(UAR RC信托)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出了一种两阶段框架,证明大语言模型可通过语义有意义的提示超越机械记忆数据,实现了有效的知识注入和潜在的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00720 2026-03-03 cs.LG 70%

MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search

MARS: 通过自适应排名搜索实现多模态收敛的统一

Minkyoung Cho, Insu Jang, Shuowei Jin, Zesen Zhao, Adityan Jothi, Ethem F. Can, Min-Hung Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。

Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12411 2026-03-03 cs.AI 70%

Detecting the Disturbance: A Nuanced View of Introspective Abilities in LLMs

检测干扰:对LLM中反思能力的细致审视

Ely Hahami, Ishaan Sinha, Lavik Jain, Josh Kaplan, Jon Hahami

机构 * Department of Computer Science, Harvard College, Cambridge, MA(哈佛学院计算机科学系) University of Chicago, Chicago, IL(芝加哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示LLM在特定任务中能部分检测内部状态扰动,但这种能力受限于模型层数,需进一步探索其机制。

Comments 7 pages (+ 4 pages for appendix), 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14894 2026-03-03 cs.CL 70%

SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs

SASFT:基于稀疏自编码器的监督微调以缓解大语言模型中的意外语言混合

Boyi Deng, Yu Wan, Baosong Yang, Fei Huang, Wenjie Wang, Fuli Feng

机构 * Tongyi Lab, Alibaba Group Inc(通义实验室,阿里巴巴集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SASFT通过稀疏自编码器引导监督微调,有效减少大语言模型中的意外语言混合,同时保持多语言能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01840 2026-03-03 cs.CV eess.IV 67%

FireRed-OCR Technical Report

FireRed-OCR 技术报告

Hao Wu, Haoran Lou, Xinyue Li, Zuodong Zhong, Zhaojun Sun, Phellon Chen, Xuanhe Zhou, Kai Zuo, Yibo Chen, Xu Tang, Yao Hu, Boxiang Zhou, Jian Wu, Yongji Wu, Wenxin Yu, Yingmiao Liu, Yuhao Huang, Manjie Xu, Gang Liu, Yidong Ma, Zhichao Sun, Changhao Qiao

机构 * Super Intelligence Team(超级智能团队) Xiaohongshu Inc(小红书公司)

专题命中 指令微调 :language model(abstract);SFT(abstract)

AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23348 2026-03-03 cs.RO cs.CV 67%

Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts

为拟合物体操纵的物理常识知识而引入分析概念

Jiude Wei, Yuxuan Li, Cewu Lu, Jianhua Sun

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13061 2026-03-03 cs.CL cs.AI cs.CV cs.LG 67%

Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection

鲁棒适应大规模多模态模型用于检索增强的仇恨表情包检测

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种鲁棒适应框架,用于提升大规模多模态模型在检索增强的仇恨表情包检测中的性能与泛化能力,同时提高模型的可解释性。

Comments EMNLP 2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09935 2026-03-03 cs.CV 67%

Precise Parameter Localization for Textual Generation in Diffusion Models

扩散模型中文本生成的精确参数定位

Łukasz Staniszewski, Bartosz Cywiński, Franziska Boenisch, Kamil Deja, Adam Dziedzic

机构 * Warsaw University of Technology(华沙技术大学) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) IDEAS NCBR

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 通过局部化扩散模型中负责文本生成的注意力层,提升文本生成效率和性能,同时防止生成有毒文本。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO 67%

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

专题命中 指令微调 :foundation model(abstract);SFT(abstract)

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04932 2026-03-03 cs.CV 67%

UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features

UniView: 通过统一参考特征从单张图像增强新颖视角合成

Haowang Cui, Rui Chen, Jiaze Wang, Tao Guo, Zheng Qin

机构 * Tianjin University(天津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 UniView通过统一参考特征提升单张图像新颖视角合成性能,采用检索增强系统和多模态大语言模型选择参考图像,并结合解耦三重注意力机制提高合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14362 2026-03-03 cs.CV 67%

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

DeepEyes: 通过强化学习激励'图像思考'

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 指令微调 :language model(abstract);SFT(abstract)

AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。

Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01714 2026-03-03 cs.LG cs.CL 62%

TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training

TopoCurate:基于交互拓扑的工具使用代理训练建模

Jinluan Yang, Yuxin Liu, Zhengyu Chen, Chengcheng Han, Yueqing Sun, Qi Gu, Hui Su, Xunliang Cai, Fei Wu, Kun Kuang

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.LG

AI总结 TopoCurate通过交互拓扑建模提升工具使用代理训练效果,采用双选择机制优化SFT和RL性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01224 2026-03-03 cs.CV cs.AI cs.HC cs.LG cs.RO 62%

Monocular 3D Object Position Estimation with VLMs for Human-Robot Interaction

单目3D物体位置估计用于人机交互的VLMs

Ari Wahl, Dorian Gawlinski, David Przewozny, Paul Chojecki, Felix Bießmann, Sebastian Bosse

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用VLMs通过单目RGB图像、自然语言输入和机器人状态估计3D物体位置,通过微调和条件路由技术提升预测性能,实现人机交互中的鲁棒预测。

Comments Accepted at Workshop on Integrating Image Processing with Large-Scale Language/Vision Models for Advanced Visual Understanding (LVLM) at IEEE International Conference on Image Processing (ICIP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01759 2026-03-03 cs.LG 57%

Meta-Learning Hyperparameters for Parameter Efficient Fine-Tuning

元学习超参数用于参数高效微调

Zichen Tian, Yaoyao Liu, Qianru Sun

机构 * Singapore Management University(新加坡管理大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 MetaPEFT通过元学习动态调整超参数,提升遥感图像微调的性能和尾部类别准确性。

Comments Accepted by CVPR 2025 (Highlight). Code is available at: https://github.com/doem97/metalora

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 23037-23047

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06158 2026-03-03 cs.AI 57%

PsyAgent: Constructing Human-like Agents Based on Psychological Modeling and Contextual Interaction

PsyAgent: 基于心理建模和情境交互构建类人代理

Zibin Meng, Kani Chen

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 PsyAgent通过心理建模和情境交互构建类人代理,结合特质-情境接口框架,提升稳定性和情境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00061 2026-03-03 cs.CR cs.LG 57%

The Hidden Costs of Domain Fine-Tuning: Pii-Bearing Data Degrades Safety and Increases Leakage

领域微调的隐性成本:包含个人身份信息的数据会削弱安全性和增加泄露

Jayesh Choudhari, Piyush Kumar Singh

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究揭示领域微调导致安全性和隐私泄露风险增加,包含PII数据加剧了有害合规和信息泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01450 2026-03-03 cs.CV 50%

Deepfake Forensics Adapter: A Dual-Stream Network for Generalizable Deepfake Detection

深度伪造取证适配器:一种通用深度伪造检测的双流网络

Jianfeng Liao, Yichen Wei, Raymond Chan Ching Bon, Shulan Wang, Kam-Pui Chow, Kwok-Yan Lam

机构 * Shenzhen Technology University(深圳技术大学) Singapore Institute of Technology(新加坡理工学院) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出深度伪造取证适配器,通过双流网络结合CLIP模型实现高效通用深度伪造检测。

Comments Accepted at ICDF2C 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01063 2026-03-03 cs.CV 50%

Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures

通过从失败中显式学习解锁VLA在自动驾驶中的潜力

Yuechen Luo, Qimao Chen, Fang Li, Shaoqing Xu, Jaxin Liu, Ziying Song, Zhi-xin Yang, Fuxi Wen

机构 * Tsinghua University(清华大学) University of Macau(澳门大学) Beijing Jiaotong University(北京交通大学)

专题命中 指令微调 :SFT(abstract)

AI总结 本文提出ELF-VLA框架,通过显式学习失败来提升自动驾驶中VLA模型的性能,实现关键场景的解决并取得SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏