arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 213 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2602.22963 2026-02-27 cs.AI 70%

FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning

FactGuard:通过强化学习进行代理视频虚假信息检测

Zehao Li, Hongwei Yu, Hao Jiang, Qiang Sheng, Yilong Xu, Baolong Bi, Yang Li, Zhenlong Yuan, Yujun Cai, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) University of Science and Technology Beijing(北京科技大学) The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FactGuard通过强化学习和代理框架,提升视频虚假信息检测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22703 2026-02-27 cs.LG 70%

Enhancing Geometric Perception in VLMs via Translator-Guided Reinforcement Learning

通过翻译引导强化学习增强VLMs的几何感知

Hao Yu, Shuning Jia, Guanghao Li, Wenhao Jiang, Chun Yuan

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.LG

AI总结 通过翻译引导强化学习提升VLMs的几何感知能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22072 2026-02-27 cs.CL 70%

Fine-tuning Done Right in Model Editing

在模型编辑中正确进行微调

Wanli Yang, Rui Tang, Hongyu Zang, Du Su, Qi Cao, Jingang Wang, Huawei Shen, Xueqi Cheng, Fei Sun

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室、计算技术研究所、中国科学院大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LocFT-BF方法,通过恢复微调的广度优先管道并改进调参策略,在模型编辑中显著提升了效果,实现了大规模编辑任务的高效处理。

Comments Accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22462 2026-02-27 cs.CV cs.IR 69%

MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation

MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成

Raiyan Jahangir, Nafiz Imtiaz Khan, Amritanand Sudheerkumar, Vladimir Filkov

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 指令微调 :prompting(abstract,comments);language model(abstract)

AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。

Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15464 2026-02-27 cs.LG cs.AI stat.ML 62%

Learning to Answer from Correct Demonstrations

从正确示范中学习回答

Nirmit Joshi, Gene Li, Siddharth Bhandari, Shiva Prasad Kasiviswanathan, Cong Ma, Nathan Srebro

机构 * Toyota Technological Institute at Chicago(芝加哥技术学院) Amazon(亚马逊) University of Chicago(芝加哥大学)

专题命中 指令微调 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于上下文老虎机的模仿学习方法,通过离线示范学习回答问题,无需显式奖励,样本复杂度与奖励类基数对数成正比,能处理任意自适应示范。

Comments Generalized some results. Updated the presentation in light of an important related work of Syed and Schapire. Improved discussions. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23339 2026-02-27 cs.CV 50%

Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?

检索与分割:在开放词汇分割中,几个示例是否足以弥合监督差距?

Tilemachos Aravanis, Vladan Stojnić, Bill Psomas, Nikos Komodakis, Giorgos Tolias

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种基于检索增强的测试时间适配器,通过融合文本和视觉支持特征来实现开放词汇分割,有效缩小了零样本与监督分割间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 8 篇

2602.22718 2026-02-27 cs.AI cs.DC 89%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 88%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12522 2026-02-27 cs.CL cs.AI 88%

Evaluating the Diversity and Quality of LLM Generated Content

评估大型语言模型生成内容的多样性和质量

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) UC Berkeley(伯克利大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出有效语义多样性测量框架,发现偏好微调模型在质量阈值下具有更高多样性,且小模型在固定预算内更高效生成独特内容。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21585 2026-02-27 cs.LG cs.AI cs.CL stat.ML 82%

Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences

Duel-Evolve:通过LLM自我偏好实现无奖励的测试时间扩展

Sweta Karlekar, Carolina Zheng, Magnus Saebo, Nicolas Beltran-Velez, Shuyang Yu, John Bowlan, Michal Kucer, David Blei

机构 * Columbia University(哥伦比亚大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Duel-Evolve通过LLM自我偏好实现无奖励的测试时间优化,提升MathBench和LiveCodeBench的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 79%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :preference optimization(title);foundation model(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16434 2026-02-27 cs.RO 78%

From Prompts to Printable Models: Support-Effective 3D Generation via Offset Direct Preference Optimization

从提示到可打印模型:通过偏移直接偏好优化实现支持有效的3D生成

Chenming Wu, Xiaofan Li, Chengkai Dai

机构 * Axiswise Ltd.(Axiswise有限公司) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 SEG通过偏移直接偏好优化实现支持有效的3D生成,显著减少支撑材料使用并提升打印可制造性。

Comments Accepted by IEEE Robotics and Automation Letters 2026, preprint version by authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22426 2026-02-27 cs.CV cs.LG 70%

SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read

SimpleOCR: 将可视化问题呈现以教导大语言模型阅读

Yibo Peng, Peng Xia, Ding Zhong, Kaide Zeng, Siwei Han, Yiyang Zhou, Jiaqi Liu, Ruiyi Zhang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SimpleOCR通过强制模型视觉参与,解决多模态大语言模型在图像中阅读文本的性能问题,提升模型的视觉文本提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22226 2026-02-27 cs.IR cs.LG 57%

SEGB: Self-Evolved Generative Bidding with Local Autoregressive Diffusion

SEGB: 自适应生成性竞价与局部自回归扩散

Yulong Gao, Wan Jiang, Mingzhe Cao, Xuepu Wang, Zeyu Pan, Haonan Yang, Ye Liu, Xin Yang

机构 * Beijing China(中国北京)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 SEGB通过自适应生成性竞价与局部自回归扩散,实现动态市场中的高效竞价策略,显著提升广告效果与商业价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 5 篇

2602.22402 2026-02-27 cs.SE cs.AI cs.HC cs.OS 86%

Contextual Memory Virtualisation: DAG-Based State Management and Structurally Lossless Trimming for LLM Agents

上下文记忆虚拟化:基于DAG的状态管理和结构无损修剪用于LLM代理

Cosmo Santoni

机构 * Imperial College London(伦敦帝国学院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 上下文记忆虚拟化通过DAG结构管理和无损修剪技术,提升LLM代理在长期推理任务中的上下文重用效率和经济性。

Comments 11 pages. 6 figures. Introduces a DAG-based state management system for LLM agents. Evaluation on 76 coding sessions shows up to 86% token reduction (mean 20%) while remaining economically viable under prompt caching. Includes reference implementation for Claude Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12064 2026-02-27 cs.NI 82%

GeoPipe: a Geo-distributed LLM Training Framework with enhanced Pipeline Parallelism in a Lossless RDMA-enabled Datacenter Optical Transport Network

GeoPipe:一种具有增强流水线并行性的地理分布式LLM训练框架,在无损RDMA启用的数据中心光传送网络中

Jun Dai, Xiaorun Wang, Kexiong Fang, Zheng Yang, Yuefeng Ji, Jiawei Zhang

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract)

AI总结 GeoPipe提出了一种基于无损RDMA的数据中心光传送网络的地理分布式LLM训练框架,通过增强的流水线并行技术显著降低计算气泡比率。

Comments 6 pages, 4 figures

Journal ref 2025 Asia Communications and Photonics Conference (ACP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11094 2026-02-27 cs.NI 75%

SHIFT: Exploring the Boundary of RDMA Network Fault Tolerance

SHIFT:探索RDMA网络容错的边界

Shengkai Lin, Kairui Zhou, Hongtao Zhang, Yibo Wu, Yi Pan, Yihan Yang, Qinwei Yang, Wei Zhang, Arvind Krishnamurthy, Shizhen Zhao

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SHIFT通过用户空间RDMA层实现跨NIC容错,保持正确内存语义,有效应对NIC故障和链路异常,减少训练重启成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10585 2026-02-27 cs.GR 67%

D3MAS: Decompose, Deduce, and Distribute for Enhanced Knowledge Sharing in Multi-Agent Systems

D3MAS:分解、推断与分配以增强多智能体系统中的知识共享

Heng Zhang, Yuling Shi, Xiaodong Gu, Haochen You, Zijian Zhang, Lubin Gan, Yilei Yuan, Jin Huang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 D3MAS通过分层协调框架减少多智能体系统中的知识冗余,提升推理准确性。

Comments This submission has been withdrawn by the authors due to a fundamental error in the methodology that affects the validity of the main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22406 2026-02-27 cs.AI 57%

Towards Autonomous Memory Agents

朝向自主记忆代理

Xinle Wu, Rui Zhang, Mustafa Anis Hussain, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 U-Mem通过自主获取、验证和整理知识的方法,在记忆代理领域实现了优于现有基线和强化学习优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 22 篇

2507.14398 2026-02-27 cs.NI 90%

NetIntent: Leveraging Large Language Models for End-to-End Intent-Based SDN Automation

NetIntent: 利用大语言模型实现基于意图的SDN自动化

Md. Kamrul Hossain, Walid Aljoby

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 NetIntent利用大语言模型实现基于意图的SDN自动化,提供统一框架以完成完整的IBN生命周期,包括翻译、激活和保证,并通过实验验证其在SDN控制器中的有效性。

Journal ref IEEE Open Journal of the Communications Society, vol. 6, pp. 10512-10541, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22698 2026-02-27 cs.CL cs.AI 90%

Tokenization, Fusion and Decoupling: Bridging the Granularity Mismatch Between Large Language Models and Knowledge Graphs

分词、融合与解耦:弥合大语言模型与知识图谱之间的粒度不匹配

Siyue Su, Jian Yang, Bo Li, Guanglin Niu

机构 * Beihang University(北航大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 KGT通过专门的实体token分词、融合预训练特征及解耦预测,有效弥合大语言模型与知识图谱间的粒度不匹配,提升知识图谱补全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22280 2026-02-27 cs.LG cs.AI 90%

Integrating Machine Learning Ensembles and Large Language Models for Heart Disease Prediction Using Voting Fusion

将机器学习集成与大型语言模型结合用于心脏病预测的投票融合

Md. Tahsin Amin, Tanim Ahmmod, Zannatul Ferdus, Talukder Naemul Hasan Naem, Ehsanul Ferdous, Arpita Bhattacharjee, Ishmam Ahmed Solaiman, Nahiyan Bin Noor

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过结合机器学习集成与大型语言模型的投票融合方法,提高了心脏病预测的准确性与可靠性。

Comments 7 pages, 8 figures, (Accepted at a peer-reviewed conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23079 2026-02-27 cs.CL cs.CR cs.LG 86%

Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent

通过风格学辅助LLM代理评估去匿名化风险

Boyang Zhang, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SLA方法,通过风格学与LLM推理结合,评估和缓解文本去匿名化风险,实验表明其在各类场景中具有高推断准确性,并提出引导重组成策略以降低作者身份可识别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22546 2026-02-27 cs.AI 85%

Requesting Expert Reasoning: Augmenting LLM Agents with Learned Collaborative Intervention

请求专家推理:通过学习的协作干预增强LLM代理

Zhiming Wang, Jinwei He, Feng Lu

机构 * State Key Laboratory of VR Technology and Systems, School of CSE, Beihang University(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过学习协作干预框架,提升LLM代理在需要专家推理任务中的表现,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21670 2026-02-27 cs.RO cs.AI cs.MA 85%

Hierarchical LLM-Based Multi-Agent Framework with Prompt Optimization for Multi-Robot Task Planning

分层基于大语言模型的多智能体框架与提示优化用于多机器人任务规划

Tomoya Kawabe, Rin Takano

机构 * Data Science Laboratories, NEC Corporation(日本电气株式会社数据科学实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种分层多智能体框架,结合提示优化提升多机器人任务规划的准确性和效率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23220 2026-02-27 cs.DC 85%

STELLAR: Storage Tuning Engine Leveraging LLM Autonomous Reasoning for High Performance Parallel File Systems

STELLAR:利用LLM自主推理的存储调优引擎用于高性能并行文件系统

Chris Egersdoerfer, Philip Carns, Shane Snyder, Robert Ross, Dong Dai

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 STELLAR利用LLM自主推理实现高性能并行文件系统的存储调优,通过多代理设计和检索增强生成技术提升调优效率与准确性。

Comments Published in the Proceedings of the 2025 International Conference for High Performance Computing, Networking, Storage, and Analysis (SC25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22871 2026-02-27 cs.CL cs.AI 84%

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

通过奖励引导缝合实现扩散语言模型的测试时扩展

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

机构 * Huawei London Research Center(华为伦敦研究中心) MVP Lab(MVP实验室)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过奖励引导缝合实现扩散语言模型的测试时扩展,提升数学和编程任务的准确率并降低延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23193 2026-02-27 cs.AI 83%

ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering

基于大语言模型的自主代理的事件溯源:ESAA

Elzo Brito dos Santos Filho

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ESAA架构通过事件溯源技术提升自主代理在软件工程中的状态管理和任务执行能力,支持多代理并发调度和异构LLM的协同工作。

Comments 13 pages, 1 figure, 4 tables. Includes 5 technical appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19128 2026-02-27 cs.AI 83%

K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model

K-Search: 通过共进化内在世界模型生成LLM内核

Shiyi Cao, Ziming Mao, Joseph E. Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22828 2026-02-27 cs.CL cs.AI 82%

TCM-DiffRAG: Personalized Syndrome Differentiation Reasoning Method for Traditional Chinese Medicine based on Knowledge Graph and Chain of Thought

基于知识图谱和推理链的TCM-DiffRAG:一种用于传统中医个性化辨证的推理方法

Jianmin Li, Ying Chang, Su-Kit Tang, Yujia Liu, Yanwen Wang, Shuyuan Lin, Binkai Ou

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 TCM-DiffRAG结合知识图谱与推理链,提升中医个性化诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏