arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-25 至 2026-02-25 共收录 207 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2602.03411 2026-02-25 cs.SE cs.CL 85%

SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training

SWE-Master:通过训练后技术释放软件工程代理的潜力

Huatong Song, Lisheng Huang, Shuang Sun, Jinhao Jiang, Ran Le, Daixuan Cheng, Guoxin Chen, Yiwen Hu, Zongchao Chen, Yiming Jia, Wayne Xin Zhao, Yang Song, Tao Zhang, Ji-Rong Wen

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);SFT(abstract);分类 cs.CL

AI总结 SWE-Master通过训练后技术提升软件工程代理能力,实现61.4%的解决率并优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04462 2026-02-25 cs.CL cs.CR cs.LG 81%

Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

水印会损害语言模型的对齐:分析与缓解

Apurv Verma, NhatHai Phan, Shubhendu Trivedi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现水印影响语言模型对齐,提出Alignment Resampling方法恢复对齐性能。

Comments Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)

Journal ref Transactions of Machine Learning Research 02/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20273 2026-02-25 cs.LG 77%

The Truthfulness Spectrum Hypothesis

真实性光谱假说

Zhuofan Josh Ying, Shauli Ravfogel, Nikolaus Kriegeskorte, Peter Hase

机构 * Department of Psychology, Zuckerman Mind Brain Behavior Institute, Columbia University, New York, NY(心理学系、Zuckerman mind brain behavior研究所、哥伦比亚大学、纽约NY) Department of Neuroscience, Columbia University, New York, NY(神经科学系、哥伦比亚大学、纽约NY) New York University, New York, NY(纽约大学、纽约NY) Stanford University, Stanford, CA(斯坦福大学、斯坦福CA)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究提出真实性光谱假说,通过评估不同真实性类型和领域特定方向,揭示了LLM表征空间中领域通用与特定方向共存的特性。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20728 2026-02-25 cs.AI 70%

Balancing Multiple Objectives in Urban Traffic Control with Reinforcement Learning from AI Feedback

在人工智能反馈中平衡城市交通控制的多个目标

Chenyang Zhao, Vinny Cahill, Ivana Dusparic

机构 * Trinity College Dublin(都柏林三一学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用人工智能反馈方法在城市交通控制中平衡多个目标,通过多目标自适应系统实现无需繁琐奖励工程的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20696 2026-02-25 cs.AI 70%

PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding

PromptCD:通过极性提示对比解码提升测试时行为

Baolong Bi, Yuyao Ge, Shenghua Liu, Yuchen He, Siqian Tong, Lizhe Chen, Lingrui Mei, Zehao Li, Yiwei Wang, Yujun Cai, Ming-Hsuan Yang, Xueqi Cheng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PromptCD通过极性提示对比解码在测试时提升LLM和VLM的行为一致性,实现无需额外训练的广泛增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20933 2026-02-25 cs.CV 50%

Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting

丢弃锚点与球面谐波用于稀疏视角高斯点扩散

Shuangkang Fang, I-Chao Shen, Xuanyang Zhang, Zesheng Wang, Yufeng Wang, Wenrui Ding, Gang Yu, Takeo Igarashi

机构 * Beihang University(北京航空航天大学) The University of Tokyo(东京大学) StepFun

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 DropAnSH-GS通过引入锚点机制和球面谐波系数的Dropout策略,有效缓解稀疏视角下3DGS的过拟合问题,提升模型鲁棒性与压缩能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 9 篇

2602.20515 2026-02-25 cs.AR 85%

FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill

FAST-Prefill:FPGA加速的长上下文LLM预填充稀疏注意力

Rakshith Jayanth, Viktor Prasanna

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 FAST-Prefill是首个基于FPGA的长上下文LLM预填充加速器,通过动态稀疏注意力技术提升计算效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20934 2026-02-25 cs.AI 77%

Architecting AgentOS: From Token-Level Context to Emergent System-Level Intelligence

构建AgentOS:从令牌级上下文到涌现的系统级智能

ChengYou Li, XiaoDong Liu, XiangBao Meng, XinYu Zhao

机构 * Yishu Research(亿舒研究) Fukuoka Institute of Technology(福冈技术学院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgentOS框架,通过重构LLM为推理内核,引入深度上下文管理和语义切片机制,旨在构建具备系统级智能的自主认知环境。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14044 2026-02-25 cs.CL 77%

Context Shapes LLMs Retrieval-Augmented Fact-Checking Effectiveness

上下文影响基于LLM的检索增强事实核查效果

Pietro Bernardelle, Stefano Civelli, Kevin Roitero, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了上下文对LLM检索增强事实核查效果的影响,发现上下文长度和证据位置显著影响验证准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14188 2026-02-25 cs.CL cs.AI cs.HC 76%

GPT-5 vs Other LLMs in Long Short-Context Performance

GPT-5与其他LLM在长短上下文性能中的比较

Nima Esmi, Maryam Nezhad-Moghaddam, Fatemeh Borhani, Asadollah Shahbahrami, Amin Daemdoost, Georgi Gaydadjiev

机构 * Bernoulli Institute RUG(伯努利研究所) ISRC, Khazar University(ISRC、哈扎尔大学) Department of Computer Engineering University of Guilan(计算机工程系、盖兰大学) QCE Department TU Delft(QCE部门、代尔夫特理工大学)

专题命中 长上下文与记忆 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文比较了GPT-5与其他LLM在长短上下文任务中的性能,发现GPT-5在高输入量下保持高精度,揭示了模型在复杂任务中的实际表现与理论能力之间的差距。

Comments 10 pages, 7 figures. Accepted for publication in the 3rd International Conference on Foundation and Large Language Models (FLLM2025). IEEE. The final version will be available in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20502 2026-02-25 cs.AI cs.LG 73%

ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory

ActionEngine: 通过状态机内存实现从响应式到程序化GUI代理的转变

Hongbin Zhong, Fazle Faisal, Luis França, Tanakorn Leesatapornwongsa, Adriana Szekeres, Kexin Rong, Suman Nath

机构 * Microsoft Research(微软研究院)

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ActionEngine通过状态机内存实现从响应式到程序化GUI代理的转变,提升效率和准确性,减少成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20751 2026-02-25 cs.CL cs.AI cs.LG 67%

SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing

SibylSense:通过记忆调优和对抗探测实现自适应评分标准学习

Yifei Xu, Guilherme Potje, Shivam Shandilya, Tiancheng Yuan, Leonardo de Oliveira Nunes, Rakshanda Agarwal, Saeid Asgari, Adam Atkinson, Emre Kıcıman, Songwu Lu, Ranveer Chandra, Tusher Chakraborty

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SibylSense通过记忆调优和对抗探测实现自适应评分标准学习,提升开放性任务下的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03475 2026-02-25 cs.LG 57%

ContextPilot: Fast Long-Context Inference via Context Reuse

ContextPilot: 通过上下文重用实现快速长上下文推断

Yinsicheng Jiang, Yeqi Huang, Liang Cheng, Cheng Deng, Xuan Sun, Luo Mai

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 ContextPilot通过引入上下文重用机制,显著提升长上下文推断效率,减少延迟并保持推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21053 2026-02-25 cs.CV 50%

OCR-Agent: Agentic OCR with Capability and Memory Reflection

OCR-Agent: 具有能力和记忆反思的代理OCR

Shimin Wen, Zeyu Zhang, Xingdou Bian, Hongjie Zhu, Lulu He, Layi Shama, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 长上下文与记忆 :language model(abstract)

AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20478 2026-02-25 cs.SE 50%

Codified Context: Infrastructure for AI Agents in a Complex Codebase

编译上下文:复杂代码库中AI代理的基础设施

Aristidis Vasilopoulos

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出了一种编译上下文基础设施,通过编码约定、领域专家代理和知识库,提升大规模多代理项目中的代码一致性与可靠性。

Comments 9 pages, 4 figures, companion repository: https://github.com/arisvas4/codified-context-infrastructure, code DOI: 10.5281/zenodo.18746623

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 36 篇

2505.11963 2026-02-25 cs.CR cs.AI 89%

MARVEL: Multi-Agent RTL Vulnerability Extraction using Large Language Models

MARVEL:基于大语言模型的多智能体RTL漏洞提取

Luca Collini, Baleegh Ahmad, Joey Ah-kiow, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MARVEL通过多智能体框架利用大语言模型,高效识别RTL代码中的安全漏洞,发现有效漏洞和警告,提升硬件安全验证效率。

Comments Submitted for Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04867 2026-02-25 cs.AI cs.HC cs.LG cs.RO 89%

Sensory-Motor Control with Large Language Models via Iterative Policy Refinement

通过迭代策略优化实现大语言模型的感官-运动控制

Jônata Tyska Carvalho, Stefano Nolfi

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学) Institute of Cognitive Sciences and Technologies (ISTC-CNR)(认知科学与技术研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG;LLM(comments)

AI总结 本文提出通过迭代策略优化,利用大语言模型控制具身代理,结合符号知识与子符号感官运动数据实现高效控制。

Comments Final version of the article accepted for publication on Scientific Reports. 29 pages (13 pages are from appendix), 8 figures, 2 tables, code for experiments replication and supplementary material provided at https://github.com/jtyska/llm-robotics-article/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20973 2026-02-25 cs.CL 88%

Linear Reasoning vs. Proof by Cases: Obstacles for Large Language Models in FOL Problem Solving

线性推理与证明中的反证法:大型语言模型在一阶逻辑问题解决中的障碍

Yuliang Ji, Fuchen Shen, Jian Wu, Qiujie Xie, Yue Zhang

机构 * Nanjing University of Science and Technology(南京理工大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出PC-FOL数据集,通过对比线性推理与基于情况的推理,揭示大型语言模型在FOL问题解决中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21161 2026-02-25 cs.RO 87%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 86%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20229 2026-02-25 cs.MA 85%

HieraMAS: Optimizing Intra-Node LLM Mixtures and Inter-Node Topology for Multi-Agent Systems

HieraMAS: 优化多智能体系统内的节点LLM混合与节点间拓扑

Tianjun Yao, Zhaoyi Li, Zhiqiang Shen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HieraMAS通过分层协作框架结合节点内LLM混合与节点间拓扑优化,提升多智能体系统性能与成本效率。

Comments 22 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02002 2026-02-25 cs.RO 85%

LLM-Driven Corrective Robot Operation Code Generation with Static Text-Based Simulation

基于大型语言模型的纠正性机器人操作代码生成与静态文本模拟

Wenhao Wang, Yi Rong, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of CIS, University of Massachusetts Dartmouth(大学马萨诸塞州达特茅斯分校计算机信息科学系) Department of CSIS, California State University San Marcos(加州州立大学桑马科斯分校计算机科学与信息系统系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于LLM的纠正性机器人操作代码生成框架,利用静态文本模拟提升代码生成的可靠性,无需依赖动态执行环境。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 85%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 推理与问题求解 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20528 2026-02-25 cs.CL cs.LG 84%

Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning

停止-思考-自动回归:结合潜在扩散规划的语言建模

Justin Lovelace, Christian Belardi, Sofian Zalouk, Adhitya Polavaram, Srivatsa Kundurthy, Kilian Q. Weinberger

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 STAR-LDM通过引入思考阶段的潜在扩散规划,实现了更高效的全局规划和生成,显著提升了语言理解和叙事连贯性任务的表现。

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20966 2026-02-25 cs.CL 83%

Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models

黑鸟语言矩阵:一种研究语言模型语言能力的框架

Paola Merlo, Chunyang Jiang, Giuseppe Samo, Vivi Nastase

机构 * Idiap Research Institute(Idiap研究机构) University of Geneva(日内瓦大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 黑鸟语言矩阵通过结构化数据集研究语言模型的语言能力与系统性模式识别

Comments Under review, 46 pages, 5 tables, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26314 2026-02-25 cs.CL 83%

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts

潜在思维优化:你的潜在推理语言模型秘密在潜在思维中编码了奖励信号

Hanwen Du, Yuxin Dong, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Department of Biomedical Informatics, The Ohio State University, USA(生物医学信息学系,俄亥俄州立大学) Translational Data Analytics Institute, The Ohio State University, USA(转化数据分析研究所,俄亥俄州立大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出LTO方法,通过潜在奖励模型优化LLMs的潜在推理过程,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20408 2026-02-25 cs.CY cs.AI cs.HC 83%

Examining and Addressing Barriers to Diversity in LLM-Generated Ideas

检验和解决大语言模型生成想法中的多样性障碍

Yuting Deng, Melanie Brucks, Olivier Toubia

机构 * Deng, Brucks, and Toubia(邓, 布鲁克斯和托比亚)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了LLM生成想法的多样性问题,通过四种研究发现,通过链式推理提示和普通人物提示可分别减少固定现象和改善知识分区,从而提升想法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21099 2026-02-25 cs.IR 82%

Turning Semantics into Topology: LLM-Driven Attribute Augmentation for Collaborative Filtering

将语义转化为拓扑:基于LLM的属性增强协同过滤

Junjie Meng, Ranxu zhang, Wei Wu, Rui Zhang, Chuan Qin, Qi Zhang, Qi Liu, Hui Xiong, Chao Wang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 基于LLM的属性增强协同过滤框架,通过拓扑连接性转换语义知识,提升协同过滤效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20794 2026-02-25 cs.CV 82%

VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving

VGGDrive: 通过跨视角几何 grounding 为自动驾驶赋能 Vision-Language 模型

Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Xiaomi EV(小米汽车)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract)

AI总结 VGGDrive通过引入跨视角几何 grounding 机制,提升Vision-Language模型在自动驾驶任务中的性能表现。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20330 2026-02-25 cs.CV cs.AI cs.LG 81%

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏