arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-23 至 2026-03-23 共收录 187 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2603.19532 2026-03-23 cs.CL cs.IR cs.LG 84%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19335 2026-03-23 cs.LG cs.AI 81%

Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions

训练后算法真的不同吗?跨模型规模的受控研究揭示了规模依赖的排名倒置

Xiaoyi Li

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过跨模型规模的受控研究,揭示了训练后算法在不同规模下的稳定性差异、损失函数修改的微小收益以及算法利用的任务依赖性,为算法选择提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19665 2026-03-23 cs.IR 67%

GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce

GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索

Zhouwei Zhai, Min Yang, Jin Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09814 2026-03-23 cs.CV 67%

DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision

DreamCS: 基于几何感知的文本到3D生成与无配对3D奖励监督

Xiandong Zou, Ruihao Xia, Hongsong Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) East China University of Science and Technology(东华大学) Southeast University(东南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出DreamCS框架,通过无配对3D-MeshPref数据训练奖励模型,提升文本到3D生成的几何准确性和人类偏好对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO 50%

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV 50%

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 7 篇

2603.19935 2026-03-23 cs.LG 85%

Memori: A Persistent Memory Layer for Efficient, Context-Aware LLM Agents

Memori:一种高效的、基于上下文的LLM代理持久内存层

Luiz C. Borro, Luiz A. B. Macarini, Gordon Tindall, Michael Montero, Adam B. Struck

机构 * Memori Labs Inc.(Memori实验室)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Memori通过结构化表示替代大上下文窗口,实现高效、低成本的LLM代理部署,准确率达81.95%。

Comments 9 pages; 2 figures; white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19584 2026-03-23 cs.AI cs.SY eess.SY 85%

PowerLens: Taming LLM Agents for Safe and Personalized Mobile Power Management

PowerLens:利用大语言模型安全且个性化地管理移动设备电源

Xingyu Feng, Chang Sun, Yuzhu Wang, Zhangbing Zhou, Chengwen Luo, Zhuangzhuang Chen, Xiaomin Ouyang, Huanqi Yang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Shenzhen University(深圳大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PowerLens通过利用大语言模型的常识推理,实现安全且个性化的移动电源管理。系统通过用户活动与系统参数之间的语义桥梁,生成适应个人偏好的零样本策略,通过隐式反馈学习用户偏好,无需显式配置,3-5天内收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19469 2026-03-23 cs.CR cs.AI 79%

A Framework for Formalizing LLM Agent Security

一个形式化大语言模型代理安全性的框架

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Neil Gong, Chenguang Wang, Dawn Song

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) Duke University(杜克大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一个框架,从情境安全角度系统化现有攻击与防御,定义四个安全属性并引入Oracle函数验证,重新定义攻击和防御,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19272 2026-03-23 cs.CL cs.AI cs.CV cs.LG 75%

Transformers are Stateless Differentiable Neural Computers

Transformer 是无状态可微神经计算机

Bo Tang, Weiwei Xie

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文证明因果Transformer层等同于无状态可微神经计算机(sDNC),并扩展到交叉注意力,为Transformer提供统一的记忆中心解释。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20105 2026-03-23 cs.LG cs.AI 73%

The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus

LLMs的Y-组合子:解决长上下文旋转问题的λ演算

Amartya Roy, Rasul Tutunov, Xiaotong Ji, Matthieu Zimmer, Haitham Bou-Ammar

机构 * The School of Interdisciplinary Research(跨学科研究学院) Indian Institute of Technology (IIT) Delhi(印度理工学院德里分校) Robert Bosch GmbH, India(德国罗伯特·博世有限公司,印度) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Noah’s Ark UCL Centre for Artificial Intelligence(华为诺亚方舟大学伦敦人工智能中心)

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出λ-RLM框架,通过类型化的功能运行时替代自由递归代码生成,提升长上下文推理的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19571 2026-03-23 cs.CV 67%

CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

CurveStream: 通过曲率感知的层次视觉记忆管理提升MLLMs在流媒体视频理解中的性能

Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 CurveStream通过曲率感知的层次视觉记忆管理框架,在流媒体视频理解中实现显著性能提升,实验表明其在多个基准测试中均优于现有方法,达到新状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19481 2026-03-23 cs.CV 67%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 37 篇

2603.19257 2026-03-23 cs.CL 89%

Constraint-aware Path Planning from Natural Language Instructions Using Large Language Models

基于自然语言指令的约束感知路径规划:利用大语言模型

Dylan Shim, Minghan Wei

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型解决带约束的路径规划问题,通过自然语言输入进行问题匹配和自推断,实现灵活且可扩展的解决方案。

Comments Accepted by 2026 SPIE Security + Defense Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19558 2026-03-23 cs.CL 88%

TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?

TextReasoningBench: 推理是否真的能提升大语言模型中的文本分类性能?

Xinyu Guo, Yazhou Zhang, Jing Qin

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Nursing, The Hong Kong Polytechnic University(香港理工大学护理学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过TextReasoningBench评估推理策略在文本分类中的有效性与效率,发现推理并非总能提升性能,且多数策略效率低下。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19515 2026-03-23 cs.AI 88%

ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models

ItinBench:利用大语言模型在多个认知维度上进行规划的基准测试

Tianlong Wang, Pinqiao Wang, Weili Shi, Sheng li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出ItinBench,通过整合空间推理和传统语言推理任务,评估大语言模型在多认知维度上的规划能力,发现模型在同时处理多个维度时性能不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19514 2026-03-23 cs.AI 88%

Learning to Disprove: Formal Counterexample Generation with Large Language Models

学习以反驳:利用大语言模型进行形式反例生成

Zenan Li, Zhaoyu Li, Kaiyu Yang, Xiaoxing Ma, Zhendong Su

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MiroMind(MiroMind公司) Nanjing University(南京大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过微调大语言模型生成形式反例,解决数学推理中反例发现的不足,提出符号突变策略提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 86%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19328 2026-03-23 cs.CR 85%

The Verifier Tax: Horizon Dependent Safety Success Tradeoffs in Tool Using LLM Agents

验证者税:工具使用LLM代理中地平线依赖的安全成功权衡

Tanmay Sah, Vishal Srivastava, Dolly Sah, Kayden Jordan

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究运行时强制执行对多步骤工具使用大语言模型代理端到端任务性能的影响,发现安全调解虽能拦截94%的非合规动作,但难以保证安全完成,凸显了需要具备基础身份验证和后干预推理能力的代理。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19239 2026-03-23 cs.PL cs.SE 85%

Defusing Logic Bombs in Symbolic Execution with LLM-Generated Ghost Code

用LLM生成的鬼代码解构符号执行中的逻辑炸弹

Dimitrios Stamatios Bouras, Sergey Mechtaev

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Gordian框架,通过LLM生成轻量级鬼代码辅助SMT求解器处理对抗性代码,提升覆盖率和效率,减少LLM使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19611 2026-03-23 cs.LG 83%

Demonstrations, CoT, and Prompting: A Theoretical Analysis of ICL

演示、推理链和提示:对基于上下文学习(ICL)的理论分析

Xuhan Tong, Yuchen Zeng, Jiawei Zhang

专题命中 推理与问题求解 :prompting(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过理论分析探讨了基于上下文学习(ICL)中演示、推理链提示和提示模板的影响,揭示了模型泛化能力的决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18377 2026-03-23 cs.CR cs.AI cs.ET 83%

PlanTwin: Privacy-Preserving Planning Abstractions for Cloud-Assisted LLM Agents

PlanTwin: 云辅助规划中的隐私保护规划抽象

Guangsheng Yu, Qin Wang, Rui Lang, Shuai Su, Xu Wang

机构 * University of Technology Sydney(悉尼技术大学) CSIRO Data61(CSIRO数据61)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PlanTwin通过构建规划导向的数字孪生,实现云辅助规划中本地环境信息的隐私保护,同时保持规划质量接近全上下文系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19909 2026-03-23 cs.IR 82%

DALI: LLM-Agent Enhanced Dual-Stream Adaptive Leadership Identification for Group Recommendations

DALI:LLM-Agent增强的双流自适应领导力识别用于群体推荐

Boxun Song, Min Gao, Jiawei Cheng

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 DALI通过结合大语言模型的符号推理能力与神经网络表示学习,解决群体推荐中区分领导主导与协作群体的问题,提升推荐准确性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19348 2026-03-23 cs.LG cs.CL 81%

Anatomical Heterogeneity in Transformer Language Models

Transformer语言模型中的解剖异质性

Tomasz Wietrzykowski

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现Transformer语言模型各层存在显著异质性,包括权重规律性、层重要性差异及训练预算分配策略的影响。

Comments 11 pages, 10 tables. Independent research. Code available at https://github.com/tomaszwi66

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19779 2026-03-23 cs.CV 80%

One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment

一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估

Wen Yin, Cencen Liu, Dingrui Liu, Bing Su, Yuan-Fang Li, Tao He

机构 * University of Electronic Science and Technology of China(电子科技大学) Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20162 2026-03-23 cs.CL 79%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19714 2026-03-23 cs.CL 79%

LoopRPT: Reinforcement Pre-Training for Looped Language Models

LoopRPT: 用于循环语言模型的强化预训练

Guo Tang, Shixin Jiang, Heng Chang, Nuo Chen, Yuhan Li, Huiming Fan, Jia Li, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong University of Science and Technology, Guangzhou, China(香港科学与技术大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出LoopRPT框架,通过将下一步预测转化为推理任务,利用EMA教师参考和噪声潜在轨迹直接优化循环语言模型的中间表示,提升表示质量并实现准确度与计算量的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG 79%

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19203 2026-03-23 cs.CV 78%

Tinted Frames: Question Framing Blinds Vision-Language Models

着色边框:问题框架使视觉语言模型失明

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Vector Institute for AI(人工智能向量研究所)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文研究视觉语言模型在不同问题框架下的注意力分配问题,发现框架影响其视觉输入处理,提出轻量级提示调优方法提升视觉感知能力。

Comments Preprint. Project page: https://davidhalladay.github.io/tinted_frames_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20170 2026-03-23 cs.AI 77%

Learning Dynamic Belief Graphs for Theory-of-mind Reasoning

学习动态信念图以进行心灵理论推理

Ruxiao Chen, Xilei Zhao, Thomas J. Cova, Frank A. Drews, Susu Xu

机构 * Department of Civil Systems Engineering, Johns Hopkins University, Baltimore, MD, USA School of the Environment, Society \& Sustainability, University of Utah, Salt Lake City, UT, USA Department of Psychology, University of Utah, Salt Lake City, UT, USA Coastal Engineering, University of Florida, Gainesville, FL, USA

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种动态信念图模型,用于增强大语言模型的心灵理论推理能力,通过联合推断潜在信念、学习时间变化依赖关系,并链接信念演变与信息获取和决策,提升高不确定性环境下的行动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏