arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2604.02986 2026-04-06 cs.LG cs.AI cs.CL 82%

Mitigating Reward Hacking in RLHF via Advantage Sign Robustness

通过优势符号鲁棒性缓解RLHF中的奖励黑客

Shinnosuke Ono, Johannes Ackermann, Soichiro Nishimori, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所革新智能研究中心)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SignCert-PO方法,通过在策略优化阶段降低非鲁棒完成的权重,缓解RLHF中的奖励黑客问题,在摘要和AlpacaFarm基准测试中表现优于基线。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02652 2026-04-06 cs.LG cs.AI 79%

Generalization Limits of Reinforcement Learning Alignment

强化学习对齐的泛化极限

Haruhi Shida, Koo Imai, Keigo Kansa

机构 * Aladdin Security Inc(阿拉丁安全公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了强化学习对齐技术的泛化能力限制,提出复合越狱方法,通过结合多种攻击技术提高攻击成功率,验证了安全训练无法广泛泛化 hypothesis。

Comments 7 pages, 2 figures, 2 tables, accepted at JSAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02686 2026-04-06 cs.LG cs.AI 62%

Beyond Semantic Manipulation: Token-Space Attacks on Reward Models

超越语义操控:奖励模型中的标记空间攻击

Yuheng Zhang, Mingyue Huo, Minghao Zhu, Mengxue Zhang, Nan Jiang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究员) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Token Mapping Perturbation Attack(TOMPA)框架,通过在标记空间中进行对抗优化,发现非语言标记模式以提升奖励模型性能,揭示了当前RLHF流程的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02869 2026-04-06 cs.AI 57%

Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration

多轮强化学习用于工具调用代理的迭代奖励校准

Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(Amity研究与应用中心(ARAC))

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 本文提出MT-GRPO与GTPO结合的方法,通过迭代奖励校准提升工具调用代理性能,在真实客服任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 6 篇

2604.02734 2026-04-06 cs.AI 83%

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

对齐进展与可行性:一种神经符号双记忆框架用于长周期LLM智能体

Bin Wen, Ruoxuan Zhang, Yang Chen, Hongxia Xie, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号双记忆框架,通过分离语义进展指导与逻辑可行性验证,解决长周期任务中进展漂移与可行性违反问题,实验显示在ALFWorld、WebShop和TextCraft上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03143 2026-04-06 cs.DC 78%

TokenDance: Scaling Multi-Agent LLM Serving via Collective KV Cache Sharing

TokenDance: 通过集体KV缓存共享扩展多智能体LLM服务

Zhuohang Bian, Feiyang Wu, Chengrui Zhang, Hangcheng Dong, Yun Liang, Youwei Zhuo

专题命中 长上下文与记忆 :LLM(title,abstract)

AI总结 TokenDance通过利用All-Gather模式实现集体KV缓存共享,提升多智能体LLM服务的并发数量,减少缓存存储并加快预填充速度。

Comments 14 pages, 14 figures, arXiv:submit/7438760 [cs.DC], preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02655 2026-04-06 cs.DB 75%

Semantic Data Processing with Holistic Data Understanding

基于整体数据理解的语义数据处理

Youran Sun, Sepanta Zeighami, Bhavya Chopra, Shreya Shankar, Aditya G. Parameswaran

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HoldUp方法,通过联合处理数据记录并利用跨记录关系,提升语义数据处理的准确性,在15个真实数据集上表现优于现有方案,分类和聚类任务准确率分别提高33%和30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02650 2026-04-06 cs.CL 70%

Revealing the Learning Dynamics of Long-Context Continual Pre-training

揭示长上下文持续预训练的学习动态

Yupu Liang, Shuang Chen, Guanwei Zhang, Shaolei Wang, Suncong Zheng

机构 * Tencent Hunyuan(腾讯混元)

专题命中 长上下文与记忆 :LLM(abstract);SFT(abstract);分类 cs.CL

AI总结 本文通过Hunyuan-A13B模型系统研究长上下文持续预训练的学习动态,揭示大规模数据训练的必要性、欺骗性饱和与内在饱和的区别,以及通过检索头监测训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02431 2026-04-06 cs.IR 50%

SelRoute: Query-Type-Aware Routing for Long-Term Conversational Memory Retrieval

SelRoute:基于查询类型的长期对话记忆检索路由

Matthew McKee

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 SelRoute通过根据查询类型选择专用检索管道提升长期对话记忆检索效果,实验显示其在多个基准测试中表现优异,但存在推理密集型检索任务的失败模式。

Comments 12 pages, 12 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 36 篇

2604.02910 2026-04-06 cs.AI cs.CL 90%

Analysis of Optimality of Large Language Models on Planning Problems

大型语言模型在规划问题中的最优性分析

Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在规划问题中的最优性,通过Blocksworld领域和Path-Star图任务,发现增强推理的LLM在复杂多目标配置中显著优于传统规划器,且能精确跟踪理论最优限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02346 2026-04-06 cs.LG cs.AI cs.SE q-bio.BM 90%

DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery

DrugPlayGround:大型语言模型和嵌入式在药物发现中的基准测试

Tianyu Liu, Sihan Jiang, Fan Zhang, Kunyang Sun, Teresa Head-Gordon, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学博德研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DrugPlayGround框架,用于评估大型语言模型在生成药物物理化学特性、药物协同作用等文本描述方面的性能,同时通过专家解释验证模型的化学和生物推理能力。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12643 2026-04-06 cs.AI 89%

Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution

通过大语言模型学习放松:通过双向共进化解决约束优化问题

Beidan Liu, Zhengqiu Zhu, Chen Gao, Tianle Pu, Yong Zhao, Wei Qi, Quanjun Yin

机构 * State Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出AutoCO方法,结合运筹学约束放松原理与LLM推理,通过双向共进化机制提升复杂约束优化问题的求解能力,实验验证其在硬问题中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02490 2026-04-06 cs.CR cs.AI 88%

Automated Malware Family Classification using Weighted Hierarchical Ensembles of Large Language Models

基于预训练大语言模型加权层次集成的自动化恶意软件家族分类

Samita Bai, Hamed Jelodar, Tochukwu Emmanuel Nwankwo, Parisa Hamedi, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,新不伦瑞克大学计算机科学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于预训练大语言模型加权层次集成的零标签恶意软件家族分类框架,通过聚合多个互补推理能力的语言模型决策预测,提升分类鲁棒性和分析员推理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02398 2026-04-06 cs.SE cs.AI 88%

Improving MPI Error Detection and Repair with Large Language Models and Bug References

利用大语言模型和Bug参考改进MPI错误检测与修复

Scott Piersall, Yang Gao, Shenyang Liu, Liqiang Wang

机构 * Dept. of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出结合Few-Shot Learning、Chain-of-Thought和Retrieval Augmented Generation技术,提升大语言模型在MPI错误检测与修复中的准确性,实验结果显示错误检测准确率从44%提升至77%。

Comments 41 pages, 8 figures

Journal ref Journal of Parallel and Distributed Computing, Volume 213, 2026, 105255, ISSN 0743-7315

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02375 2026-04-06 cs.SE cs.PL 87%

KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents

KAIJU:一种意图门控的LLM代理执行内核

Cormac Guerin, Frank Guerin

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 KAIJU通过解耦LLM推理层与代理执行流程,引入意图门控执行和执行内核,提升LLM代理在复杂任务中的执行效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02485 2026-04-06 cs.CL cs.LG 86%

Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models

未能证伪:评估和缓解语言模型中的确认偏见

Ayush Rajesh Jhaveri, Anthony GX-Chen, Ilia Sucholutsky, Eunsol Choi

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了大型语言模型是否表现出确认偏见,并提出干预策略以减少其影响,通过实验发现干预可显著提高规则发现率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02674 2026-04-06 cs.MA cs.AI 85%

Do Agent Societies Develop Intellectual Elites? The Hidden Power Laws of Collective Cognition in LLM Multi-Agent Systems

智能体社会是否发展出知识分子?LLM多智能体系统中集体认知的隐藏幂律

Kavana Venkatesh, Jiaming Cui

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM多智能体系统中协调动态,揭示协调遵循幂律级联、集中于知识分子精英及系统规模增长时极端事件频发的三大定律,提出整合瓶颈机制及Deficit-Triggered Integration方法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02539 2026-04-06 cs.IR cs.LG 85%

Synapse: Evolving Job-Person Fit with Explainable Two-phase Retrieval and LLM-guided Genetic Resume Optimization

Synapse:通过可解释的双阶段检索和LLM引导的遗传简历优化实现就业-个人匹配

Ansel Kaplan Erol, Seohee Yoon, Keenan Hom, Xisheng Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Synapse通过双阶段检索和遗传优化提升招聘推荐系统,解决信息不平衡问题,提高推荐精度和透明度,实验显示nDCG@10提升22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02761 2026-04-06 cs.SE 85%

Sustainability Analysis of Prompt Strategies for SLM-based Automated Test Generation

基于SLM的自动化测试生成提示策略可持续性分析

Pragati Kumari, Novarun Deb

专题命中 推理与问题求解 :SLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文研究了基于小语言模型的自动化测试生成中提示策略对计算和环境可持续性的影响,通过实验评估七种策略,发现策略选择对可持续性指标有显著影响,简单策略更环保。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02341 2026-04-06 cs.LG cs.AI 84%

LLM Reasoning with Process Rewards for Outcome-Guided Steps

基于过程奖励的大型语言模型推理

Mohammad Rezaei, Jens Lehmann, Sahar Vahdati

机构 * Amazon Science(亚马逊科学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PROGRS框架通过过程奖励相对偏好优化,提升数学推理准确性,减少错误引导,优于仅基于结果的基线方法。

Comments 8 pages, 3 figures, 2 tables, submitted to IJCNN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03157 2026-04-06 cs.AI 83%

Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models

Chart-RL: 通过强化学习优化策略以提升基于视觉语言模型的图表问答中的视觉推理

Yunfei Bai, Amit Dhanda, Shekhar Jain

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出Chart-RL框架,通过反馈驱动的策略优化提升视觉语言模型在复杂数据可视化中的推理能力,实现更高的准确率和更高效的推理速度。

Comments In Proceedings of the 32nd ACM-SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02315 2026-04-06 cs.AI 83%

Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models

超越助手回合:用户回合生成作为语言模型交互意识的探测器

Sarath Shekkizhar, Romain Cosentino, Adam Earle

专题命中 推理与问题求解 :language model(title);LLM(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出通过用户回合生成探测语言模型的交互意识,发现交互意识与任务准确性无关,且通过温度采样可提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02699 2026-04-06 cs.CL cs.AI 81%

Trivial Vocabulary Bans Improve LLM Reasoning More Than Deep Linguistic Constraints

词汇禁令对LLM推理的提升胜过深层语言约束

Rodney Jehu-Appiah

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比不同词汇禁令对语言模型推理的影响,发现简单禁令比深层语言约束更有效,揭示了输出正则化机制对推理提升的作用。

Comments 19 pages, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27176 2026-04-06 cs.AI cs.CL cs.DC 79%

Glia: A Human-Inspired AI for Automated Systems Design and Optimization

Glia:一种受人类启发的AI,用于自动化系统设计与优化

Pouya Hamadanian, Pantea Karimi, Arash Nasr-Esfahany, Kimia Noorbakhsh, Joseph Chandler, Ali ParandehGheibi, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent Researcher(独立研究员)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Glia通过人类启发的多智能体工作流利用大语言模型,生成可解释的系统设计,展示了AI在复杂系统问题中创造性和可理解性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02434 2026-04-06 cs.AI 77%

Compositional Neuro-Symbolic Reasoning

组合式神经符号推理

Anugyan Das, Omkar Ghugarkar, Vishvesh Bhat, Asad Aali

机构 * CoreThink AI Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合神经和符号方法的推理框架,通过提取网格对象结构、利用神经先验提出变换候选方案并过滤假设,提升ARC-AGI-2任务表现,无需任务特定微调或强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29585 2026-04-06 cs.GR cs.AI 77%

Learn2Fold: Structured Origami Generation with World Model Planning

Learn2Fold: 基于世界模型规划的结构化折纸生成

Yanjia Huang, Yunuo Chen, Ying Jiang, Jinru Han, Zhengzhong Tu, Yin Yang, Chenfanfu Jiang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出Learn2Fold框架,通过结合符号推理与物理模拟,解决从文本生成物理有效的折纸折叠序列问题。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02891 2026-04-06 cs.CV 75%

Progressive Video Condensation with MLLM Agent for Long-form Video Understanding

逐步视频压缩与MLLM代理用于长视频理解

Yufei Yin, Yuchen Xing, Qianke Meng, Minghao Chen, Yan Yang, Zhou Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,杭州电子科技大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ProVCA,通过逐步缩小范围从粗略片段到精细帧,利用MLLM进行高效视频理解,实现高准确率。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02547 2026-04-06 cs.SE 75%

Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure

超越分辨率率:编码代理成功与失败的行为驱动因素

Tural Mehtiyev, Wesley Assunção

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过大规模实证研究分析了9374条轨迹,探讨了编码代理在特定任务中失败的原因,发现行为模式和LLM能力对成功与失败有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02450 2026-04-06 cs.LG cs.AI cs.CL 75%

Do We Need Frontier Models to Verify Mathematical Proofs?

我们是否需要前沿模型来验证数学证明?

Aaditya Naik, Guruprerana Shabadi, Rajeev Alur, Mayur Naik

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了开源和前沿LLM在验证数学证明中的表现,发现较小模型在准确性上接近前沿模型,但一致性较差,通过定制提示词提升性能。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏