arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 93 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2605.09504 2026-07-24 cs.CR cs.AI cs.LG 版本更新 82%

AI Security Policy Should Assess Systems, Not Only Models

位置:AI安全政策应针对系统,而非模型

Michael A. Riegler, Inga Strümke

机构 * AI Safety Department(人工智能安全部门) SimulaMet and OsloMet(SimulaMet和奥斯陆计量)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18821 2026-07-24 cs.PL 版本更新 82%

VirtualSet: Typed Ontology Worlds as an LLM Generation Target for Grounded Queries and Guarded Decisions

虚拟集:作为大语言模型生成目标的类型化本体世界,用于有根据的查询和有保障的决策

Qunhui Zhang

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对大语言模型操作企业数据时SQL错误信号延迟的问题,提出VirtualSet,通过集合表达式、通用约束投影等技术实现有根据的查询和有保障的决策,在实验中展现出优势,在SQL基准测试中保持竞争力。

Comments 21 pages, 13 figures, 1 table; added a reference to the companion GCP paper (arXiv:2607.19693) and aligned GCP terminology; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10161 2026-07-24 q-bio.GN 版本更新 80%

Omics Data Discovery Agents: Agent-Supported Retrieval, Reanalysis, and Synthesis of Published Omics Data

组学数据发现代理

Alexandre Hutton, Jesse G. Meyer

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于代理的框架,通过自动化提取和处理组学数据,实现对生物医学文献的可执行查询和大规模数据重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09635 2026-07-24 cs.CL 版本更新 70%

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

K12-KGraph:一种对齐课程的图谱用于基准测试和训练教育大语言模型

Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong, Meiyi Qiang, Linzhuang Sun, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) OriginHub Technology(OriginHub技术) Zhongguancun Academy(中关村学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出K12-KGraph,基于中小学教材构建的课程对齐知识图谱,用于构建多选基准测试K12-Bench和训练数据集K12-Train,验证课程结构监督在教育模型训练中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10092 2026-07-24 cs.AI cs.LG 版本更新 62%

Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit

使用稀疏自动编码器的可解释嵌入:一种数据分析工具包

Nick Jiang, Xiaoqing Sun, Lisa Dunlap, Lewis Smith, Neel Nanda

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模文本语料库分析难题,提出用稀疏自动编码器创建SAE嵌入,经四个任务验证其比大语言模型更具性价比、比密集嵌入更可控,通过案例研究展示其在研究模型行为上的作用,是用于非结构化数据分析的通用工具。

Comments ICML 2026. Project page and code: https://interp-embed.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03354 2026-07-24 cs.CL cs.AI 版本更新 62%

Generative Artificial Intelligence in Bioinformatics: A Systematic Review of Models, Applications, and Methodological Advances

生物信息学中的生成式人工智能:模型、应用和方法进展的系统综述

Wasimul Karim, Riasad Alvi, Sayeem Been Zaman, Arefin Ittesafun Abian, Mohaimenul Azam Khan Raiaan, Saddam Mukta, Md Rafi Ur Rashid, Md Rafiqul Islam, Yakub Sebastian, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Software Engineering, Lappeenranta-Lahti University of Technology(软件工程系,拉佩兰塔-拉赫蒂技术大学) Department of Computer Science and Engineering, Pennsylvania State University(计算机科学与工程系,宾夕法尼亚州立大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 综述围绕六个问题评估GenAI在生物信息学中的策略,发现其支持多种分析,专业架构表现优,在分子分析等方面有益,存在局限,多种数据集助其发展,展现出推进计算生物学的潜力。

Comments Accepted: Archives of Computational Methods in Engineering Journal

Journal ref Arch Computat Methods Eng (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00250 2026-07-24 cs.CL cs.CV 版本更新 57%

LV-ROVER-MLT: Low-Resource Maltese OCR by Synthetic Fine-Tuning and Multi-Stream Arbitration

LV-ROVER:用于马耳他语段落OCR的多流Tesseract投票

Adam Darmanin

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 针对马耳他语OCR资源匮乏的问题,提出合成训练管道和5流Tesseract LV-ROVER集成,在422段落基准上将字符错误率从0.0234降至0.00700(降幅70%),其中集成识别贡献44%的改进。

Comments 10 pages, including 8 pages of main text and references plus appendices. Working paper. The held-out DocEng 2026 competition result is under organizer embargo and is not reported

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00418 2026-07-24 cs.LG math-ph math.MP nlin.PS physics.flu-dyn 版本更新 57%

Structure-Preserving Physics-Informed Neural Network for the Korteweg--de Vries (KdV) Equation

用于Korteweg - de Vries(KdV)方程的结构保持物理信息神经网络

Victory Obieke, Emmanuel Oguadimma

机构 * Oregon State University(俄勒冈州立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 针对KdV方程,提出结构保持物理信息神经网络框架,将质量和能量守恒嵌入损失函数,采用正弦激活函数,经案例和消融研究表明该方法能有效再现KdV动力学行为,加速收敛,提高稳定性,无需多阶段预训练。

Comments 9 Pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19315 2026-07-24 cs.CV 版本更新 50%

ERank in Latent Space as an Image-Complexity and Richness Measure

潜在空间中的有效秩作为图像复杂度和丰富度度量

Maksim Smirnov, Grigory Kononov, Anastasiia Linich, Egor Surkov, Egor Shvetsov

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究提出用图像深度特征图通道协方差的ERank衡量视觉丰富度,经单次前向传播计算得出。它能排序图像,与多种指标相关,与人类标注有一定关联。作为数据选择标准,对超分辨率、OCR等任务有不同影响,是受输入丰富度影响时有用的廉价信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13969 2026-07-24 cs.CV 版本更新 50%

SoccerSynth Field: enhancing field detection with synthetic data from virtual soccer simulator

足球合成场地:利用虚拟足球模拟器的合成数据增强场地检测

HaoBin Qin, Jiale Fang, Keisuke Fujii

机构 * Graduate School of Informatics, Nagoya University, Nagoya, Aichi, Japan(名古屋大学信息科学研究生院) RIKEN Center for Advanced Intelligence Project, Tokyo, Tokyo, Japan(理化学研究所先进情报项目中心)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对团队运动场地检测中真实数据集收集成本高、耗时的问题,提出用合成数据集(足球合成场地)预训练模型,经实验对比,该合成数据集预训练的模型在足球场检测中性能卓越,有效增强了模型鲁棒性与准确性。

Comments Accepted at ACIVS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 5 篇

2603.11838 2026-07-24 cs.CL q-fin.GN 版本更新 92%

DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining

DatedGPT:通过时间感知预训练防止大语言模型中的前瞻性偏差

Yutong Yan, Raphael Tang, Zhenyu Gao, Wenxi Jiang, Yao Lu

机构 * Department of Finance, CUHK Business School, The Chinese University of Hong Kong(香港中文大学商学院金融系,香港中文大学) Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);pretraining(title);post-training(abstract)

AI总结 DatedGPT通过时间感知预训练和指令微调,防止大语言模型中的前瞻性偏差,确保模型知识受限于数据截止年份,并在基准测试中表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23672 2026-07-24 cs.AI 版本更新 88%

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

教LLM字符串匹配、回溯与错误恢复:为组合爆炸的位操作谜题推导基和真值表

Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

机构 * NVIDIA

专题命中 指令微调 :LLM(title_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种新方法,通过字符串相似性、结构化搜索和自主错误恢复,避免复杂布尔逻辑,解决位操作谜题中的组合爆炸问题,实现96%以上验证准确率。

Comments 22 pages, 4 figures, 2 tables. 7th Place Solution for the NVIDIA Nemotron Model Reasoning Challenge (Kaggle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19337 2026-07-24 cs.CL cs.CV 版本更新 86%

Token-Level Entropy Reveals Demographic Disparities in Large Language Models

Token级熵揭示语言模型中的群体统计差异

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 通过测量零温度下全词汇香农熵,发现黑裔名字比白裔名字产生更高的首token熵,且女性名字比男性名字产生更低的熵和更同质的输出,种族和性别效应可加,指令微调未减弱种族差距,显式群体标签探测无显著种族效应。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30997 2026-07-24 cs.AI 版本更新 79%

A Three-Phase Foundation Model for Tax-Aware Personalized Portfolio Management

面向税务感知的个性化投资组合管理的三阶段基础模型

Ramin Pishehvar

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 提出三阶段深度强化学习系统,通过自监督跨资产编码器、MoE策略网络和LoRA个性化层,解决金融RL中标的锁定、单目标优化和静态用户模型三大局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20515 2026-07-24 cs.CV 版本更新 67%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 6 篇

2607.20083 2026-07-24 cs.LG cs.AI 版本更新 86%

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18239 2026-07-24 cs.LG cs.AI 版本更新 86%

Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

朝着解耦偏好优化动态:压制失败者,保留胜利者

Wei Chen, Yubing Wu, Junmei Yang, Delu Zeng, Qibin Zhao, John Paisley, Min Chen, Zhou Wang

机构 * South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出奖励校准方法,通过解耦带宽条件实现压制失败者并保留胜利者的优化动态,提升了下游性能。

Journal ref International Conference on Machine Learning(ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05385 2026-07-24 cs.IR cs.AI 版本更新 77%

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework

TeaRAG:一种令牌高效的智能检索增强生成框架

Chao Zhang, Yuhao Wang, Derong Xu, Haoxin Zhang, Yuanjie Lyu, Yuhao Chen, Shuochen Liu, Tong Xu, Xiangyu Zhao, Yan Gao, Yao Hu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13026 2026-07-24 cs.LG cs.CR 版本更新 70%

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

PISmith: 基于强化学习的提示注入防御红队测试

Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 62%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 57%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 6 篇

2601.01885 2026-07-24 cs.CL 版本更新 90%

Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents

代理记忆:为大语言模型代理学习统一的长期和短期记忆管理

Yi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) Alibaba Group(阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Agentic Memory框架,统一管理大语言模型的长期和短期记忆,通过分步GRPO和三阶段强化学习提升记忆效率与任务表现。

Comments ACL'26 SAC Highlight. The code is available at https://github.com/y1y5/AgeMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新 89%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);foundation model(abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20064 2026-07-24 cs.AI 版本更新 86%

PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning

PRO-LONG:程序化内存实现长程推理

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长程任务中LLM智能体的挑战,提出PRO-LONG框架,通过程序化内存管理上下文,保留交互日志并利用编码智能体进展高效搜索历史,在ARC-AGI-3上有显著提升,减少令牌使用并达到高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21028 2026-07-24 cs.AI 版本更新 86%

SciTrek: Evaluating and Improving Long-Context Numerical Reasoning over Scientific Articles

谁被引用最多?在科学文章上基准测试长上下文数值推理

Miao Li, Alexander Gurung, Irina Saparina, Mirella Lapata

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SciTrek基准测试通过长上下文科学文章问题探索LLM的数值推理能力,发现即使最佳模型在长上下文下也面临显著挑战,尤其在处理引用和复合逻辑问题时表现不佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12997 2026-07-24 cs.AI cs.CL 版本更新 79%

WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance

WebCoach:具有跨会话记忆引导的自我进化网络代理

Genglin Liu, Shijie Geng, Sha Li, Hejie Cui, Sarah Zhang, Xin Liu, Tianyi Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00004 2026-07-24 cs.CL cs.AI 版本更新 73%

LinearARD: Linear-Memory Attention Distillation for RoPE Restoration

线性记忆注意力蒸馏:用于RoPE修复的线性内存注意力蒸馏

Ning Yang, Hengyu Zhong, Wentao Wang, Baoliang Tian, Haijun Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southwest University(西南大学) Dalian University of Technology(大连理工大学) University of Science and Technology Beijing(北京科技大学) University College London(伦敦大学学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LinearARD,通过冻结的原生RoPE教师模型,利用注意力结构一致性恢复RoPE缩放的学生模型,以线性内存核克服二次内存瓶颈,提升长上下文性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 9 篇

2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新 88%

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);post-training(abstract)

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11936 2026-07-24 cs.AI 版本更新 87%

From Noise to Diversity: Random Embedding Injection in LLM Reasoning

从噪声到多样性:在LLM推理中的随机嵌入注入

Heejun Kim, Seungpil Lee, Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim, Sundong Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术学院) Seoul National University(首尔国立大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了随机软提示(RSPs),通过在输入中添加随机嵌入向量提升推理性能,揭示了注入过程对生成多样性的影响,并在推理和训练中均取得显著效果。

Comments Under review, ICML 2026 Mechanistic Interpretability Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09999 2026-07-24 cs.CL cs.LG 版本更新 86%

Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

量化语言模型推理中的无声失败:基于分类法的空洞收敛和失败模式转移分析

Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry Wu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究量化大语言模型推理中的无声失败,用六类失败分类法对五个模型在三种精度和四个基准下的思维链输出分类,发现空洞收敛等问题有精度和基准依赖性,且无法从文本特征可靠检测,揭示了标准评估管道未捕捉到的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏