arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5804 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5804 篇

2605.06139 2026-05-21 cs.LG cs.AI 62%

Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex

列表式策略优化:基于组的RLVR作为LLM响应单纯形上的目标投影

Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系) LLM Department, Tencent(腾讯LLM部门)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出列表式策略优化(LPO),通过显式执行目标投影来解构隐式目标,利用响应单纯形限制近端RL目标,并通过精确散度最小化进行策略投影,从而在多样推理任务和LLM基础上提升训练性能,同时保持优化稳定性和响应多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19738 2026-05-20 cs.CL cs.AI 62%

TERGAD: Structure-Aware Text-Enhanced Representations for Graph Anomaly Detection

TERGAD: 用于图异常检测的结构感知文本增强表示

Wen Shi, Zhe Wang, Huafei Huang, Qing Qing, Ziqi Xu, Qixin Zhang, Xikun Zhang, Renqiang Luo, Feng Xia

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息科技学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TERGAD,一种通过大语言模型的语义推理能力增强图异常检测的新型数据增强框架,通过将节点拓扑属性转化为描述性自然语言,再结合门控双分支自编码器融合语义嵌入和原始节点属性,从而更有效地检测图中异常实体。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00856 2026-05-20 eess.SP cs.AI cs.HC cs.LG 62%

One-Block Transformer (1BT) for EEG-Based Cognitive Workload Assessment

用于EEG认知负荷评估的单块变换器(1BT)

Stefanos Gkikas, Christian Arzate Cruz, Thomas Kassiotis, Giorgos Giannakakis, Raul Fernandez Rojas, Randy Gomez

机构 * Honda Research Institute Japan Wako City, Japan Department of Electronic Engineering Hellenic Mediterranean University Chania, Greece BioSIS (Biosensing \& Intelligent Systems) Lab Centre for Intelligent Computing Systems University of Canberra Canberra, Australia

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于EEG认知负荷评估的单块变换器(1BT),通过一个最小的潜在瓶颈聚合多通道时间序列,结合轻量级自注意力机制,实现了高效且紧凑的模型设计,从而在保持高性能的同时显著降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01499 2026-05-20 cs.LG cs.AI cs.GT 62%

Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information

超越多数投票:利用高阶信息进行LLM聚合

Rui Ai, Yuqi Pan, David Simchi-Levi, Milind Tambe, Haifeng Xu

机构 * Massachusetts Institute of Technology(麻省理工学院) School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学) Data Science, The University of Chicago(数据科学,芝加哥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Optimal Weight和Inverse Surprising Popularity两种算法,通过结合一阶和二阶信息,有效缓解多数投票的局限性,提升多智能体LLM聚合的可靠性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17862 2026-05-19 cs.LG cs.AI 62%

$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control

f-OPD: 通过新鲜度感知控制稳定长周期在线策略蒸馏

Xianwei Chen, Shimin Zhang, Jibin Wu

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出f-OPD框架,通过引入样本级新鲜度评分来稳定长周期在线策略蒸馏,实现性能与效率的平衡,为大规模长周期智能体训练奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17811 2026-05-19 cs.LG cs.AI math.OC 62%

One Model, Two Roles: Emergent Specialization in a Shared Recurrent Transformer

一个模型,两种角色:共享递归变压器中的涌现专业化

Jucheng Shen, Barbara Su, Anastasios Kyrillidis

机构 * Rice University(里士大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究探讨了共享权重的递归变压器是否能在未被分割成独立模块的情况下发展出不同的内部角色,通过不对称输入递归(AIR)架构发现,模型内部状态分化出不同的功能角色,并展示了这种分化与模型状态动态的关系。

Comments 21 pages, 13 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17757 2026-05-19 cs.LG cs.AI cs.DC cs.PF 62%

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

OSCAR: 2位KV缓存量化中的离线频谱协方差感知旋转

Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

机构 * Together AI University of Sydney(悉尼大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OSCAR方法,通过离线估计注意力感知的协方差结构,实现2位KV缓存量化的高效和准确,同时开发了可部署的系统,提升了LLM服务框架的性能和效率。

Comments 35 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17684 2026-05-19 cs.LG cs.AI 62%

CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models

CodeScaler: 通过奖励模型扩展代码大语言模型的训练和测试时间推理

Xiao Zhu, Xinyu Zhou, Boyu Zhu, Hanxu Hu, Mingzhe Du, Haotian Zhang, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(LARK,香港科技大学(广州)) Kuaishou Technology(快手科技) UCL(伦敦大学学院) UZH(苏黎世联邦理工学院) NUS(国立新加坡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeScaler,一种通过奖励模型扩展代码生成模型的训练和测试时间推理的框架,通过精心编纂的偏好数据和语法感知的代码提取,实现了在四个编码基准上比基于执行的RL提升1.55分,在Qwen3-14B-Base上提升4.23分,并在无测试用例的情况下通过合成数据进一步提升14.64分,同时在推理时间减少10倍的延迟,且在代码、通用和推理领域均优于现有奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16895 2026-05-19 cs.CE cs.AI cs.CL 62%

The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence

阿尔法幻觉:LLM交易代理报告的阿尔法不应被视为部署证据

Yuxuan Ye, Jun Han, Ao Hu, Juncheng Bu, Yiyi Chen, Liangjian Wen, Danilo Mandic, Danny Dongning Sun, Xu Yinghui, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Southwest University of Finance and Economics(西南财经大学) Northeastern University(东北大学) Imperial College London(伦敦帝国理工学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文指出,LLM交易代理报告的阿尔法不应被当作部署的证据,因为这些阿尔法需要通过结构有效性测试来验证其时间完整性、现实摩擦、反事实稳健性、预测校准、数值执行和多代理分解等关键指标,当前的公开证据无法区分稳健的预测能力与时间污染、未建模的摩擦、短窗口夏普不确定性、叙事拟合和参数先验等因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16800 2026-05-19 cs.LG cs.CL 62%

FIM-LoRA: Task-Informative Rank Allocation for LoRA via Calibration-Time Gradient-Variance Estimation

FIM-LoRA: 通过校准时间梯度方差估计实现任务信息的秩分配

Ramakrishnan Sathyavageeswaran

机构 * Intuit

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FIM-LoRA,通过校准时间梯度方差估计来分配任务信息的秩,以优化LoRA的秩分配,从而提高模型性能。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16671 2026-05-19 cs.AI cs.CV cs.CY cs.LG 62%

Sustainable Intelligence for the Wild: Democratizing Ecological Monitoring via Knowledge-Adaptive Edge Expert Agents

野生环境中的可持续智能:通过知识自适应边缘专家代理实现生态监测民主化

Jiaxing Li, Hao Fang, Chi Xu, Miao Zhang, Jiangchuan Liu, William I. Atlas, Katrina M. Connors, Mark A. Spoljaric

机构 * Simon Fraser University(西蒙 Fraser大学) Wild Salmon Center(野生鲑鱼中心) Pacific Salmon Foundation(太平洋鲑鱼基金会) Haida Fisheries Program(海达渔业计划)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种知识自适应边缘代理架构,通过分离视觉感知与推理,结合视觉编码器和动态知识库,实现生态监测的可持续发展,促进伦理AI协同开发。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16345 2026-05-19 cs.LG cs.AI 62%

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

面向目标的监督学习用于大语言模型微调

Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Intuit AI Research(Intuit人工智能研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出目标条件监督学习(GCSL)框架,通过将反馈信号作为显式目标,利用监督学习生成高质量响应,改进了传统监督微调和直接偏好优化的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15102 2026-05-15 cs.CL cs.AI 62%

Improving Multi-turn Dialogue Consistency with Self-Recall Thinking

通过自回忆思考提升多轮对话一致性

Renning Pang, Tian Lan, Leyuan Liu, Xiaoming Huang, Piao Tong, Xiaosong Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自回忆思考框架,解决多轮对话中长距离上下文依赖和稀疏信息问题,通过自动生成回忆链和优化推理过程,提升F1分数并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12484 2026-05-15 cs.LG cs.AI 62%

Learning, Fast and Slow: Towards LLMs That Adapt Continually

学习,快速与缓慢:迈向能够持续适应的LLM

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

机构 * UC Berkeley(加州大学伯克利分校) Mila(蒙特利尔大学人工智能研究所) UT Austin(得克萨斯大学奥斯汀分校) Eragon Periodic Labs Mirendil Video

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种快速-缓慢学习框架,通过将模型参数作为缓慢权重和优化上下文作为快速权重,提升LLM在连续学习中的样本效率和性能,减少灾难性遗忘。

Comments 29 pages, 14 figures, including appendix; Blog post: https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14192 2026-05-15 cs.CL cs.AI 62%

Why Retrieval-Augmented Generation Fails: A Graph Perspective

为何检索增强生成失败:一种图视角

Kai Guo, Xinnan Dai, Zhibo Zhang, Nuohan Lin, Shenglai Zeng, Jie Ren, Haoyu Han, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从图视角分析检索增强生成失败原因,发现正确回答具有更深层推理路径和更分布的证据流,而失败回答则表现出碎片化和集中化的证据流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02350 2026-05-14 cs.AI cs.LG cs.MA 62%

Context Learning for Multi-Agent Discussion

多智能体讨论中的上下文学习

Xingyuan Hua, Sheng Yue, Xinyi Li, Yizhe Zhao, Jinrui Zhang, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus(中山大学深圳校区网络科学与技术学院) College of Computer Science, Northwest University(西北大学计算机学院) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网体系结构实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出M2CL方法,通过动态生成上下文指令提升多智能体讨论的一致性与协作效率,实验表明其在多个任务中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12460 2026-05-13 cs.LG cs.CL 62%

Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs

多流语言模型:通过并行思维、输入和输出流解除语言模型瓶颈

Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院) University Hospital Tübingen(图宾根大学医院) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过并行计算流替代顺序消息格式,提升语言模型的效率、安全性和可监控性,解决单流计算的局限性。

Comments Preprint, 37 pages. Code at https://github.com/seal-rg/streaming/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12419 2026-05-13 cs.CL cs.IR cs.LG 62%

ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging

ORBIT:通过起源调节合并在生成检索中保留基础语言能力

Neha Verma, Nikhil Mehta, Shao-Chuan Wang, Naijing Zhang, Alicia Tsai, Li Wei, Lukasz Heldt, Lichan Hong, Ed Chi, Xinyang Yi

机构 * Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ORBIT通过跟踪模型权重距离并使用加权平均策略,在生成检索微调中减少模型漂移,有效保留语言基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11613 2026-05-13 cs.LG cs.AI 62%

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

从通用相关性到输入特定的信用在在线自我蒸馏中

Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在线自我蒸馏中奖励的测量与信用分配,提出CREDIT方法通过对比学习分离输入特定成分,提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10765 2026-05-12 cs.CV cs.AI cs.LG 62%

Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning

动态跨模态提示生成用于多模态持续指令微调

Tao Hu, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRAPE框架,通过生成连续实例特定的软提示提升多模态持续指令微调性能,采用跨模态注意力和投影梯度投影减少遗忘,实验显示优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-05-12 cs.CL cs.AI 62%

DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10211 2026-05-12 cs.CL cs.AI cs.IR 62%

To Redact, or not to Redact? A Local LLM Approach to Deliberative Process Privilege Classification

应标注还是不应标注?一种局部LLM方法用于审议过程特权分类

Maik Larooij, David Graus

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种局部LLM方法,用于自动分类FOIA豁免5项审议过程特权的敏感性,通过结合链式思维提示和基于错误的少样本提示,提升召回率和F2分数,接近商用模型性能。

Comments Accepted to The First Workshop on Artificial Intelligence & Open Government at the 21st International Conference on Artificial Intelligence and Law (ICAIL), June 8, 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09294 2026-05-12 cs.LG cs.AI 62%

Towards Effective Theory of LLMs: A Representation Learning Approach

面向大语言模型的有效理论:一种表征学习方法

Muhammed Ustaomeroglu, Guannan Qu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RET框架,通过学习宏观状态而非微观细节描述大语言模型计算,验证其在可解释性中的实用性。

Comments Project webpage: https://ustaomeroglu.github.io/RET/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09268 2026-05-12 cs.CL cs.AI 62%

Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs

超越连续性:在LLMs多轮对话中上下文切换的挑战

Aditya Sinha, Harald Steck, Vito Ostuni, Matteo Rinaldi

机构 * Netflix Inc.(Netflix公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在多轮对话中处理上下文切换的挑战,通过构建合成基准测试,评估了十种LLMs在检测用户话题切换和筛选相关上下文方面的性能,发现只有部分具备推理能力的LLMs能准确检测话题切换。

Comments Accepted to the ICBINB Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06225 2026-05-12 cs.LG cs.AI 62%

Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs

记忆 inception:用于引导 LLMs 的潜在空间 KV 缓存操作

Andy Zeyi Liu, Michael Zhang, Ilana Greenberg, Adam Alnasser, Lucas Baker, John Sous

机构 * Yale University(耶鲁大学) Princeton University(普林斯顿大学) Jump Trading

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 memory inception 方法,通过在选定层插入文本衍生的键值对(KV)银行,在潜在注意力空间中引导 LLMs,实现更高效的控制与更少的存储消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13486 2026-05-12 cs.LG cs.AI cs.DC 62%

Preventing Rank Collapse in Federated Low-Rank Adaptation with Client Heterogeneity

防止联邦低秩适应中的秩坍缩与客户端异质性

Fei Wu, Jia Hu, Geyong Min, Shiqiang Wang

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文针对联邦低秩适应中因客户端异质性导致的秩坍缩问题,提出raFLoRA方法,通过分解本地更新并加权聚合提升模型性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12235 2026-05-12 cs.LG cs.AI 62%

RL Fine-Tuning Heals OOD Forgetting in SFT

强化学习修复SFT中的分布外遗忘

Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析SFT和RL对ID和OOD推理的影响,发现RL能修复后期SFT导致的OOD能力下降,且与奇异向量旋转相关。

Comments 31 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08301 2026-05-12 cs.LG cs.AI 62%

Priming: Hybrid State Space Models From Pre-trained Transformers

预训练:从预训练变换器中获得的混合状态空间模型

Aditya Chattopadhyay, Elvis Nunez, Prannay Kaul, Benjamin Bowman, Evan Becker, Luca Zancato, David Thomas, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理AI)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 预训练通过从预训练变换器初始化混合模型,利用短对齐和微调阶段,在少于源模型预训练token预算的情况下恢复下游性能,实现了大规模混合架构设计的可控比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08134 2026-05-12 cs.LG cs.AI 62%

DARE: Diffusion Language Model Activation Reuse for Efficient Inference

DARE:扩散语言模型激活重用以提高推理效率

Natalia Frumkin, Bokun Wang, Hung-Yueh Chiang, Chi-Chih Chang, Mohamed S. Abdelfattah, Diana Marculescu

机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电子与计算机工程系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cornell University(康奈尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DARE通过利用扩散语言模型中token级冗余性,提高推理效率,减少计算量,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07260 2026-05-11 cs.LG cs.CL 62%

When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models

专家误路由何时发生?混合专家语言模型中的反事实路由分析

Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了混合专家模型中路由选择的质量评估,发现标准路由在自信 token 上表现良好,但在脆弱 token 上存在误分配问题,通过更新路由层可提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏