arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 482 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 73 篇

2607.11211 2026-07-14 cs.LG 新提交 87%

FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

FastTPS:一种针对人工智能加速器的大语言模型令牌阶段的优化方法

Wenzong Yang, Danyang Zhang, Kun Cao, Tejus Siddagangaiah, Rajeev Patwari, Zhanxing Pu, Siyin Kong, Zijiang Yang, Hao Zhu, Varun Sharma, Yue Gao, Tianping Li, Fan Yang, Jicheng Chen, Yushan Chen, Fennian Zhao, Aaron Ng, Elliott Delaye, Ashish Sirasao, Sudip Nag

机构 * Anonymous Institution(匿名机构)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对LLMs推理令牌阶段低并行性问题,提出FastTPS方法,含无重新加载KV缓存串联、优化“RoPE”注意力、高度融合MLP及细粒度流水线调度,显著缓解内存瓶颈,提升推理速度与内存带宽利用率。

Comments 16 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10709 2026-07-14 cs.CR cs.AI 新提交 87%

PromptGraph: Graph-Guided Prompt Sanitization for Balancing Privacy and Utility in LLM Inference

PromptGraph:用于在大语言模型推理中平衡隐私与效用的图引导提示净化

Chen Gu, Hui Wan, Donghui Hu, Hui Wang, Zhuoer Gu

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) International College Beijing, China Agricultural University(北京国际学院,中国农业大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型推理中的隐私与效用平衡问题,提出PromptGraph方法,将提示表示为属性图,估计隐私泄露与上下文依赖,通过净化目标平衡两者,实验证明该方法比基线更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01415 2026-07-14 cs.MA 版本更新 87%

Evidence-Decision-Feedback: Theory-Driven Adaptive Scaffolding for LLM Agents

证据-决策-反馈:面向LLM代理的理论驱动自适应支架框架

Clayton Cohn, Siyuan Guo, Surya Rayala, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Meiyi Ma, Gautam Biswas

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出EDF框架,通过Copa代理在真实课堂中展示其能有效引导反馈与学生理解一致,促进支架退化,并提供可解释的证据支持解释。

Comments Published as a long paper in the proceedings of the 27th International Conference on Artificial Intelligence in Education (AIED26)

Journal ref International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10582 2026-07-14 cs.LG cs.AI 新提交 86%

MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

MemDecay:用于高效大语言模型智能体推理的区域感知键值缓存逐出策略

Venkatesha Matam, Keon Kim

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体KV缓存内存瓶颈问题,提出无需训练的区域感知逐出策略MemDecay,为令牌分配特定区域优先级和衰减率,经实验验证该策略能有效管理缓存,确立语义提示结构对KV缓存管理的作用并明确其与关注重要性的结合方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24956 2026-07-14 cs.CL 版本更新 85%

NITP: Next Implicit Token Prediction for LLM Pre-training

NITP:面向LLM预训练的下一隐式令牌预测

Xiangdong Zhang, Debing Zhang, Shaofeng Zhang, Xiaohan Qin, Yu Cheng, Junchi Yan

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出NITP方法,通过在表示空间中添加密集连续监督来增强离散令牌预测,以解决标准下一令牌预测中潜在表示空间约束不足的问题,并在0.5B至9B参数模型上取得一致性能提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11262 2026-07-14 cs.DC 新提交 85%

GPU-Tile-Sim: A Tile-Centric GPU Simulation Framework for LLM Hardware-Software Co-Design

GPU-Tile-Sim:用于大语言模型软硬件协同设计的以瓦片为中心的GPU仿真框架

Yitong Ding, Jiawei Huang, Renyang Guan, Yangjie Zhou, Zihan Liu, Yu Feng, Shixuan Sun, Mingyi Guo, Jingwen Leng, Jian Weng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型中GPU内核给性能模型带来的挑战,提出GPU-Tile-Sim框架,以瓦片图表示内核执行,设计前后端,在多种工作负载上评估,精度高,还扩展到Blackwell验证其对设计分析的有效性。

Comments 14 pages, 14 figures. Accepted to MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11475 2026-07-14 cs.LG cs.CL 新提交 84%

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

HyperSafe:微调语言模型推理时的安全恢复

Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey, Bang An, Bernard Ghanem, Yibo Yang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10555 2026-07-14 cs.IR cs.AI cs.CL 新提交 84%

Tool-Adaptive LLM Reranker

工具自适应语言模型重排器

Zichuan Liu, Ruijin Hua

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对生成式大语言模型在复杂查询时的事实幻觉及重排延迟问题,提出TALRanker框架,将相关性评分形式化为马尔可夫决策过程,经两阶段训练优化,在检索基准上性能领先,兼顾吞吐量与准确性。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20430 2026-07-14 cs.CV 版本更新 83%

Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding

Youtu-Parsing:通过高并行解码实现感知、结构化与识别

Haoyu Cao, Kun Yin, Yunfei Wu, Bing Liu, Zhongpeng Cai, Xiaotian Li, Huang Chen, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Yunsheng Wu, Qianyu Li, Antai Guo, Yanzhen Liao, Yanqiu Qu, Haodong Lin, Chengxu He, Shuangyin Liu

机构 * Youtu-Parsing Team(优图解析团队)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract)

AI总结 Youtu-Parsing是用于高性能内容提取的文档解析模型,采用含动态分辨率视觉编码器的ViT与Youtu-LLM-2B语言模型,引入令牌并行和查询并行的高并行解码策略,涵盖多种文档元素,在多基准测试中达最优性能,有重要实验和实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04419 2026-07-14 cs.CL cs.AI cs.LG 版本更新 82%

Context-Dependent Affordance Computation in Vision-Language Models

视觉-语言模型中基于情境的可及性计算

Murad Farzulla

机构 * Dissensus AI King’s College London(伦敦国王学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究揭示视觉-语言模型中可及性计算的高度情境依赖性,通过大规模实验显示超过90%的词汇描述受情境影响,提出动态本体投影方法替代静态世界建模。

Comments 33 pages, 13 tables, 3 figures. Code available at: https://github.com/studiofarzulla/semantic-vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21169 2026-07-14 cs.CL cs.AI 82%

Output-Space Search: Targeting LLM Generations in a Frozen Encoder-Defined Output Space

输出空间搜索:在冻结编码器定义的输出空间中定向LLM生成

Tobias Materzok

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 OS-Search通过在冻结编码器定义的输出空间中进行端点搜索,提升LLM生成的多样性和代码有效性。

Journal ref Proceedings of the First Workshop on Structured Understanding, Retrieval, and Generation in the LLM Era (SURGeLLM 2026), pp. 70-92, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11801 2026-07-14 cs.SD cs.AI 新提交 79%

Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models

大型音频语言模型中用于声学感知的编码器端神经元识别与增强

Yu-Han Huang, Chih-Kai Yang, Ke-Han Lu, An-Yu Cheng, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Graduate Institute of Communication Engineering(通信工程研究所) NTU Artificial Intelligence Center of Research Excellence(国立交通大学人工智能卓越研究中心) ASUS Open Cloud Infrastructure Software Center(ASUS开放云基础设施软件中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究针对大型音频语言模型在语音非语义属性表现不佳的问题,提出IAAN方法,通过对比音频编码器神经元在真实波形与噪声参考上的激活来评分并增强高分神经元,有效提升了模型在多数据集上的声学感知准确率,开辟了新的推理时改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11257 2026-07-14 cs.CV cs.LG 新提交 79%

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏

Gangsu Kim, Won-Ki Jeong

机构 * College of Informatics, Korea University(韩国大学信息学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09877 2026-07-14 cs.LG cs.IR 新提交 79%

Serving the Long Tail: Training-Free LLM Candidate Generation for Vacation Rental Marketplaces

服务长尾:度假租赁市场中无需训练的大语言模型候选生成

Syed Mohammed Arshad Zaidi, Eric Rincon, Shayan Hassantabar

机构 * Expedia Group(亿客行集团)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 度假租赁市场供应端失衡,长尾房源难获有效服务。本文提出无需训练的大语言模型候选生成管道,用静态房产元数据补充IBKNN,经联合融合等策略提升效果,扩大候选覆盖范围,缩小模型召回差距,有效服务长尾房源。

Comments Accepted at TSMO 2026 workshop, co-located with KDD 2026; 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15133 2026-07-14 cs.LG 版本更新 79%

Causal Foundation Models with Continuous Treatments

具有连续处理的因果基础模型

Christopher Stith, Medha Barath, Vahid Balazadeh, Jesse C. Cresswell, Rahul G. Krishnan

机构 * Layer 6 AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出首个连续处理因果基础模型,通过设计连续处理变量的数据生成先验,生成丰富因果训练语料,并利用Transformer重建个体治疗响应曲线,实现无需额外训练的因果效应预测。

Comments 21 pages, 9 figures; added link to inference code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16514 2026-07-14 cs.CV cs.LG 版本更新 79%

BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

BARD:通过高效渐进性块合并和分阶段蒸馏桥接自回归与扩散视觉-语言模型

Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Liwei Zhang, Yuxuan Yao, Weihao Yuan, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 BARD通过高效渐进块合并与分阶段蒸馏将预训练自回归视觉-语言模型转换为解码高效的扩散视觉-语言模型,实现在大块规模下性能恢复与解码效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10805 2026-07-14 cs.CL cs.LG 新提交 79%

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

诊断和缓解基于策略的自蒸馏中的思维崩溃

Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding

机构 * Beihang University(北京航空航天大学) Hong Kong Polytechnic University(香港理工大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略的自蒸馏在复杂推理任务中性能下降问题,发现思维崩溃陷阱。提出自适应双视角OPSD,通过动态调节自蒸馏目标缓解该问题,在多模型规模和数据集上实验验证其有效性,提升绝对平均准确率4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10655 2026-07-14 cs.RO 新提交 78%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11586 2026-07-14 cs.AI 新提交 77%

HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference

HCRMap:用于3.5D MoE小芯片推理的压力感知热专家驻留映射

Yongqin Zhang

机构 * Nanjing Vocational College of Information Technology(南京信息技术职业学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对3.5D MoE推理中专家热度偏差问题,提出HCRMap框架,基于专家热度等因素动态管理专家副本,映射令牌组,有效缓解通信、内存和队列瓶颈,实验显示其能显著降低端到端延迟。

Comments 15 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25059 2026-07-14 cs.CR cs.AI 版本更新 77%

What Does It Mean to Break a Distillation Defense?

打破蒸馏防御意味着什么?

Lena Libon, Pura Peetathawatchai, Michael Aerni, Daniel Paleka, Florian Tramèr

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出一个三维威胁模型框架(查询预算、数据预算、接口配置),用于评估针对黑盒LLM的输出扰动蒸馏防御,并通过反蒸馏采样案例表明防御有效性依赖于威胁模型假设。

Comments 29 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11633 2026-07-14 cs.RO 新提交 75%

Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues

突破15%的障碍:一个由用户非语言线索触发的、用于主动社交机器人的真实世界数据驱动系统

Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira

机构 * Kyushu Institute of Technology(九州工业大学) CyberAgent(CyberAgent公司) The University of Osaka(大阪大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 研究零售商店中服务机器人交互,发现非语言行为触发机器人话语占比15.3%。通过分析客户行为定义非语言线索,开发识别器和对话框架,能基于非语言线索实现主动机器人响应,还进行了离线评估和展示在线原型。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10316 2026-07-14 cs.IR 新提交 75%

SVD-RAG: Efficient Tree-Organized Retrieval-Augmented Generation via Singular Value Decomposition

SVD-RAG:通过奇异值分解实现高效的树状组织检索增强生成

Zhihui Sun

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究提出SVD-RAG,通过对密集句子嵌入矩阵应用奇异值分解进行层次RAG抽取式摘要。该方法具确定性、成本效益高、内容自适应特点,实验表明其检索质量与RAPTOR相近,构建树速度更快且在多主题基准上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05313 2026-07-14 cs.LG 版本更新 74%

Controllably Efficient Language Models

可控高效语言模型

Jatin Prakash, Aahlad Puli, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 效率与部署 :language model(title);分类 cs.LG

AI总结 研究提出可控高效语言模型CAT,通过关注压缩序列块解码,能在训练时控制推理成本与质量的权衡,测试时无需重新训练,使用密集注意力作混合器可匹配多种高效模型,在长上下文理解任务中表现出色且吞吐量高。

Comments Preprint v2; Added more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 73%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10803 2026-07-14 cs.LG cs.AI 新提交 73%

Weight-Adjusted Gradients Reveal Parameter Importance and Failure Modes in LLMs

权重调整梯度揭示大语言模型中的参数重要性和失效模式

Shrestha Datta, Hongfu Liu, Anshuman Chhabra

机构 * University of South Florida(南佛罗里达大学) Brandeis University(布兰迪斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中参数重要性,提出权重调整梯度(WAG)方法,通过捕捉权重与梯度相互作用识别关键参数,揭示新的相互作用关系,展示其在多应用中的效用,为模型分析、调试和控制提供统一方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09936 2026-07-14 cs.LG cs.AI cs.CR 新提交 73%

SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification

SMETA-ZSL:用于零样本威胁分类的语义元对齐

Ivan Alejandro Montoya Sanchez, Anantaa Kotal, Aritran Piplai

机构 * The University of Texas at El Paso(德克萨斯大学艾尔帕索分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络安全新威胁无标注数据问题,提出SMETA-ZSL方法,通过对比微调、情景元学习和知识蒸馏等,从重叠语言描述学习语义原型并对齐行为特征,实现跨可见-未见类别的泛化,在7个基准测试中性能远超先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09791 2026-07-14 cs.LG cs.CL 新提交 73%

Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls

符号分支重复惩罚中的规范依赖性和结构化输出损坏:跨模型、推理堆栈和替代重复控制的测量

Peter Hollows

专题命中 效率与部署 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究符号分支重复惩罚中规范依赖性和结构化输出损坏问题,发现其惩罚定义不明确且损坏输出,将惩罚应用于归一化对数概率可消除这些问题,给出了相关机制、测量及归一化变体。

Comments 8 pages, 2 figures, 4 tables. Code, data, per-stack survey and git genealogy: https://github.com/captainpete/repetition-penalty-gauge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02502 2026-07-14 cs.LG cs.AI 版本更新 73%

DemoPSD: Disagreement-Modulated Policy Self-Distillation

DemoPSD: 分歧调节的策略自蒸馏

Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳理工大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07155 2026-07-14 cs.LG cs.AI 版本更新 73%

Stable On-Policy Distillation through Adaptive Target Reformulation

通过自适应目标重述实现稳定的在线策略蒸馏

Ijun Jang, Jewon Yeom, Juan Yeo, Hyunggyu Lim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Veto方法,通过在logit空间构建几何桥梁,解决传统在线策略蒸馏中的分布不匹配问题,提升训练稳定性与输出多样性。

Comments 10 pages, 5 figures, Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11423 2026-07-14 cs.CL 新提交 70%

ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

ToFu:面向研究人员的白盒、令牌高效代理工具包

Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University(东北大学) LongCat RSI, Meituan(美团龙猫RSI) NiuTrans Research(小牛翻译研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出ToFu这一代理工具包,作为研究助手,以高令牌效率等支持实际研究流程,且能本地部署;作为研究对象,提供白盒工具包供研究人员检查、修改和评估,兼具强大性能与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏