arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 73 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 73 篇

2606.29116 2026-07-14 cs.AI 版本更新 92%

Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem

表征大语言模型智能体工作流:基于N8n生态系统的研究

Yutian Tang, Yuming Zhou, Huaming Chen

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 通过分析6000多个n8n工作流,揭示LLM在低代码平台中嵌入控制逻辑、外部工具和人工审核等结构,但可靠性机制不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07066 2026-07-14 cs.AI 版本更新 92%

2.5-D Decomposition for LLM-Based Spatial Construction

基于2.5-D分解的LLM空间构建

Paul Whitten, Li-Jen Chen, Sharath Baddam

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 92%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10252 2026-07-14 cs.CR cs.CL cs.LG 新提交 91%

One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions

一个令牌就够了:从单令牌输出分布中对大语言模型进行指纹识别和验证

Tomas Bruckner

机构 * Faculty of Informatics and Statistics, Prague University of Economics and Business(信息与统计学院,布拉格经济与商业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究如何从大语言模型单令牌输出分布中进行指纹识别和验证。通过定义行为指纹,利用对简单提示的回答分布,实现模型谱系恢复和验证,还发现生态系统异常,且相关协议等已发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09172 2026-07-14 cs.LG 版本更新 90%

BalDRO: A Distributionally Robust Optimization based Framework for Large Language Model Unlearning

BalDRO:一种基于分布鲁棒优化的大语言模型遗忘框架

Pengyang Shao, Naixin Zhai, Lei Chen, Yonghui Yang, Fengbin Zhu, Xun Yang, Meng Wang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对大语言模型遗忘中样本不均衡问题,提出BalDRO框架,将遗忘设为最小-上确界过程,通过内、外步更新参数,经BalDRO-G和BalDRO-DV变体实例化,实验显示其在遗忘质量和模型效用上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10661 2026-07-14 cs.CL cs.AI 新提交 90%

Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

通过渐进式树状草稿的推测性解码解锁自回归语言模型中的并行性

Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出渐进式树状草稿(PTD)方法,通过结构化、引导式并行草稿策略利用模型并行潜力,结合渐进树结构与逐步修剪机制,在单次前向传播中引导LLM探索多条语义路径,实现高达2倍解码加速且无需训练、与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07978 2026-07-14 cs.IR 版本更新 90%

Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on Large Language Models

基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性

Benedict Wolff, Jacopo Bennati

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。

Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 90%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11810 2026-07-14 cs.HC 新提交 89%

Supporting Reflection in LLM-based Exploratory Search

支持基于大语言模型的探索性搜索中的反思

Giulia Di Fede, Salvatore Andolina

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探索性搜索中LLMs的问题,提出TrailLM系统,通过与用户意义建构工作流程对齐,帮助用户重构和重温探索路径,在保留基于LLM搜索优势的同时,增加对搜索过程批判性反思机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10186 2026-07-14 cs.AR 新提交 89%

FlashAccel: Leveraging High-Bandwidth Flash for High-Throughput LLM Inference

FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理

Xinyu Wang, Yalong Xue, Xiaotian Sun, Xiaoyu Zhang, Chunmeng Dou, Xueqi Li, Xiaoming Chen

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01299 2026-07-14 cs.DC 版本更新 89%

HYPIC: Accelerating Hybrid-Attention LLM Serving with Position-Independent Caching

HYPIC: 利用位置无关缓存加速混合注意力LLM服务

Yifei Liu, Juntong Wu, Yang Liu, Junhao Hu, Minghao Li, Xiaoxu Chen, Weihang Chen

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出Hypic系统,通过段累积转移算子和边界重计算,实现混合注意力LLM的位置无关缓存,显著降低首令牌延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10855 2026-07-14 cs.LG 新提交 89%

Reliability Scaling Laws for Quantized Large Language Models

量化大语言模型的可靠性缩放定律

Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Pruna AI(Pruna人工智能公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 研究量化大语言模型的可靠性缩放定律,通过对其不确定性、校准和鲁棒性进行全面评估,刻画可靠性与模型比特总数的关系,发现4比特量化模型有可靠性峰值,且量化增强了模型对自然输入扰动的鲁棒性。

Comments Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09713 2026-07-14 cs.AI cs.MA cs.RO 新提交 89%

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

基于规则对齐的小语言模型和多智能体自我校正的闭环控制

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 研究能否对紧凑型小语言模型再训练用于控制推理并嵌入验证器引导的校正循环,通过组相对策略优化对齐模型,结合多种智能体,在随机热控模拟中取得高准确率和低延迟,支持该架构用于边缘可重构自主控制。

Comments Accepted by IEEE CCTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18331 2026-07-14 cs.LG 版本更新 89%

Prune, Update and Trim: Robust Structured Pruning for Large Language Models

剪枝、更新与裁剪:大型语言模型的鲁棒结构剪枝

Diego Coello de Portugal Mecke, Tom Hanika, Lars Schmidt-Thieme

机构 * ISMLL & DARC VWFS University of Hildesheim(ISMLL与DARC VWFS大学海德斯海姆大学) ISMLL University of Hildesheim(ISMLL大学海德斯海姆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出Putri方法,通过更新未剪枝权重、按顺序剪枝FFN层以及移除单个注意力头来改进大型语言模型的后训练剪枝,实现了在极端稀疏率下的高效剪枝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09904 2026-07-14 cs.LG cs.AI 版本更新 89%

Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs

超越简单提示:改进LLMs上下文辅助预测的策略

Arjun Ashok, Andrew Robert Williams, Vincent Zhihao Zheng, Irina Rish, Nicolas Chapados, Étienne Marcotte, Valentina Zantedeschi, Alexandre Drouin

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。

Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10825 2026-07-14 cs.CL cs.AI cs.LG 新提交 89%

Large Language Models for Token-Efficient and Semantic-Preserving Opinion Summarization

用于高效令牌和语义保留观点摘要的大语言模型

Fabrizio Marozzo, Stefano Iannicelli

机构 * University of Calabria(卡拉布里亚大学)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 研究如何在大语言模型进行观点摘要时保留语义并减少令牌使用,结合多维分类与分层抽样策略选择观点子集,定制提示生成摘要,实验证明该方法能降本增效,优于传统和标准大语言模型摘要基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11012 2026-07-14 cs.CL 新提交 88%

EasyOPD: An Easy-to-use On-Policy Distillation Framework for Large Language Models

EasyOPD:一种易于使用的大语言模型在线策略蒸馏框架

Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Gengsheng Li, Zhepei Hong, Chang Wu, Pengfei Liu, Junfeng Fang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究针对传统语言模型蒸馏问题,提出基于verl构建的EasyOPD框架,分离用户配置等,为三种OPD设置实例化方法,经多基准测试,其实现可通过同一后端执行,还发布了相关配置、文档及演示包。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10762 2026-07-14 cs.CV cs.LG cs.RO 新提交 88%

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation

TOLiD:通过用于蒸馏的令牌提升弥合视觉基础模型与激光雷达预训练之间的架构差距

Sutharsan Mahendran, Darshana Priyasad, Kaushik Roy, Tharindu Fernando, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * SAIVT Group, School of Electrical Engineering and Robotics, Queensland University of Technology(澳大利亚昆士兰科技大学电气工程与机器人学院SAIVT组) CSIRO Robotics, CSIRO(澳大利亚联邦科学与工业研究组织机器人部)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究提出TOLiD方法,通过耦合激光雷达主干与从冻结VFM教师初始化的学生ViT,利用视锥体池化、注意力及掩码双线性采样等技术,解决模态和架构差距问题,在多数据集上评估显示能提升迁移效果。

Comments Accepted to The IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08098 2026-07-14 cs.AI cs.LG 版本更新 88%

When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM Inference

何时委托优于多数?一种基于委托的多样本LLM推理聚合器

Yasushi Sakai, Allen Song, Kent Larson

机构 * MIT Media Lab(麻省理工学院媒体实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出基于委托的聚合器PPV,利用样本的字母熵和推理几何信号,在MMLU-Pro上比多数投票高1.5个百分点,无需标签或训练。

Comments Preprint. 16 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24256 2026-07-14 cs.LG cs.AI 版本更新 88%

Graph Optimization Foundation Model: Tokenizing Graph via A Language-Model Paradigm

图优化基础模型:通过语言模型范式对图进行分词

Yunhao Liang, Pujun Zhang, Yuan Qu, Jingyuan Yang, Shaochong Lin, Zuo-jun Max Shen

机构 * Faculty of Engineering, The University of Hong Kong(香港大学工程学院) Costello College of Business, George Mason University(乔治·马歇尔大学商学院) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院) College of Engineering, University of California, Berkeley(加州大学伯克利分校工程学院)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在将预训练-迁移范式用于图优化,引入图基础模型(GFM)。通过在图随机游走路径上进行自监督预训练,使其内化图规则。该方法能有效应对多种优化挑战,实验显示其性能与专用求解器相当且推理更快,建立了图优化新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10123 2026-07-14 cs.LG cs.AI cs.CL 版本更新 88%

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

Nested-ReFT:通过离策略展开实现大语言模型微调的高效强化学习

Maxime Heuillet, Yufei Cui, Boxing Chen, Audrey Durand, Prasanna Parthasarathi

机构 * Mila - Québec AI Institute, Canada(魁北克人工智能研究所) Huawei Noah's Ark Lab (Montreal Research Center), Canada(华为诺亚实验室(蒙特利尔研究中心)) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 效率与部署 :large language model(title);language model(title);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型在数学推理等领域的高级推理难题,提出Nested-ReFT框架,利用离策略展开及动态层跳过降低训练推理成本,经理论与实证分析验证其有效性,还探索偏差缓解变体以维持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11211 2026-07-14 cs.LG 新提交 87%

FastTPS: An Optimized Method for LLM Token Phase for AI accelerators

FastTPS:一种针对人工智能加速器的大语言模型令牌阶段的优化方法

Wenzong Yang, Danyang Zhang, Kun Cao, Tejus Siddagangaiah, Rajeev Patwari, Zhanxing Pu, Siyin Kong, Zijiang Yang, Hao Zhu, Varun Sharma, Yue Gao, Tianping Li, Fan Yang, Jicheng Chen, Yushan Chen, Fennian Zhao, Aaron Ng, Elliott Delaye, Ashish Sirasao, Sudip Nag

机构 * Anonymous Institution(匿名机构)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对LLMs推理令牌阶段低并行性问题,提出FastTPS方法,含无重新加载KV缓存串联、优化“RoPE”注意力、高度融合MLP及细粒度流水线调度,显著缓解内存瓶颈,提升推理速度与内存带宽利用率。

Comments 16 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10709 2026-07-14 cs.CR cs.AI 新提交 87%

PromptGraph: Graph-Guided Prompt Sanitization for Balancing Privacy and Utility in LLM Inference

PromptGraph:用于在大语言模型推理中平衡隐私与效用的图引导提示净化

Chen Gu, Hui Wan, Donghui Hu, Hui Wang, Zhuoer Gu

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) International College Beijing, China Agricultural University(北京国际学院,中国农业大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型推理中的隐私与效用平衡问题,提出PromptGraph方法,将提示表示为属性图,估计隐私泄露与上下文依赖,通过净化目标平衡两者,实验证明该方法比基线更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01415 2026-07-14 cs.MA 版本更新 87%

Evidence-Decision-Feedback: Theory-Driven Adaptive Scaffolding for LLM Agents

证据-决策-反馈:面向LLM代理的理论驱动自适应支架框架

Clayton Cohn, Siyuan Guo, Surya Rayala, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Meiyi Ma, Gautam Biswas

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出EDF框架,通过Copa代理在真实课堂中展示其能有效引导反馈与学生理解一致,促进支架退化,并提供可解释的证据支持解释。

Comments Published as a long paper in the proceedings of the 27th International Conference on Artificial Intelligence in Education (AIED26)

Journal ref International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10582 2026-07-14 cs.LG cs.AI 新提交 86%

MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

MemDecay:用于高效大语言模型智能体推理的区域感知键值缓存逐出策略

Venkatesha Matam, Keon Kim

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体KV缓存内存瓶颈问题,提出无需训练的区域感知逐出策略MemDecay,为令牌分配特定区域优先级和衰减率,经实验验证该策略能有效管理缓存,确立语义提示结构对KV缓存管理的作用并明确其与关注重要性的结合方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24956 2026-07-14 cs.CL 版本更新 85%

NITP: Next Implicit Token Prediction for LLM Pre-training

NITP:面向LLM预训练的下一隐式令牌预测

Xiangdong Zhang, Debing Zhang, Shaofeng Zhang, Xiaohan Qin, Yu Cheng, Junchi Yan

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出NITP方法,通过在表示空间中添加密集连续监督来增强离散令牌预测,以解决标准下一令牌预测中潜在表示空间约束不足的问题,并在0.5B至9B参数模型上取得一致性能提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11262 2026-07-14 cs.DC 新提交 85%

GPU-Tile-Sim: A Tile-Centric GPU Simulation Framework for LLM Hardware-Software Co-Design

GPU-Tile-Sim:用于大语言模型软硬件协同设计的以瓦片为中心的GPU仿真框架

Yitong Ding, Jiawei Huang, Renyang Guan, Yangjie Zhou, Zihan Liu, Yu Feng, Shixuan Sun, Mingyi Guo, Jingwen Leng, Jian Weng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型中GPU内核给性能模型带来的挑战,提出GPU-Tile-Sim框架,以瓦片图表示内核执行,设计前后端,在多种工作负载上评估,精度高,还扩展到Blackwell验证其对设计分析的有效性。

Comments 14 pages, 14 figures. Accepted to MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11475 2026-07-14 cs.LG cs.CL 新提交 84%

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

HyperSafe:微调语言模型推理时的安全恢复

Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey, Bang An, Bernard Ghanem, Yibo Yang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10555 2026-07-14 cs.IR cs.AI cs.CL 新提交 84%

Tool-Adaptive LLM Reranker

工具自适应语言模型重排器

Zichuan Liu, Ruijin Hua

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对生成式大语言模型在复杂查询时的事实幻觉及重排延迟问题,提出TALRanker框架,将相关性评分形式化为马尔可夫决策过程,经两阶段训练优化,在检索基准上性能领先,兼顾吞吐量与准确性。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20430 2026-07-14 cs.CV 版本更新 83%

Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding

Youtu-Parsing:通过高并行解码实现感知、结构化与识别

Haoyu Cao, Kun Yin, Yunfei Wu, Bing Liu, Zhongpeng Cai, Xiaotian Li, Huang Chen, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Yunsheng Wu, Qianyu Li, Antai Guo, Yanzhen Liao, Yanqiu Qu, Haodong Lin, Chengxu He, Shuangyin Liu

机构 * Youtu-Parsing Team(优图解析团队)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract)

AI总结 Youtu-Parsing是用于高性能内容提取的文档解析模型,采用含动态分辨率视觉编码器的ViT与Youtu-LLM-2B语言模型,引入令牌并行和查询并行的高并行解码策略,涵盖多种文档元素,在多基准测试中达最优性能,有重要实验和实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏