arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2608.04390 2026-08-06 cs.CL cs.DB 新提交 83%

EdgeLM: Edge Demonstrations for Language Models' Table Understanding

EdgeLM:面向语言模型表格理解的边缘演示

Soroush Omidvartehrani, Mohammadamin Habibollah, Mohammadreza Daviran, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EdgeLM是一种检索框架,通过选择数据边缘和模型边缘两种互补的边缘证据,在五个数据整理任务、十五个数据集及五种LLMs上,始终取得最佳或接近最佳的表格理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03311 2026-08-05 cs.SE cs.AI 新提交 83%

Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform

评估用于企业自动化的大语言模型权衡:来自生产级企业平台中工作流生成的经验教训

Xavier Wrenn, Radoslav Raykov, Aleksandar Angelov, Hirokuni Kitahara, Yuji Watanabe, Anca Sailer

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过在生产级企业平台评估6种大语言模型的工作流生成能力,发现分段式流水线可提升结构成功率,使小型模型达生产可行性,为云工程提供模型无关的自动化方案。

Comments 10 pages, 3 figures, 5 tables. Accepted at the 14th IEEE International Conference on Cloud Engineering (IC2E 2026), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01718 2026-08-04 cs.AI 新提交 83%

LaCache: Robust Semantic Caching for LLM Serving

LaCache:面向大语言模型服务的鲁棒语义缓存

Jiacheng Liang, Yuhui Wang, Tanqiu Jiang, Ting Wang

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 LaCache是一种新型语义缓存方案,通过检查查询及其前k个解码标记的缓存命中,可抵御缓存碰撞攻击,提升响应相关性,经多种大语言模型及基准验证了其安全性与效率优势。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27836 2026-07-31 cs.AI 新提交 83%

Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration

跨越边际悬崖:通过边际校准实现可再学习鲁棒的大语言模型遗忘

Xiangyu Yin, Jiaxu Liu, Zhen Chen, Chih-Hong Cheng

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型遗忘在再学习攻击下的脆弱性,提出边际校准方法,在多个数据集和模型上提升遗忘鲁棒性并降低成员推断风险,仅以保留侧效用降低为代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25157 2026-07-29 cs.AI 新提交 83%

PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Stevens Institute of Technology(史蒂文斯理工学院) University of Notre Dame(圣母大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24392 2026-07-28 cs.CR cs.LG 新提交 83%

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

当大语言模型防御适得其反时:刻画安全性、性能和成本的权衡

Tong Zhang, Zexin Li, Simin Chen, Yun Peng

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型越狱防御的安全性、性能和成本权衡,按操作策略组织防御并研究其副作用,发现不同防御在安全与可用性、效率权衡上有差异,为评估防御副作用及选择防御提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20469 2026-07-24 cs.AI 新提交 83%

DecodeShare: Tracing the Shared Subspace of LLM Decode-Time Decisions

DecodeShare:追踪大语言模型解码时刻决策的共享子空间

Zishan Shao, Lixun Zhang, Kangning Cui, Yixiao Wang, Ting Jiang, Hancheng Ye, Qinsi Wang, Zhixu Du, Yuzhe Fu, Fan Yang, Danyang Zhuo, Yiran Chen, Hai Helen Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型解码时任务通用结构,提出DecodeShare协议识别共享子空间并测试其因果作用,实验显示干扰该子空间对决策性能影响大,且其对激活引导有实际意义,能分离组件功能、提供可靠信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09092 2026-07-13 cs.CL 新提交 83%

AgentKGV: Agentic LLM-RAG Framework with Two-Stage Training for the Fact Verification of Knowledge Graphs

AgentKGV:用于知识图谱事实验证的两阶段训练的智能语言模型-检索增强生成框架

Yumin Heo, Hyeon-gu Lee, Sumin Seo, Youngjoong Ko

机构 * SungKyunKwan University(成均馆大学) NAVER(纳维)

专题命中 效率与部署 :LLM(title,abstract);SFT(abstract);分类 cs.CL

AI总结 针对知识图谱事实错误验证难题,提出AgentKGV框架,集成动态路由等处理表面形式不匹配。引入两阶段训练策略,在开放域T-REx基准上,该框架提升了宏观F1,减少搜索调用次数,提高了验证准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08930 2026-07-13 cs.LG 新提交 83%

BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving

BlockServe:用于高吞吐量扩散语言模型服务的块粒度连续批处理

Yuanjie Zhu, Liangwei Yang, Ke Xu, Weizhi Zhang, Shanghao Li, Zihe Song, Philip S. Yu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对扩散大语言模型服务的收敛异质性问题,提出BlockServe框架,集成块粒度调度、混合状态执行及计算感知准入控制器,在五个基准测试中实现高吞吐量,确立块粒度调度为高吞吐量离线dLLM推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02521 2026-07-07 cs.DC cs.LG cs.PL 新提交 83%

Tile-Level Activation Overlap for Efficient LLM Inference

用于高效大语言模型推理的瓦片级激活重叠

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对现代大语言模型中SwiGLU中间张量物化成本高的问题,提出基于CUTLASS的SM90内核,通过瓦片级融合SwiGLU与GeMM,提升推理速度,验证手工设计的必要性且数值表现优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00908 2026-07-02 cs.LG 新提交 83%

Beyond Activation Alignment:The Alignment-Diversity Tradeoff in Task-Aware LLM Quantization

超越激活对齐:任务感知的大语言模型量化中的对齐-多样性权衡

Fei Wang, Chao Xue, Taoran Liu, Li Shen, Ye Liu, ChangXing Ding

机构 * South China University of Technology(华南理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Ocean University of China(中国海洋大学) Center for AI Theoretical Foundation and Systems, Shenzhen Loop Area Institute(深圳环区研究所人工智能理论基础与系统中心)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文揭示混合精度量化中的困惑度幻觉和对齐-多样性权衡,提出TASA框架联合优化校准数据组成和比特分配,在3.5比特平均精度下匹配或超越4比特基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31903 2026-07-01 cs.CV cs.AI 新提交 83%

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃

Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Sun Yat-sen University(中山大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08761 2026-06-30 cs.DC cs.AI 新提交 83%

APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

APEX4: 通过SM内计算重平衡实现高效纯W4A4 LLM推理

Hong Guo, Nianhui Guo, Weixing Wang, Jona Otholt, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institute(霍普夫-普拉特纳研究所) GreenBit.AI German University of Digital Science(德国数字科学大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对W4A4量化中CUDA核心反量化瓶颈,提出基于SM内计算平衡的ρ感知粒度自适应方法,设计纯INT4 GEMM内核,在多种GPU上实现最高2.09倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16908 2026-06-16 cs.CL 新提交 83%

LESS Is More: Mutual-Stability Sampling for Diffusion Language Models

LESS Is More: 扩散语言模型的互稳定采样

Amr Mohamed, Guokan Shang, Michalis Vazirgiannis

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Ecole Polytechnique(巴黎综合理工学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 针对扩散语言模型固定步数采样效率低的问题,提出无训练的自适应采样器LESS,通过互稳定规则动态决定掩码位置何时解码,在7个基准上平均准确率提升且步数减少72.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13322 2026-06-12 cs.CL 新提交 83%

Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation

基于LLM并行文本生成的低延迟实时音频游戏解说系统

Ryota Kawamatsu, Anum Afzal, Yuki Saito, Shinnosuke Takamichi, Graham Neubig, Katsuhito Sudoh, Hiroya Takamura, Tatsuya Ishigaki

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology(产业技术综合研究所) Technical University of Munich(慕尼黑工业大学) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学) Nara Women’s University(奈良女子大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种并行文本生成与语音播放的低延迟实时游戏解说系统,将平均句间静默从9.6秒降至0.3秒,显著提升解说节奏。

Comments Accepted at IJCAI-ECAI 2026 (Demonstrations Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11576 2026-06-11 cs.CV cs.AI 新提交 83%

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

AVIS: 视觉语言模型的自适应测试时缩放

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 效率与部署 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。

Comments Project page: https://avis-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11106 2026-06-10 cs.CV cs.AI 新提交 83%

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

FADA: 可访问的胎儿超声解读与标注——基于选择性蒸馏的统一视觉-语言模型

Mahmood Alzubaidi, Uzair Shah, Raden Muaz, Ines Abbes, Nader Mohammed, Abdullatif Magram, Khalid Alyafei, Mowafa Househ, Marco Agus

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) HMC(哈马德医疗公司) Advanced AlRazi Diagnostic Center(高级阿尔拉齐诊断中心) Sidra Medicine(锡德拉医学)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出统一视觉-语言模型FADA,通过选择性蒸馏从四个领域基础模型提取知识,实现胎儿超声的解读、分类、检测和分割,在单个消费级GPU上训练,无需外部标签,可在智能手机上离线运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08635 2026-06-09 cs.LG cs.DC 新提交 83%

SpectrumKV: Per-Token Mixed-Precision KV Cache Transfer for Prefill-Decode Disaggregated LLM Serving

SpectrumKV: 面向预填充-解码分离式LLM服务的逐令牌混合精度KV缓存传输

Yang Pengju

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对预填充-解码分离架构中KV缓存传输开销大的问题,提出SpectrumKV,通过为每个令牌分配不同精度(FP16/INT8/INT4)实现混合精度传输,并设计轻量部署探测自适应选择精度策略,在相同传输预算下显著提升模型质量并降低TTFT。

Comments 28 pages,13 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 83%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07345 2026-06-08 cs.LG 新提交 83%

TabSwift: An Efficient Tabular Foundation Model with Row-Wise Attention

TabSwift: 一种高效的基于行注意力的表格基础模型

Si-Yang Liu, Han-Jia Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出TabSwift,通过门控注意力稳定和可学习注册令牌增强轻量级行注意力骨干,实现高效表格上下文学习,在保持竞争力的同时降低推理成本。

Comments Accepted to ICML 2026, spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14397 2026-08-17 cs.AI cs.CL 新提交 82%

LLMs Don't Pay for the Jump

大语言模型不承担“跳跃”的代价

Paras Balani, Subhrakanta Panda

机构 * Birla Institute of Technology and Science, Pilani(毕拉理工与科学学院皮拉尼分校)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究指出LLMs无法完成催生科学发现的溯因“跳跃”,因固定权重Transformer推理缺乏认知误差与物理代价的耦合,提出机器溯因需更深层物理机制的核心观点。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13844 2026-08-17 cs.LG cs.AI cs.DC 新提交 82%

Federated Prompt Learning: A Unified Framework, Empirical Analysis, and Future Directions

联邦提示学习:统一框架、实证分析与未来方向

Qinglin Yang, Chen Qiu, Hongyuan Zhang, Pengdeng Li, Yuan Liu, Zhihong Tian

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络空间研究院) Huangpu Research School of Guangzhou University(广州大学黄埔研究院) Iwate Biotechnology Research Center(岩手生物技术研究中心) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文为联邦提示学习(FPL)的全面综述,明确其与传统联邦学习及全模型联邦微调的差异,分析其多维度权衡与现存挑战,梳理全生命周期方法及防御机制,为该领域研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10288 2026-08-12 cs.LG cs.CL 新提交 82%

Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference

幂律图注意力:缩放点积注意力的精确泛化,推理时的经验崩溃

Burc Gokden

机构 * Fromthesky Research Labs LLC(弗洛姆斯基研究实验室有限责任公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出PLGA注意力机制,其在$G_{LM}=I$时精确包含SDPA,还证明了推理崩溃定理,在测试样本上的分块与顺序评分结果与TruthfulQA度量偏差极小,相关证明核心已通过Lean 4机器验证。

Comments 61 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08237 2026-08-11 cs.LG cs.CL cs.DC cs.IR 新提交 82%

SAGE: SLO-Aware Adaptive Retrieval for Production RAG Systems

SAGE:面向生产级RAG系统的感知SLO自适应检索方案

Muhammad Faizan Raza, Shuo, Yang, Satish Mahadevan Srinivasan

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 SAGE是面向生产级RAG系统的感知SLO自适应检索策略,通过模仿学习训练,能动态选段落数,在多数据集与LLM上提升SLO合规率、降本减时延且质量损失小。

Comments 7 pages, 5 figures, 2 tables. Authors' accepted version of a paper published in Proc. IEEE CoDIT 2026. The version of record is available at the DOI below

Journal ref 2026 12th International Conference on Control, Decision and Information Technologies (CoDIT), Bari, Italy, 2026, pp. 169-175

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07532 2026-08-11 cs.AI cs.LG econ.TH 新提交 82%

Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems

基于技能的智能体人工智能系统中的动态联盟形成与通信定价

Mojtaba Eslami

机构 * University of Calgary(卡尔加里大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对技能型智能体 AI 系统通信低效问题,提出基于夏普利值的边际值激活与贪心路由方法,在合成实验中其效用达蛮力最优的 99.5%,激活智能体数远少于全广播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06849 2026-08-10 cs.CL cs.AI 新提交 82%

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

头自主性:基于冻结查询-键几何的无数据稀疏注意力

Yehan Yang, Junyuan Shang, Yang Li, Guanqun Zhao, Shuohuan Wang, Dianhai Yu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Posts and Telecommunications(北京邮电大学) Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无数据稀疏注意力方法 AoH,通过查询-键投影谱几何识别检索头与流头,在 50% 稀疏度下平均保留全注意力 96.5% 性能,同时显著降低 LLM 的计算延迟与 KV-cache 内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05499 2026-08-07 cs.CV cs.AI cs.LG 新提交 82%

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

APQF:基于智能体分析引导的结构化剪枝与混合精度量化及自适应微调

Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou, Brian Gelder, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 APQF是结合LLM引导与分析支撑的自动化剪枝量化框架,在ImageNet等数据集上实现高压缩比且精度接近基线,优于现有联合剪枝量化方法。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 82%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 82%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03138 2026-08-05 cs.CL cs.AI 新提交 82%

Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

通过结构感知策略学习内化学术写作工作流以生成引言

Meicong Zhang, Tiancheng Su, Jiahao Cheng, Guoxiu He, Xinqi Tao, Dejia Song

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏