arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 77 篇

2605.28058 2026-05-28 cs.CL 94%

Prompting Is All You Need: Multi-view Prompting Large Language Models for Aspect-Based Sentiment Analysis

提示即一切:基于多视角提示的大语言模型在方面级情感分析中的应用

Nils Constantin Hellwig, Niklas Donhauser, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group, University of Regensburg, Germany(里根大学媒体信息学小组) Information Science Group, University of Regensburg, Germany(里根大学信息科学小组)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 提出LLM-MvP方法,通过多视角提示、模式约束解码和前缀批处理,使大语言模型在少量样本下达到与微调模型竞争甚至更优的性能,同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08014 2026-05-28 cs.CL cs.AI cs.CY 92%

Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking

大规模真实对话分析揭示LLM越狱的复杂性界限

Aldan Creo, Raul Castro Fernandez, Manuel Cebrian

机构 * Valencian Research Institute for Artificial Intelligence (VRAIN), Universitat Politècnica de València, Valencia, Spain.(瓦伦西亚人工智能研究 institute,瓦伦西亚理工大学,西班牙瓦伦西亚) Department of Computer Science, The University of Chicago, Chicago, USA(计算机科学系,芝加哥大学,美国芝加哥) Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过分析超过200万条真实对话,发现越狱尝试的复杂性并不显著高于正常对话,且攻击复杂性随时间保持稳定,表明LLM安全演化受人类创造力限制。

Comments Code: https://github.com/ACMCMC/risky-conversations Results: https://huggingface.co/risky-conversations Visualizer: https://huggingface.co/spaces/risky-conversations/Visualizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28042 2026-05-28 cs.CL cs.AI cs.LG 92%

Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts

通过激进剪枝专家从LLM中提取小型翻译专家

Liu O. Martin, Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :LLM(title_cn,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种从混合专家LLM中激进剪枝与翻译无关的专家,实现大幅压缩MoE块而不显著降低翻译质量的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27435 2026-05-28 cs.AR cs.AI 92%

When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference

当NPU并非总是更快:移动LLM推理的阶段级分析

Pu Li, Jiawen Qi, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过OPMASK控制管道分解方法,在CPU-NPU异构SoC上对移动LLM推理进行阶段感知的多级基准测试,发现Prefill阶段CPU比NPU快1.6倍,Decode阶段NPU仅提供1.05-1.2倍加速,且NPU卸载增加能耗高达51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13820 2026-05-28 cs.LG cs.AI cs.CL 91%

Structured Agent Distillation for Large Language Model

大型语言模型的结构化智能体蒸馏

Jun Liu, Zhenglun Kong, Peiyan Dong, Changdi Yang, Tianqi Li, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue Lin, Dong Huang, Yanzhi Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) MIT(麻省理工学院) Northeastern University(东北大学) Adobe Research(Adobe研究) National University of Singapore(新加坡国立大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。

Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27704 2026-05-28 cs.IR 90%

Joint Optimization of Relevance and Engagement in Multi-Task Ranking for E-Commerce with Efficient LLM Supervision

电子商务中多任务排序的相关性与参与度联合优化与高效LLM监督

Luming Chen, Jiaqi Xi, Raghav Saboo, Kenny Chi, Martin Wang, Sudeep Das, Danny Nightingale, Aditya Dodda, Elyse Winer, Akshad Viswanathan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一个生产级多任务排序系统,通过序数相关头与统一价值模型联合优化相关性和参与度,并利用微调轻量级LLM生成三级序数相关标签,显著提升语义对齐同时保持核心参与目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24938 2026-05-28 cs.LG cs.AI cs.CL 90%

Rethinking Layer Redundancy: Calibration Matters More Than Search in LLM Depth Pruning

重新思考层冗余:校准比搜索在LLM深度剪枝中更重要

Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim, Suin Cho, Woosang Lim, Sunwoo Lee

机构 * Neural Superintelligence Lab, MODULABS(神经超智能实验室,MODULABS) University of Southern California(南加州大学) Boston University(波士顿大学) Seoul National University(首尔国立大学) Inha University(inha大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实验发现,在大型语言模型深度剪枝中,校准配置对剪枝模式和性能的影响远大于搜索算法的选择。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 90%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28302 2026-05-28 cs.LG cs.AI cs.DC 90%

How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving

解聚能走多远?面向高效 MoE LLM 服务的 Attention-FFN 解聚设计空间探索

Hanjiang Wu, Abhimanyu Rajeshkumar Bambhaniya, Sarbartha Banerjee, Tuhin Khare, Sudarshan Srinivasan, Suvinay Subramanian, Souvik Kundu, Madhu Kumar, Midhilesh Elavazhagan, William Won, Amir Yazdanbakhsh, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel(英特尔) Google(谷歌) Google DeepMind(谷歌DeepMind) Infravana

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统探索了从分块预填充、预填充-解码解聚到算子级 Attention-FFN 解聚 (AFD) 的不同解聚层次在 MoE 模型推理中的收益与局限,通过融合设备内核测量与高保真网络仿真的框架,在严格 TTFT/TPOT SLO 下 AFD 可在 DeepSeek-V3.2 上维持约 4k tokens/s 的系统吞吐量,并给出了联合优化吞吐与交互性的具体设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28168 2026-05-28 cs.AI 90%

OccuReward: LLM-Guided Occupant-Centric Reward Shaping for Demographic Equity in Grid-Interactive Buildings

OccuReward: 面向电网交互建筑中人口公平性的LLM引导的以 occupant 为中心的奖励塑造

Shadmehr Zaregarizi, Khashayar Yavari

机构 * Politecnico di Torino(都灵理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OccuReward框架,利用大语言模型迭代塑造奖励函数,通过舒适公平指数(CEI)反馈,在CityLearn v2中提升不同人口群体的舒适公平性,同时降低能耗成本。

Comments 4 pages, 2 figures. Accepted at OccuSys 2026, co-located with ACM Sustainability Week 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27429 2026-05-28 cs.IR cs.AI 90%

Ocean4Rec: Offline LLM-Derived OCEAN Profiles for Request-Time VOD Reranking

Ocean4Rec:离线LLM生成的OCEAN画像用于请求时VOD重排序

Wonkyun Kim, Sehyun Bae, Kwanki Ahn, Mungyu Bae, Saeun Choi, Soyeon You, Chandra Prabhakar, Sehyun Kim

机构 * Samsung Electronics Republic of Korea(韩国三星电子公司) Samsung Electronics India(印度三星电子公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Ocean4Rec重排序层,利用LLM离线生成物品OCEAN画像,在请求时无需LLM调用,通过数值计算提升VOD推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28095 2026-05-28 cs.DC 89%

SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference

SiDP:面向离线LLM推理的内存高效数据并行

Alan Zhao, Cyril Y. He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SiDP,一种将权重视为带宽支持的共享资源的内存高效数据并行范式,通过Weight-as-a-Service和Compute-as-a-Service两种模式,在相同配置下将可用KV容量提升至1.8倍,端到端吞吐量提升至1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28115 2026-05-28 cs.AI 89%

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

CIVIC: 面向高效视觉语言模型的端到端序列紧凑性

Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

机构 * Department of Civil & Environmental Engineering(土木与环境工程系) University of Utah(犹他大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出CIVIC框架,通过路径一致的紧凑视觉推理,在视觉编码器、投影层、LLM预填充和KV缓存中保持紧凑序列表示,减少非连续内存访问和局部合并开销,在Qwen3-VL架构上实现KV缓存内存降至约三分之一并降低端到端推理延迟,同时通过文本对齐KL蒸馏和自适应空间保留下限保持精度。

Comments 11 pages, 6 figures, 2 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27763 2026-05-28 cs.LG 89%

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving

LLM服务中基于批处理条件的拒绝鲁棒性配对测试协议

Sahil Kadadekar

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 提出配对测试协议,通过四项研究验证批处理条件对LLM安全标签的影响,发现批处理导致的安全标签翻转率低但存在,建议精确堆栈验证。

Comments 12 pages. Accepted to the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18692 2026-05-28 cs.AI math.OC 89%

Democratizing Large-Scale Re-Optimization with LLM-Guided Model Patches

利用LLM引导的模型补丁实现大规模重新优化的大众化

Tinghan Ye, Arnaud Deza, Ved Mohan, El Mehdi Er Raqabi, Pascal Van Hentenryck

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(赫尔曼·米利特·斯图尔特工业与系统工程学院,佐治亚理工学院) Department of Operations and Decision Systems, Université Laval(运营与决策系统系,拉瓦尔大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的代理重新优化框架,通过自然语言交互和优化工具箱,使非专家用户能够动态更新和重新优化部署的优化模型,并在两个大规模实际案例中验证了其有效性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28573 2026-05-28 cs.LG cs.AI 88%

Efficient Pre-Training of LLMs through Truncated SVD Layers

通过截断SVD层实现LLM的高效预训练

Kaivan Kamali, Kajetan Schweighofer, Hormoz Shahrzad, Olivier Francon, Babak Hodjat, Risto Miikkulainen

机构 * Cognizant AI Lab(认知AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出TSVD框架,利用谱能量启发式自适应秩选择和缓存机制保持低秩与严格正交性,在减少计算开销的同时匹配或超越全参数基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28268 2026-05-28 cs.DB 88%

Towards Cost-effective LLMs Routing with Batch Prompting

面向成本效益的批量提示大语言模型路由

Haotian Xu, Kangfei Zhao, Jiadong Xie

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RoBatch框架,联合优化模型分配和查询聚合两个维度,在成本预算下实现更优的成本-性能帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28051 2026-05-28 cs.CV 88%

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) CUHK MMLab(香港中文大学MMLab) CPII under InnoHK(创新工场CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15390 2026-05-28 cs.CV 88%

Automatic Pruning Discovery for Large Language Models

大型语言模型的自动剪枝发现

Haidong Kang, Lihong Lin, Enneng Yang, Hongning Dai, Hao Wang

机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern University at Qinhuangdao 066004, Hebei Province, China(河北省海洋感知网络与数据处理重点实验室,秦皇岛东北大学066004,河北省) Sun Yat-sen University, Shenzhen, China(深圳大学) Hong Kong Baptist University, Hongkong, China(香港 Baptist 大学) Xidian University, Xian, China(西安电子科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 提出AutoPrune方法,利用LLMs自动设计剪枝算法,并通过图驱动思维链优化提示,结合偏态感知动态稀疏分配解决高剪枝率下的异常值问题,在主流基准上超越现有方法。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28557 2026-05-28 cs.LO cs.AI 87%

Token Optimization Strategies for LLM-Based Oracle-to-PostgreSQL Migration

基于LLM的Oracle到PostgreSQL迁移的Token优化策略

Oleg Grynets, Dmytro Babarytskyi, Vasyl Lyashkevych

机构 * EPAM Systems(EPAM系统) Kharkiv, Ukraine(乌克兰基尔基茨) Lviv, Ukraine(乌克兰利沃夫) McLean, Virginia, USA(美国弗吉尼亚州麦莱恩)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文形式化并评估了十二种Token优化策略,在Oracle到PostgreSQL迁移中平衡成本、语法有效性、语义保持和结构保真度。

Comments 11 pages, 3 figures, 5 tables, 38 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28224 2026-05-28 cs.AI 87%

When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?

何时记忆有助于工具使用LLM代理的多轨迹推理?

Xinzhe Li, Yaguang Tao

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一个统一框架,将记忆沿传输范围和内容抽象两个维度分解,在无验证器设置下评估四种记忆方法与三种推理策略在四个工具使用基准上的表现,发现推理策略是混淆变量,不同策略下相同记忆方法产生显著不同结果。

Comments More evaluation and analysis are on the way

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27899 2026-05-28 cs.AI 87%

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

SKILLC: 通过对比信用分配学习LLM智能体的自主技能内化

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang

机构 * Meituan(美团)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SkillC框架,基于对比技能信用分配(CSCA)将技能帮助性对比转化为直接学习信号,实现LLM智能体的自主技能内化,在ALFWorld和WebShop上分别超越最强基线5.5%和4.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27823 2026-05-28 cs.CR cs.AI cs.CV 87%

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

解耦对抗性提示:基于语义图的鲁棒大语言模型安全防御

Xiang Fang, Wanlong Fang

机构 * Xiang Fang(1. 方翔) Wanlong Fang(2. 方万龙)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出对抗性提示解耦(APD)框架,通过互信息语义分解、图谱分析和轻量级分类器,在输入处理前识别并中和恶意组件,将有害输出减少85%以上。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06350 2026-05-28 cs.CL cs.AI cs.CR 87%

Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?

Mask-GCG:对抗性后缀中的所有标记对于越狱攻击都是必要的吗?

Junjie Mu, Zonghao Ying, Zhekui Fan, Zonglei Jing, Yaoyuan Zhang, Zhengmin Yu, Wenxin Zhang, Quanchen Zou, Xiangzheng Zhang

机构 * Politecnico di Milano(米兰理工学院) Beihang University(北京航空航天大学) East China Normal University(华东师范大学) Fudan University(复旦大学) University of the Chinese Academy of Sciences(中国科学院大学) AI Security Lab(360人工智能安全实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Mask-GCG方法,通过可学习的标记掩码识别后缀中高影响力标记并剪枝低影响力标记,降低计算开销并保持攻击成功率,揭示LLM提示中的标记冗余。

Comments Accepted to ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 13887-13891, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18893 2026-05-28 cs.CL cs.LG 87%

xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction

xKV:通过对齐奇异向量提取的跨层KV缓存压缩

Chi-Chih Chang, Wei-Cheng Lin, Chien-Yu Lin, Hung-Yueh Chiang, Yash Akhauri, Xilai Dai, Huiqiang Jiang, Yucheng Li, Luis Ceze, Kai-Chiang Wu, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学) Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Surrey(塞夫顿大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出xKV,一种通过跨层共享低秩子空间压缩KV缓存的后训练方法,实现高达8倍压缩且保持长上下文任务精度,并引入选择性重建实现端到端加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27740 2026-05-28 cs.CL 86%

UNIQUE: Universal Top-k Sparse Attention for Training-free Inference and Sparsity-aware Training

UNIQUE: 通用Top-k稀疏注意力,用于免训练推理和稀疏感知训练

Keqi Deng, Shaoshi Ling, Ruchao Fan, Jinyu Li

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UNIQUE框架,通过基于键均值和标准差的页面重要性评分和软掩码稀疏感知训练,实现LLM长上下文推理中KV缓存的高效稀疏注意力,在保持任务性能的同时显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27432 2026-05-28 cs.IR cs.AI 86%

FD-RAG: Federated Dual-System Retrieval-Augmented Generation

FD-RAG: 联邦双系统检索增强生成

Tianhao Gao, Kai Yang, Yiyang Li

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FD-RAG框架,通过解耦轻量级记忆访问与按需LLM推理,并利用语义感知自适应超图蒸馏为紧凑QA记忆,在联邦设置下实现高效、隐私保护的检索增强生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05642 2026-05-28 cs.RO cs.AI 86%

Relational Semantic Reasoning on 3D Scene Graphs for Open World Interactive Object Search

基于3D场景图的开放世界交互式物体搜索的关系语义推理

Imen Mahdi, Matteo Cassinelli, Fabien Despinoy, Tim Welschehold, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SCOUT方法,通过从LLM蒸馏的关系探索启发式直接搜索3D场景图,实现高效开放世界交互式物体搜索,性能匹配LLM且计算高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28526 2026-05-28 cs.AI cs.CL 84%

Entropy-aware Masking for Masked Language Modeling

面向掩码语言建模的熵感知掩码策略

Gokul Srinivasagan, Kai Hartung, Munir Georges

机构 * AImotion Bavaria(AImotion巴伐利亚) Technische Hochschule Ingolstadt(英戈尔施塔特技术大学)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出基于熵分布的掩码策略,通过模型预测熵识别信息量高的token进行掩码,并引入自掩码方法提升训练效率,在GLUE上平均提升5%。

Comments accepted at starsem 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28283 2026-05-28 cs.CL cs.AI 84%

PrunePath: Towards Highly Structured Sparse Language Models

PrunePath:迈向高度结构化稀疏语言模型

Zhexuan Gu, Zixun Fu, Yancheng Yuan

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PrunePath框架,通过软最大归一化路由和累积质量阈值实现自适应预算的结构化稀疏化,在自然语言理解、生成和指令调优中取得优越的稀疏-性能权衡,并利用Triton内核将结构化稀疏转化为实际内存节省和解码速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏