arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 265 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 49 篇

2604.25326 2026-05-01 cs.AR cs.AI 91%

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

AHASD:异步异构架构用于移动设备上的LLM自适应草案推测解码

Ma Zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AHASD提出一种异步异构架构,通过任务级DLM-TLM解耦和熵历史感知草案控制,提升移动设备上LLM自适应草案推测解码的吞吐量和能效。

Comments 7 pages, 9 figures, accepted by DAC 2026, repo: https://github.com/MAdrid1011/AHASD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28018 2026-05-01 cs.CE cs.AI 90%

Design Structure Matrix Modularization with Large Language Models

基于大语言模型的Design Structure Matrix模块化设计

Shuo Jiang, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出利用大语言模型进行DSM模块化设计的方法,通过五个案例和三种基础LLM实现近参考质量的结果,在30次迭代内无需专用优化代码。发现领域知识在复杂DSM中会损害性能,提出语义对齐假设以指导LLM在工程设计优化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27536 2026-05-01 cs.AI 90%

Belief-Guided Inference Control for Large Language Model Services via Verifiable Observations

基于可验证观测的信念引导推理控制:通过可验证观测实现大语言模型服务

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Shuo Yang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Veroic框架,通过构建轻量级可验证观测通道,利用聚合的异质质量信号形成信念状态,以实现更优的质量-成本权衡、更强的风险估计和更稳健的长期推理控制。

Comments Accepted by KnowFM@ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27747 2026-05-01 cs.IR cs.AI 90%

Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation

基于位置感知的drafting用于LLM生成列表式推荐的推理加速

Jiaju Chen, Chongming Gao, Chenxiao Fan, Haoyan Liu, Qingpeng Cai, Peng Jiang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PAD-Rec,通过引入位置感知drafting机制,提升生成式推荐的推理效率,实验显示在四个真实数据集上达到3.1倍的时钟速度提升,并保持推荐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09718 2026-05-01 cs.DC cs.AI cs.PL 90%

Agentic Compilation: Mitigating the LLM Rerun Crisis for Minimized-Inference-Cost Web Automation

代理编译:缓解LLM重跑危机以实现最小化推理成本的网络自动化

Jagadeesh Chundru

机构 * Selfotix

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出编译与执行架构,通过分离LLM推理与浏览器执行,将每项工作流的推理成本降至0.1美元以下,实现零样本编译成功率80-94%,并证明确定性编译可经济可行地实现大规模自动化。

Comments 12 pages, 4 figures, 2 tables. v2: Expanded literature review and clarified architecture limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08101 2026-05-01 cs.CR 89%

LLM-Assisted Web Measurements

基于大型语言模型的网络测量

Simone Bozzolan, Stefano Calzavara, Lorenzo Cazzaro

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨利用大型语言模型进行定向网络测量,通过构建定制数据集评估不同模型性能,提出两步方法提升测量效率,并验证LLM在安全隐私趋势分析中的有效性。

Comments 23 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27296 2026-05-01 cs.SE cs.CL 89%

To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing

要进行差异生成还是不进行差异生成?面向高效LLM代码编辑的结构感知和自适应输出格式

Wei Cheng, Yongchang Cao, Chen Shen, Binhua Li, Jue Chen, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BlockDiff和FuncDiff两种结构感知差异格式及AdaEdit策略,通过减少生成复杂度提升长代码编辑效率,准确度与全代码生成相当,降低30%以上延迟和成本。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27032 2026-05-01 cs.SE cs.LG 89%

LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference

基于大语言模型的运行时参数优化以实现高效模型推理

Katelyn Crumpacker, Dimitrios Nikolopoulos

机构 * Virginia Polytechnic and State University(弗吉尼亚理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种结合人类反馈和大语言模型的运行时参数优化方法,以提高模型推理的能效,通过迭代优化快速找到高效参数配置。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27115 2026-05-01 cs.CL 88%

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复

M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan, Niloy Farhan, Farig Sadeque

机构 * BRAC University(布拉格大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27002 2026-05-01 cs.CR 88%

Membership Inference Attacks Against Video Large Language Models

针对视频大语言模型的成员推断攻击

Wei Song, Yuxin Cao, Ziqi Ding, Yi Liu, Gelei Deng, Yuekang Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了针对视频大语言模型的黑盒成员推断攻击,通过温度扰动生成与视频感知难度特征结合,验证了视频大语言模型对隐私风险的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27844 2026-05-01 cs.DC cs.CL 87%

ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

ZipCCL: 通信集体的高效无损数据压缩以加速大语言模型训练

Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science(香港科学大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ZipCCL,通过理论编码、GPU优化内核和自适应策略,实现通信数据的无损压缩,减少通信时间并提升训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02277 2026-05-01 cs.LG cs.AI 87%

Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs

垃圾DNA假说:修剪小的预训练权重不可逆且单调地损害LLM中的“困难”下游任务

Lu Yin, Ajay Jaiswal, Shiwei Liu, Souvik Kundu, Zhangyang Wang

机构 * University of Surrey Eindhoven University of Technology University of Texas at Austin Intel Labs University of Oxford

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出垃圾DNA假说,指出LLM预训练权重中存在关键知识,修剪小权重会单调损害困难下游任务性能,且即使允许持续训练也无法弥补损失。

Comments Published at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 87%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22099 2026-05-01 cs.LG cs.AI 85%

Decomposed Trust: Privacy, Adversarial Robustness, Ethics, and Fairness in Low-Rank LLMs

分解信任:低秩大语言模型中的隐私、对抗鲁棒性、伦理与公平性

Daniel Agyei Asante, Md Mokarram Chowdhury, Yang Li

机构 * Department of Computer Science, Iowa State University, United States(爱荷华州立大学计算机科学系) Meta, United States(Meta)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究低秩因子化对大语言模型信任性的影响,发现其在隐私保护上有所保留,但会削弱对话中个人身份信息的保护,同时增强对抗鲁棒性,但伦理和公平性有所下降。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 85%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14067 2026-05-01 cs.CL cs.AI cs.LG 85%

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

Efficient-DLM:从自回归到扩散语言模型,以及速度上的突破

Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

机构 * Georgia Tech(佐治亚理工学院) University of Chicago(芝加哥大学) University of Hong Kong(香港大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Efficient-DLM方法,通过改进自回归到扩散语言模型的转换,提升生成速度并保持任务准确性,实验显示其在精度和效率上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27861 2026-05-01 cs.CR cs.CL cs.LG 82%

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate: 通过非对称对比学习实现对不可追踪流量中分解性劫持的有状态防御

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM中分解性劫持威胁,TwinGate通过非对称对比学习在共享潜在空间中聚类语义不同但意图匹配的恶意片段,同时利用冻结编码器抑制良性主题重叠导致的误报,实现高效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27096 2026-05-01 cs.AI 81%

Think it, Run it: Autonomous ML pipeline generation via self-healing multi-agent AI

思考并运行:通过自我修复多智能体AI实现自主ML流水线生成

Adela Bara, Gabriela Dobrita, Simona-Vasilica Oprea

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种统一的多智能体架构,实现从数据集和自然语言目标自动生成端到端机器学习流水线,提升效率、鲁棒性和可解释性。通过五智能体系统处理数据剖析、意图解析、微服务推荐、DAG构建与执行,并结合代码基础的RAG、可解释混合推荐、自我修复机制和自适应学习,实现了84.7%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08332 2026-05-01 cs.AI 81%

ORFS-agent: Tool-Using Agents for Chip Design Optimization

ORFS-agent:用于芯片设计优化的工具使用代理

Amur Ghose, Andrew B. Kahng, Sayak Kundu, Zhiang Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ORFS-agent,一种基于大语言模型的迭代优化代理,用于自动化开放式硬件设计流程中的参数调优,通过改进资源效率和设计指标,在六个基准测试中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27084 2026-05-01 cs.NI 80%

BLINC: Context-Specific Causal Learning for Automated RAN Configuration

BLINC:基于上下文的因果学习用于自动无线接入网配置

Reshma Prasad, Michele Polese, Tommaso Melodia

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 BLINC通过整合电信领域知识,利用贝叶斯网络框架实现无线接入网配置的自动优化,提升吞吐量63.5%,降低误块率19.7%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27911 2026-05-01 cs.LG cs.ET cs.NE 79%

Physical Foundation Models: Fixed hardware implementations of large-scale neural networks

物理基础模型:大规模神经网络的固定硬件实现

Logan G Wright, Tianyu Wang, Tatsuhiro Onodera, Peter L. McMahon

机构 * Department of Applied Physics, Yale University, New Haven, CT 06520, USA(耶鲁大学应用物理系) School of Applied and Engineering Physics, Cornell University, Ithaca, NY 14853, USA(康奈尔大学应用与工程物理学院) Department of Electrical and Computer Engineering, Boston University, Boston, MA 02215, USA(波士顿大学电气与计算机工程系) NTT Physics and Informatics Laboratories, NTT Research, Inc., Sunnyvale, CA 94085, USA(NTT物理与信息学实验室,NTT研究公司) Kavli Institute at Cornell for Nanoscale Science, Cornell University, Ithaca, NY 14853, USA(康奈尔大学纳米科学研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文探讨了物理基础模型(PFMs)的概念,提出通过物理设计实现神经网络,以提升能效、速度和参数密度,适用于大规模模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27667 2026-05-01 cs.RO cs.LG 79%

Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?

表基础模型能否指导机器人策略学习中的探索?

Buqing Ou, Frederike Dümbgen

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) Inria, Département d’informatique de l’ENS, CNRS, PSL Research University(法国国家科学研究中心(CNRS)、巴黎综合理工学院(ENS)和PSL研究大学的Inria)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TFM-S3方法,通过结合局部和全局搜索提升机器人策略学习的全局探索效率,实验显示其在连续控制基准上加速收敛并提升性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27124 2026-05-01 cs.LG q-bio.QM 79%

Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models

更好的模型,更快的训练:Sigmoid 注意力用于单细胞基础模型

Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh

机构 * Merck & Co., Inc.(默克公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出Sigmoid注意力机制,通过改进表示学习、加速训练和提升稳定性,在单细胞数据集上实现了更优的细胞类型分离和更低的验证损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25711 2026-05-01 cs.SE cs.AI 77%

Learning Generalizable Multimodal Representations for Software Vulnerability Detection

学习通用的多模态表示以进行软件漏洞检测

Zeming Dong, Yuejun Guo, Qiang Hu, Yao Zhang, Maxime Cordy, Hao Liu, Mike Papadakis, Yongqiang Lyu

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Tianjin University(天津大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出MultiVul框架,通过双相似性学习和一致性正则化对代码和注释进行多模态对齐,提升漏洞检测的泛化能力,实验表明在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28028 2026-05-01 cs.CL cs.AI cs.DB cs.IR 73%

Reliable Answers for Recurring Questions: Boosting Text-to-SQL Accuracy with Template Constrained Decoding

可靠重复问题的答案:通过模板约束解码提升文本到SQL准确性

Smit Jivani, Sarvam Maheshwari, Sunita Sarawagi

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(计算机科学与工程系,印度理工学院班加罗尔)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TeCoD系统,通过利用标注工作负载中查询模式的重复性,提升文本到SQL的准确性,并在匹配查询上降低延迟。

Comments Project Code: https://github.com/SSLab-CSE-IITB/tecod

Journal ref Proceedings of the ACM on Management of Data, Volume 3, Issue 6, 2025, Article 357, Pages 1 - 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25385 2026-05-01 cs.LG cs.AI 73%

GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs

GlowQ: 组共享低秩近似用于量化大语言模型

Selim An, Il hong Suh, Yeseong Kim

机构 * COGA robotics, Korea(COGA机器人,韩国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GlowQ通过组共享低秩近似方法优化量化大语言模型,减少延迟和内存开销,同时提升准确率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12071 2026-05-01 cs.AI cs.CL 73%

Benchmarking quantized LLaMa-based models on the Brazilian Secondary School Exam

在巴西中学考试上评估基于量化LLaMa模型的基准测试

Matheus L. O. Santos, Cláudio E. C. Campelo

机构 * Systems and Computing Department(系统与计算系) Federal University of Campina Grande(坎皮纳斯格雷大联邦大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了基于7亿和13亿LLaMa模型的量化模型在巴西中学考试上的性能,通过1006道题目测试,发现最佳模型在葡萄牙语原题上准确率为46%,英文翻译上为49%,并评估了模型的计算效率。

Comments 8 pages, 6 figures, 4 tables

Journal ref https://sbic.org.br/eventos/cbic_2023/cbic2023-177/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27233 2026-05-01 cs.AI cs.LG cs.MA 73%

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

强化代理:推理时间的工具调用反馈

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出在推理时引入反馈机制,通过分离执行与审查任务,提升工具调用代理的实时纠错能力,并通过帮助性与危害性指标评估审查模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27085 2026-05-01 cs.DC cs.AI cs.LG 73%

Efficient Training on Multiple Consumer GPUs with RoundPipe

在多个消费级GPU上高效训练的RoundPipe

Yibin Luo, Shiwei Gao, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RoundPipe,通过动态调度和优先级转移解决GPU负载不均问题,实现近零管道气泡,提升大语言模型微调效率。

Comments Github Repo: https://github.com/ITcarrot/RoundPipe Project website: https://itcarrot.github.io/RoundPipe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26103 2026-05-01 cs.AR cs.AI cs.DC cs.LG 73%

AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving

AMMA: 一种面向低延迟1M上下文注意力服务的多芯片片内存架构

Zhongkai Yu, Haotian Ye, Chenyang Zhou, Ohm Rishabh Venkatachalam, Zaifeng Pan, Zhengding Hu, Junsung Kim, Won Woo Ro, Po-An Tsai, Shuyi Pei, Yangwook Kang, Yufei Ding

机构 * University of California, San Diego(加州大学圣迭戈分校) Columbia University(哥伦比亚大学) Yonsei University(延世大学) NVIDIA(NVIDIA公司) Samsung Semiconductor, Inc.(三星半导体公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 AMMA是一种面向低延迟1M上下文注意力服务的多芯片片内存架构,通过提高内存带宽和优化并行计算方案,显著降低注意力延迟和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏