arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1859 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1859 篇

2607.26631 2026-07-30 cs.LG cs.IR 新提交 90%

RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别

Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Curtin University(科廷大学) Colorado State University(科罗拉多州立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。

Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20483 2026-07-24 cs.AI 新提交 90%

Tractable Hierarchical Control of Autoregressive Language Models

自回归语言模型的可处理分层控制

Max Scribner, Antonio Vergari, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究如何约束自回归大语言模型生成,核心方法是将其提炼为可处理概率模型,利用有限时长$LR(k)$文法可多项式时间计算满足情况的特性,实现对LLM生成的有效约束与引导,确保输出满足形式句法约束。

Comments 21 pages, 4 figures, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19490 2026-07-23 cs.CR cs.AI 新提交 90%

Integrity of peer-to-peer distributed LLM inference under malicious nodes

恶意节点下对等分布式大语言模型推理的完整性

Mert Cihangiroglu, Antonino Nocera

机构 * DCALab, Department of Electrical, Computer and Biomedical Engineering, University of Pavia, Italy(DCALab,电气、计算机与生物医学工程系,帕维亚大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究对等分布式LLM推理在恶意节点下的完整性问题,提出通过测量节点激活值变化检查输出完整性的方法,即混入秘密金丝雀输入,利用与已知参考的偏差识别恶意节点,实验中检测器AUROC达1.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17715 2026-07-21 cs.CL 新提交 90%

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用

Chuheng Du, Junyi Chen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chaoyue Niu, Shengzhong Liu, Guihai Chen, Fan Wu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。

Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08774 2026-07-13 cs.AI cs.HC 新提交 90%

CogniConsole: Externalizing Inference-Time Control as a Formal Abstraction for Reliable LLM Interactions

CogniConsole:将推理时控制作为可靠大语言模型交互的形式化抽象进行外化

Vanessa Figueiredo, Wilter Franceschi

机构 * University of Regina(里贾纳大学) Orbital Sea(轨道海)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究挑战大语言模型可靠性仅取决于模型能力的观点,引入CogniConsole将推理时控制外化为结构化接口,通过489个探针实验表明增加结构支架可降低输出方差和故障率,为LLM系统设计评估开辟新方向。

Comments Revised version focusing on the CogniConsole system architecture and empirical evaluation of inference-time control probes (N=489)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 90%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02043 2026-07-03 cs.DC cs.AI 新提交 90%

Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

面向负载感知的预填充偏转用于分离式LLM服务

Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出一种主动预填充偏转调度器,通过将预填充作为分块步骤在解码节点上交错执行,消除节点间KV传输,显著降低P95 TTFT并提高SLO达标率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01601 2026-07-03 cs.AI 新提交 90%

SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication

SemHash-LLM:一种用于文档去重的多粒度语义哈希框架

Xinyi Fang, Kejian Tong, Jiabei Liu, Tao Ning, Yuhang He

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出多粒度语义哈希框架SemHash-LLM,融合语义投影哈希、注意力加权MinHash、对比边界学习和选择性LLM裁决,实现高效的大规模文档去重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11357 2026-07-03 cs.DC cs.AI cs.AR cs.PF 新提交 90%

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

TileFuse:用于AMD NPU上高效量化LLM推理的融合混合精度内核库

Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对边缘NPU上量化LLM部署困难,提出TileFuse库,通过融合解包、反量化与GEMM/GEMV内核,并设计交错预分块布局与数据流,在XDNA2上实现AWQ格式原生支持,性能提升最高281%,能耗降低64.6%。

Comments 13 pages excluding reference, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26595 2026-06-26 cs.AI 新提交 90%

LLM-based Models for Detecting Emerging Topics in Service Feedback

基于LLM的服务反馈中新兴主题检测模型

Mahsa Tavakoli, Ruth Bankey, Cristián Bravo

机构 * Department of Statistical and Actuarial Sciences, The University of Western Ontario(西安大略大学统计与精算科学系) Canada Revenue Agency(加拿大税务局)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型、统计技术和人机协作的方法,用于检测服务反馈中的新兴质量主题,并揭示潜在服务不公,经税务专家评估优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24467 2026-06-24 cs.AI 新提交 90%

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

CompressKV: 面向资源高效长上下文LLM推理的语义检索引导KV缓存压缩

Xiaolin Lin, Jingcun Wang, Olga Kondrateva, Yiyu Shi, Bing Li, Grace Li Zhang

机构 * Technical University of Darmstadt(达姆施塔特工业大学) University of Notre Dame(圣母大学) Technical University of Ilmenau(伊尔梅瑙工业大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CompressKV框架,通过识别语义检索头(SRH)选择关键token并分层分配缓存预算,在仅用3% KV缓存时保留97%以上性能。

Comments arXiv admin note: substantial text overlap with arXiv:2508.02401

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23521 2026-06-23 cs.DC cs.LG 新提交 90%

Concordia: JIT-Compiled Persistent-Kernel Checkpointing for Fault-Tolerant LLM Inference

Concordia: 用于容错LLM推理的即时编译持久内核检查点

Yuhang Gan, Yiwei Yang, Yuyi Li, Xiangyu Gao, Yichen Wang, Rain Jiang, Xiaoning Ding, Andi Quinn, Chen Qian

机构 * University of California Santa Cruz(加州大学圣克ruz分校) University of California, Davis(加州大学戴维斯分校) University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理中GPU状态丢失问题,提出Concordia运行时,利用设备驻留持久内核实现JIT编译的增量检查点,支持PTX/SASS级插桩,无需修改应用代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22840 2026-06-23 cs.LG 新提交 90%

RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving

RLM-Cascade:用于成本高效LLM API服务的响应级推测解码

Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan

机构 * PayPal

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RLM-Cascade代理层系统,通过响应级推测解码降低LLM API成本,在真实编码工作负载上实现45.8%成本降低和1.83倍延迟加速,同时保持或超越基线质量。

Comments 9 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交 90%

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20577 2026-06-23 cs.NI cs.AI cs.DC 新提交 90%

Human-Less LLM Serving: Quantifying the Human Tax on Throughput

无人类交互的LLM服务:量化吞吐量中的人类税

Jianhui Lian, Li Chen, Dan Li, Yong Jiang

机构 * Tsinghua SIGS(清华大学SIGS) Beijing Zhongguancun Laboratory(北京中关村实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过系统测量发现,为满足人类感知延迟的SLO(TTFT和TPOT),LLM服务系统在长上下文场景下牺牲了60-93%的吞吐量,并提出无人类交互服务模式以消除这一开销。

Comments 10 pages, 2 figures, 1 table. Preliminary work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20373 2026-06-19 cs.SE cs.AI 新提交 90%

AutoPass: Evidence-Guided LLM Agents for Compiler Performance Tuning

AutoPass:基于证据的LLM智能体用于编译器性能调优

Zepeng Li, Jie Ren, Zhanyong Tang, Jie Zheng, Zheng Wang

机构 * Shaanxi Normal University(陕西师范大学) Northwest University(西北大学) University of Leeds(利兹大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AutoPass多智能体框架,通过查询编译器内部状态和中间表示,利用运行时反馈迭代优化编译选项,无需训练即可提升性能,在x86-64和ARM64上分别实现1.043倍和1.117倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20245 2026-06-19 cs.AI 新提交 90%

Navigating Unreliable Parametric and Contextual Knowledge: Explicit Knowledge Conflict Resolution for LLM Inference

导航不可靠的参数化与上下文知识:面向LLM推理的显式知识冲突解决

Huang Peng, Jiuyang Tang, Weixin Zeng, Hao Xu, Xiang Zhao

机构 * National Key Laboratory of Big Data and Decision, National University of Defense Technology(国防科技大学大数据与决策国家重点实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MACR框架,通过自适应知识评估与多智能体推理,显式解决大语言模型内部参数知识与外部上下文之间的冲突,超越传统二元选择范式。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19755 2026-06-19 cs.CR cs.AI 新提交 90%

SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling

SafeSpec: 通过动态反射采样实现快速且安全的LLM

Haotian Xu, Zeyang Zhang, Linbao Li, Huadi Zheng, Yu Li, Cheng Zhuo

机构 * Zhejiang University, Hangzhou, China(浙江大学) Huawei(华为) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SafeSpec框架,将轻量安全头集成到推测解码的验证过程中,通过风险估计和反射采样恢复安全生成,在保持加速的同时显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19135 2026-06-18 cs.MA cs.AI cs.NI 新提交 90%

A Technical Taxonomy of LLM Agent Communication Protocols

LLM智能体通信协议的技术分类法

Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll

机构 * Technische Universität München(慕尼黑技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型智能体通信协议碎片化问题,提出包含五个维度的技术分类法,分析九种开源协议,揭示架构模式并预测协议演进趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18650 2026-06-18 cs.LG 新提交 90%

BLADE: Scalable Bi-level Adaptive Data Selection for LLM Training

BLADE: 面向LLM训练的可扩展双层自适应数据选择

Jiaxing Wang, Deping Xiang, Jin Xu, Zirui Liu, Zicheng Zhang, Guoqiang Gong, Jun Fang, Chao Liu, Pengzhang Liu, Tongxuan Liu, Ke Zhang, Qixia Jiang

机构 * University of Oxford(牛津大学) Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出BLADE框架,通过拉格朗日乘子将双层优化转化为单层惩罚目标,避免逆Hessian计算,实现动态参考模型,理论保证一阶收敛,实验优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18431 2026-06-18 cs.LG cs.DC 新提交 90%

Beyond Prediction: Tail-Aware Scheduling for LLM Inference

超越预测:面向LLM推理的尾延迟感知调度

Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta

机构 * Cornell University, Computer Science Department(康奈尔大学计算机科学系) Cornell University, Electrical and Computer Engineering Department(康奈尔大学电气与计算机工程系) Cornell University, Operations Research and Information Engineering Department(康奈尔大学运筹学与信息工程系) Microsoft Azure System Research(微软Azure系统研究) NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理中长度预测调度在分布偏移和尾延迟控制上的脆弱性,提出无预测的分布感知调度框架,通过轻量统计信号实现软优先级提升,结合缓存感知抢占,在多种工作负载下将P99 TTLT降低35-50%,TTFT降低34-47%。

Journal ref Forty-Third International Conference on Machine Learning (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17915 2026-06-17 cs.MA cs.AI cs.DB cs.SE 新提交 90%

Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization

可信赖的自组合大数据即服务:一种LLM编排的多智能体框架,用于自动化数据工程、AutoML、MLOps部署和漂移感知生命周期优化

Aueaphum Aueawatthanaphisut, Badri Raj Lamichhane

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(素金国际技术研究所,泰国 Thammasat 大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于LLM编排的多智能体BDaaS框架,通过分解生命周期为专用智能体并协调执行,实现自动化数据工程、AutoML、MLOps部署和漂移感知优化,提升生命周期级可靠性。

Comments 7 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17666 2026-06-17 cs.SE cs.AI 新提交 90%

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin: 一种基于LLM的流程孪生开发系统

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17536 2026-06-17 cs.CV cs.AI 新提交 90%

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

机构 * Peking University(北京大学) Xiamen University(厦门大学) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) National Taiwan University(国立台湾大学) Wuhan University(武汉大学) Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16813 2026-06-16 cs.AI 新提交 90%

GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents

GIST-CMTF:LLM代理中因果最小工具过滤的目标状态推断

Rahul Suresh Babu, Rohit Shukla

机构 * Rahul Suresh Babu Rohit Shukla

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出GIST-CMTF层,通过预测候选符号目标状态并估计歧义性,解决工具增强LLM代理因用户请求多义性导致的错误目标执行问题,在120个任务上达到97.0%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16332 2026-06-16 cs.DC cs.AI cs.PF 新提交 90%

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

SMEPilot: 利用可扩展矩阵扩展表征和优化LLM推理

Feiyang Chen, Haibo Chen

机构 * IPADS, Shanghai Jiao Tong University(上海交通大学IPADS)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对CPU矩阵扩展单元与核心在LLM推理中的不匹配,提出SMEPilot引擎,通过基于屋顶线的表征指导算子执行选择,实现SME与CPU协同工作,端到端性能提升达3.94倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13968 2026-06-15 cs.DC cs.AI 新提交 90%

STREAM: Multi-Tier LLM Inference Middleware with Dual-Channel HPC Token Streaming

STREAM:具有双通道 HPC 令牌流的多层 LLM 推理中间件

Anas Nassar, Steve Mohr, Leonard Apanasevich, Himanshu Sharma

机构 * Advanced Cyberinfrastructure for Education and Research (ACER) University of Illinois Chicago(高级教育与研究计算基础设施(ACER)伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 STREAM 系统,通过三层路由架构(本地、HPC、云)和双通道 HPC 流(控制平面与数据平面分离)实现亚秒级 TTFT,解决现有系统无法统一三种推理场景的问题。

Comments 6 pages, 1 figure, PEARC '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11806 2026-06-11 cs.CL 新提交 90%

External Experience Serving in Production LLM Systems: A Deployment-Oriented Study of Quality-Cost Trade-offs

生产级LLM系统中的外部经验服务:面向部署的质量-成本权衡研究

Lin Sun, Heming Zhang, Xiangzheng Zhang

机构 * Qiyuan Tech(奇元科技)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究生产级LLM系统中注入外部经验的质量-成本权衡,发现选择性检索优于全局注入,且检索质量比增加Top-K更重要,成本效益因任务输出长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11379 2026-06-11 cs.AI 新提交 90%

Automated Mediator for Human Negotiation: Pre-Mediation via a Structured LLM Pipeline

人类谈判的自动调解器:通过结构化LLM流水线进行预调解

Jamie Bergen, Sarit Kraus

机构 * University of Washington(华盛顿大学) University of Haifa(海法大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种结构化LLM流水线作为自动调解器,在整合性谈判中支持预调解,通过分解准备任务为专用模块,在短期自我报告结果上与人类调解员相当,并在偏好推理任务上误差降低36%。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10861 2026-06-10 cs.SE cs.AI cs.HC 新提交 90%

From Perception to Action: Can UI Interventions Foster Sustainable LLM Chatbot

从感知到行动:UI干预能否促进可持续的LLM聊天机器人

Nitish Patkar, Pooja Rani, Jack Glässer, Simon Lüscher, Martin Kropp

机构 * University of Applied Sciences and Arts Northwestern Switzerland (FHNW)(瑞士西北应用科学与艺术大学(FHNW)) University of Mannheim(曼海姆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过UI干预(如模式切换、能耗反馈)提升用户对LLM聊天机器人能耗的感知,并鼓励节能行为,发现模式切换是主要行为机制。

详情

展开后加载摘要…

URL PDF HTML 收藏