arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 58 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 58 篇

2605.21427 2026-05-21 cs.AI cs.DC 92%

PALS: Power-Aware LLM Serving for Mixture-of-Experts Models

PALS: 为混合专家模型的功率感知LLM服务

Can Hankendi, Rana Shahout, Minlan Yu, Ayse K. Coskun

机构 * Boston University(波士顿大学) Harvard University School of Engineering(哈佛大学工程与应用科学学院) Harvard University(哈佛大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PALS,一种功率感知的LLM服务运行时,通过将GPU功率上限作为可控制的参数与软件参数如批大小联合优化,提升能效并减少在功率限制下的服务质量违规。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21049 2026-05-21 cs.CL 92%

Cross-lingual robustness of LLM-brain alignment and its computational roots

LLM-脑对齐的跨语言鲁棒性及其计算根源

Ni Yang, Rui He, Philipp Homan, Iris Sommer, Davide Staub, Wolfram Hinzen

机构 * Grammar and Cognition Lab, Department of Translation & Language Sciences, Universitat Pompeu Fabra(语言与翻译科学系语法与认知实验室,庞培法华大学) Department of Adult Psychiatry and Psychotherapy, University of Zurich(苏黎世大学成人精神病学与心理治疗系) Neuroscience Center Zurich, University of Zurich and ETH Zurich(苏黎世大学神经科学中心与苏黎世联邦理工学院) Center for Clinical Neuroscience and Cognition and Department of Psychiatry, University of Groningen, University Medical Center Groningen(格罗宁根大学临床神经科学与认知中心及精神病学系,格罗宁根大学医学中心) Scalable Scientific Machine Learning Lab, Imperial College London, Department of Earth Science and Engineering(伦敦帝国理工学院可扩展科学机器学习实验室,地球科学与工程系) Institut Català de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究与研究机构(ICREA),巴塞罗那,西班牙)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究探讨了大型语言模型与大脑对齐的跨语言鲁棒性,通过多语言全脑编码框架分析了中文、英语和法语在自然故事听觉过程中大脑与LLM的对齐情况,发现其在空间上具有跨语言重叠性,但无法通过预测不确定性或表征几何来解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10726 2026-05-21 cs.CR cs.DC cs.LG 92%

PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems

PrefixWall: 缓解共享LLM系统中的前缀缓存侧信道

Panagiotis Georgios Pennas, Konstantinos Papaioannou, Marco Guarnieri, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PrefixWall系统,通过监控缓存重用并选择性隔离前缀,有效缓解多租户LLM服务系统中自动前缀缓存(APC)侧信道带来的安全风险,同时提升缓存利用率和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20706 2026-05-21 cs.DC cs.AI cs.LG 91%

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

网络上的Llamas:基于WebGPU的内存高效、性能可移植和多精度LLM推理

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

机构 * Microsoft Research(微软研究院) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LlamaWeb,一种基于WebGPU的LLM推理框架,通过静态内存规划和高效模型加载减少内存开销,支持多种模型权重格式,实现了内存高效、性能可移植的LLM推理。

Comments 19 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14444 2026-05-21 cs.LG cs.AI 91%

A Free Lunch in LLM Compression: Revisiting Retraining after Pruning

在LLM压缩中寻找免费午餐:重新审视剪枝后的重新训练

Moritz Wagner, Christophe Roux, Max Zimmer, Sebastian Pokutta

机构 * Department for AI in Society, Science, and Technology, Zuse Institute Berlin(人工智能社会、科学与技术系,柏林Zuse研究所) Institute of Mathematics, Technische Universität Berlin(数学系,柏林技术大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在剪枝后通过局部重建进行适应的方法,发现其在减少数据和计算成本的同时能有效提升模型性能,并揭示了在不同粒度下重建参数窗口对最终质量的影响,挑战了LLM剪枝后适应不可行的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16359 2026-05-21 cs.SE 91%

LLM4Log: A Systematic Review of Large Language Model-based Log Analysis

LLM4Log: 大型语言模型基于日志分析的系统综述

Zeyang Ma, Jinqiu Yang, Tse-Hsun Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文系统综述了基于大型语言模型的日志分析,涵盖从日志生成维护到解析结构化及下游任务如异常检测、故障预测、根本原因分析和日志摘要的全流程,总结了常见设计模式和评估实践,并指出可靠实际应用中的关键挑战和开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21405 2026-05-21 cs.SE cs.AI cs.PL 90%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21082 2026-05-21 cs.AI 90%

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化

Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19537 2026-05-21 cs.LG 90%

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

沉默的超参数:量化推理后端对LLM可重复性的影响

David Pape, Jonathan Evertz, Lea Schönherr

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了推理后端对LLM基准测试结果的影响,发现不同后端可能导致基准分数变化达16.6个百分点,并引发高比例的输出分歧,强调了推理后端作为关键超参数的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17631 2026-05-21 cs.LG cs.AI 90%

Time-Prompt: Integrated Heterogeneous Prompts for Unlocking LLMs in Time Series Forecasting

Time-Prompt: 集成异构提示以解锁时间序列预测中的LLM

Zesen Wang, Lijuan Lan, Yonggang Li

机构 * Central South University, Changsha, China(中南大学,长沙,中国)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Time-Prompt框架,通过构建统一的提示范式、设计语义空间嵌入和跨模态对齐模块以及高效微调LLM参数,提升时间序列预测性能,并在碳排放数据集上验证其有效性。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18586 2026-05-21 cs.DC 89%

TokenCake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications

TokenCake: 一种面向基于LLM的多智能体应用的KV缓存中心化服务框架

Zhuohang Bian, Feiyang Wu, Zhuoran Li, Teng Ma, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TokenCake,一种面向基于LLM的多智能体应用的KV缓存中心化服务框架,通过智能体感知设计共同优化调度和内存管理,以解决KV缓存中的空间竞争和时间利用率问题,实验表明其显著降低了端到端延迟并提高了GPU内存利用率。

Comments 14 pages, 17 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09557 2026-05-21 cs.DC cs.LG 89%

Understanding and Improving Communication Performance in Multi-node LLM Inference

理解并改进多节点LLM推理中的通信性能

Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

机构 * Department of Computer Science, University of Maryland(马里兰大学计算机科学系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究探讨了多节点分布式推理中通信性能的优化,通过分析不同模型并行方案的强标度行为,提出了一种基于递归倍增的分层all-reduce算法NVRAR,显著降低了推理延迟。

Comments 17 Figures, To Appear in Proceedings of ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04155 2026-05-21 cs.CL 88%

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

针对大型语言模型的对话响应生成中的有毒子词修剪

Hongyuan Lu, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种名为ToxPrune的新型算法,通过修剪包含有毒词的子词来防止大型语言模型生成有毒内容,同时提升了对话响应生成任务中非有毒模型的表现。

Comments ACL *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19893 2026-05-21 cs.OS 87%

SSV: Sparse Speculative Verification for Efficient LLM Inference

SSV:用于高效LLM推理的稀疏推测验证

Zhibin Wang, Ziyu Zhong, Nuo Shen, Yuhang Zhou, Rong Gu, Sheng Zhong

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出SSV框架,通过结合重叠感知的分组查询执行、基于刷新/重用的NSA内核融合和基于性能配置文件的提示自适应调度,提升跨查询重用率,减少所选索引和分支融合开销,并在用户指定的精度类别下选择有效的草稿验证策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12321 2026-05-21 cs.AI cs.CY cs.ET 86%

LIDSA: Cognitive Arbitration for Signal-Free Autonomous Intersection Management

LIDSA:信号自由的自主交叉口管理中的认知仲裁

Abderrahmane Lakas, Mohamed Amine Ferrag, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LIDSA框架,利用大语言模型进行意图驱动的速度建议,以实现信号自由的自主交叉口管理,通过对比固定周期控制、SCATS、AIM和GLOSA等方法,证明LLM在实时交叉口管理中的有效性。

Comments Renamed LISA to LIDSA to avoid naming ambiguity with existing traffic-control software. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20613 2026-05-21 cs.CL 85%

HRM-Text: Efficient Pretraining Beyond Scaling

HRM-Text: 超越规模的高效预训练

Guan Wang, Changling Liu, Chenyu Wang, Cai Zhou, Yuhao Sun, Yifei Wu, Shuai Zhen, Luca Scimeca, Yasin Abbasi Yadkori

机构 * Sapient Intelligence MIT(麻省理工学院)

专题命中 效率与部署 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HRM-Text模型,通过引入分层递归模型和新的训练方法,在减少计算资源消耗的同时实现了与大规模模型相当的性能,展示了高效预训练的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06824 2026-05-21 cs.LG 85%

Efficient numeracy in language models through single-token number embeddings

通过单token数字嵌入提升语言模型的数值处理效率

Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, Munich, Germany(人工智能在医疗和医学中的Chair,慕尼黑技术大学(TUM)和慕尼黑技术大学医院,德国慕尼黑) Department of Computing, Imperial College London, UK(计算系,伦敦帝国学院,英国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(哈索·platzer研究所数字工程学院,波茨坦大学,德国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出BitTokens,一种利用IEEE 754二进制浮点表示将数字编码为单token的方法,使语言模型能更高效地处理数值计算,从而提升其解决复杂问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20473 2026-05-21 cs.SE cs.AI cs.LG 85%

Code Generation by Differential Test Time Scaling

通过微分测试时间缩放进行代码生成

Yifeng He, Ethan Wang, Jicheng Wang, Xuanxin Ouyang, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DiffCodeGen,一种基于覆盖引导的微分分析的代码生成方法,通过生成多样化的代码候选并利用覆盖引导模糊测试来合成输入,无需现有测试用例或大语言模型,从而提高效率和可扩展性。

Comments 16 main text, 21 pages with references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20295 2026-05-21 cs.LG cs.AI 85%

Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization

Quant.npu:通过完全静态量化实现高效的移动NPU推理以支持设备端LLM

Jinghe Zhang, Daliang Xu, Chenghua Wang, Weikai Xie, Tao Qi, Yun Ma, Mengwei Xu, Gang Huang

机构 * Qualcomm(高通)

专题命中 效率与部署 :LLM(title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Quant.npu框架,通过完全静态量化方法实现高效的移动NPU推理,解决了传统后训练量化方法在NPU硬件约束下的兼容性问题,并在实际移动NPU上实现了较高的准确性和较低的推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18579 2026-05-21 cs.LG 84%

S2Aligner: Pair-Efficient and Transferable Pre-Training for Sparse Text-Attributed Graphs

S2Aligner: 用于稀疏文本属性图的高效且可迁移的预训练方法

Yuhan Wang, Haopeng Zhang, Yibo Ding, Jiaqi Yu, Xinyu Zhao, Yuhang Liu, Ziwei Zhang, Xiao Wang, Ruijie Wang

机构 * Beihang University(北航大学) Tianjin University(天津大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出S2Aligner,一种针对稀疏文本属性图的高效且可迁移的预训练方法,通过解耦语义对齐与结构建模,增强对齐过程而不污染共享的语义空间,从而减少跨域泛化差距。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17164 2026-05-21 cs.DC cs.AI cs.LG cs.PL 84%

Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference

Charon:一种用于大规模大语言模型训练和推理的统一且细粒度模拟器

Mengtian Yang, Zhekun Zhang, Mingheng Wu, Jianwen Yan, Hanshi Sun, Li-wen Chang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Charon模拟器,通过统一、模块化和细粒度的方法,准确预测大语言模型性能,实验显示其在不同模型和配置上具有高精度,预测误差低于5.35%,并在实际推理部署中发现提升系统吞吐量的配置,展示了其实际价值。

Comments Accepted by MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20813 2026-05-21 cs.CL 83%

PulseCol: Periodically Refreshed Column-Sparse Attention for Accelerating Diffusion Language Models

PulseCol: 周期性刷新的列稀疏注意力用于加速扩散语言模型

Yanyi Lyu, Letian Chen, Futing Sun, Miao Zhang, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出PulseCol,一种周期性刷新的列稀疏注意力方法,通过更细粒度的稀疏化策略提升扩散语言模型的计算效率和加速性能,同时保持模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18915 2026-05-21 cs.CL cs.AI 82%

END: Early Noise Dropping for Efficient and Effective Context Denoising

END:早期噪声丢弃以实现高效有效的上下文去噪

Hongye Jin, Pei Chen, Jingfeng Yang, Zhengyang Wang, Fangran Mo, Jinghan Zhang, Meng Jiang, Yifan Gao, Binxuan Huang, Xinyang Zhang, Zheng Li, Tianyi Liu, Huasheng Li, Bing Yin

机构 * Amazon(亚马逊)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出END方法,通过在早期层对输入序列进行分割和线性探针,有效识别并丢弃噪声部分,从而提升LLM在不同任务上的性能和效率,同时加深了对LLM内部上下文推理机制的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21442 2026-05-21 cs.LG cs.AI 81%

torchtune: PyTorch native post-training library

torchtune: 一种基于PyTorch的后训练库

Mark Obozov, Maxime Griot, Joseph Cummings, Evan Smothers, Felipe Mello, Rafi Ayub, Philip John Bontrager, Salman Mohammadi, Ariel Kwiatkowski, Nathan Azrak, Mircea Mironenco

机构 * PyTorch Meta Stanford(斯坦福) Meta-FAIR

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了torchtune,一种基于PyTorch的后训练库,旨在简化大语言模型的后训练生命周期,提供高效的微调、实验和部署流程,通过模块化和可扩展性提升性能和灵活性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16813 2026-05-21 cs.CL cs.AI 81%

Flow Map Language Models: One-step Language Modeling via Continuous Denoising

流映射语言模型:通过连续去噪实现一步语言建模

Chanhyuk Lee, Jaehoon Yoo, Manan Agarwal, Sheel Shah, Jerry Huang, Aditi Raghunathan, Seunghoon Hong, Nicholas M. Boffi, Jinwoo Kim

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于连续流的流映射语言模型,通过在one-hot token嵌入上构建连续流,实现了在质量和速度上优于离散扩散模型的性能,展示了连续流在离散模态生成建模中的潜力。

Comments 58 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16513 2026-05-21 cs.LG cs.AI 81%

FEAT: A Linear-Complexity Foundation Model for Extremely Large Structured Data

FEAT: 一个线性复杂度的超大规模结构化数据基础模型

Zhenghang Song, Tang Qian, Lu Chen, Yushuai Li, Zhengke Hu, Bingbing Fang, Yumeng Song, Junbo Zhao, Sheng Zhang, Tianyi Li

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Aalborg University(奥尔堡大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FEAT,一种线性复杂度的基础模型,用于处理超大规模结构化数据,通过多层双轴编码架构和自适应融合双向状态空间模型,实现线性时间内的跨元组上下文化,同时支持排列不变的表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21434 2026-05-21 cs.SE 80%

Agentic Model Checking

代理模型检查

Youcheng Sun, Jiawen Liu, Daniel Kroening, Jason Xue

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21035 2026-05-21 cs.HC 80%

The Quiet Path from Seemingly Minor Design Errors to Workplace AI Incidents

从看似微小的设计错误到工作场所AI事件的沉默路径

Julia De Miguel Velázquez, Sanja Šćepanović, Andrés Gvirtz, Daniele Quercia

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨了工作场所中人工智能系统设计与员工需求之间的不匹配问题,发现83%的工作场所AI事件源于员工与AI系统之间的不匹配,主要表现为员工期望系统精准、有洞察力或个性化,但实际获得的是基础、简单或通用的系统,且开发者过度关注效率和速度导致了大量问题。

Comments Accepted in April 2026 to be published in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25-28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20563 2026-05-21 cs.MA cs.AI cs.CL cs.LG cs.SE 80%

Multi-agent Collaboration with State Management

具有状态管理的多智能体协作

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong

机构 * Shanghai Jiaotong University(上海交通大学) Cortices AI Emory University(埃默里大学) Peking University(北京大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出STORM,一种面向多智能体协作的状态管理方法,通过在共享工作区中调解智能体的交互,确保每个智能体在一致的代码库视图上操作,并在写入时检测和解决冲突。STORM在多个LLM上优于基于git-worktree的多智能体基线,且在成本效率上具有竞争力,表明显式状态管理比工作区隔离更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20193 2026-05-21 cs.CL cs.AI cs.LG 80%

Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification

通过多轮提示验证提升量化模型在定性分析中的性能

Aisvarya Adeseye, Jouni Isoaho, Adeyemi Adeseye

机构 * University of Turku, Turku, Finland(图尔库大学,芬兰图尔库) Brilloconnetz Partners avoin yhtiö, Turku, Finland(Brilloconnetz Partners 有限公司,芬兰图尔库)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了不同位数量化级别和类型对LLaMA-3.1(8B)在定性分析中的性能影响,提出了一种量化感知的多轮提示验证方法以提高模型的稳定性和准确性,结果显示8位模型最接近黄金标准,4位模型在应用方法后变得稳定,3位和2位模型在提示设计和验证后性能有所提升。

Comments Accepted to publish in 12th Intelligent Systems Conference 2026; 3-4 September 2026 in Amsterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏