arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2606.04596 2026-06-04 cs.CL 70%

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

多视频摘要中位置偏差的系统评估:基于多模态大语言模型

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(未来科学国际中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04389 2026-06-04 cs.CL 70%

When Clients Stop Following: A Cognitive Conceptualization Diagram-driven Framework for Strategic Counseling

当来访者不再跟随:基于认知概念化图的策略性咨询框架

Yihao Qin, Junyi Zhao, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Chang Liu, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有评估协议中来访者过度顺从导致评分虚高的问题,提出基于认知行为疗法的抵抗感知框架,通过认知概念化图模拟动态抵抗,并利用强化学习优化策略推理与响应生成,以提升在困难咨询交互中的策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30947 2026-06-04 cs.CL 70%

Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship

将人工智能研究扩展到人文学科:一个用于证据基础学术的多智能体框架

Yating Pan, Jiajun Zhang, Jun Wang, Qi Su

机构 * Department of Information Management(信息管理系) Research Center for Digital Humanities(数字人文研究中心) School of Foreign Languages(外国语言学院) Institute for Artificial Intelligence(人工智能研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SPIRE多智能体框架,通过将人文学科操作建模为协作智能体角色,结合多尺度细读检索,实现基于证据的论证,在古典文献基准上优于现有方法。

Comments 28 pages, 3 figures. Code, data catalogues, and reproduction scripts: https://github.com/YatingPan/SPIRE. Lead corresponding author: Jun Wang; corresponding author: Qi Su

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11194 2026-06-04 cs.AI 70%

Aligning Deep Implicit Preferences by Learning to Reason Defensively

通过防御性推理对齐深度隐式偏好

Peiming Li, Zhiyuan Hu, Yang Tang, Shiyu Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。

Journal ref ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02555 2026-06-04 cs.CV cs.CL 70%

High-Quality Entity Segmentation and Grounding

高质量实体分割与定位

Lu Qi, Yi-Wen Chen, Tao Zhang, Xiangtai Li, Xu Yang, Bo Du, Ming-Hsuan Yang

机构 * Wuhan University(武汉大学) Insta360 Research(Insta360研究院) Department of EECS, University of California, Merced(加州大学默塞德分校电子工程与计算机科学系) Nanyang Technological University(南洋理工大学) Institute of Automation of the Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ESG流水线,通过新数据集EntitySeg和两阶段解耦设计(CropFormer高质量分割+GELLA精确名词提取与语义匹配),实现高质量实体分割与定位,在五项任务上有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05023 2026-06-04 cs.HC 67%

Scaling Expert Feedback with Reflective Edit Propagation in Compositional Knowledge Bases

在组合知识库中通过反思性编辑传播扩展专家反馈

Jiajing Guo, Xueming Li, Jorge Piazentin Ono, Wenbin He, Liu Ren

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出RAID系统,通过反思性代理推断专家编辑意图并自动传播到整个知识库,以规模化扩展专家反馈。

Comments Accepted to ACM CAIS '26 Demo Track

Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04716 2026-06-04 cs.SE 67%

The State of Peer Review in Empirical Software Engineering: A Community Survey on Review Load, Quality, and GenAI Use

实证软件工程中同行评审的现状:关于评审负荷、质量和生成式AI使用的社区调查

Justus Bogner, Roberto Verdecchia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 通过对实证软件工程社区进行问卷调查(120份回复),研究了同行评审的负荷、质量、生成式AI使用问题及改进建议。

Comments Published in ACM SIGSOFT Software Engineering Notes (SEN), Volume 51, Issue 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04282 2026-06-04 cs.CV 67%

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

FindIt:面向通用多模态大语言模型的格式感知视觉检测基准

Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne

机构 * Tuebingen AI Center, University of Tuebingen(图宾根人工智能中心,图宾根大学) Woven by Toyota, Inc.(丰田公司) Toyota Motor Europe(丰田欧洲公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出首个全面评估通用多模态大语言模型在可提示定位能力上的基准,涵盖四种核心任务,并标准化输入输出格式,揭示模型对格式约束的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03892 2026-06-04 cs.CL cs.AI cs.LG 67%

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

合成与奖励——面向实时环境中多步骤工具使用的强化学习

Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PROVE框架,通过20个有状态MCP服务器、自动化数据合成流水线和多组件程序化奖励,解决多步骤工具调用中的环境构建、查询生成和奖励设计问题,在BFCL Multi-Turn、tau2-bench和T-Eval上分别提升最多+10.2、+6.8和+6.5分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01804 2026-06-04 eess.AS cs.SD 67%

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

SpeechEditBench:面向指令引导语音编辑的双语多属性基准

Hanlin Zhang, Daxin Tan, Dehua Tao, Xiao Chen, Haochen Tan, Linqi Song

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) AI Lab, Leibniz Research Center, Huawei(华为莱茵研究院人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SpeechEditBench双语多属性基准,通过锚点评估协议衡量语音编辑中目标属性的修改成功与非目标属性的保持,发现现有模型在组合编辑任务上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04320 2026-06-04 cs.LG cs.AI 62%

OpenRFM: Dissecting Relational In-Context Learning

OpenRFM:剖析关系型上下文学习

Zhikai Chen, Junyu Yin, Jialiang Gu, Siheng Xiong, Xiaoze Liu, Ruowang Zhang, Keren Zhou, Kai Guo

机构 * Michigan State University(密歇根州立大学) Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析关系型Transformer的模型和数据两方面问题,提出双阶段上下文学习架构和同质性感知预训练混合策略,构建OpenRFM模型,在关系型基础模型上平均任务性能提升约30%。

Comments 25 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13672 2026-06-04 cs.CV cs.AI cs.LG 62%

SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification

SpurAudio: 用于研究少样本音频分类中捷径学习的基准

Giries Abu Ayoub, Morad Tukan, Loay Mualem

机构 * Department of Computer Science, University of Haifa(海法大学计算机科学系) Independent Researcher(独立研究者) University of Stuttgart, Germany(斯图加特大学,德国) IMPRS-IS, Germany(智能系统国际Max Planck研究学校,德国)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出SpurAudio基准,通过控制音频中前景与背景的关联,评估少样本分类模型对虚假相关性的敏感性,发现现有方法在背景变化时性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05124 2026-06-04 cs.GR cs.CV cs.LG 57%

Geometry Gaussians: Decoupling Appearance and Geometry in Gaussian Splatting

几何高斯:在高斯泼溅中解耦外观与几何

Hongyu Zhou, Zorah Lähner

机构 * University of Bonn(波恩大学) Lamarr Institut(拉马尔研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对3D高斯泼溅在几何表示与外观渲染间的冲突,提出通过为每个溅射添加几何不透明度参数并配合透明度优化流程,实现几何与外观的解耦,提升复杂场景(尤其是透明物体)的渲染与几何性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04970 2026-06-04 cs.CV cs.AI 57%

Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

计划、观察、恢复:主动式程序辅助的基准与架构

Kaustav Kundu, Ritvik Shrivastava, Maxim Arap, Nanshu Wang, Xianhui Zhu, Quintin Fettes, Gautam Tiwari, Parth Suresh, Théo Moutakanni, Alejandro Castillejo Munoz, Allen Bolourchi, Pascale Fung, Pinar Donmez, Babak Damavandi, Anuj Kumar, Seungwhan Moon

机构 * Meta Reality Labs(Meta现实实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出EgoProactive数据集和Pro²Bench基准,并设计解耦规划器-交互架构,用于主动式程序辅助中的实时引导和异常恢复。

Comments 53 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04967 2026-06-04 cs.SE cs.AI 57%

From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents

从提示到流程:支持AI软件开发智能体的框架流程分类与比较评估

Sanderson Oliveira de Macedo

机构 * Federal Institute of Goias(戈亚斯联邦理工学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出六维流程分类法,对六个AI软件开发框架进行评分比较,揭示流程深度与可移植性之间的结构性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04680 2026-06-04 eess.AS cs.CL cs.SD 57%

Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy

听你所写:基于声学差异的无参考假设评估

Zhihan Li, Hankun Wang, Yiwei Guo, Bohan Li, Xie Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室、计算机科学学院、上海交通大学、中国) MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing, China(人工智能MOE重点实验室、江苏省语言计算重点实验室、中国)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出READ指标,利用预训练自回归TTS模型计算语音与文本假设的声学差异,无需参考转录即可评估ASR假设,并在噪声条件下实现高达20%的相对错误率降低。

Comments Submitted to Interspeech 2026. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05160 2026-06-04 cs.RO 50%

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

GRAIL: 从3D资产和视频先验生成人形机器人全身操作

Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan

机构 * NVIDIA UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GRAIL全虚拟生成管线,利用3D资产和视频基础模型先验合成人机交互演示,无需物理搭建或遥操作,实现人形机器人全身操作策略的模拟到现实迁移。

Comments Project page: https://research.nvidia.com/labs/dair/grail/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04844 2026-06-04 cs.SD cs.CV 50%

Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification

漂移增强评分:文本驱动的零样本音频-语言分类噪声鲁棒性

Tu Vo, Sheir Zaheer, Chan Y. Park

机构 * Anonymous Authors(匿名作者)

专题命中 评测与基准 :language model(abstract)

AI总结 提出漂移增强评分(DAS),通过文本生成的噪声条件提示预测音频嵌入漂移方向,为每个类别添加奖励分数,在不增加梯度或测试时批处理的情况下,显著提升零样本音频分类在噪声下的准确率和mAP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04545 2026-06-04 cs.CV 50%

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

Impostor:一个用于真实AIGC篡改定位的智能体策划基准

Zhenliang Li, Yutao Hu, Qixiong Wang, Wenpeng Du, Hongxiang Jiang, Jiasong Wu, Xiaolong Jiang, Jungong Han

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 为解决现有图像篡改检测与定位基准在视觉真实感、篡改多样性和生成器覆盖方面的局限,提出了Impostor数据集和CraftAgent框架,并设计了PhaseAware-Net方法,在多个基准上取得优异性能。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04414 2026-06-04 cs.CV cs.MM 50%

Motion-Guided Causal Disentanglement for Robust Multi-View Cine Cardiac MRI Diagnosis

运动引导的因果解耦用于鲁棒多视角电影心脏MRI诊断

Chuankai Xu, Cristiane De Carvalho Singulane, Mohammad Abuannadi, Stephen Chandler, Jeremy Slivnick, Karolina Zareba, Jane Cao, Vidya Nadig, Fabio Fernandes, Seth Uretsky, Diego Perez de Arenaza, Amit Patel, Jianxin Xie

机构 * University of Virginia(弗吉尼亚大学) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学) St. Francis Hospital & Heart Center(圣弗朗西斯医院及心脏中心) Hartford HealthCare(哈特福德医疗集团) Instituto do Coração (InCor)(心脏研究所(InCor)) Atlantic Health System(大西洋健康系统) Sociedad Italiana de Beneficencia (Hospital Italiano)(意大利慈善协会(意大利医院))

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出运动引导的视角-疾病解耦框架MoViD,通过双分支监督对比学习和梯度反转对抗约束分离视角特定与疾病判别特征,结合无标注时间运动特征定位心脏区域并缓解类别不平衡,在静脉血栓数据集和两个公开基准上超越标准Transformer基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 65 篇

2510.21459 2026-06-04 cs.CR cs.CL cs.LG 92%

SBASH: a Framework for Designing and Evaluating RAG vs. Prompt-Tuned LLM Honeypots

SBASH:用于设计和评估RAG与提示调优的LLM蜜罐框架

Adetayo Adebimpe, Helmut Neukirchen, Thomas Welsh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.LG

AI总结 提出SBASH框架,利用轻量级本地LLM和RAG技术构建蜜罐,通过多种指标评估RAG与提示调优对LLM蜜罐真实性和响应延迟的影响。

Comments to be published in: The 3rd International Conference on Foundation and Large Language Models (FLLM2025), IEEE, 2025

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09719 2026-06-04 cs.CL cs.AI 92%

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

有界双曲正切:大型语言模型中预层归一化的稳定高效替代方案

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

机构 * Yonsei University(延世大学) Upstage AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出BHyT,通过有界双曲正切和数据驱动的输入约束替代Pre-LN,在保持稳定性的同时提升训练和推理效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05004 2026-06-04 cs.CR cs.AI 90%

SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

SharedRequest: 面向大型语言模型的隐私保护模型无关推理

Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang

机构 * National University of Singapore (Chongqing) Research Institute(新加坡国立大学(重庆)研究院) Chongqing Key Laboratory of Trusted Perception and Interaction Technology for Intelligent and Connected Vehicles(重庆智能网联车辆可信感知与交互技术重点实验室) National University of Singapore(新加坡国立大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) State Key Laboratory of Intelligent Vehicle Safety Technology, Chongqing, China(重庆智能车辆安全技术国家重点实验室) CHONGQING CHANGAN AUTOMOBILE Co., Ltd(重庆长安汽车有限公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种模型无关的隐私保护推理框架SharedRequest,通过批量级别混淆和语义分组实现高效隐私保护,相比差分隐私基线效用提升20%以上,查询成本降低5倍。

Comments accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17709 2026-06-04 cs.CL cs.DC 90%

DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

DeInfer:分解式大语言模型的高效并行推理

You-Liang Huang, Xinhao Huang, Chengxi Liao, Zeyi Wen

机构 * Boston University(波士顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对分解式大语言模型并行推理性能差的问题,提出DeInfer系统,通过多项优化实现高性能并行推理,实验证明其优越性。

Comments accepted by DAC'26, latest version fixs a minor mistake

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05130 2026-06-04 cs.LG cs.AI 90%

Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent

面向高效且基于证据的移动预测:基于LLM驱动的智能体

Linyao Chen, Qinlao Zhao, Zechen Li, Mingming Li, Likun Ni, Jinyu Chen, Yuhao Yao, Xuan Song, Noboru Koshizuka, Hiroki Kobayashi

机构 * The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) University of New South Wales, Sydney(新南威尔士大学(悉尼)) LocationMind Inc.(LocationMind公司) Southern University of Science and Technology(南方科技大学) Jilin University(吉林大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的LLM驱动智能体框架AgentMob,通过自适应证据收集机制解决移动预测中的模糊情况,在多个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04719 2026-06-04 cs.CL 90%

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

基于查询的跨模态投影器增强Mamba多模态大语言模型

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology / Korea, Republic of(韩国科学技术院) University of Illinois in Urbana-Champaign / United States of America(伊利诺伊大学厄巴纳-香槟分校) Korea University / Korea, Republic of(韩国大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于查询的跨模态投影器,通过交叉注意力压缩视觉令牌,消除手动设计2D扫描顺序的需求,提升Mamba多模态LLM的性能和吞吐量。

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04594 2026-06-04 cs.DC cs.AI cs.SE 90%

Ekka: Automated Diagnosis of Silent Errors in LLM Inference

Ekka: LLM推理中静默错误的自动诊断

Yile Gu, Zhen Zhang, Shaowei Zhu, Xinwei Fu, Jun Wu, Yida Wang, Baris Kasikci

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Ekka系统,通过差分调试对齐比较中间执行状态,自动诊断LLM推理框架中的静默错误,在真实错误基准上达到80% pass@1和88% pass@5的诊断准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03353 2026-06-04 cs.CR cs.AI 90%

SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents

SkCC:面向跨框架LLM代理的可移植且安全的技能编译

Yipeng Ouyang, Yi Xiao, Yuhao Gu, Xianwei Zhang

机构 * Sun Yat-sen University(中山大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM代理技能在不同框架间缺乏可移植性和安全性的问题,提出SkCC编译器,通过强类型中间表示SkIR解耦语义与格式,实现跨框架部署,并内置静态优化器强制执行安全约束,显著提升性能并降低适配复杂度。

Comments Accepted by the Agent Skills Workshop at ACM CAIS 2026. 20 pages, 6 figures. Project Homepage: https://skcc.nexa-lang.com/ Code Repo: https://github.com/Nexa-Language/Skill-Compiler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23312 2026-06-04 cs.HC cs.AI cs.LG cs.RO cs.SY eess.SY 90%

Evaluating Zero-Shot and One-Shot Adaptation of Small Language Models in Leader-Follower Interaction

评估小语言模型在领导者-跟随者交互中的零样本和单样本适应

Rafael R. Baptista, André de Lima Salgado, Ricardo V. Godoy, Marcelo Becker, Thiago Boaventura, Gustavo J. G. Lahr

机构 * University of Sao Paulo(圣保罗大学) Federal University of Lavras(拉瓦尔联邦大学) Faculdade Israelita de Ensino e Pesquisa Albert Einstein(亚伯拉罕·林克·埃instein教育与研究学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过微调小语言模型(Qwen2.5-0.5B)在领导者-跟随者交互中实现角色分类,零样本微调达到86.66%准确率且延迟低至22.2毫秒,但单样本模式因上下文长度增加导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05722 2026-06-04 cs.CL cs.AI 89%

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench:衡量LLM推理效率

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OckBench基准,联合评估推理和编码任务中的准确性与token效率,揭示当前模型token利用率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏