arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 97 篇

2605.03213 2026-05-08 cs.CR cs.AI 70%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 70%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23055 2026-05-08 stat.ML cs.IT cs.LG math.IT 70%

Post-Selection Distributional Model Evaluation

后选择分布模型评估

Amirmohammad Farzaneh, Osvaldo Simeone

机构 * Institute for Intelligent Networked Systems (INSI)(智能网络系统研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PS-DME框架,用于在数据依赖的模型预选后进行统计有效的分布模型评估,通过控制后选择虚无覆盖率提升样本效率,实验证明其在性能-可靠性权衡中可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07819 2026-05-08 cs.CV cs.LG 70%

Fusion Complexity Inversion: Why Simpler Cross View Modules Outperform SSMs and Cross View Attention Transformers for Pasture Biomass Regression

融合复杂性倒置:为何更简单的跨视图模块在牧草生物量回归中优于SSM和跨视图注意力变换器

Mridankan Mandal

机构 * Department of Information Technology(信息科技系) Indian Institute of Information Technology, Allahabad Prayagraj(印度阿姆利达德普信息科技学院)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文研究了在稀少农业数据下,简单跨视图模块在牧草生物量回归中的优越性,发现模型复杂度与性能呈反比关系,提出应优先考虑模型基础架构质量而非融合复杂度。

Comments Accepted to CVPR: Vision for Agriculture Workshop 2026 (Withdrawn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05710 2026-05-08 cs.LG 70%

On the Blessing of Pre-training in Weak-to-Strong Generalization

在弱到强泛化中预训练的恩赐

Wei Yao, Wang Zhaoyang, Gengze Xu, Chen Qian, Dongrui Liu, Ziqiao Wang, Yong Liu, Yunbei Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了弱到强泛化现象,发现预训练是其必要前提,理论和实验均证明预训练通过提供几何热启动使模型进入有效区域,从而实现泛化。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05250 2026-05-08 cs.IR cs.AI 70%

Decision-aware User Simulation Agent for Evaluating Conversational Recommender Systems

面向决策意识的用户模拟代理用于评估对话推荐系统

Yuan-Chi Li, Li-Chi Chen, Sung-Yi Wu, Yu-Che Tsai, Shou-De Lin

机构 * Department of Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Hesitator框架,通过模块化决策模块模拟人类在选择过载下的决策过程,实验表明其能有效缓解模拟器在高过载条件下的不现实行为,复现了心理学经济学中的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05244 2026-05-08 cs.IR cs.AI 70%

Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction

迈向通过事实可信度预测的可靠检索增强生成

Florian Geissler, Francesco Carella, Laura Fieback, Jakob Spiegelberg

机构 * Fraunhofer Institute for Cognitive Systems (IKS), Munich, Germany(弗劳恩霍夫认知系统研究所(IKS),德国慕尼黑) Volkswagen AG, Wolfsburg, Germany(大众集团,德国沃尔夫斯堡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过事实可信度预测改进检索增强生成系统,采用符合预测选择高可信检索片段和基于注意力的事实性分类器检测不一致答案,提升生成答案的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01669 2026-05-08 stat.ML cs.LG stat.ME 70%

PRCD-MAP: Learning How Much to Trust Imperfect Priors in Causal Discovery

PRCD-MAP:学习如何信任不完美的先验信息在因果发现中

Xihang Shan, Da Zhou

机构 * School of Mathematical Sciences(数学科学学院) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 PRCD-MAP通过为每个边分配信任度,结合先验信息和正则化项,提供了一种安全的因果发现方法,实验证明其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06327 2026-05-08 cs.CL cs.AI cs.LG 67%

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

在开放权重大语言模型中测量评估-情境差异:一种配对提示协议及其初步证据表明对齐-流水线特定异质性

Florian A. D. Burnat, Brittany I. Davidson

机构 * University of Bath(巴斯大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种配对提示协议,用于测量开放权重大语言模型中因任务框架不同而引起的评估-情境差异,发现不同模型在评估和部署情境下的行为存在显著异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06311 2026-05-08 cs.RO 67%

Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation

迈向视觉逼真模拟:评估机器人操作的基准测试

Yixin Zhu, Zixiong Wang, Jian Yang, Jin Xie, Jingyi Yu, Jiayuan Gu, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出VISER基准,通过高保真3D资产和物理渲染材料,评估机器人操作的视觉逼真度,提升仿真与现实性能的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06098 2026-05-08 cs.SE 67%

Exploring the Effectiveness of Abstract Syntax Tree Patterns for Algorithm Recognition

探索抽象语法树模式在算法识别中的有效性

Denis Neumüller, Florian Sihler, Raphael Straub, Matthias Tichy

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过构建基于抽象语法树的特定领域语言,设计搜索模式匹配算法,评估其在算法识别中的有效性,实验结果优于大型语言模型。

Comments Accepted at the 4th International Conference on Code Quality (ICCQ) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12941 2026-05-08 cs.IR 67%

JARVIS: An Evidence-Grounded Retrieval System for Interpretable Deceptive Reviews Adjudication

JARVIS:一种基于证据的可解释欺骗性评论裁决检索系统

Nan Lu, Leyang Li, Yurong Hu, Rui Lin, Shaoyi Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出JARVIS框架,通过混合密集-稀疏多模态检索和证据图结构,提升可解释性欺骗性评论裁决的精度和召回率,实验显示其在精度和召回率上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05830 2026-05-08 cs.CR 67%

Fairness in Token Delegation: Mitigating Voting Power Concentration in DAOs

代币委托中的公平性:缓解DAO中的投票权集中问题

Johnnatan Messias, Ayae Ide

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究DAO治理中委托机制的问题,通过分析14个DAO论坛的数据,发现委托常与持有者优先级不一致,提出引入兴趣匹配以缓解权力集中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05888 2026-05-08 cs.AR cs.DC 67%

MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems

MoE-Hub:通过硬件加速通信降低软件复杂性以实现多GPU系统中无缝的MoE重叠

Zhuoshan Zhou, Chen Zhang, Shuyi Zhang, Qijun Zhang, Haibo Wang, Zhe Zhou, Zhipeng Tu, Guangyu Sun, Yijia Diao, Zhigang Ji, Jingwen Leng, Guanghui He, Minyi Guo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MoE-Hub,通过硬件软件协同设计解决多GPU系统中MoE动态令牌到专家映射与GPU静态地址通信模型的不匹配问题,实现通信与计算的无缝重叠,提升性能和灵活性。

Comments Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05868 2026-05-08 cs.CR 67%

SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills

SkillScope:迈向细粒度最小特权执行的代理技能

Jiangrong Wu, Yuhong Nan, Yixi Lin, Huaijin Wang, Yuming Xiao, Shuai Wang, Zibin Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出SkillScope框架,通过图分析方法实现细粒度最小特权执行,检测技能超特权行为,实验表明其在检测和约束超特权方面效果显著。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05073 2026-05-08 stat.ME 67%

Heterogeneous Judge-Aware Ranking with Sensitivity, Disagreement, and Confidence

异质性裁判感知排序与敏感性、分歧和置信度

Shibo Yu, Yingzhou Wang, Yan Chen, Guodong Li, Jin-Hong Du

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出HJA排序框架,通过分离共识排名、裁判敏感性和残差偏好分歧,提升多裁判比较数据的恢复、鲁棒性和不确定性校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14594 2026-05-08 cs.CV 67%

LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning

LFS: 用于事件感知和时间多样化的视频描述生成的可学习帧选择器

Lianying Chao, Linfeng Yin, Peiyu Ren, Yifan Jiang, Qiaoyu Ren, Dingcheng Shan, Jing-cheng Pang, Sijie Wu, Xubin Li, Kai Zhang, Xin Chen

机构 * GTS, AI Data Department, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能数据部)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出LFS,通过学习选择时间多样且事件相关的帧,提升视频描述的细节质量,在两个基准和ICH-CC上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22812 2026-05-08 cs.CV 67%

LC4-DViT: Land-cover Creation for Land-cover Classification with Deformable Vision Transformer

LC4-DViT:基于变形视觉Transformer的土地覆盖创建用于土地覆盖分类

Kai Wang, Siyi Chen, Weicong Pang, Chenchen Zhang, Renjun Gao, Ziru Chen, Cheng Li, Dasa Gu, Rui Huang, Alexis Kai Hon Lau

机构 * HKUST(香港科技大学) SSE, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)电子工程系) JHU(约翰·霍普金斯大学) NUS(新加坡国立大学) MUST(慕斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出LC4-DViT框架,结合生成数据创建与变形感知视觉Transformer,提升高分辨率土地覆盖制图精度,优于基线模型和传统网络。

Comments This work has been submitted to the IEEE for possible publication.The project is available at https://github.com/weicongpang/LVC2-DViT.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05463 2026-05-08 cs.LG cs.AI 62%

Robustness of Graph Self-Supervised Learning to Real-World Noise: A Case Study on Text-Driven Biomedical Graphs

图自监督学习在现实世界噪声中的鲁棒性:基于文本驱动的生物医学图的案例研究

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise

机构 * National Institute of Informatics(国家信息研究所) Institute of Science Tokyo(东京科学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了图自监督学习在现实世界噪声下的鲁棒性,提出NATD-GSSL框架,通过对比噪声图与清洁图评估方法,发现关系重建对噪声敏感而特征重建更鲁棒,GNN架构对噪声也有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06540 2026-05-08 cs.AI cs.GT 57%

Ex Ante Evaluation of AI-Induced Idea Diversity Collapse

事前评估人工智能引发的创意多样性崩溃

Nafis Saami Azad, Raiyan Abdul Baten

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出一种人类相对框架,用于基准测试AI导致的人类多样性崩溃,通过模型生成内容和未辅助人类基线的比较,评估创意多样性崩溃风险,展示多样性崩溃的可识别性及减少方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06462 2026-05-08 cs.LG math.CO 57%

Invariant-Based Diagnostics for Graph Benchmarks

基于不变量的图基准诊断

Richard von Moos, Mathieu Alain, Bastian Rieck

机构 * University of Fribourg(弗里堡大学) University College London(伦敦大学学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出利用图不变量作为诊断框架,揭示模型是否真正学习了图结构,展示不变量在表达性、结构异质性、多任务性能等方面的优势,表明简单不变量模型在26个数据集上可与基线模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06382 2026-05-08 cs.AI 57%

Rethinking Vacuity for OOD Detection in Evidential Deep Learning

重新审视证据深度学习中异常检测的空虚性

Claire McNamara

机构 * Accenture Labs(埃森哲实验室) Trinity College Dublin(都柏林三一学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究指出证据深度学习中空虚性指标对类别数敏感,通过实验证明类别数差异会导致AUROC和AUPR显著变化,提出需明确ID和OOD定义以避免评估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05980 2026-05-08 cs.AI 57%

TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

TACT: 通过激活引导缓解编码代理中的过度思考与过度行动

Yuan Sui, Yulin Chen, Yibo Li, Xue Jiang, Yufei He, Yihong Dong, Xiaoxin He, Tianyu Gao, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Meta

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05820 2026-05-08 cs.CV 50%

ChartZero: Synthetic Priors Enable Zero Shot Chart Data Extraction

ChartZero:合成先验使零样本图表数据提取成为可能

Md Touhidul Islam, Yasir Mahmud, Sujan Kumar Saha, Mark Tehranipoor, Farimah Farahmandi

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出ChartZero框架,通过合成先验实现鲁棒的零样本图表数据提取,克服了传统方法在曲线碎片化和语义关联上的缺陷,引入GOI损失和VLM引导的图例匹配策略,提升整体数据重建能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05640 2026-05-08 cs.CV 50%

AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

AffectSeek: 长视频中基于模糊用户查询的代理情感理解

Zhen Zhang, Yuhang Yang, Yunxiang Jiang, Yuhuan Lu, Haifeng Lu, Zheng Lian, Runhao Zeng, Xiping Hu

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05299 2026-05-08 quant-ph cond-mat.mes-hall cond-mat.str-el physics.comp-ph 50%

Universal Neural Propagator: Learning Time Evolution in Many-Body Quantum Systems

通用神经传播器:在多体量子系统中学习时间演化

Zihao Qi, Christopher Earls, Yang Peng

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出通用神经传播器(UNP),通过自监督学习实现驱动协议到时间演化传播器的功能映射,展示了其在多体量子系统中对初始态和驱动协议的高精度与泛化能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04791 2026-05-08 cs.HC 50%

OpenWatch: A Multimodal Benchmark for Hand Gesture Recognition on Smartwatches

OpenWatch: 一种用于智能手表手部动作识别的多模态基准

Pietro Bonazzi, Youssef Ahmed, Daniel Eckert, Andrea Ronco, Junjie Zeng, Dengxin Dai, Michele Magno

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出OpenWatch多模态基准,通过同步惯性与生理传感数据,评估手部动作识别方法,展示了MixToken和NormWear-Lora等新方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 73 篇

2605.01120 2026-05-08 cs.AI math.CO 92%

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06052 2026-05-08 cs.AR 91%

XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA

XtraMAC:一种适用于FPGA上混合精度LLM推断的高效MAC架构

Feng Yu, Hongshi Tan, Yao Chen, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出XtraMAC架构,通过统一整数、浮点和混合精度运算,实现动态运算打包和高效资源共享,提升FPGA在混合精度LLM推断中的计算密度和能效。

Comments Accepted to ISCA 2026. 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05274 2026-05-08 cs.CR 91%

Sealing the Audit-Runtime Gap for LLM Skills

填补LLM技能的审计-运行时差距

Tingda Shen, Yebo Feng, Konglin Zhu, Xiaojun Jia, Yang Liu, Lin Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SIGIL框架,通过去中心化链上注册表和技能验证协议,实现LLM技能从发布到运行时的可验证绑定,有效抵御技能供应链攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏