arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-04 至 2026-05-04 共收录 183 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 44 篇

2605.00113 2026-05-04 cs.CL cs.AI cs.HC 87%

How Frontier LLMs Adapt to Neurodivergence Context: A Measurement Framework for Surface vs. Structural Change in System-Prompted Responses

前沿大语言模型如何适应神经多样性上下文:一种测量框架,用于系统提示响应中的表面变化与结构变化

Ishan Gupta, Pavlo Buryi

机构 * Harrisburg University of Science and Technology(哈里斯堡科学与技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NDBench基准,通过不同系统提示类型和神经多样性配置,研究前沿LLM在神经多样性上下文下的适应性变化,发现结构变化显著,但单一神经多样性角色声明无法有效抑制潜在有害倾向。

Comments 15 pages, 3 figures, 2 tables. Benchmark, code, and data available at https://github.com/ishansgupta/ndbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06698 2026-05-04 cs.CL 86%

SCAN: Structured Capability Assessment and Navigation for LLMs

SCAN:面向大语言模型的结构化能力评估与导航

Zongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院) Baidu, Inc(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SCAN框架,通过细粒度评估实现对LLM能力的深入分析,揭示了同一类别下不同子能力的显著性能差异,强调了细粒度评估的重要性。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26388 2026-05-04 eess.AS cs.AI cs.CL 86%

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

Game-Time:评估口语语言模型中的时间动态

Kai-Wei Chang, En-Pei Hu, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, James Glass

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University(台湾国立台湾大学) Academia Sinica(台湾“ Academia Sinica”) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心卓越研究中心)

专题命中 评测与基准 :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Game-Time基准测试,用于评估口语语言模型在时间动态方面的能力,发现现有模型在时间约束下表现不佳,揭示了时间感知和全双工交互的不足。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15949 2026-05-04 cs.CL 84%

BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction

BanglaSocialBench: 一个评估大语言模型在孟加拉社会互动中社会语用和文化对齐的基准

Tanvir Ahmed Sijan, S. M Golam Rifat, Pankaj Chowdhury Partha, Md. Tanjeed Islam, Md. Musfique Anwar

机构 * Jahangirnagar University(贾亨吉尔纳加尔大学) Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BanglaSocialBench,通过情境依赖的语言使用评估孟加拉语的社会语用能力,发现当前LLM在文化对齐上存在系统性偏差。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03565 2026-05-04 cs.AI cs.CL cs.LG 83%

Build, Judge, Optimize: A Blueprint for Continuous Improvement of Multi-Agent Consumer Assistants

构建、评判与优化:多智能体消费者助手持续改进的蓝图

Alejandro Breen Herrera, Aayush Sheth, Steven G. Xu, Zhucheng Zhan, Charles Wright, Marcus Yearwood, Hongtai Wei, Sudeep Das, Danny Nightingale, Meg Watson, Charles Pollnow

机构 * Metis DoorDash

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出评估和优化对话购物助手的实用蓝图,通过生产级AI杂货助手示例,介绍多维评估标准和校准的LLM评判流程,并提出两种互补的提示优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 81%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV 81%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00353 2026-05-04 cs.IR 80%

Negative Data Mining for Contrastive Learning in Dense Retrieval at IKEA.com

密集检索中对比学习的负样本挖掘

Eva Agapaki, Amritpal Singh Gill

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出基于结构化负样本策略和LLM评估方法提升IKEA产品检索,通过生成语义挑战性负样本和训练数据生成,提升检索性能,但发现在线用户参与度无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19098 2026-05-04 cs.CL cs.AI cs.LG 80%

SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning

SAHM:阿拉伯语金融与伊斯兰合规推理的基准

Rania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid khalil, Yuxia Wang, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里迪斯") The University of Manchester(曼彻斯特大学) The Fin AI(Fin AI)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SAHM基准,涵盖七个任务,包含14380个专家验证实例,评估20个LLM发现阿拉伯语流畅性不等于金融推理能力,特别是在事件因果推理上存在显著差距。

Comments 29 page

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15139 2026-05-04 cs.SE 80%

Investigating Notable Metadata Practices in PyPI Libraries: An Empirical Study about Repository and Donation Platform URLs

对PyPI库中显著元数据实践的调查:关于仓库和捐赠平台网址的实证研究

Alexandros Tsakpinis, Nicolas Raube, Alexander Pretschner

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究通过大规模定性调查数据,分析PyPI库中仓库和捐赠平台链接的缺失或过时问题,揭示其背后的原因,并评估基于LLM的主题建模方法的鲁棒性和质量。

Comments 20 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00731 2026-05-04 cs.SI cs.AI 79%

Empowering Heterogeneous Graph Foundation Models via Decoupled Relation Alignment

通过解耦关系对齐增强异质图基础模型

Ziyu Zheng, Yaming Yang, Zhe Wang, Ziyu Guan, Wei Zhao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出DRSA方法,通过解耦特征语义与关系结构,解决异质图中跨类型特征偏移和领域内关系缺口问题,提升跨域和少样本知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22982 2026-05-04 cs.CV 78%

Revisiting CroPA: A Reproducibility Study and Enhancements for Cross-Prompt Adversarial Transferability in Vision-Language Models

重新审视CroPA:面向视觉-语言模型跨提示对抗转移性的可重复性研究与改进

Atharv Mittal, Agam Pandey, Amritanshu Tiwari, Sukrit Jindal, Swadesh Swain

机构 * Mehta Family School of Data Science and Artificial Intelligence(梅hta家族数据科学与人工智能学院) Indian Institute of Technology, Roorkee(印度理工学院罗奥克学院) Department of Civil Engineering(土木工程系) Department of Electronics and Communication(电子与通信系)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文重新审视CroPA,验证其跨提示转移性,并提出改进方法,包括新的初始化策略、跨图像迁移性研究及针对视觉编码器的损失函数,提升对抗有效性。

Comments Accepted to MLRC 2025

Journal ref Transactions on Machine Learning Research (TMLR), 2025. Available at OpenReview: https://openreview.net/forum?id=5L90cl0xtf

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03928 2026-05-04 cs.LG 77%

SynQuE: Estimating Synthetic Dataset Quality Without Annotations

SynQuE:无需标注即可估计合成数据集质量

Arthur Chen, Victor Zhong

机构 * David R. Cheriton School of Computer Science(戴维·R·切里顿计算机科学学院) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出SynQuE问题,通过有限未标注真实数据对合成数据集进行排序,以提升实际任务性能。引入首个综合基准,提出LENS等代理指标,显著提升复杂任务性能。

Comments Our code and dataset are available here: https://github.com/r2llab/SynQuE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00269 2026-05-04 cs.CL cs.LG 76%

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

语言模型如何处理分布外输入:一种双路径框架

Hamidreza Saghir

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG

AI总结 本文提出双路径框架以识别真实分布外信号,通过嵌入和处理轨迹分析不同OoD类型,展示嵌入路径在词汇区分上的优势,轨迹特征在隐含意图检测中的有效性。

Comments 30 pages, 3 figures, 30+ tables. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00513 2026-05-04 cs.CL cs.LG 73%

ControBench: An Interaction-Aware Benchmark for Controversial Discourse Analysis on Social Networks

ControBench:一种考虑交互的争议性 discourse 分析社交网络基准

Ta Thanh Thuy, Jiaqi Zhu, Xuan Liu, Lin Shang, Reihaneh Rabbany, Guillaume Rabusseau, Lihui Chen, Zheng Yilun, Sitao Luan

机构 * Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) Nanjing University(南京大学) Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 ControBench结合异质社交交互图与丰富文本语义,通过Reddit讨论数据构建,用于研究争议性 discourse 分析中的政治极化、虚假信息和内容审核问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00420 2026-05-04 cs.MA cs.LG q-fin.GN 70%

Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents

前瞻性竞技场:一种去中心化的链上基准,用于评估AI预测代理

Maksym Nechepurenko, Pavel Shuvalov

机构 * Director of Research, Devnull(研发总监,Devnull) Chief Technology Officer, Devnull(首席技术官,Devnull)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Foresight Arena,首个去中心化链上基准,用于评估AI预测代理在真实世界预测市场中的能力,通过概率预测和智能合约评估,结合Brier分数和Alpha分数衡量性能。

Comments 27 pages, 5 figures, 10 tables. Project page: https://foresightarena.xyz/. Code: https://github.com/foresight-arena/contracts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00227 2026-05-04 cs.CL 70%

Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations

基于角色的AI陪伴在多轮对话中的安全性评估

Prerna Juneja, Lika Lomidze

机构 * Seattle University(西雅图大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出首个端到端可扩展框架,用于可控模拟和评估AI陪伴应用的多轮交互安全性,通过构建角色、生成场景、模拟对话及评估危害,分析Replika对高风险用户群体的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28139 2026-05-04 cs.SE cs.AI 70%

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准

Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Xiamen University(厦门大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。

Comments Project page: https://claw-eval-live.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21199 2026-05-04 cs.LG cs.CV 70%

ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

ARFBench: 用于软件事件响应的时间序列问题回答能力基准测试

Stephan Xie, Ben Cohen, Mononito Goswami, Junhong Shen, Emaad Khwaja, Chenghao Liu, David Asker, Othmane Abou-Amal, Ameet Talwalkar

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Datadog AI Research(Datadog AI研究) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出ARFBench基准测试,评估多模态基础模型对软件事件数据中时间序列异常的理解能力,发现前沿VLM表现优异,提出混合模型并建立模型-专家 oracle,达到超人类水平。

Comments Updated author affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14093 2026-05-04 cs.RO cs.CL cs.CV 70%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18280 2026-05-04 cs.LG cs.AI cs.CL 67%

Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails

检测成本低,路由是学习的:为何基于拒绝的对齐评估失败

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出现有对齐评估忽视路由层,通过政治审查实验发现检测准确率不具诊断性,路由机制因模型和实验室而异,拒绝不再是主要审查机制,需采用检测-路由-生成三阶段框架。

Comments Code and data: https://github.com/gregfrank/routing-is-learned

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00472 2026-05-04 cs.SE 67%

Q-ARE: An Evaluation Dataset for Query Based API Recommendation

Q-ARE:基于查询的API推荐评估数据集

Shenglong Wu, Xunhui Zhang, Tao Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文构建了Q-ARE数据集,用于评估基于查询的API推荐方法的语义理解能力,通过分析开源Java项目的方法调用链,引入API调用深度和调用密度两个指标,评估现有方法在多级调用结构中的表现。

Comments 10 pages, 6 figures, 1 tables. Accepted to EQUISA 2026, Glasgow, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27977 2026-05-04 cs.AI cs.LG 62%

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

D3-Gym:构建现实世界可验证环境用于数据驱动发现

Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Cisco Research(思科研究)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 D3-Gym通过构建首个自动化的可验证环境数据集,提升科学数据驱动发现的模型能力,验证信号质量高,训练效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15304 2026-05-04 cs.LG cs.AI 62%

Explaining the Explainers in Graph Neural Networks: a Comparative Study

解释图神经网络解释器:一项比较研究

Antonio Longa, Steve Azzolin, Gabriele Santin, Giulia Cencetti, Pietro Liò, Bruno Lepri, Andrea Passerini

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Venice(威尼斯大学) CNRS, Centre de Physique Theorique(国家科学研究中心,理论物理中心) University of Cambridge(剑桥大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统实验比较十种解释器在八种图和节点分类架构上的表现,揭示了不同架构的可解释性差异及解释器选择的指导原则。

Journal ref ACM Comput. Surv. 57, 5, Article 120 (2025), 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16762 2026-05-04 cs.LG 57%

NRGPT: An Energy-based Alternative for GPT

NRGPT:一种基于能量的GPT替代方案

Nima Dehmamy, Benjamin Hoover, Bishwajit Saha, Leo Kozachkov, Jean-Jacques Slotine, Dmitry Krotov

机构 * IBM Research(IBM研究院) Georgia Tech(佐治亚理工学院) Brown University(布朗大学) MIT(麻省理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 NRGPT通过最小化修改将GPT与能量基模型框架统一,其推理过程被视为在能量景观上探索,实验证明在特定条件下可转化为梯度下降,适用于简单语言、代数任务和更复杂的语言建模。

Comments Accepted to ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00400 2026-05-04 cs.IR cs.CL 57%

FollowTable: A Benchmark for Instruction-Following Table Retrieval

FollowTable:一项指令遵循表格检索的基准测试

Rihui Jin, Yuchen Lu, Ting Zhang, Jun Wang, Kuicai Dong, Zhaocheng Du, Dongping Liu, Gang Wang, Yong Liu, Guilin Qi

机构 * Southeast University(东南大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室(东南大学)) Its Interdisciplinary Applications (Southeast University), Ministry of Education(交叉应用(东南大学),教育部)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一项新的表格检索任务IFTR,要求模型同时满足主题相关性和细粒度指令约束。通过引入FollowTable基准测试,评估模型在遵循指令方面的表现,发现现有检索模型在处理表格数据时存在系统性偏差。

Comments SIGIR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 57%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV 50%

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 25 篇

2605.00741 2026-05-04 cs.CR 91%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00320 2026-05-04 cs.AR 91%

VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices

VitaLLM:一种 versatile 且 tiny 的混合精度 LLM 推理边缘设备加速器

Zi-Wei Lin, Tian-Sheuan Chang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 VitaLLM 通过 ternary 权重模型和高效计算核心,实现边缘设备上的高效混合精度 LLM 推理,减少 KV 通信并提升利用效率。

Comments accepted in ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏