arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9331 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9331 篇

2605.19328 2026-05-20 cs.CR cs.RO 67%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19159 2026-05-20 cs.CR 67%

On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap

关于变换器对混淆攻击的几何极限:潜在嵌入崩溃与性能鲁棒性差距

Becky Mashaido, Tapadhir Das

专题命中 安全评测 :safety(abstract);prompt injection(abstract)

AI总结 本文研究了变换器在对抗混淆攻击时的几何极限,揭示了高检测性能并不等同于表示鲁棒性,通过实验发现潜在嵌入崩溃现象及性能鲁棒性差距,表明现有评估指标未能捕捉到潜在嵌入崩溃和底层几何脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18474 2026-05-20 cs.CR cs.AI cs.CL cs.LG 67%

Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation

Prompt2Fingerprint: 通过文本到权重生成实现即插即用的LLM指纹生成

Sixu Chen, Xiang Chen, Hongyao Yu, Jiaxin Hong, Hao Fang, Shuoyang Sun, Bin Chen, Shu-Tao Xia

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) South China University of Technology, Guangzhou, China(华南理工大学,中国广州) Harbin Institute of Technology, Shenzhen, Shenzhen, China(哈尔滨工业大学深圳校区,中国深圳)

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prompt2Fingerprint框架,将LLM指纹生成重新定义为条件参数生成任务,通过专用生成器将文本描述直接映射到低秩参数增量,实现无需进一步模型微调的即插即用LLM指纹注入,显著降低计算开销,提供可扩展且即时的LLM所有权管理解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18956 2026-05-20 cs.CV 67%

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE: 一种用于人体动作编辑、推理、生成和解释的多粒度框架

Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

机构 * Computer Vision Institute, School of Computer Science and Software Engineering, Shenzhen University(计算机视觉研究院,计算机科学与软件工程学院,深圳大学) Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(Nottingham Ningbo 中国计算机科学学院) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Sun Yat-sen University(中山大学) School of Computer Science, University of Nottingham(计算机科学学院,Nottingham大学)

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 本文提出MotionMERGE框架,通过细粒度语言引导的动作控制、跨粒度协同预训练和细粒度动作-语言对齐,实现了更精确的动作生成、理解和编辑,并建立了新的细粒度文本驱动动作编辑和动作引导推理基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15641 2026-05-19 cs.RO cs.CR 67%

Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise

通过单个机器人入侵在LLM控制的多机器人协作中传播不安全行为

Zhen Huang, Zhihuang Liu, Mengxuan Luo, Weishang Wu, Zhiping Cai

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文研究了LLM控制的多机器人协作中的安全问题,提出了一种新型攻击模式,其中攻击者仅通过单个机器人传播恶意意图,导致系统中协调的不安全行为,通过三个指标量化了这一过程,并展示了攻击的高效性和持续性。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026). 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16354 2026-05-19 cs.LG cs.AI cs.CL cs.HC stat.ML 67%

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

通过LLM裁判增强人类评估:你真的需要多少人类评审?

Jane Paik Kim

机构 * Department of Psychiatry and Behavioral Sciences(精神病学与行为科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过LLM作为辅助裁判来增强人类评估,通过两阶段抽样设计确定人类和LLM评审样本量,以实现目标统计功效。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16198 2026-05-18 cs.AI cs.CY cs.LG cs.LO 67%

Formal Methods Meet LLMs: Auditing, Monitoring, and Intervention for Compliance of Advanced AI Systems

形式方法与大语言模型交汇:面向高级AI系统合规性的审计、监控与干预

Parand A. Alamdari, Toryn Q. Klassen, Sheila A. McIlraith

机构 * University of Toronto, Vector Institute(多伦多大学,向量研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出结合形式方法与机器学习的审计和监控技术,用于检测AI系统中时间扩展行为约束的违规,实验表明其在检测违规方面优于LLM基方法,且能有效降低LLM代理的违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24366 2026-05-18 cs.IR 67%

On the Factual Consistency of Text-based Explainable Recommendation Models

基于文本的可解释推荐模型的事实一致性研究

Ben Kabongo, Vincent Guigue

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文研究基于文本的可解释推荐模型的事实一致性,提出评估框架和指标,发现尽管模型在语义相似度上表现良好,但事实一致性指标表现不佳,凸显了事实意识评估的重要性。

Comments 13 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13369 2026-05-15 cs.CL cs.AI cs.LG 67%

Query-Conditioned Test-Time Self-Training for Large Language Models

基于查询的测试时自我训练用于大语言模型

Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13542 2026-05-14 cs.AI cs.CL cs.LG cs.MA 67%

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

RealICU: 大语言模型能否理解长期上下文ICU数据?一个超越行为模仿的基准测试

Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen, Jun Li, Yuyuan Liu, Xuepeng Zhang, Zhenyu Gong, Daniel Rueckert, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) University of Sheffield(谢菲尔德大学) University of Oxford(牛津大学) Zhongshan Hospital Fudan University(复旦大学中山医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心) Imperial College London(伦敦帝国学院) Munich Center for Machine Learning(慕尼黑机器学习中心) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 卡诺夫茨卓越可靠人工智能学校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RealICU通过真实ICU场景评估大语言模型的长期上下文理解能力,提出四个医生驱动任务,揭示现有模型在临床推荐中的召回与安全性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13770 2026-05-13 cs.AI cs.CL cs.LG stat.ME stat.ML 67%

Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inference

冰淇淋不导致溺水:对LLM在因果推断统计陷阱中的基准测试

Jin Du, Li Chen, Xun Xian, An Luo, Fangqiao Tian, Ganghua Wang, Charles Doss, Xiaotong Shen, Jie Ding

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学系) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CausalPitfalls基准测试,评估LLM在因果推断中的能力,揭示当前LLM在统计因果推断中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09647 2026-05-12 cs.SI 67%

Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs

对LLMs中隐含冲突监控机制对抗刻板印象的建模

Jingshen Zhang, Bo Wang, Yanlin Fu, Dongming Zhao, Ruifang He, Yuexian Hou, Zifei Yu

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出COCO方法,通过对比因果机制识别高内在一致性且强跨对比差异的神经元,提升模型公平性并对抗对抗性劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08468 2026-05-12 cs.CL cs.AI cs.LG 67%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07806 2026-05-11 cs.CL cs.AI cs.LG 67%

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

超越置信度:重新思考用于大语言模型性能预测的自我评估

Sree Bhattacharyya, Samarth Khanna, Leona Chen, Lucas Craig, Tharun Dilliraj, James Z. Wang

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于认知评估理论的多维自我评估框架,通过六个评估维度和置信度预测模型失败,发现能力相关维度在多数场景中表现更优,且努力维度在推理任务中更具预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 67%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20605 2026-05-05 cs.CL cs.AI cs.DL cs.LG 67%

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

TF1-EN-3M:三百万合成道德寓言用于训练小型开放语言模型

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu

机构 * Babeș-Bolyai University(巴纳德-波耶亚大学) KlusAI Labs(KlusAI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TF1-EN-3M数据集,包含三百万英文寓言,用于训练小型开放语言模型,展示通过指令微调模型生成高质量寓言的方法,验证了无需大模型即可实现大规模道德叙事的可能性。

Comments 18 pages, 6 tables, 1 figure. v2: revised evaluation with open-weight LLM judge panel, expanded citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19098 2026-05-04 cs.CL cs.AI cs.LG 67%

SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning

SAHM:阿拉伯语金融与伊斯兰合规推理的基准

Rania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid khalil, Yuxia Wang, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里迪斯") The University of Manchester(曼彻斯特大学) The Fin AI(Fin AI)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SAHM基准,涵盖七个任务,包含14380个专家验证实例,评估20个LLM发现阿拉伯语流畅性不等于金融推理能力,特别是在事件因果推理上存在显著差距。

Comments 29 page

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 67%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26671 2026-04-30 cs.CL cs.AI cs.CY 67%

From Black-Box Confidence to Measurable Trust in Clinical AI: A Framework for Evidence, Supervision, and Staged Autonomy

从黑盒信心到可测量的信任:临床AI可信框架的构建

Serhii Zabolotnii, Viktoriia Holinko, Olha Antonenko

机构 * Cherkasy State Business College(切尔卡西州商业学院) healthPrecision

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一个基于证据、监督和分阶段自主的临床AI可信框架,通过模块化提示和层级升级机制提升信任度,强调信任是系统属性而非单一模型属性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 67%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23513 2026-04-28 cs.RO 67%

Large Language Model based Interactive Decision-Making for Autonomous Driving

基于大语言模型的自主驾驶交互决策

Xinwei Dong, Jiyang Li, Jiabin Xie, Yang Yi, Tianshang Jia, Shiyu Fang, Ye Tian, Peng Hang

机构 * College of Transportation, Tongji University, Shanghai 201804, China(同济大学交通运输学院,上海201804,中国) School of Automotive Studies, Tongji University, Shanghai 201804, China(同济大学汽车学院,上海201804,中国) School of Computer Science and Technology, Tongji University, Shanghai 201804, China(同济大学计算机科学与技术学院,上海201804,中国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文提出基于大语言模型的交互决策框架,通过语义建模和意图感知提升安全性和效率,实验表明在混合交通场景中优于传统方法,且具有高度的人类相似性。

Comments Accepted by Journal of Traffic and Transportation Engineering (English Edition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23460 2026-04-28 cs.AI cs.CL cs.LG 67%

Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models

隐秘动机:在连续思维模型中检测不一致的推理

Sharan Ramjee

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了连续思维模型中如何检测不一致的推理,提出MoralChain基准测试,并通过双触发方法训练模型,揭示了潜在空间中不一致推理的存在及早期规划阶段的安全监控重要性。

Comments 15 pages with 2 figures

Journal ref International Conference on Learning Representations (ICLR) Latent & Implicit Thinking (LIT) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-04-28 cs.CV 67%

Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Pedro Reviriego, Elena Merino-Gómez

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22427 2026-04-27 cs.CR 67%

Automation-Exploit: A Multi-Agent LLM Framework for Adaptive Offensive Security with Digital Twin-Based Risk-Mitigated Exploitation

自动化-漏洞利用:一种多智能体LLM框架,用于基于数字孪生的自适应进攻性安全与风险缓解漏洞利用

Biagio Andreucci, Arcangelo Castiglione

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出自动化-漏洞利用框架,通过多智能体系统在复杂黑盒场景中实现自适应进攻性安全,利用数字孪生技术缓解风险,有效解决内存漏洞等安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19206 2026-04-22 cs.CV 67%

When Can We Trust Deep Neural Networks? Towards Reliable Industrial Deployment with an Interpretability Guide

当我们可以信任深度神经网络?迈向可靠工业部署的可解释性指南

Hang-Cheng Dong, Yuhao Jiang, Yibo Jiao, Lu Zou, Kai Zheng, Bingguo Liu, Dong Ye, Guodong Liu

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文提出一种基于事后解释的指标,用于检测二分类缺陷检测网络中的假阴性,通过计算类别特定判别热图与类别无关热图的交并比差异作为可靠性评分,并引入对抗增强方法以放大差异,实验证明该方法能有效识别假阴性,尽管牺牲了真阴性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18394 2026-04-21 cs.SE 67%

OpenGame: Open Agentic Coding for Games

OpenGame: 开源代理游戏开发

Yilei Jiang, Jinyuan Hu, Qianyin Xiao, Yaozhi Zheng, Ruize Ma, Kaituo Feng, Jiaming Han, Tianshuo Peng, Kaixuan Fan, Manyuan Zhang, Xiangyu Yue

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 OpenGame通过Game Skill和GameCoder-27B实现端到端网页游戏开发,解决跨文件不一致和逻辑不一致问题,建立新状态-of-the-art。

Comments OpenGame Report-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06155 2026-04-21 cs.LG cs.AI cs.CL 67%

Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement

迈向一致的世界模型:多令牌预测与潜在语义增强

Qimin Zhong, Hao Liao, Haiming Qin, Mingyang Zhou, Rui Mao, Wei Chen, Naipeng Chao

机构 * Shenzhen University(深圳大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过多令牌预测和潜在语义增强方法,解决大语言模型内部世界模型一致性问题,提升表示对齐性和鲁棒性。

Comments Accepted by ACL 2026 Main Conference. 21 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏