arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2607.19701 2026-07-23 cs.CV 新提交 78%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 78%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 78%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11339 2026-07-14 cs.CV 新提交 78%

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10758 2026-07-08 cs.CR 版本更新 78%

Agents at Risk: How Users Unwittingly Undermine LLM Safety

处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性

Fengchao Chen, Tingmin Wu, Van Nguyen, Surya. Nepal, Carsten Rudolph

专题命中 安全评测 :safety(title,abstract)

AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。

Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04451 2026-07-07 cs.CV 新提交 78%

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

CCFM:用于安全关键场景生成的碰撞约束流匹配

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(纽约州立大学石溪分校) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02465 2026-07-03 cs.AR 新提交 78%

Probabilistic Memory for Trustworthy Edge Intelligence

面向可信边缘智能的概率存储器

Likai Pei, Jiahao Zheng, Xueji Zhao, Emilie Ye, Jianbo Liu, Hanqing Tao, Ming-Yen Lee, Ruiyang Qin, Yiyu Shi, Shimeng Yu, X. Sharon Hu, Ningyuan Cao

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出概率存储器(p-MEM),通过存储分布参数并直接在原生内存带宽下采样,解决了高斯随机数生成与计算之间的吞吐量差距,在贝叶斯神经网络中实现指令数、延迟和能耗的大幅降低。

Comments This paper has been accepted for publication in the proceedings of the ACM/IEEE Design Automation Conference (DAC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01667 2026-07-03 cs.CV 新提交 78%

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

增强视听视频字幕的时间与跨模态对齐

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) Meituan(美团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00395 2026-07-02 cs.HC 新提交 78%

Child Safety in Generative AI: An Expert-Guided and Incident-Grounded Evaluation Framework

生成式AI中的儿童安全:一个专家引导且基于事件的评估框架

Haein Kong

专题命中 安全评测 :safety(title,abstract)

AI总结 针对儿童使用生成式AI的特定风险,提出一个结合专家引导风险因素和真实AI事件数据的评估框架,并应用于教育领域评估Llama Guard模型,发现其难以检测教育相关的不安全用户提示。

Comments Accepted to the HEAL Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28968 2026-07-01 cs.CR cs.HC 版本更新 78%

Beyond Her: Safety Dynamics in Role-play AI Companions

超越《她》:角色扮演AI伴侣中的安全动态

Zehang Deng, Zhaoyang Xie, Changzhou Han, Hiran Thabrew, Wanlun Ma, Yue Huang, Jason, Xue, Sheng Wen, Tianqing Zhu, Yang Xiang

专题命中 安全评测 :safety(title,abstract)

AI总结 通过混合方法研究,揭示角色扮演AI伴侣使用中用户内化问题、AI角色人格和风险互动模式共同塑造安全动态,并发现短期情绪缓解与长期恶化并存的趋势,提出自适应安全防护设计。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 78%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV 78%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27264 2026-06-26 cs.CV 新提交 78%

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Hasso Plattner Institute(哈索·普拉特纳研究所) Khalifa University(哈利法大学)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25296 2026-06-25 cs.AR 新提交 78%

SafeGen: LLM-Driven Assertion Generation and Fault Criticality Evaluation for Functional Safety

SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估

Xuanyi Tan, Arjun Chaudhuri, Rubin Parekhji, Krishnendu Chakrabarty

专题命中 安全评测 :safety(title,abstract)

AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24570 2026-06-25 cs.CV 新提交 78%

Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

Jolia: 用于3D CT对比学习的概念级视觉-语言对齐

Julien Khlaut, Charles Corbière, Baptiste Callard, Amaury Prat, Leo Butsanets, Antoine Saporta, Théo Danielou, Leo Machado, Korentin Le Floch, Tom Boeken, Pierre Manceron, Corentin Dancette

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP(欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité(巴黎西岱大学健康学院) HEKA, INRIA(HEKA,法国国家信息与自动化研究所) Imaging Department, Fondation Ophtalmologique Adolphe de Rothschild(阿道夫·罗斯柴尔德眼科基金会影像科)

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出ConQuer方法,通过概念查询将报告拆分为特定概念部分,学习交叉注意力查询以匹配图像特征,实现概念级对齐,在胸部与腹部CT上训练的Jolia模型在多项任务中超越CLIP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23917 2026-06-24 cs.CV 新提交 78%

Trustworthy Image Authentication using Forensic Knowledge Graphs

使用取证知识图谱的可信图像认证

Tai D. Nguyen, Matthew C. Stamm

机构 * Drexel University(德雷塞尔大学)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出取证知识图谱(FKG)框架,通过结构化取证证据提取与推理实现可解释的图像伪造检测,优于现有检测器和视觉语言模型。

Comments Accepted and Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 78%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 安全评测 :alignment(title,abstract)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07339 2026-06-23 cs.CR 78%

TDML -- A Trustworthy Distributed Machine Learning Framework

TDML -- 一个可信的分布式机器学习框架

Zhen Wang, Qin Wang, Guangsheng Yu, Shiping Chen

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出TDML框架,利用区块链协调远程训练器并验证工作负载,实现隐私、透明和高效的模型训练,克服性能限制和恶意节点检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07455 2026-06-16 cs.AR 新提交 78%

A 65 nm Trustworthy Hypoglycemia Forecasting Engine Achieving 11.3 nJ per Inference

一种65纳米可信赖的低血糖预测引擎,每次推理能耗11.3 nJ

Boyang Cheng, Jianbo Liu, Pengyu Ren, Xueji Zhao, Steven Davis, Likai Pei, Zephan M. Enciso, Kai Ni, Ningyuan Cao

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出基于概率决策树的低血糖预测引擎,采用混合架构降低复杂度,在65 nm CMOS上实现11.3 nJ/推理和0.825的F1分数,对传感器噪声鲁棒性提升4.1-16.1倍。

Comments Submitted to IEEE Transactions on Circuits and Systems I: Regular Papers (TCAS-I)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11803 2026-06-11 cs.CR cs.NI 新提交 78%

SwarmSense-DNN: A Trustworthy and Decentralized Neural Framework for Proactive Anomaly Defense in Consumer IoT

SwarmSense-DNN:面向消费物联网中主动异常防御的可信去中心化神经框架

Jing Yang, Vijay Govindarajan, Saad Arif, Xu Xu, Mohamed Kallel, Zaffar Ahmed Shaikh, Zhe Liu, Chunhong Yuan, Lip Yee Por

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出SwarmSense-DNN,一种结合群体智能与深度神经网络的去中心化框架,通过分层联邦学习与图注意力机制实现分布式IoT环境中的协同异常检测,在五个基准数据集上达到95.44%平均检测精度并降低67%通信开销。

Comments 11 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20795 2026-06-11 cs.CV 版本更新 78%

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu

机构 * HKUST(香港理工大学) FDU(福建大学) ZJU(浙江大学) NUS(新加坡国立大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 78%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19961 2026-06-08 eess.SY cs.SY 版本更新 78%

Toward Trustworthy Digital Twins in AI Agent-based Wireless Network Optimization: Challenges, Solutions, and Opportunities

迈向可信的AI代理无线网络优化数字孪生:挑战、解决方案与机遇

Zhenyu Tao, Wei Xu, Xiaohu You

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出一种新的数字孪生评估框架,用于确保AI代理基于网络优化的数字孪生的可信度,通过任务导向的评估方法减少训练和测试成本,同时保持部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00540 2026-06-02 cs.IR 78%

Trustworthy Recommendation in the Era of Large Language Models: Opportunities and Challenges

大语言模型时代的可信推荐:机遇与挑战

Bohao Wang, Yu Cui, Zhenxiang Xu, Jujia Zhao, Chenxiao Fan, Jizhi Zhang, Weiqin Yang, Shengjia Zhang, Sirui Chen, Yang Zhang, Xiaoyan Zhao, Wenjie Wang, Chongming Gao, Fuli Feng, Xiangnan He, Jiawei Chen

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文系统综述了大语言模型增强推荐系统在可信性方面的双重影响,识别出13个机遇和18个挑战,并构建了新的分类体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30650 2026-06-01 cs.CR 78%

When AI Meets Wall Street: A Survey on Trustworthy AI in Fintech

当AI遇见华尔街:金融科技中可信AI综述

Qingwen Zeng, Zhenghao Zhao, Yitian Yang, Yiqi Zhu, Fangchen Liu, Zhaoge Bi, Moe Thandar Kyaw Wynn, Kim-Kwang Raymond Choo, Huaming Chen

专题命中 安全评测 :trustworthy(title);prompt injection(abstract)

AI总结 本文提出一个以生命周期为中心、机制驱动的统一框架,将金融AI分为训练更新、部署推理、运营监控三个阶段,并构建金融AI安全与鲁棒性分类法,涵盖17种攻击子类型,分析其算法策略、可行性约束、隐蔽性与持久性及下游金融后果,最后指出开放挑战并规划研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29969 2026-05-29 cond-mat.mtrl-sci cond-mat.dis-nn 78%

Prototype-Guided Latent Alignment for Data-Efficient Fine-Tuning of Molecular Foundation Models

原型引导的潜在对齐用于分子基础模型的数据高效微调

Rushikesh Pawar, Harshit Rawat, Ayush Kumar, Phani Motamarri

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出基于原型的对齐方法,通过将目标域原子的能量贡献对齐到源域原型,实现分子基础模型在低数据下的高效微调,在rMD17和SPICE数据集上能量MAE降低高达18%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27418 2026-05-28 cs.MA cs.RO 78%

Differentiable Model Predictive Safety for Heterogeneous Mobility at Urban Intersections

城市交叉口异构移动体的可微分模型预测安全

Wenzhe Song, Hao Zhang

机构 * School of Business(商学院) Department of Mechanical Engineering(机械工程系) Stevens Institute of Technology(史蒂文斯理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 提出可微分模型预测安全(DMPS)框架,将模型预测控制的前瞻性嵌入数据驱动的端到端强化学习架构,通过可微分安全评价器实现精确在线安全校正,在高密度混合交通仿真中将碰撞率降至5.6%以下。

Comments 6 pages. Published in IEEE IARCE 2025

Journal ref 2025 IEEE 5th International Conference on Industrial Automation, Robotics and Control Engineering (IARCE), Chongqing, China, 2025, pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11011 2026-05-28 cs.CV 78%

Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?

大型预训练视觉语言模型能否成为有效的施工安全检查员?

Xuezheng Chen, Zhengbo Zou

机构 * Mechanical Engineering(机械工程)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出ConstructionSite 10k数据集,包含1万张施工图像及三项任务标注,评估大型预训练视觉语言模型在零样本和小样本下的泛化能力,为施工安全检查提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24462 2026-05-26 cs.CE 78%

No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents

无证书,不执行:认证轨迹作为可信AI代理的基础

Xiao-Yang Liu Yanglet, Xiaodong Wang, Agostino Capponi

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07919 2026-05-25 cs.CV 78%

MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型

Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li

机构 * University of Georgia(佐治亚大学) Harvard Medical School(哈佛医学院) Chungbuk National University(Chungbuk国立大学) Chungnam National University Hospital(Chungnam国立大学医院) National University of Singapore(新加坡国立大学) New York University(纽约大学) University of Sydney(悉尼大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。

详情

展开后加载摘要…

URL PDF HTML 收藏