arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 187 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 68 篇

2606.22726 2026-07-07 cs.AI 新提交 57%

Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation

文本主导,音乐装饰:基于能量的注意力机制用于可编辑舞蹈动作生成

Seong Jong Yoo, Siyuan Peng, Felix Gu, Stratis Aloimonos, Cornelia Fermüller

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出STREAM模型,通过模态解耦的扩散变压器分离文本语义和音乐节奏控制,实现可编辑舞蹈动作生成,并引入新数据集Motorica++和评估指标EDS。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06890 2026-07-07 cs.AI cs.MA 版本更新 57%

Beyond the Black Box: Interpretability of Agentic AI Tool Use

超越黑箱:代理AI工具使用的可解释性

Hariom Tatsat, Ariye Shater

机构 * Quantitative Analytics, Barclays(巴克莱证券量化分析部)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于稀疏自编码器(SAEs)和线性探针的机制可解释性工具包,旨在提升代理AI在长周期任务中对工具调用的可观测性和可解释性,通过分析模型内部状态来识别工具决策的关键特征,从而揭示代理失败的深层原因。

Comments 12 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18895 2026-07-07 q-fin.RM cs.LG 57%

Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?

大语言模型能否在信用风险模型中作为事后可解释性工具?

Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) Southern Methodist University(南方 Methodist 大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究大语言模型是否能作为信用风险模型的事后可解释性接口,评估其在保持特征重要性排名和生成自主解释方面的能力。

Comments 39 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09448 2026-07-07 cs.SD cs.AI 版本更新 57%

One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization

一个提示,多种声音:在基于大语言模型的均衡中建模听众差异

Ioannis Stylianou, Jon Francombe, Pablo Martinez-Nuevo, Sven Ewan Shepstone, Zheng-Hua Tan

机构 * Bang & Olufsen A/S, Struer, Denmark(丹麦Bang & Olufsen A/S公司,Struer) Department of Electronic Systems, Aalborg University(奥胡斯大学电子系统系) Pioneer Centre for AI, Copenhagen, Denmark(哥本哈根先锋人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型将自然语言提示映射到均衡设置,通过上下文学习和参数高效微调技术,实现更灵活的音频均衡控制。

Comments 13 pages, 15 figures, 2 tables, Accepted for publication in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 57%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14095 2026-07-07 cs.AI cs.CR 版本更新 57%

NEST: Nascent Encoded Steganographic Thoughts

NEST:新生编码隐写思想

Artem Karpov

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15476 2026-07-07 cs.CR cs.AI 版本更新 57%

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估

Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

机构 * University of Connecticut(康涅狄格大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Independent(独立研究者)

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI

AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18133 2026-07-07 cs.CY 版本更新 57%

Aggregated Individual Reporting for Post-Deployment Evaluation

部署后评估的聚合个体报告

Jessica Dai, Inioluwa Deborah Raji, Benjamin Recht, Irene Y. Chen

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 针对部署后模型评估需求,提出聚合个体报告机制,依靠公众个体报告来评估系统,探讨个体经验在评估中的作用及实施流程等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02519 2026-07-07 cs.CY 版本更新 57%

Deaf in AI: AI language technologies and the erosion of linguistic rights

人工智能中的聋人问题:人工智能语言技术与语言权利的侵蚀

Maartje De Meulder

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 探讨人工智能语言技术、手语翻译和语言获取的相互作用,指出技术存在缺陷,批判将人工智能替代口译员的框架,呼吁聋人主导培养公平包容的人工智能系统。

Journal ref Language and Law / Linguagem e Direito, Vol. 12(1), 2025, pp. 100-121

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08777 2026-07-07 stat.ML cs.LG 版本更新 57%

Distribution-free Deviation Bounds and The Role of Domain Knowledge in Learning via Model Selection with Cross-validation Risk Estimation

无分布偏差界以及领域知识在通过交叉验证风险估计进行模型选择学习中的作用

Diego Marcondes, Cláudia Peixoto

机构 * Mathematical Sciences Institute and France-Australia Mathematical Sciences and Interactions ANU-CNRS International Research Lab(数学科学研究所和法澳数学科学与互动ANU-CNRS国际研究实验室) Department of Applied Mathematics, Institute of Mathematics and Statistics, Universidade de São Paulo(应用数学系、数学与统计研究所、圣保罗大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文在经典统计学习理论中,构建通过交叉验证风险估计进行模型选择学习的通用无分布框架,建立基于VC维的偏差界,引入学习空间探讨候选模型结构对泛化的影响,通过案例和模拟研究展示其优势并提供模型选择指导。

Comments arXiv admin note: text overlap with arXiv:2109.03866

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 50%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 50%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 安全评测 :safety(abstract)

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04761 2026-07-07 cs.CV 新提交 50%

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04199 2026-07-07 cs.CV 新提交 50%

Topology-Driven Transferability Estimation for 3D Medical Vision Foundation Models

用于3D医学视觉基础模型的拓扑驱动可迁移性估计

Jiaqi Tang, Shaoyang Zhang, Fandong Zhang, Shu Zhang, Yang Liu, Qingchao Chen

机构 * National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) Institute of Medical Technology, Peking University(北京大学医学技术研究所) Deepwise Co., Ltd.(深度智医科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 针对医学视觉基础模型选择难题,提出非参数、拓扑驱动框架,通过最小生成树从密集特征与语义标签的稀疏1-骨架图对齐中估计可迁移性,包含局部和全局互补尺度,提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03792 2026-07-07 cs.RO cs.CV 新提交 50%

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03720 2026-07-07 cs.HC 新提交 50%

Between Knowledge and Care: A Mixed-Methods Evaluation of Generative AI for T2DM Self-Management from Patient and Physician Perspectives

知识与关怀之间:从患者和医生角度对用于2型糖尿病自我管理的生成式人工智能的混合方法评估

Ruiqi Chen, Yibo Meng, Huidi Lu, Xiaolan Ding

专题命中 安全评测 :safety(abstract)

AI总结 该混合方法研究从患者和医生角度评估用于2型糖尿病自我管理的生成式人工智能。通过分析患者查询、医生评分及访谈,发现模型优缺点,得出两个分析概念,为四个设计方向提供依据。

Comments arXiv admin note: text overlap with arXiv:2510.10048

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 50%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00874 2026-07-07 cs.RO cs.MA 新提交 50%

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

超越视线:复杂场景中V2X集体感知的混合验证

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

机构 * European Union(欧盟)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。

Comments 6 pages, 4 figures, to be presented in ITS World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12057 2026-07-07 stat.AP 新提交 50%

ChargeBD: Character-Aware Heterogeneous Agent Reasoning for Guided Engineering in Battery Development

ChargeBD:面向电池开发中引导工程的字符感知异构智能体推理

Rui Huang, Zekun Jiang, Mengran Hou, Xingyu Niu, Yuqiang Li, Qinying Gu, Tianhang Zhou

专题命中 安全评测 :safety(abstract)

AI总结 提出ChargeBD框架,通过MBTI启发的角色智能体矩阵,结合异构推理,解决液流电池多尺度多目标研发中的自适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 50%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 安全评测 :safety(abstract)

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01878 2026-07-07 cs.CV 版本更新 50%

CTForensics: A Comprehensive Dataset and Method for AI-Generated CT Image Detection

CTForensics:用于人工智能生成的CT图像检测的综合数据集和方法

Yiheng Li, Zichang Tan, Guoqing Xu, Yichun Yeh, Yang Yang, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究中心) Sangfor Technologies Inc.(深信服技术有限公司)

专题命中 安全评测 :safety(abstract)

AI总结 研究针对人工智能生成CT图像检测难题,介绍含75990张二维CT图像的CTForensics数据集及十种生成模型样本,提出ESF-CTFD框架,实验表明该框架性能优且抗干扰强。

Comments under review, repo: https://github.com/liyih/CTForensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10730 2026-07-07 cs.CV 版本更新 50%

IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation

IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化

Yuan-Ming Li, Qize Yang, Nan Lei, Shenghao Fu, Ling-An Zeng, Jian-Fang Hu, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24380 2026-07-07 cs.SE 版本更新 50%

Agentic Services Computing

智能服务计算

Shuiguang Deng, Hailiang Zhao, Ziqi Wang, Wenzhuo Qian, Xiang Ao, Guanjie Cheng, Jianwei Yin, Albert Y. Zomaya, Schahram Dustdar

专题命中 安全评测 :alignment(abstract)

AI总结 探讨服务计算范式转变带来的新问题,基于现有研究基础,引入智能服务计算,扩展服务计算范畴,为未来服务生态系统奠定以服务为中心的基础,实现对自治代理的系统管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15330 2026-07-07 cs.CV 版本更新 50%

CoDoL: Conditional Domain Prompt Learning for Out-of-Distribution Generalization

CoDoL:用于分布外泛化的条件域提示学习

Min Zhang, Yuyin Wang, Zhongxiang Dai, Zhikang Chen, Jie Zhou, Miao Liu, Sen Cui

机构 * East China Normal University(东华师范大学) Xidian University(西安电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对基于提示的CLIP方法存在的文本描述不准确、视觉语言嵌入对齐有限问题,提出CoDoL方法,利用域信息形成提示,还提出DMN生成输入条件令牌,实验验证其在分布外泛化的有效性。

Comments Accepted to TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01006 2026-07-07 cs.SE 版本更新 50%

REConnect: Participatory RE for Social Sustainability

REConnect:面向社会可持续性的参与式需求工程

Daniela Damian, Bachan Ghimire, Ze Shi Li, Kezia Devathasan

专题命中 安全评测 :alignment(abstract)

AI总结 介绍REConnect这一以人类为中心的参与式需求工程框架,通过对多个社区软件项目分析得出,阐述了三项核心原则及行动,强调人际联系是社会可持续性需求工程基础,讨论其与AI支持的整合。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05124 2026-07-07 cs.CR cs.CV 版本更新 50%

A Simulation Framework for Electromagnetic Signal Injection Attacks on Image Sensors

图像传感器电磁信号注入攻击的仿真框架

Youqian Zhang, MK Michael Cheung, Chunxi Yang, Xinwei Zhai, Zitong Shen, Xinyu Ji, Eugene Yujun Fu, Sze Yiu Chau, Xiapu Luo

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 安全评测 :safety(abstract)

AI总结 针对图像传感器电磁信号注入攻击,通过建模开发仿真框架生成合成对抗图像,可快速评估算法漏洞,对抗训练能提升算法鲁棒性,为缓解攻击威胁提供实用路径。

Comments 20 pages, 9 figures, 6 tables

Journal ref 31st European Symposium on Research in Computer Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 8 篇

2604.16870 2026-07-07 cs.CR cs.AI cs.OS 版本更新 79%

Governed MCP: Kernel-Level Tool Governance for AI Agents via Logit-Based Safety Primitives

受控MCP:通过基于logit的安全原语实现AI代理的内核级工具治理

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 本文提出 Governed MCP,一种基于logit的安全原语的内核级工具治理网关,通过六层管道对MCP工具调用进行安全检查,提升AI代理的安全性。

Comments 14 pages, 6 tables. Companion paper to arXiv:2604.11943 (ProbeLogits)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04249 2026-07-07 cs.CV 新提交 78%

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation

超越随机采样:用于半监督医学图像分割的分布感知对齐

Weihao Yan, Yeqiang Qian, Yi Dong, Ming Yang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Department of Ultrasound, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院超声科)

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 研究针对半监督医学图像分割中随机采样策略在低数据量时表征偏差的问题,提出基于分布对齐的高效框架,用分布感知样本选择策略和记忆引导复制粘贴模块,提升分割性能。

Comments 19 pages, 5 figures, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18236 2026-07-07 cs.CY 版本更新 70%

Two Means to an End Goal: Connecting Explainability and Contestability in the Regulation of Public Sector AI

实现目标的两种方式:在公共部门人工智能监管中连接可解释性与可争议性

Timothée Schmude, Mireia Yurrita, Kars Alfrink, Thomas Le Goff, Sebastian Tschiatschek, Tiphaine Viard

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CY

AI总结 探讨公共部门人工智能监管中可解释性与可争议性,通过对14位专家访谈研究其交叉与实施,明确相关差异及实现难点,从设计角度为人工智能政策提三条建议。

Comments 19 pages main text, 4 figures. Supplementary material is provided

Journal ref Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (pp. 3078-3104). Association for Computing Machinery

详情

展开后加载摘要…

URL PDF HTML 收藏