arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2604.02008 2026-04-03 cs.CL 79%

$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection

$k$NNProxy:高效无训练代理对齐方法用于黑盒零样本LLM生成文本检测

Kahim Wong, Kemou Li, Haiwei Wu, Jiantao Zhou

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出$ k $NNProxy方法,利用$ k $NN语言模型检索机制作为领域适配器,实现无训练的代理对齐,提升黑盒零样本LLM生成文本检测的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 79%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA 79%

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26922 2026-03-31 cs.HC cs.AI 79%

Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles

模仿对齐与ASPECT:AI推断个人资料的评估

Ruoxi Shang, Dan Marshall, Edward Cutrell, Denae Ford

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。

Comments 20 pages (including appendix), 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26122 2026-03-30 cs.CV cs.AI 79%

SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis

SkinGPT-X: 一种自演化协作多智能体系统用于透明和可信的皮肤病诊断

Zhangtianyi Chen, Yuhao Shen, Florensia Widjaja, Yan Xu, Liyuan Sun, Zijian Wang, Hongyi Chen, Wufei Dai, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 SkinGPT-X通过自演化皮肤病记忆机制,解决单一大语言模型在细粒度多类诊断和罕见皮肤病诊断中的不足,实现透明可信的皮肤病诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00262 2026-03-30 cs.CV cs.AI 79%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 79%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06055 2026-03-27 cs.LG 79%

A Trustworthy By Design Classification Model for Building Energy Retrofit Decision Support

为建筑节能改造决策支持设计的可信分类模型

Panagiota Rempi, Sotiris Pelekis, Alexandros Menelaos Tzortzis, Evangelos Spiliotis, Evangelos Karakolis, Christos Ntanos, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(雅典国家技术大学电气与计算机工程学院决策支持系统实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出一种可信-by-设计的机器学习框架,通过条件表格生成对抗网络和神经网络多标签分类器,为住宅建筑提供节能策略推荐,结合SHAP解释层提升透明度和可信度,验证了在不同数据条件下性能提升达53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 79%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 79%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI 79%

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22350 2026-03-25 cs.AI cs.CR 79%

Session Risk Memory (SRM): Temporal Authorization for Deterministic Pre-Execution Safety Gates

会话风险记忆(SRM):确定性预执行安全门的时序授权

Florin Adrian Chitan

机构 * Independent Researcher(独立研究者) ILION Project(ILION项目)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SRM,一种轻量确定性模块,通过轨迹级授权扩展无状态执行门,以检测分布式攻击。实验显示SRM在检测率和准确率上优于传统方法,且具备低延迟。

Comments 12 pages, 3 figures. Companion paper to arXiv:2603.13247. Benchmark dataset and artifacts available on Zenodo: 10.5281/zenodo.15410944

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20595 2026-03-24 cs.AI cs.MA 79%

Position: Multi-Agent Algorithmic Care Systems Demand Contestability for Trustworthy AI

位置:多智能体算法护理系统需具备可挑战性以实现可信AI

Truong Thanh Hung Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(安利克斯 everywhere 实验室,新不伦瑞克大学,加拿大) National Research Council Canada, Canada(加拿大国家研究委员会,加拿大) Thompson Rivers University, Canada(汤普森河大学,加拿大) ISB Corporation, Japan(ISB公司,日本) University of Northern British Columbia, Canada(北北加拿大大学,加拿大)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文探讨了多智能体算法护理系统中可挑战性设计的必要性,提出通过透明性、干预机会和审查机制来增强人机协作的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 79%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17373 2026-03-19 cs.CL 79%

SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems

SafeTutors: 评估AI辅导系统中的教学安全性

Rima Hazra, Bikram Ghuku, Ilona Marchenko, Yaroslava Tokarieva, Sayan Layek, Somnath Banerjee, Julia Stoyanovich, Mykola Pechenizkiy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Indian Institute of Technology Kharagpur(印度理工学院Khargpur分校) Cisco Research(思科研究) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) National Technical University of Ukraine(乌克兰国家技术大学) New York University(纽约大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出SafeTutors基准,评估AI辅导系统在数学、物理和化学中的教学有效性与安全性,发现模型在多轮对话中教学失败率显著上升,且学科差异影响安全措施效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 79%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16052 2026-03-18 cs.AI 79%

A Context Alignment Pre-processor for Enhancing the Coherence of Human-LLM Dialog

一种增强人与大语言模型对话连贯性的上下文对齐预处理模块

Ding Wei

机构 * College of Architecture, Nanjing Tech University(南京工业大学建筑学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出C.A.P.预处理框架,通过语义扩展、时间加权上下文检索和对齐验证,解决长对话中的上下文错位问题,提升对话连贯性与协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 79%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 79%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 79%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12701 2026-03-16 cs.HC cs.AI 79%

Seeing Eye to Eye: Enabling Cognitive Alignment Through Shared First-Person Perspective in Human-AI Collaboration

彼此相视:通过共享第一人称视角实现人机协作中的认知对齐

Zhuyu Teng, Pei Chen, Yichen Cai, Ruoqing Lu, Zhaoqu Jiang, Jiayang Li, Weitao You, Lingyun Sun

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Eye2Eye框架,通过共享第一人称视角实现人机认知对齐,解决沟通和理解鸿沟问题,实验表明其能提升协作效率和信任度。

Comments 19 pages, 11 figures. Accepted at ACM CHI 2026, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11987 2026-03-13 cs.AI 79%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 79%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 79%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08321 2026-03-10 cs.AI 79%

CORE-Acu: Structured Reasoning Traces and Knowledge Graph Safety Verification for Acupuncture Clinical Decision Support

CORE-Acu: 结构化推理轨迹与知识图谱安全验证用于针灸临床决策支持

Liuyi Xu, Yun Guo, Ming Chen, Zihan Dun, Yining Qian, An-Yang Lu, Shuang Li, Lijun Liu

机构 * College of Information Science and Engineering, Northeastern University, Shenyang 110819, China(信息科学与工程学院,东北大学,沈阳110819,中国) School of Information Science and Engineering, Yanshan University, Qinhuangdao, Hebei 066000, China(信息科学与工程学院,燕山大学,秦皇岛,河北省066000,中国) School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(计算机科学与工程学院,东北大学,沈阳110819,中国) School of Artificial Intelligence, Beihang University, Beijing 100000, China(人工智能学院,北航,北京100000,中国) Key Laboratory of Bioresource Research and Development of Liaoning Province, Northeastern University, Shenyang 110169, China(辽宁省生物资源研究开发重点实验室,东北大学,沈阳110169,中国) College of Life and Health Sciences, Northeastern University, Shenyang 110169, China(生命与健康科学学院,东北大学,沈阳110169,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 CORE-Acu通过结构化推理轨迹与知识图谱安全验证,提升针灸临床决策支持的可解释性与安全性。

Comments 19 pages, 5 figures, 18 tables. Includes the Acu-Reasoning dataset and TCM knowledge graph schema

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06884 2026-03-10 cs.AI 79%

Distributed Legal Infrastructure for a Trustworthy Agentic Web

分布式法律基础设施用于可信代理网络

Tomer Jordi Chaffer, Victor Jiawei Zhang, Sante Dino Facchini, Botao Amber Hu, Helena Rong, Zihan Guo, Xisen Wang, Carlos Santana, Giovanni De Gasperis

机构 * Institute for Technoscience and Society(科技与社会研究所) Berkeley Center for Law & Technology(伯克利法与科技中心) U.C. Berkeley Law School(伯克利法学院) Technical University of Munich(慕尼黑技术大学) Università degli Studi dell’Aquila(阿奎拉大学) University of Oxford(牛津大学) Existential Risk Alliance(存在风险联盟) NYU Shanghai(纽约大学上海分校) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03098 2026-03-06 q-bio.QM cs.LG 79%

An AI Implementation Science Study to Improve Trustworthy Data in a Large Healthcare System

一项提升大型医疗系统中可信数据的AI实施科学研究

Benoit L. Marteau, Andrew Hornback, Shaun Q. Tan, Christian Lowson, Jason Woloff, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Shriners Hospitals for Children(夏皮罗儿童医院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本研究通过在大型医疗系统中实施AI技术,提升数据质量并整合可信AI原则,探索混合实施策略以促进医疗AI的发展。

Comments 10 pages, 7 figures. Preprint version. This manuscript has been accepted at IEEE BHI 2025. This is the author-prepared version and not the final published IEEE version. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 79%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 79%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03340 2026-03-05 cs.CY 79%

Trustworthy AI Posture (TAIP): A Framework for Continuous AI Assurance of Agentic Systems at Horizontal and Vertical scale

可信AI姿态(TAIP):一种用于在横向和纵向规模上持续确保代理系统AI可信度的框架

Guy Lupo, Bao Quoc Vo, Natania Locke

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 TAIP框架通过将可信度定义为持续生成的信号,提供了一种在横向和纵向尺度上持续确保代理系统AI可信度的方法,结合本体模型和证据门限基准,实现可重用的AI保证对象。

Comments 40 Pages, 13 Figures, 7 Tables,

详情

展开后加载摘要…

URL PDF HTML 收藏