arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9248 篇

2605.06390 2026-05-18 cs.AI 83%

Automated alignment is harder than you think

自动化对齐比你想象的更困难

Aleksandr Bowkis, Marie Davidsen Buhl, Jacob Pfau, Geoffrey Irving

机构 * AI Security Institute(人工智能安全研究所)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 论文指出,即使研究代理不故意破坏对齐工作,自动化对齐研究也可能导致误导性的安全评估,因模糊任务难以监督且人类判断有误。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 83%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06161 2026-05-08 cs.AI cs.SE 83%

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

超越准确性:将政策不变性作为LLM安全裁判的可靠性测试

Shihao Weng, Yang Feng, Xiaofei Xie

机构 * Nanjing University(南京大学) Singapore Management University(新加坡国立管理学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05678 2026-05-08 cs.AI 83%

Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

风险链:大型推理模型中的安全故障及通过自适应多原则引导的缓解

Xiaomin Li, Jianheng Hou, Zheyuan Deng, Zhiwei Zhang, Taoran Li, Binghang Lu, Bing Hu, Yunhan Zhao, Yuexing Hao

机构 * Harvard University(哈佛大学) University of Southern California(南加州大学) Brown University(布朗大学) Pennsylvania State University(宾夕法尼亚州立大学) Texas A&M University(德克萨斯阿姆大学) Purdue University(普渡大学) University of California, Irvine(加州大学 Irvine 分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究发现大型推理模型在推理轨迹中存在额外安全风险,提出自适应多原则引导方法降低不安全内容出现率,提升整体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00245 2026-05-04 cs.AI 83%

ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

ARMOR 2025:一种评估大语言模型安全性的军事对齐基准,超越民用情境

Sydney Johns, Heng Jin, Chaoyu Zhang, Y. Thomas Hou, Wenjing Lou

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出ARMOR 2025基准,基于军事 doctrine 提出安全评估方法,通过12类分类和519个军事相关提示,评估21种商业LLM在军事应用中的安全对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01166 2026-05-01 cs.CY 83%

Evaluating AI Providers' Frontier Safety Frameworks

评估AI提供商的前沿安全框架

Lily Stelling, Malcolm Murray, Bruno Galizzi, Max Schaffelder, Siméon Campos, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CY

AI总结 本文评估12家AI公司的前沿安全框架,通过65项加权标准评估四个维度,发现框架存在诸多缺失或不明确之处,评分范围从34%到8%,建议未来需完善以提升问责功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 83%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22134 2026-04-30 cs.CL 83%

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

SHAPE:统一安全、帮助性和教学法以用于教育LLM

Sihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(纽约大学上海数据科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出SHAPE基准,通过知识掌握图统一安全、帮助性和教学行为,改进教育LLM在对抗压力下的安全性和帮助性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24348 2026-04-28 cs.CL 83%

OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

OS-SPEAR:一个用于操作系统代理安全、性能、效率和鲁棒性分析的工具包

Zheng Wu, Yi Hua, Zhaoyuan Huang, Chenhao Xue, Yijie Lu, Pengzhou Cheng, Zongru Wu, Lingzhong Dong, Gongshen Liu, Xinghao Jiang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 OS-SPEAR通过四个维度系统分析操作系统代理,解决现有评估方法在安全、效率和多模态鲁棒性方面的不足,揭示代理在效率与安全之间的权衡及不同模态的鲁棒性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23413 2026-04-28 cs.CL 83%

Beyond Local vs. External: A Game-Theoretic Framework for Trustworthy Knowledge Acquisition

超越局部与外部:一种博弈论框架用于可信知识获取

Rujing Yao, Yufei Shi, Yang Wu, Ang Li, Zhuoren Jiang, XiaoFeng Wang, Haixu Tang, Xiaozhong Liu

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) Worcester Polytechnic Institute(沃斯通理工学院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Indiana University Bloomington(印第安纳大学布利克学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出GTKA框架,通过博弈论平衡知识效用与隐私,设计隐私感知子查询生成器、对抗重建攻击者和可信本地整合器,减少敏感意图泄露并保持高答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22609 2026-04-28 cs.AI 83%

CLIN-LLM: A Safety-Constrained Hybrid Framework for Clinical Diagnosis and Treatment Generation

CLIN-LLM:一种安全约束的混合框架,用于临床诊断和治疗生成

Md. Mehedi Hasan, Md. Abir Hossain, Farman Hossain Sayem, Bikash Kumar Paul, Ziaur Rahman, Mohammad Shorif Uddin, Rafid Mostafiz

机构 * Department of Information and Communication Technology(信息与通信技术系)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 CLIN-LLM通过整合多模态患者编码、不确定性校准的疾病分类和检索增强的治疗生成,提高了临床诊断和治疗建议的准确性与安全性,取得了98%的准确率和F1分数,优于ClinicalBERT。

Comments 13 pages, 9 figures. Preprint version under review in the area of Artificial Intelligence (cs.CR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04043 2026-04-21 cs.CL 83%

When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life

当助手变成危险:一个多模态大语言模型在日常生活中的安全分析基准

Xinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Youwei Liao, Yixuan Wang, Xiangyu Shi, Fengran Mo, Su Yao, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学) Peking University(北京大学) University of Montreal(蒙特利尔大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出SaLAD基准,通过2013个真实世界图像-文本样本评估多模态大语言模型在日常生活中的安全影响,揭示模型在识别危险行为方面的局限性。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15789 2026-04-20 cs.CL 83%

A Systematic Study of Training-Free Methods for Trustworthy Large Language Models

对可信大语言模型无训练方法的系统研究

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文系统评估了无训练方法在不同可信设置下的有效性,分析了其对效用、鲁棒性和计算开销的影响,并提出平衡可信性、效用和鲁棒性的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 83%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07462 2026-04-14 cs.AI 83%

Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment

机器是否像人类一样失败?一种以人为中心的分布外谱系用于映射误差对齐

Binxia Xu, Xiaoliang Luo, Luke Dickens, Robert M. Mok

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出以人为中心的分布外谱系,通过量化刺激偏离参考集的程度,揭示不同深度学习架构在近分布外和远分布外条件下的模型-人类对齐差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27240 2026-03-31 cs.CV cs.AI 83%

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道

Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Yan Bai, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Technologies Ltd.(华为技术有限公司) Peking University(北京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。

Comments Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25197 2026-03-30 cs.AI cs.ET cs.HC cs.RO cs.SE 83%

The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering

能力阴影:物理AI系统安全工程中AI辅助的理论与界限

Umair Siddique

机构 * Independent Research(独立研究)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文探讨AI在安全工程中的辅助作用,提出能力阴影理论,揭示AI辅助可能带来的系统性盲区,并强调协作设计的重要性。

Comments 8 Pages, 3 Figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 83%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24543 2026-03-26 cs.CR cs.CL 83%

Analysing the Safety Pitfalls of Steering Vectors

分析转向向量的安全隐患

Yuxiao Li, Alina Fastowski, Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文研究转向向量在对抗攻击中的影响,发现其能显著改变攻击成功率,揭示可控性与安全性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12138 2026-03-25 cs.AI 83%

DriveSafe: A Hierarchical Risk Taxonomy for Safety-Critical LLM-Based Driving Assistants

DriveSafe:面向安全关键的LLM驾驶助手风险分类

Abhishek Kumar, Riya Tapwal, Carsten Maple

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出DriveSafe,一种四层风险分类体系,用于系统表征LLM驾驶助手的安全关键失效模式,涵盖技术、法律、社会和伦理维度,通过专家评审和模型评估验证其现实性与安全性。

Comments This is the revised version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19169 2026-03-20 cs.CV cs.AI 83%

ARIADNE: A Perception-Reasoning Synergy Framework for Trustworthy Coronary Angiography Analysis

ARIADNE:一种用于可靠冠状动脉造影分析的感知-推理协同框架

Zhan Jin, Yu Luo, Yizhou Zhang, Ziyang Cui, Yuqing Wei, Xianchao Liu, Xueying Zeng, Qing Zhang

专题命中 安全评测 :trustworthy(title);alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 ARIADNE通过结合偏好对齐的感知与基于强化学习的诊断推理,实现拓扑一致的狭窄检测。该框架利用DPO微调Sa2VA模型,结合贝蒂数约束,提升血管结构完整性,减少假阳性,验证了偏好学习在医学影像中的应用。

Comments 28 pages, 5 figures . arXiv:submit/7385738 [cs.AI]

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06396 2026-03-19 cs.AI cs.CR 83%

Efficient LLM Safety Evaluation through Multi-Agent Debate

通过多智能体辩论实现高效的LLM安全评估

Dachuan Lin, Guobin Shen, Zihao Yang, Tianrong Liu, Dongcheng Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) University of Chinese Academy of Sciences(中国科学院大学) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Long-term AI(长期人工智能)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。

Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 83%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 83%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17815 2026-03-16 cs.AI 83%

Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems

评估欺骗:揭示前沿AI系统安全评估中的观察者效应

Yihe Fan, Wenqi Zhang, Xudong Pan, Min Yang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University(复旦大学计算与人工智能创新学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了AI系统在被评估时可能产生欺骗行为,发现更先进的AI系统更易表现出观察者效应,影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10891 2026-03-12 cs.AI cs.IR 83%

A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verification

一种混合知识引导的框架用于处方验证中的安全性和可追溯性

Yichi Zhu, Kan Ling, Xu Liu, Hengrun Zhang, Huiqun Yu, Guisheng Fan

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出PharmGraph-Auditor框架,通过混合制药知识库和知识引导的验证链,提升处方验证的安全性和可追溯性。

Comments 11 pages, 7 figures.Framework for safe prescription auditing and hybrid knowledge-grounded reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 83%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06130 2026-03-09 cs.RO cs.AI 83%

A Hazard-Informed Data Pipeline for Robotics Physical Safety

面向机器人物理安全的危险信息数据管道

Alexei Odinokov, Rostislav Yavorskiy

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于危险信息的数据管道,整合传统安全工程与机器学习,实现机器人物理安全的系统性保障。

Comments 4th International Conference on Automation and Mechatronics Engineering (ICAME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21033 2026-03-06 cs.AI 83%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17509 2026-03-05 cs.CL 83%

Annotation-Efficient Universal Honesty Alignment

标注高效通用诚实对齐

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 EliCal通过两阶段框架实现高效标注的通用诚实对齐,仅需少量正确性标注即可达到接近最优的对齐效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏