arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 13 篇

2603.19169 2026-03-20 cs.CV cs.AI 83%

ARIADNE: A Perception-Reasoning Synergy Framework for Trustworthy Coronary Angiography Analysis

ARIADNE:一种用于可靠冠状动脉造影分析的感知-推理协同框架

Zhan Jin, Yu Luo, Yizhou Zhang, Ziyang Cui, Yuqing Wei, Xianchao Liu, Xueying Zeng, Qing Zhang

专题命中 安全评测 :trustworthy(title);alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 ARIADNE通过结合偏好对齐的感知与基于强化学习的诊断推理,实现拓扑一致的狭窄检测。该框架利用DPO微调Sa2VA模型,结合贝蒂数约束,提升血管结构完整性,减少假阳性,验证了偏好学习在医学影像中的应用。

Comments 28 pages, 5 figures . arXiv:submit/7385738 [cs.AI]

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 82%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18976 2026-03-20 cs.AI 79%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 78%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18130 2026-03-20 cs.RO cs.AI 70%

Final Report for the Workshop on Robotics & AI in Medicine

医学领域机器人与人工智能研讨会最终报告

Juan P Wachs

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研讨会聚焦医疗领域机器人与AI的协同发展,强调数据获取、评估方法标准化及跨学科培训的重要性,提出建立国家AI与机器人卓越中心的迫切需求。

Comments 51 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18235 2026-03-20 cs.CR cs.CV 67%

Toward Reliable, Safe, and Secure LLMs for Scientific Applications

迈向科学应用中可靠、安全和安全的LLM

Saket Sanjeev Chaturvedi, Joshua Bergerson, Tanwi Mallick

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文探讨了科学应用中LLM代理的安全与安全挑战,提出通过多代理系统生成领域特定对抗性安全基准,构建多层次防御框架以提升LLM可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09252 2026-03-20 cs.CL cs.AI cs.HC 62%

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

DAVIS:基于知识图谱的规划代理

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford

机构 * Davis Institute for Artificial Intelligence(戴维斯人工智能研究所) Colby College(科伯学院) University of Notre Dame(圣约翰大学) William & Mary(威廉与玛丽学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAVIS,一种基于知识图谱的规划代理,通过结构化和时间记忆实现模型驱动规划,并采用多轮检索系统提升科学任务处理能力,在ScienceWorld基准测试中表现优异。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13590 2026-03-20 cs.CL cs.AI 62%

Vulnerability of LLMs' Stated Beliefs? LLMs Belief Resistance Check Through Strategic Persuasive Conversation Interventions

LLMs所声明信念的脆弱性?通过战略性说服对话干预检查LLMs信念抵抗性

Fan Huang, Haewoon Kwak, Jisun An

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究通过战略性说服对话干预评估LLMs在不同领域中的信念稳定性,发现小模型易受说服影响,而自信提示反而加剧了脆弱性,揭示了模型依赖性的鲁棒性限制。

Comments Updated new models and minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18868 2026-03-20 cs.HC cs.AI cs.MM 57%

Through the Looking-Glass: AI-Mediated Video Communication Reduces Interpersonal Trust and Confidence in Judgments

通过魔镜:AI介导的视频通信减少人际信任和判断信心

Nelson Navajas Fernández, Jeffrey T. Hancock, Maurice Jakesch

机构 * Bauhaus University(包豪斯大学) Stanford University(斯坦福大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究探讨AI介导的视频处理对人际信任和判断信心的影响,发现AI处理降低信任和信心,但不影响实际判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18469 2026-03-20 cs.CL 57%

GAIN: A Benchmark for Goal-Aligned Decision-Making of Large Language Models under Imperfect Norms

GAIN:在不完美规范下评估大语言模型目标对齐决策的基准

Masayuki Kawarada, Kodai Watanabe, Soichiro Murakami

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 GAIN基准通过模拟现实商业场景,评估大语言模型在规范与目标冲突下的决策平衡能力,揭示影响决策的关键因素。

Comments We are working towards releasing the code in April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18329 2026-03-20 cs.AI 57%

FaithSteer-BENCH: A Deployment-Aligned Stress-Testing Benchmark for Inference-Time Steering

FaithSteer-BENCH:一种面向部署的应力测试基准,用于推理时的操控

Zikang Ding, Qiying Hu, Yi Zhang, Hongji Li, Junchi Yao, Hongbo Liu, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) South China University of Technology(华南理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出FaithSteer-BENCH基准,通过可控性、效用保持和鲁棒性三个指标评估推理时操控方法,揭示现有方法在部署场景下的可靠性问题及机制层面的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20579 2026-03-20 cs.CV cs.AI cs.MM 57%

Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence

Open-o3-Video: 基于显式时空证据的视频推理

Jiahao Meng, Xiangtai Li, Haochen Wang, Yue Tan, Tao Zhang, Lingdong Kong, Yunhai Tong, Anran Wang, Zhiyang Teng, Yujing Wang, Zhuochen Wang

机构 * PKU(北京大学) ByteDance(字节跳动) CASIA(CASIA研究院) WHU(武汉大学) NUS(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Open-o3-Video,通过显式时空证据提升视频推理的可追溯性与可验证性,基于STGR数据集和冷启动强化学习策略,在V-STAR基准上取得SOTA性能,并支持置信度感知的测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 50%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 安全评测 :safety(abstract)

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏