arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 136 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 49 篇

2603.14908 2026-03-17 cs.RO cs.CV 50%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14888 2026-03-17 cond-mat.other physics.comp-ph physics.ed-ph 50%

Demonstration of AI-Assisted Scientific Workflow on Canonical Benchmarks

在经典基准上展示AI辅助的科学工作流

Kin Hung Fung

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文通过经典基准问题展示AI辅助科学工作流,涵盖解析和数值方法,验证了AI在推导、实现、验证和论文准备中的应用价值。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14393 2026-03-17 cs.RO 50%

From Scanning Guidelines to Action: A Robotic Ultrasound Agent with LLM-Based Reasoning

从扫描指南到行动:基于LLM的机器人超声代理

Yuan Bi, Yiping Zhou, Pei Liu, Feng Li, Zhongliang Jiang, Nassir Navab

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种基于LLM的自主机器人超声扫描框架,通过动态调用软件工具实现自主扫描,提升适应性和透明度。

Comments Code: https://github.com/yuan-12138/RUSSAgent; Video: https://youtu.be/pfMOc4e2IGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 50%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 安全评测 :safety(abstract)

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14236 2026-03-17 cs.RO cs.DC 50%

AeroGen: Agentic Drone Autonomy through Single-Shot Structured Prompting & Drone SDK

AeroGen:通过单次结构提示与无人机SDK实现代理无人机自主性

Kautuk Astu, Yogesh Simmhan

专题命中 安全评测 :safety(abstract)

AI总结 本文提出AeroGen框架,通过结构化提示和AeroDaaS SDK实现无人机自主控制程序的可靠生成,验证了其在多种环境下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 50%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02384 2026-03-17 cs.CR cs.CV 50%

Secure and Robust Watermarking for AI-generated Images: A Comprehensive Survey

面向AI生成图像的安全可靠水印技术:全面综述

Jie Cao, Qi Li, Zelin Zhang, Jianbing Ni, Rongxing Lu

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了AI生成图像水印技术,从系统形式化、方法比较、评估指标、安全漏洞及未来挑战等方面系统分析,为研究者提供全面理解以推动安全可信的AI生成内容发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13717 2026-03-17 cs.HC 50%

"It Became My Buddy, But I'm Not Afraid to Disagree": A Multi-Session Study of UX Evaluators Collaborating with Conversational AI Assistants

它成了我的伙伴,但我并不害怕反对:对UX评估者与对话式AI助手多会话研究

Emily Kuang, Ehsan Jahangirzadeh Soure, Luyao Shen, Nitesh Goyal, Mingming Fan, Kristen Shinohara

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨了AI专家形象如何影响评估者分析策略和信任随时间变化,发现评估者在初期表现出新颖效应,随后信任下降但逐渐恢复,效率提升源于从双轮检查到单轮检查的转变,最终评估者认为经验型AI更高效、可信和全面。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2603.13244 2026-03-17 cs.CY cs.AI cs.CE 76%

Agentic AI, Retrieval-Augmented Generation, and the Institutional Turn: Legal Architectures and Financial Governance in the Age of Distributional AGI

代理AI、检索增强生成与制度转向:分布式AGI时代的法律架构与金融治理

Marcel Osmond

专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.CY;safety(comments)

AI总结 本文探讨代理AI与检索增强生成对法律问责和金融市场完整性的影响,主张通过制度设计问题重构对齐机制,以构建合规行为主导的机构环境。

Comments 35 pages, 92 references. Comprehensive interdisciplinary analysis integrating AI safety, mechanism design, legal regulation, and financial governance. Published on Zenodo (https://doi.org/10.5281/zenodo.18711509). Includes industry practitioner perspectives alongside peer-reviewed literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14495 2026-03-17 cs.CY cs.AI 73%

Bridging the Gap in the Responsible AI Divides

弥合负责任AI分歧的鸿沟

Bálint Gyevnár, Atoosa Kasirzadeh

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析3550篇论文,探讨AI安全与AI伦理之间的分歧与重叠,提出通过解决关键问题促进负责任的AI治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13636 2026-03-17 cs.CL cs.AI cs.CY 67%

Widespread Gender and Pronoun Bias in Moral Judgments Across LLMs

大范围性别和代词偏见在LLM道德判断中的表现

Gustavo Lúcius Fernandes, Jeiverson C. V. M. Santos, Pedro O. S. Vaz-de-Melo

机构 * Universidade Federal de Minas Gerais(巴西米纳斯吉拉斯联邦大学) Instituto Kunumi(昆米研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过分析不同LLM对公平性判断的偏见,发现代词和性别标记显著影响道德分类,非二元性别受青睐,男性受歧视,需改进公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14625 2026-03-17 cs.MA cs.AI cs.LG cs.SY eess.SY 62%

EcoFair-CH-MARL: Scalable Constrained Hierarchical Multi-Agent RL with Real-Time Emission Budgets and Fairness Guarantees

EcoFair-CH-MARL:具有实时排放预算和公平性保证的可扩展约束层次多智能体强化学习

Saad Alqithami

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EcoFair-CH-MARL框架,通过引入双重预算层、公平性奖励转换器和两级策略架构,实现高效、可持续且公平的海运物流解决方案,实验显示其在排放、吞吐量和公平性方面优于现有方法。

Comments Conference: The 28th European Conference on Artificial Intelligence (ECAI)

Journal ref Frontiers in Artificial Intelligence and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15187 2026-03-17 cs.CL 57%

The Hrunting of AI: Where and How to Improve English Dialectal Fairness

AI的提升:在哪里以及如何改进英语方言公平性

Wei Li, Adrian de Wynter

机构 * Boston College(波士顿学院) Microsoft(微软) The University of York(约克大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了数据质量和可用性对改进LLM在英语方言中的性能的影响,发现人类间的一致性直接影响LLM作为评判者的性能,并指出需谨慎评估数据以确保公平性和包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14838 2026-03-17 cs.CL 57%

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

检索增强生成中意识形态话语的影响:以新冠治疗方案为例

Elmira Salari, Maria Claudia Nunes Delfino, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Alan Davoust, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) Pontifícia Universidade Católica de São Paulo(圣保罗天主教大学) Institut national de la recherche scientifique(国家科学研究中心) Université du Québec en Outaouais(魁北克大学Outaouais)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文研究检索到的意识形态文本对大语言模型输出的影响,通过新冠治疗方案案例,探讨意识形态在RAG框架中的识别与影响,揭示意识形态偏见与潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14325 2026-03-17 cs.AI 57%

FAIRGAME: a Framework for AI Agents Bias Recognition using Game Theory

FAIRGAME: 一个用于通过博弈论识别AI代理偏见的框架

Alessio Buscemi, Daniele Proverbio, Alessandro Di Stefano, The-Anh Han, German Castignani, Pietro Liò

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 FAIRGAME利用博弈论框架识别AI代理中的偏见,通过模拟和比较不同场景下的结果,系统发现偏见并预测战略互动中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 31 篇

2603.14417 2026-03-17 cs.CY cs.AI cs.CL cs.LG 85%

Questionnaire Responses Do not Capture the Safety of AI Agents

问卷回复无法捕捉AI代理的安全性

Max Hellrigel-Holderbaum, Edward James Young

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文指出问卷式评估无法准确衡量AI代理的安全性,因LLM在情景中的表现与实际代理行为存在差异,导致评估方法缺乏有效性。

Comments 31 pages, 11 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15364 2026-03-17 cs.AI cs.CL 81%

CRASH: Cognitive Reasoning Agent for Safety Hazards in Autonomous Driving

CRASH:面向自动驾驶安全隐患的认知推理代理

Erick Silva, Rehana Yasmin, Ali Shoker

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹科技大学)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRASH,一种基于大语言模型的自动驾驶安全隐患分析工具,通过自动化处理事故报告,识别事故原因并评估自动驾驶系统对事故的影响,验证其在事故分析中的有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI 81%

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13272 2026-03-17 cs.LG cs.AI 81%

CAMEL-CLIP: Channel-aware Multimodal Electroencephalography-text Alignment for Generalizable Brain Foundation Models

CAMEL-CLIP:面向通用脑基础模型的通道感知多模态EEG-文本对齐

Hanseul Choi, Jinyeong Park, Seongwon Jin, Sungho Park, Jibum Kim

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Incheon National University(庆尚国立大学) Department of Artificial Intelligence(人工智能系) Inha University(Inha大学) Center for Brain-Machine Interface(脑机接口中心)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 CAMEL-CLIP通过通道属性位置编码、动态通道投影和双级对比学习,提升EEG-文本多模态基础模型在通道异质性下的鲁棒性,实验表明其在线性探测中表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 78%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14012 2026-03-17 cs.CV 78%

Multi-Grained Vision-Language Alignment for Domain Generalized Person Re-Identification

多粒度视觉-语言对齐用于领域泛化的人员重识别

Jiachen Li, Xiaojin Gong, Dongping Zhang

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出基于CLIP的多粒度视觉-语言对齐框架,通过引入多粒度提示和自适应掩码模块提升领域泛化人员重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13770 2026-03-17 cs.CV 78%

PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment

PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成

Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, Nathan Jacobs

专题命中 其他安全 :alignment(title,abstract)

AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21262 2026-03-17 cs.CL cs.LG cs.MA 73%

Under the Influence: Quantifying Persuasion and Vigilance in Large Language Models

受其影响:量化大型语言模型中的说服力与警觉性

Sasha Robinson, Katherine M. Collins, Ilia Sucholutsky, Kelsey R. Allen

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了大型语言模型在说服和警觉性方面的表现,发现其在任务执行中存在独立的能力差异,强调需单独监控这三个方面以保障AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14664 2026-03-17 cs.AI cs.CL cs.CY 67%

Punctuated Equilibria in Artificial Intelligence: The Institutional Scaling Law and the Speciation of Sovereign AI

人工智能中的突变平衡:制度扩展定律与主权人工智能的物种分化

Mark Baciak, Thomas A. Cellucci, Deanna M. Falkowski

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文挑战人工智能发展连续进步的假设,提出基于生物进化突变平衡理论,揭示AI发展通过停滞期与快速转型交替的非单调模式,提出制度扩展定律及主权AI的物种分化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 67%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 67%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09894 2026-03-17 cs.AI cs.CY cs.LG 67%

Beyond AlphaEarth: Toward Human-Centered Geospatial Foundation Models via POI-Guided Contrastive Learning

超越AlphaEarth:通过POI引导对比学习实现以人为中心的地理空间基础模型

Junyuan Liu, Quan Qin, Guangsheng Dong, Xinglei Wang, Jiazhuang Feng, Zichao Zeng, Tao Cheng

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AETHER框架,通过POI引导的多模态对齐,将AlphaEarth与以人为中心的城市分析结合,提升地理空间表示的可解释性与语言可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15547 2026-03-17 cs.CL cs.AI cs.HC 62%

Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation

大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究

Yanick Zengaffinen, Andreas Opedal, Donya Rooein, Kv Aditya Srivatsa, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Bocconi University, Italy(博科尼大学,意大利) University of Central Florida, USA(中央佛罗里达大学,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15183 2026-03-17 cs.DC cs.AI cs.LG cs.MA 62%

Token Coherence: Adapting MESI Cache Protocols to Minimize Synchronization Overhead in Multi-Agent LLM Systems

令牌一致性:适应MESI缓存协议以最小化多智能体大语言模型系统中的同步开销

Vladyslav Parakhin

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出令牌一致性理论,通过将MESI协议应用于多智能体系统,减少同步开销,验证了在多智能体大语言模型中同步成本与缓存一致性问题的对应关系,并通过形式化验证协议确保安全性与一致性。

Comments 25 pages. Code and reproduction scripts at https://github.com/hipvlady/agent-coherence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06107 2026-03-17 cs.CL cs.AI cs.CE 62%

Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models

分布语义追踪:一种解释大语言模型幻觉的框架

Gagan Bhatia, Somayajulu G Sripada, Kevin Allan, Jacobo Azcona

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分布语义追踪框架,通过解码残差流状态构建语义图谱,揭示大语言模型幻觉源于表征漂移,通过轻量因果追踪验证假设,实验显示其解释效果优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏