arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-11 至 2026-03-11 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2603.08987 2026-03-11 cs.LG 74%

MAPLE: Elevating Medical Reasoning from Statistical Consensus to Process-Led Alignment

MAPLE:从统计共识到过程导向对齐的医学推理提升

Kailong Fan, Anqi Pu, Yichen Wu, Wanhua Li, Yicong Li, Hanspeter Pfister, Huafeng Liu, Xiang Li, Quanzheng Li, Ning Guo

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Harvard Medical School(哈佛医学院)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 MAPLE通过整合医学过程奖励模型与TTRL,提升医学推理的准确性和可靠性,实现从统计共识到过程导向对齐的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09312 2026-03-11 cs.CV 67%

IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework

IntroSVG: 通过反思生成器-批评者框架从渲染反馈中学习以实现文本到SVG生成

Feiyu Wang, Jiayuan Yang, Zhiyuan Zhao, Da Zhang, Bingyu Li, Peng Liu, Junyu Gao

机构 * Fudan University(复旦大学) TeleAI Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 IntroSVG通过反思生成器-批评者框架,结合监督微调和直接偏好优化,实现文本到SVG生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 50%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 9 篇

2603.08760 2026-03-11 cs.CY cs.AI cs.CR 90%

Clear, Compelling Arguments: Rethinking the Foundations of Frontier AI Safety Cases

清晰有力的论点:重新思考前沿人工智能安全案例的基础

Shaun Feakins, Ibrahim Habli, Phillip Morgan

机构 * UKRI Centre for Doctoral Training in Safe AI Systems (SAINTS)(英国研究与创新机构安全人工智能系统博士培训中心) Institute for Safe Autonomy(安全自主研究所) The York Law School(约克法律学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文重新思考前沿人工智能安全案例的基础,通过借鉴安全保证领域的方法,提出更稳健的安全案例框架以确保人工智能系统的安全性。

Comments Full paper presented at the International Association of Safe and Ethical AI 2026 Conference (IASEAI 26). 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24235 2026-03-11 cs.RO cs.AI 83%

SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems

SafeGen-LLM: 提高机器人系统任务规划中的安全性泛化能力

Jialiang Fan, Weizhe Xu, Mengyu Liu, Oleg Sokolsky, Insup Lee, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SafeGen-LLM通过两阶段框架提升机器人任务规划的安全性泛化能力,优于现有基线。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00544 2026-03-11 cs.CL 70%

When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment

当思考反噬:对推理引发的不一致的机理洞察

Hanqi Yan, Hainiu Xu, Siya Qi, Shu Yang, Yulan He

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文揭示了推理能力增强导致的不一致现象,通过神经元层面的分析,解释了推理与安全之间的纠缠如何引发灾难性遗忘。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 67%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 安全训练 :safety(abstract);red teaming(abstract)

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 62%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 57%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07409 2026-03-11 eess.SY cs.LG cs.MA cs.RO cs.SY 57%

Learning responsibility allocations for multi-agent interactions: A differentiable optimization approach with control barrier functions

多智能体交互中的责任分配学习:一种基于可微优化与控制屏障函数的方法

Isaac Remy, David Fridovich-Keil, Karen Leung

机构 * University of Washington, Department of Aeronautics and Astronautics(华盛顿大学航空航天系) University of Texas, Austin, Department of Aerospace Engineering and Engineering Mechanics(得克萨斯大学奥斯汀分校航空航天工程与工程力学系) NVIDIA

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于控制屏障函数和可微优化的方法,用于学习多智能体交互中的责任分配,通过数据驱动的方式实现对安全交互行为的可解释性分析。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09090 2026-03-11 cs.LG 57%

Overcoming Valid Action Suppression in Unmasked Policy Gradient Algorithms

克服未遮蔽策略梯度算法中的有效动作抑制

Renos Zabounidis, Roy Siegelmann, Mohamad Qadri, Woojun Kim, Simon Stepputtis, Katia P. Sycara

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究揭示了未遮蔽策略梯度算法中有效动作抑制的机制,并通过实验验证了可行性分类在无需oracle遮蔽的部署中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16158 2026-03-11 cs.HC 50%

Designing Culturally Aligned AI Systems For Social Good in Non-Western Contexts

为非西方语境中的社会公益设计文化契合的AI系统

Deepak Varuvel Dennison, Mohit Jain, Tanuja Ganu, Aditya Vashistha

专题命中 安全训练 :safety(abstract)

AI总结 本文通过分析非西方语境中AI系统的部署案例,提出12条设计指南,强调文化契合与人类资源在构建安全有效AI系统中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2505.11790 2026-03-11 cs.LG cs.CR 85%

JULI: Jailbreak Large Language Models by Self-Introspection

通过自我反思 jailbreak 大型语言模型:JULI

Jesson Wang, Zhanhao Hu, David Wagner

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 JULI 通过操纵令牌日志概率,利用微小插件块 BiasNet 实现对 API 调用 LLMs 的 jailbreak,无需模型权重或生成过程权限,且在黑盒环境下有效。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09246 2026-03-11 cs.CR 82%

Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models

面向推理的编程:通过链式语义工具来突破大型视觉语言模型

Quanchen Zou, Moyang Chen, Zonghao Ying, Wenzhuo Xu, Yisong Xiao, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract)

AI总结 本文提出面向推理的编程方法,通过链式语义工具突破大型视觉语言模型的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08897 2026-03-11 cs.CV 50%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 2 篇

2603.07071 2026-03-11 cs.CV 50%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 50%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2603.09214 2026-03-11 cs.AI 79%

PrivPRISM: Automatically Detecting Discrepancies Between Google Play Data Safety Declarations and Developer Privacy Policies

PrivPRISM:自动检测Google Play数据安全声明与开发者隐私政策之间的差异

Bhanuka Silva, Dishanika Denipitiyage, Anirban Mahanti, Aruna Seneviratne, Suranga Seneviratne

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 隐私与版权 :safety(title,abstract);分类 cs.AI

AI总结 PrivPRISM通过对比隐私政策与数据安全声明,自动检测应用数据实践中的不一致,揭示系统性问题并强调自动化监管的必要性。

Comments 21 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 22 篇

2603.09154 2026-03-11 cs.CL 84%

Bioalignment: Measuring and Improving LLM Disposition Toward Biological Systems for AI Safety

Bioalignment: 评估和改进LLM对生物系统的倾向以提高AI安全性

Trent R Northen, Mingxun Wang

机构 * Bioaligned Labs(Bioaligned实验室) Lawrence Berkeley National Lab(伯克利国家实验室) Computer Science & Engineering Dept, UC Riverside(加州大学河滨分校计算机科学与工程系)

专题命中 安全评测 :safety(title);AI safety(title);分类 cs.CL

AI总结 本研究通过微调改进LLM对生物解决方案的偏好,表明少量微调可提升模型对生物与合成方法的权衡能力。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 83%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 79%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09758 2026-03-11 cs.CL 70%

Beyond Fine-Tuning: Robust Food Entity Linking under Ontology Drift with FoodOntoRAG

超越微调:在本体漂移下利用FoodOntoRAG实现鲁棒的食品实体链接

Jan Drole, Ana Gjorgjevikj, Barbara Korouši'c Seljak, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan International Postgraduate School, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬国际研究生学院计算机系统系) Computer Systems Department, Jožef Stefan Institute, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬研究所计算机系统系)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出FoodOntoRAG,通过检索本体和结构化证据实现鲁棒的食品实体链接,避免微调并提高本体漂移的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09200 2026-03-11 cs.AI cs.CL cs.CY cs.LG 70%

The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness

推理陷阱——逻辑推理作为情境意识的机制路径

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(MARS 4.0 Fellow,剑桥人工智能安全中心(CAISH),剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊生成AI创新中心,亚马逊网络服务,美国) Google, USA(谷歌,美国) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RAISE框架,揭示逻辑推理能力提升与情境意识升级的机制路径,并提出安全原则与测试方法以应对潜在风险。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07847 2026-03-11 cs.CR 67%

Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models

时间鲁棒性:对抗示例在大型语言模型纵向版本中的有效性

Yugeng Liu, Tianshuo Cong, Zhengyu Zhao, Michael Backes, Yun Shen, Yang Zhang

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文研究了大型语言模型在纵向版本中的对抗鲁棒性,发现更新并不总是提升鲁棒性,部分模型在误分类和幻觉方面有所下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09691 2026-03-11 cs.CL cs.AI 62%

ESAinsTOD: A Unified End-to-End Schema-Aware Instruction-Tuning Framework for Task-Oriented Dialog Modeling

ESAinsTOD: 一种统一的端到端模式感知指令微调框架用于任务导向对话建模

Dechuan Teng, Chunlin Lu, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会科学与信息检索研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ESAinsTOD提出一种统一的端到端模式感知指令微调框架,提升任务导向对话建模的性能与泛化能力。

Comments Published at International Journal of Machine Learning and Cybernetics (IJMLC)

Journal ref Int. J. Mach. Learn. & Cyber. 17, 127 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06758 2026-03-11 cs.LG cs.AI 62%

Enhancing SHAP Explainability for Diagnostic and Prognostic ML Models in Alzheimer Disease

增强阿尔茨海默病诊断和预后ML模型的SHAP可解释性

Pablo Guillén, Enrique Frias-Martinez

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级框架提升AD诊断预后模型SHAP解释的稳健性和一致性,通过整合相干性、稳定性与跨任务一致性验证解释的可靠性。

Journal ref CMC 1546-2226 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08736 2026-03-11 cs.DC cs.AI cs.LG cs.SY eess.SY 62%

Autonomous Edge-Deployed AI Agents for Electric Vehicle Charging Infrastructure Management

自主边缘部署AI代理用于电动汽车充电基础设施管理

Mohammed Cherifi

机构 * Hyperion Consulting(超离子咨询)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Auralink SDC架构,通过边缘部署的专用AI代理实现电动汽车充电基础设施的自主管理,实现高准确率的事故修复与快速响应。

Comments 27 pages, 10 figures (TikZ), 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09249 2026-03-11 cs.AI 57%

Social-R1: Towards Human-like Social Reasoning in LLMs

Social-R1: 向大语言模型中引入人类般的社交推理

Jincenzi Wu, Yuxuan Lei, Jianxun Lian, Yitian Huang, Lexin Zhou, Haotian Li, Xing Xie, Helen Meng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Social-R1通过多维奖励对齐模型推理与人类认知,利用ToMBench-Hard提供困难训练案例,使大模型在社交推理任务中实现超越和稳健泛化。

Comments 27 pages. Code and dataset will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09231 2026-03-11 cs.AI 57%

Cognitively Layered Data Synthesis for Domain Adaptation of LLMs to Space Situational Awareness

认知分层数据合成用于LLM在空间态势感知领域的领域适应

Ding Linghu, Cheng Wang, Da Fan, Wei Shi, Kaifeng Yin, Xiaoliang Xue, Fan Yang, Haiyi Ren, Cong Zhang

机构 * Qian Xuesen Laboratory of Space Technology(钱学森空间技术实验室) China Academy of Space Technology(中国航天科技研究院) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出BD-FDG框架,通过认知分层问题建模和结构化知识组织,构建高质量SFT数据集,提升LLM在空间态势感知领域的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 57%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏