arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-18 至 2026-03-18 共收录 70 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2603.15647 2026-03-18 cs.LG cs.AI 89%

Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing

引导冻结的大型语言模型:通过在线提示路由实现适应性社会对齐

Zeyu Zhang, Xiangxiang Dai, Ziyi Han, Xutong Liu, John C. S. Lui

机构 * The Chinese University of Hong Kong(香港中文大学) University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 本文提出CCLUB框架,通过系统提示路由实现适应性社会对齐,解决部署时静态策略无法应对动态安全规范的问题,实验显示其在累积奖励和子最优差距上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16417 2026-03-18 cs.AI 85%

Via Negativa for AI Alignment: Why Negative Constraints Are Structurally Superior to Positive Preferences

通过否定来实现AI对齐:为什么否定约束在结构上优于积极偏好

Quan Cheng

机构 * Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);harmlessness(abstract);分类 cs.AI

AI总结 本文探讨了通过否定约束而非积极偏好进行AI对齐的结构优势,提出基于波普尔的证伪逻辑,指出否定信号方法在避免趋炎附势和提升效果上的有效性。

Comments 9 pages, position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13506 2026-03-18 cs.CV 67%

LibraGen: Playing a Balance Game in Subject-Driven Video Generation

LibraGen:在以主题驱动的视频生成中进行平衡游戏

Jiahao Zhu, Shanshan Lao, Lijie Liu, Gen Li, Tianhao Qi, Wei Han, Bingchuan Li, Fangfang Liu, Zhuowei Chen, Tianxiang Ma, Qian HE, Yi Zhou, Xiaohua Xie

机构 * Pazhou Laboratory (Huangpu)(黄埔实验室( Pazhou))

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 LibraGen通过平衡视频生成基础模型的内在先验与主题到视频能力,提出了一种新的框架,采用质量优先策略和动态分类器自由引导方案,提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10045 2026-03-18 cs.AI cs.LG 62%

CHARM: Calibrating Reward Models With Chatbot Arena Scores

CHARM:通过聊天机器人竞技场分数校准奖励模型

Xiao Zhu, Chenmien Tan, Pinzhen Chen, Rico Sennrich, Huiming Wang, Yanlin Zhang, Hanxu Hu

机构 * Alibaba Group(阿里巴巴集团) Queen’s University Belfast(贝尔法斯特女王大学) University of Zurich(苏黎世大学) Singapore University of Technology(新加坡科技设计大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CHARM方法,通过利用Chatbot Arena的Elo分数校准奖励模型,减少模型偏好偏差,提升奖励模型的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04153 2026-03-18 cs.CV 50%

Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning

Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调

Yifan Wang, Yanyu Li, Gordon Guocheng Qian, Sergey Tulyakov, Yun Fu, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。

Comments Webpage: https://snap-research.github.io/diffusion-drf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25421 2026-03-18 cs.HC 50%

Small Talk, Big Impact? LLM-based Conversational Agents to Mitigate Passive Fatigue in Conditional Automated Driving

小声谈,大影响?基于LLM的对话代理用于缓解条件自动化驾驶中的被动疲劳

Lewis Cockram, Yueteng Yu, Jorge Pardo, Xiaomeng Li, Andry Rakotonirainy, Jonny Kuo, Sebastien Demmel, Mike Lenné, Ronald Schroeter

专题命中 偏好对齐 :safety(abstract)

AI总结 本文研究了基于LLM的对话代理在条件自动化驾驶中缓解被动疲劳的效果,通过实验证明该代理能提升驾驶员警觉性,并揭示了用户对代理的偏好特征。

Comments Preview version of CHI '26 Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2603.16210 2026-03-18 cs.AI 88%

MOSAIC: Composable Safety Alignment with Modular Control Tokens

MOSAIC:通过模块化控制令牌实现可组合的安全对齐

Jingyu Peng, Hongyu Chen, Jiancheng Dong, Maolin Wang, Wenxi Li, Yuchen Li, Kai Zhang, Xiangyu Zhao

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Minzu University of China(民族大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 MOSAIC通过可学习的控制令牌实现可组合的安全对齐,解决传统方法在动态安全规则下的局限性,实验显示其在降低过拒绝率的同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 78%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16397 2026-03-18 cs.CL cs.AI 73%

Fanar 2.0: Arabic Generative AI Stack

Fanar 2.0:阿拉伯生成AI堆栈

FANAR TEAM, Ummar Abbas, Mohammad Shahmeer Ahmad, Minhaj Ahmad, Abdulaziz Al-Homaid, Anas Al-Nuaimi, Enes Altinisik, Ehsaneddin Asgari, Sanjay Chawla, Shammur Chowdhury, Fahim Dalvi, Kareem Darwish, Nadir Durrani, Mohamed Elfeky, Ahmed Elmagarmid, Mohamed Eltabakh, Asim Ersoy, Masoomali Fatehkia, Mohammed Qusay Hashim, Majd Hawasly, Mohamed Hefeeda, Mus'ab Husaini, Keivin Isufaj, Soon-Gyo Jung, Houssam Lachemat, Ji Kim Lucas, Abubakr Mohamed, Tasnim Mohiuddin, Basel Mousi, Hamdy Mubarak, Ahmad Musleh, Mourad Ouzzani, Amin Sadeghi, Husrev Taha Sencar, Mohammed Shinoy, Omar Sinan, Yifan Zhang

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究 institute) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 Fanar 2.0在资源受限条件下实现卓越性能,通过数据质量优先、持续预训练和模型融合,提升阿拉伯语知识、语言、方言及英语能力,同时引入多项新功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16734 2026-03-18 cs.AI 70%

Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure

个性化LLM代理中的差异性伤害倾向:心理健康披露的奇特案例

Caglar Yildirim

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究探讨了心理健康披露对代理有害行为的影响,发现个性化设置可降低伤害,但易受对抗性压力影响,需加强个性化评估与安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16356 2026-03-18 cs.NI cs.AI 57%

Toward Experimentation-as-a-Service in 5G/6G: The Plaza6G Prototype for AI-Assisted Trials

迈向5G/6G的实验即服务:Plaza6G原型用于AI辅助试验

Sergio Barrachina-Muñoz, Marc Carrascosa-Zamacois, Horacio Bleda, Umair Riaz, Yasir Maqsood, Xavier Calle, Selva Vía, Miquel Payaró, Josep Mangues-Bafalluy

机构 * Spanish MINECO(西班牙国家研究委员会) MCIN/AEI(西班牙国家研究委员会)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Plaza6G是首个整合云资源与下一代无线基础设施的实验即服务平台,通过自然语言和REST API实现低门槛实验设计,结合LLM助手提升实验知识与领域微调,支持OTA试验与可重现的无线实验。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16110 2026-03-18 cs.AI 57%

VIGIL: Towards Edge-Extended Agentic AI for Enterprise IT Support

VIGIL:迈向企业IT支持的边缘扩展代理AI

Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Vishaal Kapoor, Mariam Dundua, Yiming Li, Derek Ho, Vaibhavi Padala, Jennifer Whitted, Rebecca Steinert

机构 * Amazon Engine, AI Center of Excellence(亚马逊引擎,人工智能卓越中心)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 VIGIL通过在用户设备上部署桌面驻留代理,实现本地诊断、企业知识检索和政策驱动的修复,减少交互轮次,提升诊断速度,支持82%的自助解决,用户反馈显示透明度对信任至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15541 2026-03-18 cs.RO 50%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2603.16192 2026-03-18 cs.CL 83%

Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models

结构化语义遮蔽用于大型语言模型的对抗攻击

Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10080 2026-03-18 cs.CR cs.AI cs.LG 62%

Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models

遗忘:大型语言模型中的对抗性语义层特定激活引导

Ali Raza, Gurang Gupta, Nikolay Matyunin, Jibesh Patra

机构 * Honda Research Institute Europe(本田欧洲研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Amnesia攻击,通过操纵transformer内部状态绕过开放式大语言模型的安全机制,展示其能生成有害内容而无需微调。研究强调了对开放式大语言模型安全性的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2603.15714 2026-03-18 cs.CR cs.AI 83%

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

专题命中 提示注入 :prompt injection(title,abstract);red teaming(abstract);分类 cs.AI

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16152 2026-03-18 cs.LG cs.AI cs.CL 80%

HIPO: Instruction Hierarchy via Constrained Reinforcement Learning

HIPO:通过约束强化学习实现指令层级

Keru Chen, Jun Luo, Sen Lin, Yingbin Liang, Alvaro Velasquez, Nathaniel Bastian, Shaofeng Zou

机构 * School of ECEE Arizona State University(亚利桑那州立大学电子与计算机工程学院) Department of ECE The Ohio State University(俄亥俄州立大学电子工程系) Computer Science Department University of Houston(休斯顿大学计算机科学系) College of Engineering & Applied Science CU Boulder(科罗拉多大学博尔德分校工程与应用科学学院) Dept. of Electrical Engineering & Computer Science United States Military Academy(美国军事学院电子工程与计算机科学系)

专题命中 提示注入 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HIPO通过约束马尔可夫决策过程解决层级指令遵循问题,提升系统合规性与用户效用。

Comments 9 pages + appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2603.15885 2026-03-18 cs.AI cs.RO 57%

Resilience Meets Autonomy: Governing Embodied AI in Critical Infrastructure

韧性与自主性:在关键基础设施中治理具身体验的人工智能

Puneet Sharma, Christer Henrik Pursiainen

机构 * Department of Automation and Process Engineering (IAP)(自动化与过程工程系) UiT The Arctic University of Norway(北极大学) Department of Technology and Safety (ITS)(技术与安全系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文探讨关键基础设施中具身体验AI的韧性与自主性治理,提出混合治理架构下的四种监管模式,结合欧盟AI法案和ISO标准,强调机器能力与人类判断的结构化分配。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-03-18 cs.CV cs.MM 50%

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 4 篇

2511.18444 2026-03-18 cs.CV 82%

SineProject: Machine Unlearning for Stable Vision Language Alignment

SineProject:用于稳定视觉语言对齐的机器反遗忘

Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 隐私与版权 :alignment(title,abstract);safety(abstract)

AI总结 SineProject通过在冻结的投影器中加入正弦调制的可训练参数,提升Jacobian的谱条件数,稳定反遗忘过程中的视觉语言对齐,减少无害查询拒绝并实现目标信息遗忘。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15679 2026-03-18 cs.CR cs.AI cs.CV 70%

IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis

IdentityGuard: 基于上下文的限制与溯源的个性化合成

Lingyun Zhang, Yu Xie, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Purple Mountain Laboratories(紫金山实验室)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出IdentityGuard,通过上下文感知的限制和概念特定水印,实现个性化合成的安全控制,防止滥用同时保持模型效用。

Comments 5 pages, 3 figures, Accepted to ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15773 2026-03-18 cs.CL cs.AI 62%

Morphemes Without Borders: Evaluating Root-Pattern Morphology in Arabic Tokenizers and LLMs

无国界词素:在阿拉伯语分词器和大语言模型中评估根-模式词素学

Yara Alakeel, Chatrine Qwaider, Hanan Aldarmaki, Sawsan Alqahtani

机构 * Saudi Data & AI Authority (SDAIA)(沙特数据与人工智能局) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Princess Nourah Bint Abdulrahman University (PNU)(普罗瑟·努拉·本·阿卜杜勒拉赫曼大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了阿拉伯语分词器和大语言模型在处理根-模式词素学方面的表现,发现分词器的词素对齐并非生成词素学的必要或充分条件。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16219 2026-03-18 cs.CL 57%

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

SpecSteer:协同局部上下文与全局推理以实现高效个性化生成

Hang Lv, Sheng Liang, Hao Wang, Yongyue Zhang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本文提出SpecSteer框架,通过结合本地上下文与云端推理,解决个性化生成中的隐私与推理能力矛盾,实现高效生成并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 29 篇

2603.15800 2026-03-18 cs.CV cs.CL cs.CR 83%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06194 2026-03-18 cs.CY cs.AI cs.CL 82%

Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias

大语言模型中的政治倾向:心理测量身份与行为偏见的多维审计

Adib Sakhawat, Tahsin Islam, Takia Farhin, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过多维心理测量工具审计26个大语言模型,发现模型在政治倾向上聚类于自由主义左 quadrant,且模型身份解释了大部分变异性,但心理测量意识形态未显著预测分类误差。

Comments Under review, 25 pages, 6 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 79%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16052 2026-03-18 cs.AI 79%

A Context Alignment Pre-processor for Enhancing the Coherence of Human-LLM Dialog

一种增强人与大语言模型对话连贯性的上下文对齐预处理模块

Ding Wei

机构 * College of Architecture, Nanjing Tech University(南京工业大学建筑学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出C.A.P.预处理框架,通过语义扩展、时间加权上下文检索和对齐验证,解决长对话中的上下文错位问题,提升对话连贯性与协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15655 2026-03-18 cs.LG cs.AI cs.CL cs.IT cs.MA math.IT 78%

Beyond Reward Suppression: Reshaping Steganographic Communication Protocols in MARL via Dynamic Representational Circuit Breaking

超越奖励压制:通过动态表示电路断开重塑MARL中的隐写通信协议

Liu Hung Ming

机构 * PARRAWA AI(PARRAWA人工智能)

专题命中 安全评测 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态表示电路断开机制,用于检测MARL中的隐写协作,通过统计对象转换和动态干预提升观测准确性并降低波动性。

Comments 38 pages, includes 5 figures and 8 tables, preliminary version, AI safety / multi-agent reinforcement learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06183 2026-03-18 cs.CL cs.AI cs.CV 73%

CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation

CRIMSON:一种基于临床的LLM评估指标用于生成放射学报告评估

Mohammed Baharoon, Thibault Heintz, Siavash Raissi, Mahmoud Alabbad, Mona Alhammad, Hassan AlOmaish, Sung Eun Kim, Oishi Banerjee, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Department of Radiation Oncology, Mass General Brigham(放射肿瘤科,麻省总医院与布里奇沃特医院) King Fahad Hospital, Al-Ahsa Health Cluster, Al Hofuf, Saudi Arabia(国王法赫德医院,阿尔阿萨卫生集群,阿尔霍夫,沙特阿拉伯) Ras-Tanura General Hospital, Ministry of Health, Eastern Province, Saudi Arabia(拉斯-坦纳医院,卫生部,东部省,沙特阿拉伯) Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(医学影像科,国王阿卜杜勒-阿齐兹医疗城,国民卫队部,利雅得,沙特阿拉伯)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 CRIMSON是一种基于临床的LLM评估指标,用于评估生成的放射学报告,通过考虑诊断正确性、上下文相关性和患者安全,提供更全面的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 70%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏