arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-20 至 2026-08-20 共收录 37 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2608.18132 2026-08-20 cs.CL cs.SD eess.AS 新提交 79%

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

对齐即全部所需:通用音频-语言模型的无指令训练

Xuanru Zhou, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18531 2026-08-20 cs.AI cs.LG 新提交 73%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18631 2026-08-20 cs.AI cs.GT cs.LG 新提交 62%

Preference Reasoning under Indeterminacy in Large Language Models

大语言模型在不确定性下的偏好推理

Hadi Hosseini, Samarth Khanna, Xiyuan Wang

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文聚焦大语言模型决策智能体的偏好推理问题,将不确定性挑战形式化为认知与结构两类,发现当前模型无法区分确定与不确定实例,推理校准不当。

Comments 55 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18770 2026-08-20 cs.LG cs.RO 新提交 57%

To Go Far, Go Together: Diverse Preferences Induce a Curriculum for Reward Optimization

欲行远,需同行:多样化偏好引出奖励优化的课程设置

Taehyung Kim, Jongeun Choi

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 该研究针对AI对齐中服务不足用户的问题,提出CurriPO方法,通过构建树状课程设置适配多样化用户目标,在个性化连续控制任务上使群体满意度达最强基线的1.2-2.1倍且缩短训练时间。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2608.18628 2026-08-20 cs.CV cs.CL 新提交 88%

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系

Mehak Gupta, Tanmoy Chakraborty

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18089 2026-08-20 cs.CL cs.AI 新提交 81%

Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining

低资源非洲语言的潜在空间拒绝锚定:无需重新训练的机制安全恢复

Godwin Abuh Faruna

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对低资源非洲语言指令模型无法拒绝有害请求的问题,提出无需训练的LSR-Anchoring方法,通过MAS或SDS引导残差流,在多数非洲语言上恢复安全且对MMLU影响小,但阿拉伯语因几何失配失败。

Comments Published at ICML 2026 Workshop on Global South in Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18136 2026-08-20 cs.AI cs.LG 新提交 73%

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

FraudBench:针对自适应欺诈的基于政策的银行智能体压力测试

Dheeraj Mohandas Pai, Lu Xian

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 研究人员推出基于τ²-bench框架和τ-Knowledge环境的可执行基准FraudBench,测试银行智能体应对自适应欺诈的安全性,评估发现4款智能体攻击安全性为49%-65%,资金骡和第一方欺诈是主要薄弱点。

Comments 9 Pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18093 2026-08-20 cs.CL cs.AI cs.CR 新提交 73%

Abliteration Mitigation via Refusal Aliases

通过拒绝别名缓解删除(Abliteration)攻击

Nathan Truong

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的删除(Abliteration)攻击,提出AMRA权重编辑防御方法,在Llama-3-8B和Gemma-2-9B上有效提升删除后的拒绝能力,同时控制了性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2608.18938 2026-08-20 cs.AI cs.LG 新提交 73%

Breaking the weakest link to evade vision language models

打破最弱环节以规避视觉语言模型

Ilan Zini, Boussad Addad, Katarzyna Kapusta

机构 * ESILV(ESILV高等工程师学院) Thales(泰雷兹集团)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19135 2026-08-20 cs.CR cs.DC cs.MA cs.NI 新提交 50%

Autonomous Cyber Defense in Connected Vehicles: A Multi-Agent Approach to V2X Security

网联车辆中的自主网络防御:一种面向V2X安全的多智能体方法

Krishna Teja Medam

专题命中 越狱攻击 :safety(abstract)

AI总结 针对网联车辆V2X安全,提出三层多智能体架构,以SAE标准时序为硬性约束,分层处理消息分类、冲突解决与模型优化,解决现有入侵检测系统的安全-安保冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 3 篇

2608.18709 2026-08-20 cs.CV cs.AI cs.LG 新提交 62%

A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

语义分割中不确定性量化与基础模型的批判性综合研究

Steven Landgraf, Joceline Hinz, Markus Ulrich

机构 * Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院摄影测量与遥感研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估四类不确定性量化方法在语义分割基础模型上的表现,揭示预测性能、可靠性与计算成本间的权衡,为现实应用需联合优化相关指标指明方向。

Comments Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18116 2026-08-20 cs.CL cs.LG 新提交 62%

You Are What You Prompt: Prompt Quality, Domain Shift, and Uncertainty in Agrifood Vision-Language Models

你即你所提示的:农业食品视觉语言模型中的提示质量、领域偏移与不确定性

Andrea Morales-Garzón, Salvador López-Joya, Miguel López-Pérez, Maria J. Martin-Bautista

机构 * University of Granada(格拉纳达大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对农业食品领域,评估了零样本提示集成(ZPE)在分布内与分布外场景的表现,提出PID方法提升严重领域偏移下的故障检测能力,验证了领域特定提示池的优势。

Comments Accepted in the journal Procesamiento del Lenguaje Natural (SEPLN2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 57%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 12 篇

2608.18131 2026-08-20 cs.AI cs.CL cs.CY 新提交 89%

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

安全对齐错觉:大语言模型中的跨语言安全差距

Namya Bhatnagar

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 针对 LLMs 安全对齐以英语为中心导致的跨语言偏见问题,提出多语言评估基准 INCLUDE,评估十款 LLMs 后发现孟加拉语在开源模型中偏见最高、英语在开源与闭源模型中偏见表现反转的现象。

Comments 7 pages, 8 figures, submitted to IEEE SLT (Spoken Language Technology) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18164 2026-08-20 cs.CL cs.AI cs.CR 新提交 81%

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

M P V S Gopinadh

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments 3 pages. Accepted at ACL 2026 Workshop on Evaluation in Practice: Methodological Rigor, Sociotechnical Perspectives, & Community Collaboration (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 67%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19073 2026-08-20 cs.AI cs.LG stat.ML 新提交 62%

Robust Risk Under Evolving Uncertainty: A Wasserstein Counterpart of the Entropic Value-at-Risk

演化不确定性下的鲁棒风险:熵值风险(Entropic Value-at-Risk)的Wasserstein对应

Deep Kumar Ganguly, Jan Křetínský

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对演化不确定性下的鲁棒风险问题,提出Wasserstein熵值风险,弥补熵值风险无法对冲名义模型认定不可能的灾难的缺陷,经数值验证其变分对偶性,并构造出随信念变化的闭式鲁棒动态规划算子。

Comments Best Paper Award at the 2nd Workshop on Safe AI at UAI (SafeAI@UAI 2026, non-archival), Amsterdam

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19029 2026-08-20 cs.AI cs.CL cs.MA 新提交 62%

Adaptive Memory and Reflection Multi-Agent System for Medical Question Answering

面向医学问答的自适应记忆与反思多智能体系统

Pradeep Murugesan, Luoxiao Yang, Xueli Chen, Xinqi Fan

机构 * School of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学学院) Electrical and Computer Engineering, Technion – Israel Institute of Technology(以色列理工学院电气与计算机工程系) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科学与科技学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对现有医学问答系统缺乏适应性等问题,提出自适应记忆与反思多智能体框架,经MedQA等数据集验证,结合专用记忆等模块可提升性能,助力开发可信医学智能体。

Comments Accepted by IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18095 2026-08-20 cs.CL cs.AI 新提交 62%

Backdoor Learning in Language Models and Vision-Language Models

语言模型与视觉-语言模型中的后门学习

Weimin Lyu

机构 * Stony Brook University(石溪大学) The Graduate School(研究生院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18900 2026-08-20 cs.AI 新提交 57%

\textsc{TestifAI}: Tomography-Based Testing for Deep Learning Systems

TestifAI:基于层析成像的深度学习系统测试方法

Arooj Arif, Tobias Hartung, Elena Botoeva, Alexandros Koliousis

机构 * Northeastern University London(伦敦东北大学) University of Kent(肯特大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TestifAI是一种深度学习测试框架,通过部分模型层析成像从低阶扰动观测预测高阶扰动测试结果,可高效准确估计多扰动下的模型鲁棒性,减少60-80%的推理量且总误差低于7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18398 2026-08-20 cs.HC cs.AI 新提交 57%

LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents

LEDGER:用于审计大语言模型智能体的从主张到证据的追踪图

Daehong Kim, Haichao Miao, Shusen Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对LLM智能体输出审计瓶颈,提出LEDGER系统构建分层追踪图,通过分组节点、添加语义边等实现以证据为中心的审计,揭示工作流决策等关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-20 cs.AI 新提交 57%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18587 2026-08-20 eess.SY 新提交 50%

Toward S^2C^2I-Integrated High-Altitude Platforms: Architectures, Cross-Functional Design, Evaluation, and Deployment Perspectives

面向S^2C^2I集成高空平台:架构、跨职能设计、评估与部署视角

Haoxiang Luo, Mohamed-Slim Alouini

专题命中 安全评测 :trustworthy(abstract)

AI总结 本综述聚焦S^2C^2I集成高空平台,阐述其架构、技术、评估方法与部署,通过应急案例验证其服务优势,指明相关研究机遇,提供从设计到部署的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18317 2026-08-20 cs.CV cs.RO 新提交 50%

Reproducible Multimodal Affordance Prediction

可复现的多模态可供性预测

Tommaso Apicella, Alessio Xompero, Andrea Cavallaro

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) EPFL(洛桑联邦理工学院)

专题命中 安全评测 :safety(abstract)

AI总结 针对可供性预测方法评估难的问题,本文提出Affordance Sheet以规范任务表述等信息,实现可供性模型的可复现基准测试与现实场景可靠评估。

Comments Paper accepted to Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW) in European Conference on Computer Vision (ECCV) 2026; 18 pages, 3 figures, 7 tables. Project webpage at this https URL (https://apicis.github.io/aff-sheet)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 50%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: this https URL (https://github.com/cseeyangchen/Human-Centric-AI;) Project Page: this https URL (https://cseeyangchen.github.io/Human-Centric-AI/homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 5 篇

2608.18135 2026-08-20 cs.AI 新提交 79%

Improving Rural Medication Safety with AI: A Scoping Review

用人工智能提升农村用药安全:一项范围综述

Jeong-ah Kim, Muhammad Ashad Kabir, Daniel Terry, Maryam Rouhi

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI

AI总结 本范围综述探究AI在农村医疗场景中提升用药安全的应用,发现AI可覆盖用药全流程,机器学习类技术能减少34%-80%的用药错误,但存在基础设施不足等农村特有挑战。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18086 2026-08-20 cs.AI cs.LG 新提交 73%

Position: Current Model Cards Are Insufficient for Downstream Governance of Open-Weight Foundation Models

立场:当前模型卡片不足以支持开放权重基础模型的下游治理

Sungwon Chae, Keonwoo Kim, Hoki Kim, Jaeyeon Ju, Sangchul Park

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文分析Hugging Face的500份模型卡片,指出现有模型卡片无法支持开放权重基础模型下游治理,提出需整合模型卡片、可接受使用政策、许可证的多层治理框架。

Comments Accepted as a position paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18122 2026-08-20 cs.CY cs.AI 新提交 62%

Global Index on Responsible AI 2026: Conceptual Framework and Methodology

2026年全球负责任AI指数:概念框架与方法论

Fola Adeleke, Rachel Adams, Ayantola Alayande, Daniela Benavente, Ana Florido, Nicolás Grossman, Leah Junck

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究介绍2026年全球负责任AI指数(GIRAI)第二版的方法论,优化框架维度与指标,经审计验证,用于跨国评估各国负责任AI治理,助力相关主体识别保护成效与差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18774 2026-08-20 cs.CV cs.LG 新提交 57%

MIFR: A Modality-Invariant and Fair Representation Framework for Skin Disease Classification

MIFR:用于皮肤病分类的模态不变公平表示框架

Asonyu Senge Njih, Yvan Guifo Fodjo, Vianney Kengne Tchendji, Jerry Lacmou Zeutouo, Kerol Djoumessi

机构 * University of Dschang(德昌大学) Université Paris-Panthéon-Assas(巴黎先贤祠-阿萨斯大学) Université de Picardie Jules Verne(儒勒·凡尔纳皮卡第大学) Hertie Institute for AI in Brain Health, University of Tübingen(蒂宾根大学赫蒂脑健康人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究提出MIFR框架,通过配对临床与皮肤镜图像的多目标损失训练,实现皮肤病分类的模态不变性与公平性,在多数据集上验证了其预测性能与公平性。

Comments Accepted for publication at the First Workshop on Advancing African Medical AI through Global Integration (AFRICAI)-MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18637 2026-08-20 cs.IR 新提交 50%

PILOT Technical Report

PILOT技术报告

Jiuning Lin, Ruiquan Lan, Xiaodong Zhu, Bin Zhang, Chengyu Lai, Chuxin Chen, Dimin Wang, Hongtao Cheng, Jialin Zhu, Lingqing Zhang, Shuai Zhong, Tao Wang, Weipeng Huang, Yinjiang Cai, Yinnan Song, Yuan Liu, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 AI治理与伦理 :safety(abstract)

AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。

Comments Technical Report, 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏